打开 Lito
Lito文档
打开 Lito
← 返回版本记录

改进案例 · 15篇论文覆盖

V1.0基线 → 问题归因 → 证据分配调整 → V1.1定向复测

一、任务与判定要求

完整题集中的用户第22题,围绕选定15篇论文进行整理,并在续问中要求每篇都有要点和引用。检查覆盖时,逐篇核对具体要点及其引用。

查看完整题目与评分规则,选择用户评测集并搜索“覆盖清单先行”。

二、V1.0:遗漏发生在回答之前

第一轮仅覆盖13篇,缺少P20和P29。续问找回部分材料,却只覆盖10篇。独立裁判分别给出2分和1分。

过程记录显示,第一轮缺失的两篇已经进入检索候选,却没有进入工具返回及主模型输入。续问的旧工具正文被替换,新证据也没有覆盖所有必需论文,最终证据输入只剩10篇。

问题出在候选筛选与跨轮证据保留,需要让缺失的原文实际进入模型输入。

三、改法:先覆盖不同论文,再补充相关段落

  • 提供当前授权文件清单,让模型明确逐篇任务的范围。检索结果再为各篇补充具体结论与来源。
  • 对明确要求逐篇介绍的任务,交错保留不同论文的候选,再按上下文限额裁剪。
  • 选择数量随进入选择的论文数量调整,先保留不同论文,再补充相关内容。
  • 记录候选、返回和最终输入的论文覆盖,便于找到遗漏环节。

逐篇整理和多篇比较先满足论文覆盖,再分配剩余阅读空间;普通问答按问题相关性选择材料。

四、同题对照

对照使用相同题目、15篇材料和授权范围。参考答案用于评分。

检查项 V1.0基线 V1.1覆盖修复的定向批次
第一轮回答覆盖 13/15篇 15/15篇
续问回答覆盖 10/15篇 15/15篇
续问最终证据输入 10篇 15篇
两轮检索调用 3次 2次
两轮服务端耗时 263.57秒 215.92秒

对照范围:用户第22题的两轮任务。

五、覆盖修复与最终评分

定向批次补齐了两轮的论文覆盖,检索调用从3次减为2次。继续核对内容时,又发现奖励机制解释错误,问题转向原文使用和正文检查。

V1.1最终全量批次的用户22续问交付883字正文和15个引用,仍被评为2分:前轮对反馈奖励的错误解释没有澄清,案例最终判为未达成。覆盖检查据此保留两项记录:每篇是否得到介绍,以及介绍是否准确。这次改动解决了证据被筛掉的问题,事实解释仍需要逐条对照原文。

图表