改进案例 · 15篇论文覆盖
V1.0基线 → 问题归因 → 证据分配调整 → V1.1定向复测
一、任务与判定要求
完整题集中的用户第22题,围绕选定15篇论文进行整理,并在续问中要求每篇都有要点和引用。检查覆盖时,逐篇核对具体要点及其引用。
查看完整题目与评分规则,选择用户评测集并搜索“覆盖清单先行”。
二、V1.0:遗漏发生在回答之前
第一轮仅覆盖13篇,缺少P20和P29。续问找回部分材料,却只覆盖10篇。独立裁判分别给出2分和1分。
过程记录显示,第一轮缺失的两篇已经进入检索候选,却没有进入工具返回及主模型输入。续问的旧工具正文被替换,新证据也没有覆盖所有必需论文,最终证据输入只剩10篇。
问题出在候选筛选与跨轮证据保留,需要让缺失的原文实际进入模型输入。
三、改法:先覆盖不同论文,再补充相关段落
- 提供当前授权文件清单,让模型明确逐篇任务的范围。检索结果再为各篇补充具体结论与来源。
- 对明确要求逐篇介绍的任务,交错保留不同论文的候选,再按上下文限额裁剪。
- 选择数量随进入选择的论文数量调整,先保留不同论文,再补充相关内容。
- 记录候选、返回和最终输入的论文覆盖,便于找到遗漏环节。
逐篇整理和多篇比较先满足论文覆盖,再分配剩余阅读空间;普通问答按问题相关性选择材料。
四、同题对照
对照使用相同题目、15篇材料和授权范围。参考答案用于评分。
| 检查项 | V1.0基线 | V1.1覆盖修复的定向批次 |
|---|---|---|
| 第一轮回答覆盖 | 13/15篇 | 15/15篇 |
| 续问回答覆盖 | 10/15篇 | 15/15篇 |
| 续问最终证据输入 | 10篇 | 15篇 |
| 两轮检索调用 | 3次 | 2次 |
| 两轮服务端耗时 | 263.57秒 | 215.92秒 |
对照范围:用户第22题的两轮任务。
五、覆盖修复与最终评分
定向批次补齐了两轮的论文覆盖,检索调用从3次减为2次。继续核对内容时,又发现奖励机制解释错误,问题转向原文使用和正文检查。
V1.1最终全量批次的用户22续问交付883字正文和15个引用,仍被评为2分:前轮对反馈奖励的错误解释没有澄清,案例最终判为未达成。覆盖检查据此保留两项记录:每篇是否得到介绍,以及介绍是否准确。这次改动解决了证据被筛掉的问题,事实解释仍需要逐条对照原文。