V1.1 · 检索与回答优化
V1.1调整论文解析、检索筛选、上下文和正文检查,处理多篇遗漏、引用错配及任务结束后没有正文等问题。完成修改后,使用与V1.0相同的28篇论文和56个案例复测,共取得61轮回答与10条工具结果。
一、主要改动
| 部分 | 本版改动 | 对用户任务的作用 |
|---|---|---|
| 论文切片 | 优先按摘要、章节与段落切分,长段落再按句子和长度拆分;保留物理页码与前后关系 | 检索命中结论后,可以继续读取附近的解释和条件 |
| 表格处理 | 按版面选择线条提取、Panel分组或Docling解析,关联表头、数值、表注与原页;缓存解析结果 | 读取表格时保留数字含义,并能回到原页核对 |
| 候选重排 | 接入硅基流动的BAAI/bge-reranker-v2-m3,按问题与候选内容重新排序 | 在召回后进一步选择与问题相关的证据 |
| 多篇证据分配 | 对逐篇整理和明确比较任务,先交错保留不同论文的候选,再补充篇内相关段落 | 减少某一篇的相似片段占满阅读空间、其他论文被遗漏的情况 |
| 上下文 | 调整推理消息回放和稳定前缀,控制单次检索带入量,按任务分配阅读空间 | 减少重复材料占用输入,保留当前任务所需证据 |
| 多轮引用 | 按文档身份关联历史与新取得的来源,维护引用映射 | 改写或重新检索时,保持论述与来源对应 |
| 正文与检查 | 为生成和修改保留轮次;区分内容问题与检查器格式错误、超时;提示词明确具体发现、条件与引用要求 | 根据已取得的证据完成正文,发现内容问题后有机会修改 |
28篇评测论文已按新流程重建索引。输入区增加思考强度选择;模型菜单保留搜索、详情和个人模型管理入口,配置页支持返回原页面。
二、同题对比
2.1 两篇比较的证据遗漏
专家第20题先比较P13与P32的研究对象和结论,再要求压缩并保留来源。V1.1修复前批次中,候选已包含两篇正文,但排序后的前列被P13占满,五次补查仍只把P13交给回答模型。
修改针对比较任务分配候选:先保留不同论文,再按篇内相关性补充材料。记录同时保存候选、工具返回和主模型输入中的论文范围。
| 专家第20题 | V1.1修复前批次 | V1.1最终批次 |
|---|---|---|
| 交给主模型的论文 | 五次返回均只有P13 | 同时取得P13与P32 |
| 第1轮:比较研究对象与结论 | 1分 | 3分 |
| 第2轮:压缩并保留来源 | 1分 | 4分 |
最终批次第1轮完成了比较,但对检索次数的说明与实际记录不符,评分为3分。这里比较的是同一道完整问答题;V1.0中只返回P13的工具第5题是另一条直接检索案例。
2.2 15篇论文的覆盖与内容
用户第22题先要求将15篇按主题分组,续问再生成600–900字摘要级综述,每篇至少一个要点和引用。V1.0两轮分别覆盖13篇和10篇;第一轮缺少的P20、P29已进入候选,却没有进入工具正文和主模型输入。
逐篇候选分配调整后的定向复测中,两轮均覆盖15篇,检索调用由3次减为2次。覆盖记录继续检查每篇是否有具体内容和来源。
最终全量批次的续问交付883字正文和15个引用,评分为2分:前轮对反馈奖励的错误解释没有澄清。首轮整体为0分,未解决的B0影响最终结果,案例判为未达成。候选覆盖得到改善后,仍需逐项核对研究发现和机制解释。查看覆盖修复的详细过程
2.3 检查器故障触发重写
一次中间复测已生成898字正文,符合篇幅要求。内容检查器返回无法解析的结果后,程序要求模型重写;新稿变成1024字,又在最后一轮被字数检查拦下,最终没有交付正文。
本版将检查结果分为内容问题、证据不足和检查器技术故障。内容问题指导修改,证据不足指导补查;格式错误与超时先重试检查器。同时提前为正文和修改保留轮次,达到篇幅修改边界后继续判断内容质量,并记录长度偏差。
这项修改处理的是检查失败后的执行方式。最终回答仍按实际内容评分,已发现的事实问题需要确认修正。
2.4 多轮引用修复
连续修改可能重新检索或改变资料范围,历史编号与新返回顺序容易出现冲突。本版按文档身份保留来源关联,处理历史工具结果和新检索结果时复用已有映射。
最终批次核查未发现数值引用号跨论文串号。引用指向正确后,评审继续对照原文检查具体论述是否受到支持。
三、评测结果
两版使用相同题集,分别统计案例完成情况与每轮回答质量。
| 指标 | V1.0 | V1.1 |
|---|---|---|
| 案例确定达成 | 24/46(52.2%) | 35/46(76.1%) |
| 部分达成 / 未达成 | 17 / 5 | 9 / 2 |
| 4分回答 | 26 | 31 |
| 3分回答 | 9 | 16 |
| 2分回答 | 21 | 12 |
| 1分回答 | 2 | 0 |
| 0分回答 | 3 | 2 |
| 3–4分回答合计 | 35/61(57.4%) | 47/61(77.0%) |
按案例比较,15例改善、27例持平、4例退步。回答档位按轮次记录;案例结果按题目约定的完整要求判断。
3.1 检索工具
直接工具R3为V1.0的9题3分、1题2分,以及V1.1的7题4分、3题2分。V1.0返回冗余较多,没有满分;V1.1的第6、8、10题分别缺少认证数据机制、意外消息条件和替代关系较弱的实证发现。第5题遗漏P32的问题已改善。
两版R2均因缺少独立候选阶段日志记U,R4均为10题4分。对话中的工具过程同样可以按适用R维度检查,10道直接工具题单独统计。
查看完整评测结果:三类指标、数据完整性与评分说明。
四、最终结果中的问题
15篇任务仍出现两类失败:用户第22题将真实反馈奖励解释成“购买好评”,续问没有澄清;另一条综述案例停留在继续搜索的进度句。
这些结果与工具题的证据遗漏一同归档。每条记录关联实际回答、论文位置和检索过程,便于后续从原题复测。
五、改进思路
5.1 奖励机制的解释
用户第22题把真实反馈奖励写成“购买好评”,需要继续检查模型采用了哪段证据、是否读到奖励领取条件,以及改写时是否改变了原意。
计划在奖励、补贴和信号机制相关任务中,按问题取得研究对象、行为条件、指标和结论,再组织正文。例如,奖励是否要求正面评价,与奖励是否鼓励提交真实反馈,需要回到原文分别核对。续问修改还应检查前文已出现的错误是否得到澄清。
复测从原问题开始,对照具体机制、指标与来源;相关正常问答一起检查,观察相同概念在不同问法下是否保持一致。
5.2 检索后的条件遗漏
工具第6、8、10题最终返回缺少部分机制或条件;独立候选阶段日志不足,仍需补齐阶段证据。下一步准备对照重排、裁剪和扩展前后的正文,确认缺失发生的位置。
已有的按篇分配解决论文覆盖,还需要检查篇内关键内容是否完整。计划围绕问题保留成组证据,例如“研究结论及适用条件”“专业车商的保修收益及替代关系”,并合并重复段落。复测同时检查必要证据覆盖、输入长度与调用用量。
5.3 长任务的正文交付
对于停留在进度句的综述任务,准备从结束前的模型输入与预算记录继续排查:证据是否够用、是否仍在重复检索、是否实际进入正文生成。
交付检查重点放在用户请求的内容上:是否已有正文、是否完成规定的主题或逐篇要求、引用是否对应。若只有检索承诺,且仍有可用证据与预算,计划让任务进入正文生成;发生中断时保存已有内容与缺失项,便于继续处理。
复测除确认任务结束外,还要逐项检查正文,记录首次执行和重复执行的结果。
5.4 下一版的综述工作流
V1.2的综述工作流面向研究论文中的文献综述、相关研究与理论背景章节。输入包括作者的研究问题与已有设计、选定论文、本节作用、篇幅和写作要求;输出包括章节正文、引用及需要继续核对的内容。
工作流按“整理逐篇证据—确定主题与文献分配—生成正文—检查发现、条件与引用—修改”组织,正在定向验证。程序管理步骤和检查结果,模型负责提取、比较与写作。用户后续调整结构或材料范围时,再确定需要重做哪些步骤。
此前的15篇任务试验用于检查覆盖、事实、条件与正文交付。最新写作标准和示例增加作者研究设定,接下来用新的材料检查章节组织和研究定位,再做原题回归与全量比较。
六、评测记录与后续工作
两版各46个对话案例的结果已汇总,工具检查和运行性能一并展示在评测结果中。数据完整性与待补测试也在该页集中说明。
V1.2正在开发面向研究论文章节的综述工作流,并改进逐篇补查和检查器误报处理。写作标准与示例已完成加载检查,下一步评估实际写作质量,并执行同范围全量评测。
查看评测结果 · 查看完整评测集 · 查看V1.0功能与评测