评测结果
V1.0与V1.1使用相同题集进行评测,每版包含46个对话案例、61轮回答和10个检索工具案例。以下展示任务完成情况、回答质量、运行耗时及用户体验数据。
一、评测范围
完整题集包含60个质量案例、75轮输入,另有38项功能检查。两版各执行其中56个案例:46个对话案例和10个直接工具案例;4个特殊条件案例受阻,38项功能检查未执行。
两版结果按统一评分标准复核,原始评分与调整记录分别保留。评分依据题目要求、实际回答与论文原文,具体方法见评测体系设计。
二、效果
2.1 案例完成情况
| 案例结果 | V1.0 | V1.1 |
|---|---|---|
| 确定达成 | 24/46(52.2%) | 35/46(76.1%) |
| 部分达成 | 17 | 9 |
| 未达成 | 5 | 2 |
| 待判断 | 0 | 0 |
同一案例比较,15例改善、27例持平、4例退步。46个案例覆盖单篇理解、多篇比较、综述、修改和原文核验。每例按题目要求判断完成情况;多轮题结合各轮要求与最终回答评价。
2.2 回答整体档位
| 档位 | V1.0 | V1.1 |
|---|---|---|
| 4分 | 26 | 31 |
| 3分 | 9 | 16 |
| 2分 | 21 | 12 |
| 1分 | 2 | 0 |
| 0分 | 3 | 2 |
| 3–4分合计 | 35/61(57.4%) | 47/61(77.0%) |
| 0–1分合计 | 5/61(8.2%) | 2/61(3.3%) |
逐轮比较有20轮升档、29轮同档、12轮降档。回答档位描述单轮质量;案例结果描述整道题是否完成,两种结果分别统计。
2.3 检索与工具
| 直接工具检查 | V1.0 | V1.1 |
|---|---|---|
| R2:范围与候选召回 | 10题均U:缺少独立候选阶段日志 | 10题均U:缺少独立候选阶段日志 |
| R3:选择与上下文 | 9题3分、1题2分 | 7题4分、3题2分 |
| R3至少3分 | 9/10 | 7/10 |
| R4:来源与传递 | 10题4分 | 10题4分 |
V1.0返回较完整的论文内容,同时带入较多无关正文、参考文献或附录,这9题的证据筛选得分为3分。V1.1修复了工具第5题遗漏P32的问题,但第6、8、10题分别遗漏认证数据机制、意外消息条件和替代关系较弱的实证发现。
直接工具题固定查询和材料,检查工具实际返回;完整对话还检查模型如何组织查询、补查和利用证据。对话中有相应过程记录时,同样评价R维度。10道直接工具题单独统计,用来定位工具问题;案例达成率统计46个对话案例。
2.4 关键错误与未交付
| 曾发生的问题(按对话案例分别去重) | V1.0 | V1.1 |
|---|---|---|
| B0:可信度或隔离底线问题 | 0 | 1 |
| B1:核心任务阻断 | 5 | 1 |
V1.1用户第22题虽然补齐15篇覆盖,首轮仍将反馈奖励解释成“购买好评”,续问没有澄清,因此案例最终未达成。专家第25题没有交付所要求的正文。这两例分别暴露了机制误述未纠正和正文未交付的问题。
三、性能
| 指标 | V1.0 | V1.1 | 统计说明 |
|---|---|---|---|
| 服务端运行耗时中位数 | 27.69秒 | 20.96秒 | 各61轮,包含实际结束状态 |
| 完整过程记录 | 60/61 | 60/61 | 其他字段按各自可用数量统计 |
| 完整用量记录 | 59/61 | 60/61 | 按有记录的用量汇总 |
| 费用记录 | 13轮估算、48轮未知 | 12轮估算、49轮未知 | 尚无全量实际费用 |
表中耗时统计服务端运行时长,涵盖各轮实际结束状态。两版的索引、配置与运行条件存在差异。客户端首字时间、完整正文等待时间和实际费用,留待后续采集。
四、用户体验与功能检查
表达质量按E8评价回答的结构、清晰程度和阅读负担。实际采用情况、内容修改量和核验时间,将通过真实试用采集;本批尚无这部分数据。已有访谈用于设计写作与修改任务。
38项功能检查未在本批执行。文档解析、切块、索引更新、容量与恢复等专项继续按各自测试方案补充,结果注明材料和执行条件。
五、后续版本比较
V1.2正在开发面向研究论文综述章节的工作流,重点处理机制误述、必要条件遗漏、正文未交付和修改后错误保留。最新写作标准和示例已完成加载检查,实际写作质量仍待验证。后续结合新材料与原题回归检查章节组织、任务完成情况和具体退步,并补充耗时、用量和真实试用反馈。