打开 Lito
Lito文档
打开 Lito

评测结果

V1.0与V1.1使用相同题集进行评测,每版包含46个对话案例、61轮回答和10个检索工具案例。以下展示任务完成情况、回答质量、运行耗时及用户体验数据。

一、评测范围

完整题集包含60个质量案例、75轮输入,另有38项功能检查。两版各执行其中56个案例:46个对话案例和10个直接工具案例;4个特殊条件案例受阻,38项功能检查未执行。

两版结果按统一评分标准复核,原始评分与调整记录分别保留。评分依据题目要求、实际回答与论文原文,具体方法见评测体系设计

二、效果

2.1 案例完成情况

案例结果 V1.0 V1.1
确定达成 24/46(52.2%) 35/46(76.1%)
部分达成 17 9
未达成 5 2
待判断 0 0

同一案例比较,15例改善、27例持平、4例退步。46个案例覆盖单篇理解、多篇比较、综述、修改和原文核验。每例按题目要求判断完成情况;多轮题结合各轮要求与最终回答评价。

2.2 回答整体档位

档位 V1.0 V1.1
4分 26 31
3分 9 16
2分 21 12
1分 2 0
0分 3 2
3–4分合计 35/61(57.4%) 47/61(77.0%)
0–1分合计 5/61(8.2%) 2/61(3.3%)

逐轮比较有20轮升档、29轮同档、12轮降档。回答档位描述单轮质量;案例结果描述整道题是否完成,两种结果分别统计。

2.3 检索与工具

直接工具检查 V1.0 V1.1
R2:范围与候选召回 10题均U:缺少独立候选阶段日志 10题均U:缺少独立候选阶段日志
R3:选择与上下文 9题3分、1题2分 7题4分、3题2分
R3至少3分 9/10 7/10
R4:来源与传递 10题4分 10题4分

V1.0返回较完整的论文内容,同时带入较多无关正文、参考文献或附录,这9题的证据筛选得分为3分。V1.1修复了工具第5题遗漏P32的问题,但第6、8、10题分别遗漏认证数据机制、意外消息条件和替代关系较弱的实证发现。

直接工具题固定查询和材料,检查工具实际返回;完整对话还检查模型如何组织查询、补查和利用证据。对话中有相应过程记录时,同样评价R维度。10道直接工具题单独统计,用来定位工具问题;案例达成率统计46个对话案例。

2.4 关键错误与未交付

曾发生的问题(按对话案例分别去重) V1.0 V1.1
B0:可信度或隔离底线问题 0 1
B1:核心任务阻断 5 1

V1.1用户第22题虽然补齐15篇覆盖,首轮仍将反馈奖励解释成“购买好评”,续问没有澄清,因此案例最终未达成。专家第25题没有交付所要求的正文。这两例分别暴露了机制误述未纠正和正文未交付的问题。

查看15篇论文覆盖案例 · 查看V1.1问题与改进思路

三、性能

指标 V1.0 V1.1 统计说明
服务端运行耗时中位数 27.69秒 20.96秒 各61轮,包含实际结束状态
完整过程记录 60/61 60/61 其他字段按各自可用数量统计
完整用量记录 59/61 60/61 按有记录的用量汇总
费用记录 13轮估算、48轮未知 12轮估算、49轮未知 尚无全量实际费用

表中耗时统计服务端运行时长,涵盖各轮实际结束状态。两版的索引、配置与运行条件存在差异。客户端首字时间、完整正文等待时间和实际费用,留待后续采集。

四、用户体验与功能检查

表达质量按E8评价回答的结构、清晰程度和阅读负担。实际采用情况、内容修改量和核验时间,将通过真实试用采集;本批尚无这部分数据。已有访谈用于设计写作与修改任务。

38项功能检查未在本批执行。文档解析、切块、索引更新、容量与恢复等专项继续按各自测试方案补充,结果注明材料和执行条件。

五、后续版本比较

V1.2正在开发面向研究论文综述章节的工作流,重点处理机制误述、必要条件遗漏、正文未交付和修改后错误保留。最新写作标准和示例已完成加载检查,实际写作质量仍待验证。后续结合新材料与原题回归检查章节组织、任务完成情况和具体退步,并补充耗时、用量和真实试用反馈。

评测体系设计 · 评测集构建 · 版本记录

图表