打开 Lito
Lito文档
打开 Lito

评测概览

一、用户的研究过程

Lito面向已有研究方向和文献的写作者,支持论文理解、多篇比较、中文综述、连续修改和原文核验。用户可以先提出一个具体问题,也可以先看初稿,再逐步调整结构、篇幅和讨论重点。

四位同学的访谈和一次个人写作实践中,反复出现的困难包括:把逐篇介绍整理成有联系的评述、向AI解释哪些内容需要修改,以及改写后重新检查事实和引用。有用户在看到正文后,才明确提出“保留主题引导、最后统一评述”等要求。

因此,评测沿着实际写作过程安排任务:选择文献,阅读回答与引用,提出修改要求,核对关键观点,再取得可继续使用的正文。首次回答和后续修改都留下记录,检查新要求是否生效、原有事实与来源是否保留。

查看用户访谈与写作实践 →

二、评测要回答的问题

评测用于了解主要任务的完成情况,确定修改优先级,并为小范围试用提供判断依据。重点看以下三个问题。

问题 观察什么 如何使用结果
用户要求的任务完成了吗? 是否交付解释、比较或正文,必答点与必要条件是否齐全 按场景记录完成情况,找出需要补内容或重做的任务
内容和来源可靠吗? 事实、数值、研究关系是否得到原文支持,引用是否指向正确论文 定位具体错误,优先处理影响主要结论和来源可信度的问题
连续修改是否顺利? 新要求是否落实,旧的有效要求是否保留,用户是否反复纠正同一问题 区分正常调整偏好与额外纠错,检查改动是否改善后续使用

例如,用户先要两篇论文的比较,再要求缩写。评测既检查最终篇幅,也核对两篇的主要发现、适用条件和来源。用户主动改变结构属于正常修改;为了找回丢失的引用再次提醒,则记录为额外纠错。

三、评测范围

评测使用项目已有的28篇PDF,其中中文12篇、英文16篇。题目按任务选择单篇、多篇组合或更大的文献集合;用户自己的研究设想和草稿作为背景,与论文依据分别记录。

范围 具体安排
研究任务 单篇理解、中英文解释、多篇比较、主题综述、连续修改与原文核验
资料规模 使用28篇固定文献及其子集;每题单独写明需要讨论的论文,逐篇任务检查各篇具体内容
检索工具 给定查询与允许材料,检查返回的正文、必要条件和来源
完整问答 从用户输入开始,检查Agent提出查询、使用证据、补查和生成回答的过程
功能检查 单独检查登录与账号隔离、文件导入、停止恢复、刷新回访、复制导出和引用定位
运行记录 保存模型与配置、调用用量、等待时间、重试和结束原因;性能与压力另设测试方案

质量案例分为专家、用户和对抗三类。专家题围绕论文中的关键结论与条件;用户题根据访谈合成写作和修改任务;对抗题加入错误前提、虚构引用或范围干扰。每类都可以检查检索或完整问答,结果按题目类型和检查对象分别统计。

每批执行固定文献、题目、模型、Prompt、工具和运行预算。独立案例使用新会话,多轮题按预定顺序继续,便于修改后重跑原题。

四、问题定位

回答与检索过程分开评价。回答检查任务是否完成、内容是否准确;检索记录用于查明证据在哪一步取得或丢失。

检查位置 需要确认的内容
PDF、解析与索引 所需正文是否进入可检索内容,文件身份与原件是否对应
检索候选 关键段落是否被找到,是否属于本题允许的材料
工具返回与模型输入 选择和裁剪后,结论与必要条件是否仍在,来源是否正确传递
最终回答 是否采用了证据,是否交付具体内容,引用与论述是否对应
原文查看 点击引用后能否打开正确文件,页码与定位状态是否准确

用户第22题要求整理15篇论文。V1.0第一轮只覆盖13篇,续问只剩10篇。过程记录显示,第一轮缺少的P20和P29已经进入候选,却没有进入工具正文和主模型输入;续问中旧证据被替换,新证据又没有覆盖所有论文。排查据此转向候选分配和跨轮证据保留。

修改后用同一道题检查论文是否补齐,再核对每篇的具体发现、条件和引用。覆盖完整与解释正确分别记录,便于判断改动解决了哪一部分问题。查看15篇论文覆盖案例

五、版本结果

两版各执行46个对话案例,产生61轮回答;另有10个直接工具案例。评测结果如下。

指标 V1.0 V1.1
案例确定达成 24/46(52.2%) 35/46(76.1%)
3–4分回答 35/61(57.4%) 47/61(77.0%)
0–1分回答 5/61(8.2%) 2/61(3.3%)
工具返回R3至少3分 9/10 7/10

同一案例中15例改善、27例持平、4例退步。案例完成、回答质量和工具过程分别统计;性能按记录完整性汇总,真实采用和修改负担仍需试用数据。现阶段以案例级任务达成率为核心指标,结合关键错误与同题变化判断版本表现。

查看完整评测结果 · 查看V1.0功能与评测 · 查看V1.1改动与结果

图表