打开 Lito
Lito文档
打开 Lito
← 返回版本记录

V1.0 · 文献问答与综述

V1.0 · 首轮版本

V1.0提供项目文献管理、论文问答、多篇比较、综述生成和连续修改。用户上传论文后,可以围绕同一组材料提问、查看引用,再根据回答调整研究问题或正文。首轮评测检查这些功能在真实论文任务中的表现,并记录影响使用的问题。

一、主要功能

功能 用户可以做什么 本版如何支持
项目与文献管理 将同一研究主题的论文放在一个项目中,选择本次使用的材料 保存PDF原件,提取正文并建立检索索引;项目关联文件与研究要求
论文问答 解释概念、研究方法、指标和具体发现 根据问题检索相关段落,结合原文回答并附来源
多篇比较 比较不同论文的研究对象、方法和结论 在所选论文中查找证据,由模型按共同维度组织比较
综述生成 根据研究主题和材料生成中文正文 综合多篇内容,按用户要求组织段落、篇幅和引用
连续修改 在已有回答上缩写、调整结构或更换资料范围 带入会话历史、当前要求与来源信息,继续生成修改稿
引用与原文查看 从回答中的引用打开论文,核对相关页面和原句 保存来源关联,提供PDF阅读、原文查找与高亮
任务运行与记录 查看任务状态、停止执行,并保留问答结果 记录模型和工具调用、结束原因、用量与检索过程,供复盘使用

一次常见的使用过程是:在项目中上传论文,先询问各篇的主要发现,再要求按主题比较,形成综述后继续压缩或调整结构。引用随回答展示,用户可以在修改过程中回到原文核对。

二、评测结果

首轮使用28篇论文,执行56个案例,取得71条结果。其中61轮评价最终回答,10道题直接评价检索工具。题目覆盖论文理解、多篇综合、连续修改和错误前提纠正。

最终回答档位 轮数
4分:完整达成 26
3分:达成,需局部修改 9
2分:部分达成 21
1分:主要要求未达成 2
0分:关键错误或未交付 3
3–4分合计 35/61(57.4%)

10道工具题的R3为9道3分、1道2分;多余正文、参考文献和附录影响了证据筛选质量。R2缺独立候选阶段日志,记U。工具题与回答题分别统计,检查给定查询是否取得所需原文,以及完整任务是否交付了可用回答。

回答评分中,35轮回答为3–4分,21轮为2分,5轮为0–1分。46个对话案例中24例达成、17例部分达成、5例未达成。运行记录中59轮正常结束、2轮预算终止;评分发现3轮缺少有效正文。这些结果把排查重点集中到论文覆盖、证据使用和最终输出。

查看两版同口径评测结果 · 查看评测体系与评分标准 · 查看完整评测集

三、Bad case 与原因

3.1 只有检索承诺,没有实际答案

任务。 专家第22题要求结合两篇论文,为一个研究设想提出有依据的问题。

实际表现。 回答只有一句“我会先查找这两篇论文”,没有后续研究问题或引用,运行状态却显示完成,独立评分为0分。

原因。 程序接受了模型的结束信号,但这条最终消息只是下一步行动的承诺。模型停止输出和用户拿到所需内容,在这次运行中没有对应起来。

3.2 15篇论文,续问中只剩10篇

任务。 用户第22题要求整理15篇论文,并在续问中为每篇给出要点和引用。

实际表现。 第一轮覆盖13篇,缺少P20和P29;续问只覆盖10篇。两轮分别为2分和1分。

原因。 第一轮缺少的两篇已经进入检索候选,却没有进入工具正文和主模型输入。续问中,旧工具正文被替换,新证据又没有覆盖全部论文。遗漏发生在候选筛选、结果传递和跨轮保留过程中。

查看15篇论文覆盖案例

3.3 两篇比较,检索只返回一篇

任务。 工具第5题需要同时返回P13与P32的依据。

实际表现。 实际返回只有P13,工具评分为2分。比较所需的另一篇证据没有交给回答环节。

归因记录。 工具第5题确认了返回证据缺少P32,问题记录为跨论文取证不完整。V1.1另外排查了专家第20题的完整比较任务,检索过程与同题对照放在V1.1详情中。

3.4 正文超过明确的篇幅要求

任务。 用户第4题要求250–350字正文。

实际表现。 按原评分口径,可见正文为529字符;排除附录和追加邀约后,主要正文仍有447字符,评分为2分。

归因记录。 超出的部分包含正文和额外输出,最终交付没有落实明确的篇幅要求。复核时按同一计数口径检查正文,再区分必要条件与可以删去的重复解释。

四、后续改进

首轮留下了三个主要修改方向:让比较和逐篇任务取得完整证据,让连续修改保留来源关系,让任务结束时交付符合要求的正文。

V1.1围绕这些问题调整了候选分配、历史引用、上下文和正文检查,并用同一批案例复测。版本详情继续展示具体改法、同题表现与整体分数变化。

查看V1.1 · 检索与回答优化

图表