Citation 与原文核验
用户读到综述中的某个判断,需要知道它来自哪篇论文,必要时打开原文检查。继续要求“缩短背景介绍,保留引用”时,这条关联也应随正文留下来。Lito 把引用做成回答的一部分,同时保存可用于查找原件的来源关系。
一、Lito 如何将回答关联到文献
搜索工具向模型提供编号证据,模型在论述中引用这些编号,系统保存回答与来源的对应关系。正文将引用显示为可点击的文章标题标签,较长的标题缩短显示。标签会清理导入文件名中的序号、作者年份前缀和扩展名,便于用户辨认论文,再打开详情或 PDF。
系统仍使用编号维护引用映射。每条回答按来源首次出现的顺序从 1 编号,重复引用同一来源时复用编号;正文标签负责展示,文档和页码标识负责定位。流式生成、刷新页面和重新打开会话采用对应的编号整理规则。
来源列表按论文合并展示,同一 PDF 的多个证据页不会重复占据列表。正文引用仍保留各自的证据位置:同一论文的不同页面显示相同的标题标签,点击后定位到对应页面。
来源详情展示完整标题和可用页码。用户停留在引用标签上时,系统会查找对应的原文依据:定位成功后显示简短摘录,查找过程中显示加载状态。浮层预览限制在 220 字符、最多四行,完整依据在 PDF 阅读区查看。
Lito 保留两种引用粒度:检索路径通常指向文件,直接放入上下文的 PDF 则可以逐页编号。逐页读取时,程序从原 PDF 获取物理页序,来源形如 file_id#pdf-page=4,并携带 pdf_page。即使中间一页没有文字,后续页面也保留原始序号。
| 引用携带的信息 | 点击后如何使用 |
|---|---|
| 文件标识 | 找到当前用户可以访问的原始 PDF |
可靠的 pdf_page |
打开对应物理页;与论文正文印刷页码分开理解 |
| 紧邻引用的直接引句 | 在指定页或整个 PDF 内查找原文,并尝试高亮 |
| 概括性论述与可靠页码 | 模型在对应页选择支持段落,经原文位置核对后展示 |
引用密度通过生成规则控制:归属清楚的连续论述可以在段末合并同一来源,具体数字、直接引文和不同研究分别保留依据。改写过程中,模型调整引用的组织方式,前端展示返回的正文与引用。
二、用户查看引用时,系统如何查找原文依据
用户悬停查看来源或打开 PDF 时,系统会结合文件、页码和引用附近的内容查找依据。前端既提取紧邻引用的直接引句,也提取引用前的当前论述,供后续定位使用。
系统先尝试匹配直接引句。匹配时统一字符形式与大小写,忽略标点、空格和换行,再检查连续文字是否唯一出现。有可靠页码时查找指定页,否则可以在 PDF 中查找引句。
如果直接匹配没有成功,但引用带有可靠页码和当前论述,模型会阅读对应页,选择最多三段能够支持这句话的原文。例如,正文是中文概括、论文是英文时,模型选取英文原句。随后程序再次核对每段文字是否在该页唯一出现,全部通过后才生成高亮。
模型负责选择相关依据,程序负责确认文字及其位置。高亮坐标按页面比例保存,缩放后仍能贴合原文。查找结果按用户、文件内容、页码和本次论述保存,重复查看可以复用;文件或论述变化后会重新查找。
| 核验结果 | 用户看到什么 |
|---|---|
matched |
对应页面与原文高亮 |
ambiguous |
提示存在多个匹配,保留 PDF 阅读,不选定其中一处 |
missing_quote / not_found |
没有可用引句或未找到匹配,仍可查看页面 |
unsupported_claim |
未找到可确认的支持段落,仍可阅读来源页 |
no_text / unsupported_rotation |
说明文字提取或页面旋转限制,不绘制未经确认的高亮 |
这一过程在用户查看引用时触发。模型选取范围是引用对应页;没有可靠页码时,概括性论述仍通过打开论文核对。当前高亮适用于可提取文字的 PDF,原文预览接口支持最大 50 MB 的文件。
三、Lito 如何在改写后保留引用
用户要求缩写、调整结构或给原文加引号时,原有引用应随正文保留。为此,Lito 在准备历史消息时同时带入回答和来源映射。
系统会检查历史回答保存的引用。文件仍可访问、仍处于当前材料范围,来源才进入新一轮;不同轮次的引用先按真实来源关联,避免相同编号混淆;新回答再按实际引用顺序整理编号。逐页来源的身份包含页码,因此同一论文的不同页面可以保留区别。用户明确提到的编号则按最近一次回答解释。
通过检查的来源在模型生成前进入本轮引用映射,并与新回答一起保存。纯改写可以复用已有来源,刷新页面或重新打开会话后仍能查看引用。
引用关联帮助用户回查原文,模型辅助选择依据,原文高亮便于进一步阅读。观点是否得到充分支持,还需要结合研究条件和上下文判断。
上述修改与核验结果见引用体验改进与回归记录。历史恢复目前覆盖本地上传 PDF;已移除或不可访问的来源不会被恢复进新回答。