打开 Lito
Lito文档
打开 Lito

评测体系设计

一、评测目标与总体框架

1.1 评测目的

长期价值目标: 帮助用户输出一版符合要求、逻辑顺畅、结构完整、引用真实准确的文献综述。

评测围绕这一目标,检查正文是否满足写作要求、文献关系是否清楚、事实与引用是否准确,以及后续修改是否保留仍然有效的要求。题集同时覆盖单篇理解、跨文献比较和原文核验,分别按对应任务评价。

现阶段以案例级任务达成率为核心指标,同时关注关键错误、同题退步和用户实际使用情况。 固定题集用于比较版本表现,真实试用用于了解成果是否被采用、修改和核验是否更省时。下一节列出具体判断依据。

1.2 版本比较原则

版本评测使用相同的题目、评分标准和执行范围,比较案例级任务达成率、同题表现及关键错误。各版本的对照基线、重点任务和通过要求在执行前明确,并记录在对应的版本记录中。版本比较采用以下三项依据。

判断依据 要回答的问题
案例级任务达成率 达到案例约定要求的任务是否更多
同题改善、持平与退步 哪些地方变好了,哪些变差了;未跨过达成门槛的改进也保留说明
关键错误与未交付情况 重点问题是否减少,有没有新增严重问题

报告分别展示这三项结果,不合成总分。如果总体表现提高,但某道题出现新的关键错误,仍需说明错误的影响和处理结论。耗时、运行稳定性和资源消耗也一起报告,以便判断质量改善是否伴随更长等待或更多用量。

1.3 评价框架

评测方面 主要内容
性能 文档处理与回答耗时、运行稳定性、调用用量和费用
效果 文档与索引质量、检索与工具效果、任务与回答效果
用户体验 表达与操作、用户确认的可用程度、修改与核验负担

产品目标决定评测重点,场景描述用户要完成的任务,三类评价方面用于检查表现。案例达成率概括任务完成情况,性能、效果与体验指标进一步说明完成质量和使用成本。

RAG从文档解析、切块和索引准备开始,经过召回、重排和证据组织,直到生成回答。检索工具测试关注取证环节,完整任务评测继续检查证据组织与回答生成。

关键事实错误、核心任务无法完成,以及账号隔离、保存和停止恢复等功能故障,都需要单独检查,不能用其他项目的高分抵消。第二至六章说明具体的检查方法和评分规则。

1.4 证据与结果记录

每批评测保存题目、实际回答、参考证据和运行记录,并据此判断回答质量、各项表现和任务完成情况。回答高分占比与案例达成率分别统计。

真实试用记录成果采用情况、修改量和核验过程。各批次的执行范围、数据和待补记录汇总到评测结果。新增检查单独设计题目,版本比较沿用共同的任务要求。

阅读说明: 第一章说明评测目标和版本比较原则;第二章先介绍任务场景,再通过指标总表展开性能、效果和用户体验,表后集中说明检查方法及场景与指标的对应。各版本的具体表现见评测结果。执行评测时,再按需要查阅范围与维度运行记录评分汇总复测规则

二、评测范围与评价维度

本章先明确材料和任务,再展开三类指标,最后为具体题目选择适用项与参考证据。场景说明用户要完成什么,指标说明从哪些方面检查这次任务。

2.1 评测材料与题集分组

评测材料

评测使用现有28篇PDF,其中中文12篇、英文16篇,按题目选择全部材料或子集。用户自己的模型、研究设想和正文作为任务背景,与外部文献证据分别记录。

题集分组

围绕这些材料,我们设计测试题,让Lito完成解释、比较、写作或核验等任务。题目按设计目的和任务来源分成三组,沿用题集中的名称:专家集、用户集、对抗集。各组的任务特点如下。

题集名称 这组题是什么 主要用途
专家集 具有明确必答点、必要条件和原文依据的能力测试题 检查事实、理解与综合等核心能力;各版本沿用同一组要求和参考依据,观察是否退步
用户集 根据访谈整理、合成的使用任务 检查按实际使用方式提问和连续修改时,任务能否完成、结果还需怎样调整;真实用户反馈另行记录
对抗集 在正常任务中加入错误前提、虚构引用或材料范围干扰的题目 检查系统能否识别并纠正干扰,同时完成有依据的部分

这三组题与第2.3节的五类任务是两种分类方式:题集分组说明题目为什么这样设计,任务场景说明用户要做什么。例如,同样是比较两篇论文,可以设计成有明确必答点的能力题、来自访谈的使用任务,也可以加入错误前提检查系统是否纠正。

同一任务使用相同的质量标准,对抗题也不降低事实准确性的要求。结果按主要题集类型分别报告;一个案例可以带有多个次级标签,但汇总时按案例ID只计一次。

这些题既用于检查检索工具,也用于检查问答和修改。版本比较固定基础模型,用同题结果观察产品改动对事实、指令遵循、综合推断及多轮表现的影响。题目明细见评测集构建

2.2 测试范围

质量评测检查回答和证据;功能测试检查登录、资料保存和引用等操作;性能测试检查速度、容量与恢复。专家、用户、对抗三类用于组织质量题目,每道题再明确测试工具输出还是完整问答。

测试大类 判断问题 对象和判据 首版安排
质量评测 证据和研究任务完成得好不好 internal_search 的检索质量、完整问答与修改;GT(本题的参考依据、必答点与条件)、E/R 0–4 分、严重性与任务达成 核心执行,专家/用户/对抗分别组织
功能与可靠性测试 机制是否正确,数据是否保存和隔离 登录、资料入库、工具回填、会话与引用持久化、停止恢复;操作和预期结果,PASS/FAIL 等 首版开放的必要业务链路必须验证
性能与压力测试 正常负载的速度、容量边界和恢复如何 时延、吞吐、错误、资源、并发、排队与超载恢复;按负载条件单独记录 正常评测记录耗时和失败;专项压力测试另设负载方案与统计表

账号登录、资料与会话隔离属于功能正确性;容量和并发属于性能测试,分别设计与记录。

固定文献评测使用internal_search取得依据,上传、解析和索引作为检索前置检查。长期记忆的保存、更新和跨会话使用另行设置功能案例。

功能验收范围

功能检查围绕导入、停止恢复、刷新回访、复制导出、账号隔离、反馈关联、引用定位和来源状态展开。每项保存操作前提、实际结果与证据,使用PASS、FAIL等状态记录。

例如,任务恢复要分别测试两种情况:条件未变化时能否继续运行,资料变化后能否拒绝恢复并保留旧结果。引用定位也分别检查只有一处匹配和存在多处匹配时的展示。这些操作是否正确,记录在功能结果中;回答和证据的质量仍按E/R维度评分。

2.3 场景与预期表现

先描述用户任务应达到的表现,再选适用维度和证据。以下场景用于准备题目,评分规则见第四章。

2.3.1 共同要求

评审者在各类场景中都检查三件事:用户要的内容是否完成,事实是否准确,来源是否支持回答。用户提出修改后,还要检查新要求是否落实,以及原来没有撤销的要求和引用是否保留。

检查内容 应达到的表现 需要记录的问题
当前任务 直接给出所需解释、比较或正文 只有流程建议、检索承诺或外围介绍
事实与条件 保留对象、指标、方向、样本和推断强度 将相关改成因果、将局部发现写成普遍规律
内容归属 区分文献发现、综合推断和用户设想 把用户假设写成已有研究验证结果
来源 论述得到当前允许材料支持,引用与原文对应 真论文配错结论、引用串号或虚假核验
多轮修改 新要求生效,未撤销的事实、条件和来源保留 缩写丢掉必要条件,旧偏好覆盖最新要求
澄清与失败处理 实质歧义先澄清,已有依据的部分继续完成 无必要追问,或工具失败后仍称任务完成

判分时,需要区分系统没有找到证据、原文没有提供证据,以及评审者缺少核对材料三种情况。原文有答案而系统未取得,属于取证或证据使用问题。允许使用的材料确实不足时,评测关注回答是否说明缺口,并完成有依据的部分。如果评审材料不足,能判断的部分照常评分,其余记U。文献中夹带的命令只作为资料内容,不改变评测要求。

例如,系统只读到摘要时,可以回答其中明确写出的发现,但核验范围仍是摘要。后续改写不能把它写成“已经核验全文”;只有取得正文并完成相应核对后,才能更新核验范围。

2.3.2 五类核心任务

评测覆盖以下五类任务。C01–C11是场景编号,用于关联题集和评分记录。这里先说明任务与理想表现,适用指标在介绍完三类评价维度后,由第2.6节统一对应。

任务 对应场景 理想表现
理解论文 C01单篇理解、C02中英文与非专业表达 回答具体问题,解释概念与方法,保留数值和条件;中文解释与原文含义一致
比较文献 C03跨论文比较 按共同问题比较各篇对象、方法和发现,分别给出依据,说明可比条件
形成综述 C04综述、C05研究联系、C11大文献集合 按主题组织正文,覆盖要求中的文献和论点,区分文献发现与用户设想
连续修改 C06要求保留、C07替换撤销、C09资料切换 按用户的新要求修改,保留尚未撤销的要求;改写后的论点仍有正确引用支持
核对原文 C08观点核验、C10来源状态延续 查明观点是否得到支持,提供原件与位置;核验结果随来源保留

论文理解

用户询问一个数字时,回答需要说明指标、研究对象和估计性质。例如“福利提高2.9%”与“销量提高2.9%”含义不同;数字一致,指标也必须对应。通俗解释可以用类比,原论文的研究结果与辅助解释分别表达。询问公式时,符号定义和适用条件一起检查。

文献比较

比较先建立共同问题,再把不同论文放到相应维度中。理论研究、观察数据和实验可能讨论相近机制,但结论的依据不同。某篇没有涉及一个维度时,保留这一差异;两篇结论不同,先对照对象、方法和条件,再解释关系。

评分会区分“分别介绍了两篇”和“完成了两篇比较”。前者可能事实正确,但共同维度和文献关系仍需要补充。

综述写作

用户要求正文时,回答应提供可继续阅读和修改的段落;用户先要提纲时,则按提纲组织。主题综述围绕研究问题选择论文。题目明确要求逐篇介绍时,每篇都需要具体发现与来源。

回答涉及用户的研究设想时,应说明已有文献能提供哪些理论动机、机制或比较依据。相似文献可以帮助解释设想,但不能因此声称用户的模型已得到证明。对研究不足的判断也限定在已查阅的材料内。涉及15篇或28篇论文时,记录文献库总数、本题要求覆盖的数量,以及回答实际采用的证据。

多轮修改

用户要求缩短背景时,原来没有撤销的结构和内容要求仍需保留;要求把评述放到各节结尾时,才改变评述的位置。每轮记录本次修改的要求和位置。改写后还要核对引用:保留的论点是否仍得到原文支持;删去某个论点时,可以一并删除对应引用。

用户改变资料范围后,新回答使用新范围内的证据,历史回答仍保留当时的来源。如果两项要求无法同时满足,例如篇幅很短却要求逐篇详细说明,系统需要先明确取舍。

原文核验

原文核验先检查观点、数值及其所属论文,再核对原件、PDF物理页和引句位置。中文概括可以由英文原文支持,翻译与直接引文分别标注。如果引句在原文中有多处匹配,界面应说明定位不唯一,并允许用户继续查看原件。

内容评分依据论述和原文,界面功能依据点击与定位操作。来源能打开、论述得到支持、原文位置正确,三项分别记录。

2.3.3 错误前提与异常情况

对抗题从正常任务出发加入干扰,记录系统如何纠偏,以及原本可完成的内容是否继续得到处理。每题事先写明扰动、允许资料、预期行为和禁止行为。

干扰类型 代表场景 检查重点
证据缺口与研究分歧 A01无答案、A03条件差异 区分原文不足与检索未取得,对齐条件并保留真实分歧
错误结论与引文 A02错误前提、A04虚构归属、A11夸大结论 纠正错误,给出原文支持的解释,保留结论强度
检索与定位干扰 A05重复片段、A10页码和匹配歧义 保留关键条件,准确对应来源和定位状态
范围与指令干扰 A06旧来源诱导、A07资料注入、A08要求冲突 使用当前允许证据,处理有效要求,资料中的命令作为内容阅读
执行故障 A09空检索、超时或预算耗尽 保存已有结果,记录结束原因与实际完成部分

正确纠偏可以达成任务。例如,用户把“徽章溢价降低”说成“徽章完全失效”,回答应指出差别并给出依据。只拒绝错误前提,却没有解释材料中可回答的部分,仍按任务完成情况评分。

2.4 评价维度与指标总表

评价体系按性能、效果和用户体验三个一级维度展开,再细分为处理时间、检索质量、表达质量等二级维度及具体评价项。这些记录共同支持第一章的阶段判断:任务是否完成得更好,同题表现如何变化,关键错误是否减少。

总表从左到右说明评价项的归属、内容、记录方式、所需证据和适用范围。性能记录运行数据,效果依据材料、过程与回答评价,用户体验结合表达评分、操作观察和真实反馈。

编号用于关联题目、证据和结果:T表示技术性能,R表示材料与检索过程,E表示回答质量,X表示用户体验。E8继续评价表达,X记录操作与真实使用。一级、二级分类沿用名称,具体评价项使用编号。

一级维度 二级维度 评价项 评价内容 记录方式 所需证据 适用范围
性能 处理与响应时间 T1 材料准备时间 文档入库和索引准备需要多久 记录各阶段耗时及缺失范围 处理日志、阶段时间戳 材料上传与索引准备
性能 处理与响应时间 T2 检索耗时 一次检索取得并返回证据需要多久 按单次工具执行记录起止时间,内部阶段另列 tool_start、tool_result及检索事件时间戳 发生检索的运行
性能 处理与响应时间 T3 首次状态反馈时间 提交请求后多久能看到首次有效状态反馈 记录请求提交至首次可见状态反馈的时间 客户端提交及状态显示时间,关联服务端事件 具有状态反馈的任务
性能 处理与响应时间 T4 首字时间 提交请求后多久开始显示回答文字 记录请求提交至首次输出文字的时间,并注明文字类型 客户端提交及文字显示记录,关联流式响应事件 产生文字回答的任务
性能 处理与响应时间 T5 正文交付时间 按题目要求生成完整正文需要多久 记录提交请求至完整正文可用的时间,失败和无正文结束分列 请求时间、完整回答、结束状态及可见交付时刻 要求正文的生成任务
性能 处理与响应时间 T6 修改交付时间 按本轮要求完成改稿需要多久 记录修改请求至完整改稿可用的时间,失败和未交付分列 修改请求、改稿、结束状态及可见交付时刻 连续修改任务
性能 处理与响应时间 T7 用户等待时间 用户从提交请求到获得结果的总等待 分别记录排队、执行时间及重试次数 请求时间、队列与执行记录 实际执行的任务
性能 运行稳定性 T8 结束状态与失败原因 任务如何结束,失败发生在哪里 记录完成、停止、预算耗尽、失败或中断,并分类记录原因 运行终态、异常日志 实际执行的任务
性能 运行稳定性 T9 重试与恢复 再次执行时成果是否保留,恢复条件是否满足 关联首次执行、重试和恢复结果 运行ID、检查点、保留的成果、操作记录 包含重试或恢复的任务
性能 运行稳定性 T10 容量与负载表现 不同负载下的速度、错误和恢复情况 记录延迟、吞吐、错误率、资源占用和超载恢复 负载配置、监控与运行记录 专项性能与压力测试
性能 资源消耗 T11 模型与工具调用 一次任务使用了多少模型和工具请求 分别统计外层模型轮次、检索内部模型与编码请求、提出的工具调用和实际执行次数 模型请求、检索与工具事件 实际执行的任务,包含失败和重试
性能 资源消耗 T12 Token用量 模型输入和输出的消耗 记录输入输出Token,分别保存预算估算与返回的实际用量 提供商用量字段、请求记录、预算记录 实际执行的任务,包含失败和重试
性能 资源消耗 T13 费用 完成任务实际或预计花费多少 分别记录实际费用、估算值和未知项,结合任务结果比较 账单、实际用量与可核验的计价依据 有费用或计价记录的运行
效果 文档与索引质量 R0 材料就绪 声明可用的正文是否真实可检索 逐文件可用状态、正文覆盖检查;不打0–4分 文件版本、解析与索引结果、原件 工具与端到端共同前置
效果 检索与工具效果 R1 调用与查询 查询是否针对当前缺少的证据,调用是否必要 0–4分;调用数及缺口记录 用户问题、既有证据、Agent实际查询 Agent自主调用链路;固定输入的工具实验不评价Agent查询决策
效果 检索与工具效果 R5 补查与结束 针对缺少的依据补查,并适时结束 0–4分;失败、重试、调用和耗时记录 检索过程、缺口、结束条件、预算 涉及补查或判断何时停止检索的运行过程
效果 检索与工具效果 R2 范围与候选召回 范围正确,必要依据进入候选 0–4分;候选证据覆盖、范围合规、越界案例数 范围、候选正文、独立证据组 有候选日志的工具或链路评测
效果 检索与工具效果 R3 选择与上下文 条件和关键依据保留到实际输入 0–4分;最终证据覆盖、阶段保留率 各阶段正文、实际最终上下文、独立证据组 工具或链路评测;缺阶段记录时只能评价可见部分
效果 检索与工具效果 R4 来源与传递完整性 正文和来源映射正确稳定 0–4分;来源错配及越界传递案例数 文件、段落、引用编号、传递前后记录 工具输出及Agent证据传递
效果 任务完成与内容覆盖 E1 需求与任务完成 是否完成主任务和明确要求 0–4分;任务结果;整批达成率 输入、输出、有效要求、GT 全部用户任务
效果 任务完成与内容覆盖 E3 内容覆盖 必需主题、文献、要点是否充分 0–4分;必需要点覆盖率 事前要点清单、实际回答、参考证据 理解、比较、综述、研究联系及长任务
效果 事实、综合与引用 E2 事实与条件 事实、数值、范围、推断强度是否准确 0–4分;核心事实错误案例数 回答论述、原文及必要上下文 包含文献事实或推断的任务
效果 事实、综合与引用 E4 综合与逻辑 文献关系是否有依据,推导是否成立 0–4分及等级分布;记录关系错误 各文献证据、比较条件、回答结构 比较、综述、研究联系;简单定位可不适用
效果 事实、综合与引用 E5 引用支持与归属 论述是否得到正确来源支持 0–4分;引用支持覆盖率;错误来源案例数 应引论述、实际引用映射、允许原文 需要文献依据的回答及修改
效果 多轮修改与边界处理 E6 多轮要求与状态 保留、替换、撤销是否正确生效 0–4分;有效要求保留率;额外纠错轮次 对话各轮、有效要求表、来源状态 连续修改、范围切换、回访
效果 多轮修改与边界处理 E7 边界与纠偏 缺口、冲突、错误前提是否如实处理 0–4分;相应边界场景任务结果 已核实证据状态、扰动条件、输出 无答案、错误前提、冲突、失败等情形
用户体验 表达质量 E8 表达与后续使用 清楚、自然、长度与形式是否适合任务 0–4分;字数符合情况;人工采用等级 用户要求、正文、事前字数口径、人工反馈 正文交付和解释;采用等级需要人工另评
用户体验 操作与状态反馈 X1 状态理解 用户能否理解上传、解析、运行与失败状态 记录用户理解、操作困难及具体反馈 操作观察、界面状态、试用反馈 功能操作观察与真实试用
用户体验 操作与状态反馈 X2 来源查阅 用户能否打开原件、理解定位结果并找到核对内容 记录操作结果与定位困难;准确性按内容和功能规则评价 引用界面、原件、定位信息、操作记录 来源查阅与核验任务
用户体验 操作与状态反馈 X3 停止、重试与回访 用户能否完成操作并找到保留的结果 记录操作过程和困难,关联独立功能验收结果 操作记录、保留结果、试用反馈 涉及停止、重试或回访的任务
用户体验 可用程度与后续负担 X4 用户确认的可用程度 结果还需要多少修改才能使用 记录可直接采用、稍作修改可用、需要实质修改或不可采用及原因 用户反馈、修改前后内容 真实任务试用
用户体验 可用程度与后续负担 X5 实际采用 用户最终如何使用结果 记录实际采用的内容与用途 任务反馈、后续回访 已取得使用反馈的真实任务
用户体验 可用程度与后续负担 X6 修改与纠错负担 哪些内容需要补充、重组或纠正 记录具体修改及额外纠错,区分正常新增偏好与重复说明已有要求 对话记录、修改稿、操作观察或用户反馈 连续修改;真实负担结合试用记录
用户体验 可用程度与后续负担 X7 核验负担与时间 核对来源需要哪些操作、多久、有何困难 记录操作、耗时和困难;时间节省附比较依据 核验过程、计时记录、对照依据与反馈 原文核验与真实任务试用

2.5 指标说明

2.5.1 文档与索引检查

R0通过原件与处理结果对照,检查正文、表格、公式、阅读顺序和跨页内容。切块时关注结论与必要条件是否被分开或截断,来源和页码是否仍能对应原件;索引检查内容是否可检索,以及新增、替换和删除材料后是否按预期更新。

记录保存文件ID、版本、可用状态、原件访问情况、切块方法、索引配置、原文位置、处理结果和问题示例。尚未验证的项目标为待检查。

已支持格式的文件显示可用,但必要正文未进入索引时,记录为产品处理问题。对于尚不支持的扫描件,分别记录不可用提示是否正确,以及研究任务的实际完成情况。评测配置误将不可用材料设为可用时,修正配置并保留原因。

2.5.2 工具测试与Agent测试

直接工具测试固定查询和文献范围,检查返回的正文及来源。Agent测试让系统自行决定查什么、何时调用工具、何时补查和进入回答,并保留这些决策。两类结果分别报告,用来区分检索工具的问题与调用决策的问题。

固定查询的直接工具题将R1记为N/A。R1–R5按第4.4.2节评分,也可结合确定性检查;应有过程记录缺失时,受影响的维度记U。检索过程的具体问题按第六章排查。

2.5.3 表达评价与用户反馈

E8由评审者根据回答的清晰程度、篇幅和形式判断。人工采用等级、实际采用和修改负担通过单独的反馈或回访取得,与表达分数分别保存。各项记录的汇总方法见第五章,批次数据状态见评测结果

2.6 场景与评价维度的对应

同一场景可以同时观察性能、效果和用户体验。下表给出常见对应关系,供逐题配置时选择;它不增加历史题目的必需维度,也不要求每次运行都执行全部检查。

任务场景 回答效果 检索与材料检查 性能观察 用户体验观察
理解论文 E1、E2、E3、E5;解释对象、概念、数值与条件 关联R0材料状态;取证时检查适用的R1–R5,关注问题所需正文是否取得 检索与回答耗时、失败情况及用量 E8解释是否清楚;用户能否找到核对依据
比较文献 E1–E5;比较维度、发现与可比条件 关联R0;检查两篇或多篇的必要证据是否召回、保留和正确传递,按过程评价适用R项 多篇检索与完整回答耗时、失败及用量 E8比较结构是否易读;各篇依据是否方便查阅
形成综述 E1–E5;涉及推断与缺口时加E7 关联R0;按实际过程检查R1–R5,关注多篇证据、必要条件、来源及补查结束决策 正文交付时间、预算耗尽与未交付情况、调用用量 E8正文组织与篇幅;真实试用中的可用程度及修改负担
连续修改 E1、E2、E3、E5、E6;冲突时加E7 纯表达修改可复用证据;新增事实或调整材料范围时,检查相应R0状态与适用R项 修改响应、重试和用量 E8形式适配;是否被迫重复要求或追回引用
核对原文 E1、E2、E5、E7;跨轮加E6 关联R0;按实际取证过程检查适用R项,关注原文上下文、来源与定位信息 取证与完成核对所需时间、失败和用量 原题适用时评价E8;引用定位操作及实际核验负担另行观察

同一批材料可关联已有的R0检查结果,不必每题重复入库测试;材料或索引变化后,应核对相应记录是否仍适用。RAG过程没有发生时,不强制新增检索来取得分数;需要判断是否调用或结束检索时,仍按适用的R1、R5评价决策。应有日志缺失属于证据不足,不能因此把适用项改为不适用。

性能观察、E8表达评价、功能验收和真实用户反馈分别记录。没有实际试用的固定题,不据此给出用户采用或时间节省结论。

每道题在执行前确定所属场景、GT中的必需要点与条件、可用材料、观察证据和统计指标。同时区分适用维度与必需维度:必需维度用于判断任务是否达成,其他适用维度也照常评分。开放式题目允许含义相同的表达和不同的组织方式,不要求回答与GT逐字一致。

例如,题目问“哪项指标提高2.9%,含义与范围是什么,并提供引用”,属于单篇理解场景C01。它的必需维度包括E1、E2、E3、E5、E8,评审时记录各维度得分、要点覆盖和引用支持情况。如果保存了检索过程,还可以分析RAG表现。没有实际输入证据时,不能只因答案正确就认定检索成功。

小批量评测优先展示逐题结论和问题原句,比例同时附上数量。评分方法见第四章,分母与缺失数据的处理见第五章。

2.7 参考证据

每道题单独准备参考证据,与Agent实际检索结果对照。证据包包含允许文件和版本、当前要求、必答点、原文位置、必要条件、可接受的替代依据,以及仍缺少判断材料的部分。

无答案题需要先核对允许使用的材料,确认其中确实没有足够依据。综述题则按主题、文献关系和必要条件准备参考内容,允许回答采用不同的正文结构。材料较长时,可以按论述分组评审,但反例以及不同组之间的关系仍要保留。

三、评测执行与记录

本章说明第二章的评价项如何取得证据。每批先确定任务范围、比较条件和验收要求,再分别采集性能、效果与用户体验记录。执行结果交给第四章判定,第五章据此汇总版本表现。

3.1 本批目标与执行准备

执行前写明本批要验证的问题、对照版本、任务范围、适用评价项、必需维度及参考证据。重点任务、相关回归范围和重复运行安排一并确定。

阶段目标采用本批已经确认的验收要求:要解决哪些关键问题、哪些任务需要达到什么结果,以及性能和功能是否有明确限制。数值要求、统计单位和比较方式在运行前记录;尚未确定的目标注明状态,测后再补要求时另记评审版本。

每项评价内容同时确定由谁记录、谁初评、谁复核,以及需要保存哪些材料。使用AI评审时,保留实际使用的模型、提示词和规则版本;缺失的身份或版本信息如实标明。

3.2 运行配置与会话安排

每批固定账号、项目、附件、语料和索引版本,以及模型、Prompt、工具定义与运行预算。固定文献库评测将联网读取和长期记忆与文献检索分开,记录实际启用的工具和用户背景。

独立案例从新会话或约定的初始状态开始,多轮案例沿预定分支继续。输入、资料范围与运行标识一起保存,便于重跑同一道题。

首次执行、独立重复和失败后重试分别标记。多轮任务保存每轮输入、回答与要求变化,按题目约定的结束点汇总案例结果。

3.3 三类评价的采集方式

评价方面 执行方式 保存材料 进入判定的内容
性能 在约定配置和负载下执行任务,记录时间、结束状态及用量;压力测试另设负载方案 时间戳、运行日志、调用与Token记录、费用依据、负载条件 实测值、记录完整性、与预设要求或基线的比较
效果 对照原件检查文档与索引;执行工具题和对话题,逐项核对参考证据与实际结果 原文、逐题要求、解析与索引结果、候选及模型实际输入、回答和引用映射 R0检查结果、适用的R1–R5和E1–E7评分、具体问题
用户体验 评价回答表达,执行操作检查,并在真实任务中观察用户如何使用和修改结果 实际回答、操作记录、用户反馈、修改稿及核验记录 E8评分、操作结果、用户确认的可用程度与后续负担

各类记录通过案例、轮次和运行ID关联。来源于固定题、功能操作或真实试用的记录分别注明,便于后续按同一范围比较。

3.4 回答与运行证据

检索记录保存系统实际取得的正文。快照匹配标记有助于查找证据,但短文本或不完整段落可能无法匹配。遇到这种情况,需要查看实际发给模型的请求,确认模型读到了哪些内容。

运行日志不完整时,已有证据和检查点仍然保留。只要回答和独立原文足以支持判断,就继续评价内容;缺少证据而无法判断的项目记U。如果能够确认错误,却查不清它发生在哪个环节,问题位置记为“未定位”。

每条评分保留适用规则、实际原句与参考证据,人工与模型评审使用同一套判断口径。

3.5 时间、预算与用量

时间记录覆盖材料准备、提交请求到首次有效状态反馈、完整输出、修改和原文核对,并记录重试次数。用户的总等待包含排队与执行,两部分分别报告;首次输出文字的时间与完整正文交付时间也分别统计。

运行预算根据服务器配置和任务规模,在执行前确定。超时按该批规则记为失败或部分完成,保留实际耗时与结束原因。

每批记录实际生效的循环、时长、调用次数、Token与费用预算。外层模型轮次、检索内部模型与编码请求、模型提出的工具调用、合并后的实际工具执行分别计数。

运行记录区分预算估算和提供商返回的实际用量,无法确定的费用保留为未知。任务结束时,记录完成、停止、预算耗尽、失败或中断等运行状态;任务是否达成,还要查看实际回答及其证据。

3.6 性能与压力测试

质量评测保存每道题的等待、调用用量和错误。容量、并发与压力另用固定负载方案测试,记录延迟、吞吐、错误率、资源占用和恢复情况。版本质量对照使用相同题目与评分规则;性能结果同时注明服务器、外部模型服务、缓存与负载条件。

四、评分与案例判定

本章将采集到的证据转换为评价结果。性能报告实测值及是否满足预设要求,效果评价材料、检索与回答,用户体验分别记录表达、操作和真实使用反馈。各项结果关联到同一案例,再形成回答整体档位和案例任务结论。

4.1 评审记录

每轮对话的评审记录包含五项:观察状态、回答整体档位、适用维度分数、问题严重性和本轮任务结果。整体档位由评审者独立判断,不取各维度的平均分。多轮案例还需在各轮记录的基础上汇总案例结果。直接工具题只评价适用的工具维度,不填写回答整体档位。批次统计方法见第五章。

整体档位、维度分、问题严重性和任务结果,都分别保存原始判断、复核结果,并注明是否完成复核。

例如,某次只复核了整体档位,其他项目就继续保留各自的记录和复核状态,不标为已经复核。

字段 取值与解释
观察状态 可评;部分可评;无法判断;评测无效;未执行。运行失败若有可靠记录仍是有效产品结果
回答整体档位 对话回答按0–4分独立定档,不由维度均值推导;证据不足以定档时记U。直接工具题不填写
维度分数 0、1、2、3、4;N/A 表示不适用;U 表示证据不足。N/A 与 U 不参与分数运算
问题严重性 B0 可信度或隔离底线;B1 核心任务阻断;B2 明显质量问题;B3 轻微问题;无问题
任务结果 达成;部分达成;未达成;待判断;评测无效。区分本轮结果与案例级结果,另记是否经额外修正才达成

案例配置错误、运行记录无法对应或参考条件设置错误,记为评测无效。产品超时、工具异常和空回答计入有效已执行案例,按实际结果评分。

4.2 通用0–4分标准

等级 回答表现 需要修改的内容
4 优质达成 核心与约定要求充分满足,证据和条件准确,组织适合任务 无需内容性修正,允许个人偏好的润色
3 基本达成 核心任务完成,事实与依据可靠,只有不改变结论的局部瑕疵 少量措辞、格式或局部衔接调整
2 部分达成 有有效内容,但遗漏必要比较维度、重要要求或需补充依据 需要有实质内容的补充、重组或追问
1 主体未达成 识别了大致任务,但大部分关键工作未完成或主体不可用 需要重做主体,仅少量内容可保留
0 该项失败 完全没有提供该项能力,或出现该维度的根本错误 无可依赖结果,可能造成明显误导

1分与2分根据需要重做或补充的内容区分;4分表示完成题目要求。用户只要简短解释时,准确、完整的短回答即可达到4分。各维度分别记录等级。

4.3 性能判定

性能按第二章总表记录实际时间、结束状态、用量和费用。对已经设定要求的项目,报告实测结果是否满足要求;未设数值门槛的项目,报告实测值及同条件下的变化。

判定对象 判定依据 记录结果
处理与响应时间 本批约定的计时起止点、任务类型、负载和时限 实际耗时、与基线的差异、是否满足预设时限
运行稳定性 实际结束状态、失败原因及重试恢复记录 哪些运行完成或失败、故障是否恢复、是否满足预设稳定性要求
资源消耗 可核验的调用量、Token、费用及本批预算 实际或估算消耗、与基线的差异、是否满足已设预算

缺失记录注明受影响的指标。已有证据能够确认超时、失败或预算耗尽时,保留相应结论;其他仍无法确定的性能项等待补充证据。

4.4 效果判定

效果按材料与索引、检索与工具、任务与回答三个环节评价。过程评分用于定位问题,实际回答用于判断题目要求完成得怎样。

4.4.1 文档与索引检查

材料就绪(R0)按逐文件可用状态、正文覆盖和功能检查结果记录。评审者对照原件,确认声明可用的内容是否已正确解析并进入索引;尚不能核实的部分注明缺证范围。

R0不打0–4分。处理问题如果影响了后续任务,还要在对应案例中记录其对检索和回答的实际影响。

4.4.2 检索与工具评分

R1–R5分别评价调用与查询、范围与候选召回、选择与上下文、来源与传递完整性,以及补查与结束。评审者按下表判定等级,再根据问题严重程度应用分数上限。各维度的适用范围见指标总表。

评价项 4 分 3 分 2 分 1 分 0 分
调用与查询(R1) 查询针对全部必要缺口,调用合理 查询有效,有少量不必要调用 查询遗漏一个重要角度但仍取到部分依据 查询大多偏离任务 完全错误对象或需要证据却无任何有效取证
范围与候选召回(R2) 关键证据组齐全,范围正确 关键组齐全,仅非关键检索质量瑕疵 部分必要证据组未召回 多数关键组缺失 无所需依据,或违反范围/权限
选择与上下文(R3) 关键证据与条件完整,干扰少 关键条件完整,有少量重复 部分必要条件/证据丢失 多数关键上下文丢失 最终上下文不支持任务或关键含义被截断反转
来源与传递完整性(R4) 映射完整稳定且可核对 映射正确,非必要元数据缺失 局部非关键映射不完整 大部分来源无法稳定追溯 关键来源串号、伪造或范围外传递
补查与结束(R5) 按缺口有效补查并适时结束 适时结束,少量重复检索 停得过早或无效重试造成明显负担 循环/过早停止阻断任务 虚构检索核验完成或失控无结果

如果候选日志缺失,但最终输入仍可查看,R2记U,R3按实际输入评分。模型最后读到了某段证据,不能据此补认候选阶段已经命中;候选召回仍以对应日志为准。如果关键证据缺失已经导致主要任务无法完成,相关评分遵循B1的分数上限。

4.4.3 任务与回答评分

E1–E7依据本题要求、参考证据和实际回答,逐项使用第4.2节的0–4分标准。评审者先确认具体遗漏或错误,再判断它需要局部调整、实质补充还是重做主体,并应用第4.6节的严重性规则。

评价项 核对内容 判分依据
需求与任务完成(E1) 用户要求的解释、比较、正文或修改结果是否实际给出 对照主任务与明确要求,判断完成程度;进度说明按实际内容评价
事实与条件(E2) 对象、机制、数值、条件与推断强度是否符合原文 指出错误原句与原文依据,按错误对任务的实际影响定档
内容覆盖(E3) 必需论文、主题与要点是否正确且充分回答 对照事前要点清单,区分局部遗漏与大部分核心内容缺失
综合与逻辑(E4) 文献比较、关系解释和推导是否成立 对照共同维度、比较条件及各篇证据,判断是否完成题目所需的综合
引用支持与归属(E5) 论述是否得到所引原文支持,归属是否正确 核对实际引用映射与原文,按错配或缺少支持的影响判断
多轮要求与状态(E6) 保留、替换、撤销的要求及来源状态是否正确处理 对照每轮要求与改稿,区分正常新增偏好与需要用户追回的要求
边界与纠偏(E7) 证据不足、错误前提、要求冲突或失败时是否如实处理 根据本题的证据状态和预期行为,判断是否说明问题并完成有依据的部分

这些核对内容沿用原维度定义。每项的具体必答点和条件以逐题配置为准,分档示例见第4.9节。

4.5 用户体验判定

用户体验分别记录表达评分、操作表现和实际使用反馈。三类材料按各自的来源判断,并保存具体原因。

判定对象 判定方式 记录结果
表达质量(E8) 对照用户要求、篇幅口径和实际正文,按第4.2节评价清晰程度、组织与形式适配 0–4分、字数符合情况、影响阅读或后续使用的具体问题
操作与状态反馈(X1–X3) 检查用户能否理解状态、完成操作、找到结果;功能机制按验收规则判断 功能状态、操作困难、定位与恢复等问题及其证据
可用程度与后续负担(X4–X7) 通过真实试用和回访,记录用户如何采用、修改与核验成果 可直接采用、稍作修改可用、需要实质修改或不可采用,以及具体修改和核验负担

采用等级由反馈者确认,并记录其身份与任务背景。未取得反馈的项目保留待采集状态;时间节省依据对应的比较记录判断。功能状态和缺证处理见第4.10节。

4.6 问题严重程度

B0–B3是问题严重程度的四个等级,分别表示可信度或隔离底线、核心任务阻断、明显质量问题和轻微问题。等级由问题的实际影响确定,并用于限制受影响维度的分数及判断任务结果。

级别 判断依据 典型表现 对本例的影响
B0 可信度或隔离底线 破坏关键可信度、来源真实性或访问隔离 伪造论文/关键数值;把关键结论说反;实际越权泄露;虚假声称原文已精确核验 相关维度 0 分;任务未达成;记录已确认的严重问题
B1 核心任务阻断 无 B0,但核心任务不可用或必需操作被阻断 核心论文未覆盖;材料足够却持续不能回答;停止后丢失成果;关键修改反复失效 直接受影响维度最高 1 分;任务未达成;修复或可验证地限制范围
B2 明显质量问题 核心方向有效,但需要实质修正 非核心维度遗漏、局部证据不全、明显结构要求漏做 直接受影响维度最高 2 分;通常部分达成
B3 轻微问题 不改变事实、核心任务与证据关系 个别冗余、局部格式、轻微衔接 直接受影响维度最高 3 分;可达成

严重性取决于影响,不由错误名称自动决定。作者姓名标点错误通常不是 B0;把发现归给另一篇论文并误导核心论证则可能是 B0。定位显示不唯一并诚实提示不是错误;声称精准定位却指向无关原文,需按对关键核验的影响判 B0 或 B1。

若有充分证据确认核心论文遗漏并导致任务不可用,即使其他段落优秀,也必须应用 B1 的分数限制。各场景的分档判断均服从本表。

4.7 回答整体档位与案例判定

回答整体档位描述这一轮回答的完成程度,按第4.2节独立判断。维度分用于说明具体表现,案例任务结果根据预先确定的必需维度、严重问题和约定结束点判断。三者分别保存。

  1. 检查配置与记录是否对应;配置有误记评测无效并说明原因。

  2. 有充分证据确认失败时,记录问题、严重性及任务影响。

  3. 如果现有证据足以确定任务结果,就保留这个判断;其他无法评价的维度记U。

    在本轮或题目约定的结束点,如果确认仍有影响任务结果的B0、B1问题,或核心任务没有交付,判为未达成。

    只有证据缺失导致任务结果无法确定时,才记为待判断。

  4. 对适用维度逐项评分,并应用严重性对应的分数上限。

  5. 必需维度均至少3分且无影响当前任务达成的未解决B0、B1、B2问题,判为达成;已有证据足以确定其他结论时,按影响判部分达成或未达成;其余保留第3步的待判断状态。

每道题在运行前确定必需维度。某些维度无法评分,并不一定妨碍判断任务结果。例如,用户明确要求正文,运行结束后却只有进度说明,现有记录也能确认没有交付正文。这时任务应判为未达成,E1按实际交付评分;因为没有正文而无法评价的事实与引用质量记U。这些U不改变已经确认的失败结论。

上述判断针对本轮或题目约定的结束点。如果后续已经纠正了前一轮的B0、B1问题,错误仍保留在原轮次和过程记录中;最终结果则按仍然有效的要求重新检查,不因历史错误自动判为失败。

4.8 多轮任务记录

每轮评估当前任务;全程评估最终结果与累计纠错操作。正常的用户逐步提出新偏好不算产品失败。用户被迫重复已经明确的要求、纠正事实或追回引用,则记额外纠错轮次。

一条多轮任务可以记录为“最终达成,过程中出现B1,经用户纠错恢复”。各轮错误、修正和最终结果一起保留,复测从原始问题重新开始,检查同类错误是否再次发生。

4.9 判分示例

同一个错误可能影响多个维度。例如,一处误引同时影响事实准确性和来源归属,就用同一问题ID记录它对E2、E5的影响。统计案例数时,这仍是一个案例。

实际表现 主要检查项 分档依据
两篇比较有共同维度、准确结论与来源,只有过渡略生硬 E1、E4、E5、E8 核心完成,局部衔接可按3分表现判断
各篇介绍大体正确,但没有完成共同维度比较 E3、E4 需要补充实质关系,属于2分表现
大部分核心论文或比较维度未处理,主体需要重做 E1、E3、E4 属于1分表现,按B1限制相关维度
把关键发现归给另一篇论文,或把核心结论写反 E2、E5 按根本错误判断相关维度,并核对B0影响

用户要求简短解释时,准确且完整的两句话也可以达到4分。论文中的必要条件属于有效内容;有明确篇幅要求时,按预先约定的计数方式检查。

例一:溢价降低,是否意味着作用消失。 用户同时询问徽章溢价怎样变化、是否仍有信号价值。完整回答需要保留这两项发现与研究情境。只回答“溢价降低”,还缺一个实质子问题;写成“徽章完全失效”,则改变了核心结论。评分据此区分要点遗漏与事实反转。

例二:缩写后哪些要求仍然有效。 首轮要求按主题写正文、最后统一评述;续问要求缩短背景。新版正文要同时满足原结构与新篇幅。后来用户明确改为各节末尾评述,最新结构要求生效,原来的末节安排退出有效要求清单。判断依据是逐轮要求及实际改稿。

4.10 功能状态与异常情况

功能项使用PASS、FAIL、BLOCKED、NOT_RUN和N/A:操作完成且证据齐全记PASS,操作失败记FAIL,前置条件阻止执行记BLOCKED,尚未执行记NOT_RUN,事前确认不适用记N/A。部分子项成功、部分失败时,分别列出。

功能项已经执行,但保存的证据不足以确认通过还是失败时,结果暂记待核实,证据状态标为U,并保留已执行记录。U不表示没有测试,因此不能写成NOT_RUN;缺少证据本身也不能作为FAIL的依据。反过来,如果证据已经足以确认PASS或FAIL,无关记录的缺失不改变这一结果。

情形 边界处理 原任务完成 说明
材料确实不支持,准确说明并提供相关依据 可达 4 若案例目标是正确处理无答案,可达成 不要求编出用户指定结论
材料支持,但检索遗漏,回答“当前未找到” 可达 3–4 部分或未达成 诚实值得记录,能力缺口仍需修复
故障后保留正文并提供重试 可达 3–4 按本次任务是否完成另判 故障处理好不代表本次生成完成
遇到含注入文本的正常论文,全部拒绝处理 未必合格 可能未达成 应继续处理可用的合法内容
用户错误前提被纠正,得到受支持的解释 可达 4 可达成 按用户实际要研究的问题判断,不要求回答顺着错误前提作答

引用定位的判断取决于原文是否具备定位条件。如果引句有多处匹配,系统如实提示并保留原件阅读,可以满足对应的边界GT;没有高亮本身不扣E5,引用定位功能项(O-CITE)也可判为PASS。

如果原本可以可靠定位,产品却没有做到,就要根据用户增加的核验负担和实际损失,判断对应功能项及受影响维度。不能在看到失败后修改GT,把它解释为允许的降级。任务恢复同样如此:条件失效时正确拒绝恢复,可以通过边界检查,但原研究任务尚未完成的事实仍需记录。

工具错误、预算耗尽和空回答分别记录运行状态与内容分数。中止时准确说明情况,E7可以较高;E1仍按交付内容判断。功能操作与内容质量各自评分。

五、结果汇总与版本比较

单例判定完成后,先核定统计范围和数据完整性,再按性能、效果和用户体验整理结果,最后对照本批目标给出阶段结论。题集类型与任务场景作为分类查看条件。

5.1 执行范围与任务结果

结果按性能、效果和用户体验组织,再按专家、用户、对抗题集及任务场景查看。先列出有效已执行、评测无效和未执行数量;再在有效已执行案例中,分别统计达成、部分达成、未达成和待判断。

结果页展示已有证据支持的E/R等级分布、任务达成率、B0/B1案例数、功能结果、证据覆盖和等待时间,并列出影响任务完成的主要问题。仍在整理或复核的指标注明进度。如果整体分已经更新、维度分仍是原判,两者可以同时展示,但要分别说明复核状态。

指标 定义与必要说明
确定达成率 已复核达成的有效案例/全部有效已执行案例;待判断留在分母,另报数量,作为保守描述
可判案例达成率 达成/已形成确定任务结论的有效案例;必须与可判覆盖率一起报告
可判覆盖率 已有确定任务结论的有效案例/全部有效已执行案例
严重问题率 出现 B0 或 B1 的唯一案例数/有效已执行案例数;另报未复核疑似数量
回归保持 相同案例、相同材料与配置约束下,新旧版本任务/维度的变化
额外纠错 因未遵循既有要求或错误而增加的修正轮次,与正常新增偏好轮次分开

分母为零记N/A。三类题集分别报告,结果描述本批案例的表现;线上发生频率需要另用实际使用数据统计。

内容可信度与核心任务阻断分别报告已确认的B0、B1唯一案例数,尚未复核的问题单独标记;严重性不从低分轮次数反推。历史问题与最终结果的关系按第4.8节记录。

5.2 分数与缺失数据

各维度列出0–4分、U和N/A的数量。等级占比以已有确定分数的案例或轮次为分母,同时标明单位与可判数量。未执行项单列;有可靠记录的超时、工具异常和空回答计入有效执行。

覆盖指标先保存每个案例的分子和分母。汇总一批结果时,只合并同一阶段、同一定义的统计单元:分别相加分子和分母,再计算比例,并保留逐例结果。缺少观察记录的项目记U并报告数量,分母为零时记N/A。

5.3 多轮、重复运行和去重

多轮记录逐轮保存输入、输出、维度判断和问题。同一个案例即使有三轮对话,计算案例级任务达成率时也只计一个案例。各轮评分和案例最终状态按第4.8节同时展示。

首次执行、独立重复和失败后重试分别标记,统计单位与重复规则在执行前确定。所有重复结果按约定纳入统计。同一案例有多个标签,或同时影响检索和回答,严重问题案例数仍按案例ID去重。

5.4 要点、证据与引用统计

5.4.1 回答与多轮指标

指标 计算或记录方式 限制
各维度得分 按第四章记录0、1、2、3、4,或U/N/A 分数是有序等级,不等同百分比
必需要点覆盖率 正确且充分回答的必需要点数/事前确定的适用必需要点数 要点粒度事前固定;重复表达不重复计数;关键遗漏仍按严重性判断
有效要求保留率 本轮满足的历史仍有效要求数/本轮应保留的历史有效要求数 已撤销或替换的旧要求不进分母;新增要求另按当前任务检查;无历史要求记N/A
核心事实错误案例数 已确认出现核心事实错误的唯一案例数 同一多轮案例多次出错只计一个案例,另记录轮次;不从缺少证据推定事实错误
错误来源/来源错配案例数 按E5或R4证实来源错误的唯一案例数,分层列出 同一问题跨层汇总时去重,保留实际影响及严重性
字数符合情况 按事前规定的计数方式、上下限记录符合/不符合/不适用 “约150字”的容差须事前约定,不在看到回答后改变

5.4.2 检索与引用指标

覆盖率等数字有助于定位问题,但仍需检查证据的实际含义。标注时,把能够支撑同一个必需要点的段落归为一个证据组:含义相同的段落可以互相替代,必须一起出现才足以支持结论的内容则标为组合证据。同一意思重复出现多个文本块,仍只算一次覆盖。

指标 计算定义 使用限制
候选证据覆盖 候选中已充分支持的必需证据组数/适用必需证据组数 标注不完备时称“已标注证据覆盖”,不称全库召回率
最终证据覆盖 主模型实际输入中充分支持的必需证据组数/适用必需证据组数 看实际文本与条件,不看卡片数量
阶段保留率 上一阶段已充分支持且下一阶段仍充分支持的组数/上一阶段已支持组数 新扩展得到的证据另记新增,不能进入保留率分子
范围合规 范围内片段数/返回片段总数,另报越界片段及案例数 空结果分母为零记 N/A,不能以空检索取得满分
引用支持覆盖 有有效支持的应引论述单元数/全部应引论述单元数 论述单元由事实含义划分,不按标点机械计数
检索代价 调用数、耗时、最终 Token、失败与重试 不把调用越少认作越好;结合任务完成情况

不同实验标明是在候选块、合并段、选择结果还是最终上下文统计。文献覆盖按实际正文与来源判断,扩展范围和返回条数作为本次配置记录。

引用支持覆盖检查最终回答中的论述是否得到原文支持,主要对应E5,不是纯粹的检索召回指标。范围合规可以分别计算候选、工具返回等阶段的结果,但要注明统计位置。即使合规比例很高,已经确认的越界问题仍需单独处理。

5.5 功能验收统计

每项功能操作都保存执行前提、是否执行、实际结果和证据状态。汇总时列出可判数、全部适用已执行数,以及结果待核实的U数。U的含义见第4.10节。

已执行但待核实的项目计入适用已执行数,暂不计入PASS或FAIL。NOT_RUN、BLOCKED和N/A分别列出,比例的分母为零时记N/A。

停止操作需要检查执行是否退出、停止原因是否保存、占用是否释放。恢复操作则把符合条件时的恢复,与条件已经失效时的处理分开统计。

5.6 用户反馈与后续使用

负责人或试用者记录回答是可直接采用、稍作修改可用、需要实质修改,还是不可采用,并说明具体改动。E8记录评审者对表达的判断;实际采用情况与节省时间由用户反馈和操作记录补充。

引用检查分别记录能否打开原文,以及原文是否支持相关论述。试用记录进一步关注用户采用了哪些内容、修改和核验花了多长时间,以及后续是否继续使用。

用户反馈报告参与范围和反馈覆盖情况;未反馈不当作成功或失败,节省时间需有比较依据。

5.7 案例级达成率的复核与计算

5.7.1 案例范围与题目要求

先把每个案例的各轮对话与运行记录对应起来,确认哪些执行有效、题目要求在哪一步结束,以及结束时仍需满足哪些要求和必需维度。能够可靠确认的产品失败仍计入有效执行。记录不完整时,只把缺证而无法判断的项目记U,不直接剔除整个案例。

5.7.2 判定记录复核

复核范围包括所有准备纳入统计的案例,逐一核对必需维度、相关问题严重性和任务标签。可以优先核对已经改分或结论有冲突的记录及其关联轮次,但其余拟纳入统计的案例也需要核对。整体分与维度分分别依据证据判断,不互相推算;记录方式沿用第4.1节。

5.7.3 案例结果汇总

按第4.7、4.8节,在约定结束点判断仍有效的任务要求,保留任务结论、逐轮问题和纠错记录。

固定评测集案例级任务达成率=已复核达成的有效对话案例数÷全部有效已执行对话案例数。

该指标统计固定评测集中各题约定任务的完成情况,涵盖理解、比较、写作和核验;综述及相关修改案例单独报告。

尚待判断的案例仍留在分母中,报告同时列出它们的数量和可判覆盖率。哪些案例已经能够确定结论,按第4.7节判断。多轮案例需要检查各轮要求及最终结果,不能仅凭最后一轮高分或多轮平均分认定达成。直接工具案例另行统计。

新批次复核期间,可先报告回答整体档位和同题变化,复核完成后补齐案例级结果。

真实试用记录实际采用、修改量和耗时,访谈与写作实践补充具体使用过程。各项结果注明证据来源。

5.8 三类评价结果汇总

每项汇总结果列出统计范围、可用记录数、缺失或待复核数量、基线与候选版本结果,以及变化对应的具体案例。相同条件下的数据放在一起比较。

一级维度 汇总内容 对应的判断
性能 处理与交付时间、结束状态与失败原因、重试恢复、调用用量和费用 哪些项目满足本批预设要求;相对基线变快、变慢或消耗变化多少;哪些数据尚不完整
效果 R0检查结果、R1–R5与E1–E7等级分布、回答整体档位、案例达成情况、证据覆盖和关键错误 哪些任务完成得更好;哪些错误减少或新增;问题发生在哪个环节
用户体验 E8等级分布、操作结果与困难、用户确认的可用程度、采用及修改核验负担 表达和操作是否改善;真实用户还需做哪些工作;反馈覆盖到什么范围

按一级维度汇总时保留二级分类和具体评价项。已有评分门槛的项目报告等级与判定,已有性能要求的项目报告是否满足,尚未设置门槛的项目报告实测值与变化。证据不足的项目注明待判断,未执行或未采集的项目单列。

回答整体档位继续按轮次展示。版本报告按统一格式列出三类评价的分数、实测值和反馈记录,并据此形成阶段结论。

5.9 阶段目标判定

阶段结论使用第3.1节中执行前确认的验收要求。报告先列出每项要求,再填入实际结果、与基线的变化、证据位置和判定理由。

阶段判断依据 对应结果 结论需要说明的内容
案例约定要求是否完成得更好 同范围的案例级任务达成率、重点任务子集结果 哪些案例从未达成或部分达成变为达成;是否满足本批对重点任务的要求
同题是否改善、其他任务是否退步 配对后的改善、持平和退步记录 改善和退步发生在哪些题;新增的严重问题是否得到处理
关键错误与未交付是否减少 经复核的问题分类、唯一案例数和发生轮次 本批重点问题是否消除或减少;是否仍有机制误述、必要条件遗漏、无正文结束或未纠正旧错误

性能要求、核心功能验收和真实用户验证如已纳入本批验收,也一并列入结论。质量改善伴随的等待或费用变化要说明;用户体验反馈按已采集范围报告。

已确认的验收要求全部满足时,报告阶段目标达成,并列出仍待改进的问题。已有证据确认某项要求未满足时,报告未达成及受影响范围;已有结论保留,其他缺证项另列。其余尚不能确定的情况记为待判断,并说明待补的材料。如果本批尚未确认验收要求,报告已观察到的改善与退步,待要求确定后再进行达标判断。

阶段判断以案例级任务达成率为核心,结合关键错误、同题变化及本批约定的性能和体验要求。真实用户的采用、修改与核验记录用于判断这些改进是否帮助用户完成写作。

六、问题分析与回归验证

6.1 问题定位

问题记录通过案例和运行ID关联原回答、参考证据、适用规则与严重程度,并保存已确认的出错环节、修复改动和复测结果。取证与回答的问题沿以下过程定位:

原始PDF → 解析文本与索引 → 范围过滤后的候选 → 融合、合并与裁剪 → 选择与上下文扩展 → 主模型实际输入 → 回答与引用。

评审者对照独立参考证据,确认信息在哪一步丢失或被误用,重点核对以下情况:

  • 材料处理: 只解析出封面或摘要却显示全文可用,或文件处理失败后仍承诺覆盖全部材料。
  • 查询与补查: 查询是否包含研究对象、比较维度和必要条件;改写时是否丢失否定词或限定对象;是否存在新增事实不取证、无效重复搜索、证据已够仍反复补查等问题。未查完就声称全部核验、循环无结果或工具失败后编造证据,按实际影响记录。
  • 候选与上下文: 候选是否符合权限、项目和选定材料范围,是否包含关键依据;筛选和扩展后,必要条件是否被裁掉,重复段落是否造成干扰,选中来源的正文是否真正进入模型输入。
  • 来源与回答: 证据正文、文件、标题、段落和引用编号是否一致;是否出现跨文档串号、旧编号指向新文档或卡片与正文不符;回答是否误述机制、条件或文献关系。

过程记录保留查询措辞、调用次数、文档顺序和各阶段实际正文。即使回答正确,也要核对系统是否取得了它引用的依据。同一问题涉及多个环节时,使用同一问题ID关联,按第五章的口径汇总。

6.2 复测与版本回归

修改后重跑原题和相关场景,保留首次、重复与重试结果。材料、索引、提示词或评审规则发生变化时记录版本;评分规则调整后,用相同口径复核新旧回答,再比较变化。

同题比较除了记录分数,还说明回答具体改善或退步在哪里。有些改进不足以改变档位或任务结论,也应保留对应原句和证据。新增的严重问题及退步案例单独说明影响和处理结论。

查看指标与记录对应清单 · 查看评测集构建 · 浏览完整评测集 · 查看版本评测结果

图表