评测体系设计
一、评测目标与总体框架
1.1 评测目的
长期价值目标: 帮助用户输出一版符合要求、逻辑顺畅、结构完整、引用真实准确的文献综述。
评测围绕这一目标,检查正文是否满足写作要求、文献关系是否清楚、事实与引用是否准确,以及后续修改是否保留仍然有效的要求。题集同时覆盖单篇理解、跨文献比较和原文核验,分别按对应任务评价。
现阶段以案例级任务达成率为核心指标,同时关注关键错误、同题退步和用户实际使用情况。 固定题集用于比较版本表现,真实试用用于了解成果是否被采用、修改和核验是否更省时。下一节列出具体判断依据。
1.2 版本比较原则
版本评测使用相同的题目、评分标准和执行范围,比较案例级任务达成率、同题表现及关键错误。各版本的对照基线、重点任务和通过要求在执行前明确,并记录在对应的版本记录中。版本比较采用以下三项依据。
| 判断依据 | 要回答的问题 |
|---|---|
| 案例级任务达成率 | 达到案例约定要求的任务是否更多 |
| 同题改善、持平与退步 | 哪些地方变好了,哪些变差了;未跨过达成门槛的改进也保留说明 |
| 关键错误与未交付情况 | 重点问题是否减少,有没有新增严重问题 |
报告分别展示这三项结果,不合成总分。如果总体表现提高,但某道题出现新的关键错误,仍需说明错误的影响和处理结论。耗时、运行稳定性和资源消耗也一起报告,以便判断质量改善是否伴随更长等待或更多用量。
1.3 评价框架
产品目标决定评测重点,场景描述用户要完成的任务,三类评价方面用于检查表现。案例达成率概括任务完成情况,性能、效果与体验指标进一步说明完成质量和使用成本。
RAG从文档解析、切块和索引准备开始,经过召回、重排和证据组织,直到生成回答。检索工具测试关注取证环节,完整任务评测继续检查证据组织与回答生成。
关键事实错误、核心任务无法完成,以及账号隔离、保存和停止恢复等功能故障,都需要单独检查,不能用其他项目的高分抵消。第二至六章说明具体的检查方法和评分规则。
1.4 证据与结果记录
每批评测保存题目、实际回答、参考证据和运行记录,并据此判断回答质量、各项表现和任务完成情况。回答高分占比与案例达成率分别统计。
真实试用记录成果采用情况、修改量和核验过程。各批次的执行范围、数据和待补记录汇总到评测结果。新增检查单独设计题目,版本比较沿用共同的任务要求。
阅读说明: 第一章说明评测目标和版本比较原则;第二章先介绍任务场景,再通过指标总表展开性能、效果和用户体验,表后集中说明检查方法及场景与指标的对应。各版本的具体表现见评测结果。执行评测时,再按需要查阅范围与维度、运行记录、评分、汇总和复测规则。
二、评测范围与评价维度
本章先明确材料和任务,再展开三类指标,最后为具体题目选择适用项与参考证据。场景说明用户要完成什么,指标说明从哪些方面检查这次任务。
2.1 评测材料与题集分组
评测材料
评测使用现有28篇PDF,其中中文12篇、英文16篇,按题目选择全部材料或子集。用户自己的模型、研究设想和正文作为任务背景,与外部文献证据分别记录。
题集分组
围绕这些材料,我们设计测试题,让Lito完成解释、比较、写作或核验等任务。题目按设计目的和任务来源分成三组,沿用题集中的名称:专家集、用户集、对抗集。各组的任务特点如下。
| 题集名称 | 这组题是什么 | 主要用途 |
|---|---|---|
| 专家集 | 具有明确必答点、必要条件和原文依据的能力测试题 | 检查事实、理解与综合等核心能力;各版本沿用同一组要求和参考依据,观察是否退步 |
| 用户集 | 根据访谈整理、合成的使用任务 | 检查按实际使用方式提问和连续修改时,任务能否完成、结果还需怎样调整;真实用户反馈另行记录 |
| 对抗集 | 在正常任务中加入错误前提、虚构引用或材料范围干扰的题目 | 检查系统能否识别并纠正干扰,同时完成有依据的部分 |
这三组题与第2.3节的五类任务是两种分类方式:题集分组说明题目为什么这样设计,任务场景说明用户要做什么。例如,同样是比较两篇论文,可以设计成有明确必答点的能力题、来自访谈的使用任务,也可以加入错误前提检查系统是否纠正。
同一任务使用相同的质量标准,对抗题也不降低事实准确性的要求。结果按主要题集类型分别报告;一个案例可以带有多个次级标签,但汇总时按案例ID只计一次。
这些题既用于检查检索工具,也用于检查问答和修改。版本比较固定基础模型,用同题结果观察产品改动对事实、指令遵循、综合推断及多轮表现的影响。题目明细见评测集构建。
2.2 测试范围
质量评测检查回答和证据;功能测试检查登录、资料保存和引用等操作;性能测试检查速度、容量与恢复。专家、用户、对抗三类用于组织质量题目,每道题再明确测试工具输出还是完整问答。
| 测试大类 | 判断问题 | 对象和判据 | 首版安排 |
|---|---|---|---|
| 质量评测 | 证据和研究任务完成得好不好 | internal_search 的检索质量、完整问答与修改;GT(本题的参考依据、必答点与条件)、E/R 0–4 分、严重性与任务达成 | 核心执行,专家/用户/对抗分别组织 |
| 功能与可靠性测试 | 机制是否正确,数据是否保存和隔离 | 登录、资料入库、工具回填、会话与引用持久化、停止恢复;操作和预期结果,PASS/FAIL 等 | 首版开放的必要业务链路必须验证 |
| 性能与压力测试 | 正常负载的速度、容量边界和恢复如何 | 时延、吞吐、错误、资源、并发、排队与超载恢复;按负载条件单独记录 | 正常评测记录耗时和失败;专项压力测试另设负载方案与统计表 |
账号登录、资料与会话隔离属于功能正确性;容量和并发属于性能测试,分别设计与记录。
固定文献评测使用internal_search取得依据,上传、解析和索引作为检索前置检查。长期记忆的保存、更新和跨会话使用另行设置功能案例。
功能验收范围
功能检查围绕导入、停止恢复、刷新回访、复制导出、账号隔离、反馈关联、引用定位和来源状态展开。每项保存操作前提、实际结果与证据,使用PASS、FAIL等状态记录。
例如,任务恢复要分别测试两种情况:条件未变化时能否继续运行,资料变化后能否拒绝恢复并保留旧结果。引用定位也分别检查只有一处匹配和存在多处匹配时的展示。这些操作是否正确,记录在功能结果中;回答和证据的质量仍按E/R维度评分。
2.3 场景与预期表现
先描述用户任务应达到的表现,再选适用维度和证据。以下场景用于准备题目,评分规则见第四章。
2.3.1 共同要求
评审者在各类场景中都检查三件事:用户要的内容是否完成,事实是否准确,来源是否支持回答。用户提出修改后,还要检查新要求是否落实,以及原来没有撤销的要求和引用是否保留。
| 检查内容 | 应达到的表现 | 需要记录的问题 |
|---|---|---|
| 当前任务 | 直接给出所需解释、比较或正文 | 只有流程建议、检索承诺或外围介绍 |
| 事实与条件 | 保留对象、指标、方向、样本和推断强度 | 将相关改成因果、将局部发现写成普遍规律 |
| 内容归属 | 区分文献发现、综合推断和用户设想 | 把用户假设写成已有研究验证结果 |
| 来源 | 论述得到当前允许材料支持,引用与原文对应 | 真论文配错结论、引用串号或虚假核验 |
| 多轮修改 | 新要求生效,未撤销的事实、条件和来源保留 | 缩写丢掉必要条件,旧偏好覆盖最新要求 |
| 澄清与失败处理 | 实质歧义先澄清,已有依据的部分继续完成 | 无必要追问,或工具失败后仍称任务完成 |
判分时,需要区分系统没有找到证据、原文没有提供证据,以及评审者缺少核对材料三种情况。原文有答案而系统未取得,属于取证或证据使用问题。允许使用的材料确实不足时,评测关注回答是否说明缺口,并完成有依据的部分。如果评审材料不足,能判断的部分照常评分,其余记U。文献中夹带的命令只作为资料内容,不改变评测要求。
例如,系统只读到摘要时,可以回答其中明确写出的发现,但核验范围仍是摘要。后续改写不能把它写成“已经核验全文”;只有取得正文并完成相应核对后,才能更新核验范围。
2.3.2 五类核心任务
评测覆盖以下五类任务。C01–C11是场景编号,用于关联题集和评分记录。这里先说明任务与理想表现,适用指标在介绍完三类评价维度后,由第2.6节统一对应。
| 任务 | 对应场景 | 理想表现 |
|---|---|---|
| 理解论文 | C01单篇理解、C02中英文与非专业表达 | 回答具体问题,解释概念与方法,保留数值和条件;中文解释与原文含义一致 |
| 比较文献 | C03跨论文比较 | 按共同问题比较各篇对象、方法和发现,分别给出依据,说明可比条件 |
| 形成综述 | C04综述、C05研究联系、C11大文献集合 | 按主题组织正文,覆盖要求中的文献和论点,区分文献发现与用户设想 |
| 连续修改 | C06要求保留、C07替换撤销、C09资料切换 | 按用户的新要求修改,保留尚未撤销的要求;改写后的论点仍有正确引用支持 |
| 核对原文 | C08观点核验、C10来源状态延续 | 查明观点是否得到支持,提供原件与位置;核验结果随来源保留 |
论文理解
用户询问一个数字时,回答需要说明指标、研究对象和估计性质。例如“福利提高2.9%”与“销量提高2.9%”含义不同;数字一致,指标也必须对应。通俗解释可以用类比,原论文的研究结果与辅助解释分别表达。询问公式时,符号定义和适用条件一起检查。
文献比较
比较先建立共同问题,再把不同论文放到相应维度中。理论研究、观察数据和实验可能讨论相近机制,但结论的依据不同。某篇没有涉及一个维度时,保留这一差异;两篇结论不同,先对照对象、方法和条件,再解释关系。
评分会区分“分别介绍了两篇”和“完成了两篇比较”。前者可能事实正确,但共同维度和文献关系仍需要补充。
综述写作
用户要求正文时,回答应提供可继续阅读和修改的段落;用户先要提纲时,则按提纲组织。主题综述围绕研究问题选择论文。题目明确要求逐篇介绍时,每篇都需要具体发现与来源。
回答涉及用户的研究设想时,应说明已有文献能提供哪些理论动机、机制或比较依据。相似文献可以帮助解释设想,但不能因此声称用户的模型已得到证明。对研究不足的判断也限定在已查阅的材料内。涉及15篇或28篇论文时,记录文献库总数、本题要求覆盖的数量,以及回答实际采用的证据。
多轮修改
用户要求缩短背景时,原来没有撤销的结构和内容要求仍需保留;要求把评述放到各节结尾时,才改变评述的位置。每轮记录本次修改的要求和位置。改写后还要核对引用:保留的论点是否仍得到原文支持;删去某个论点时,可以一并删除对应引用。
用户改变资料范围后,新回答使用新范围内的证据,历史回答仍保留当时的来源。如果两项要求无法同时满足,例如篇幅很短却要求逐篇详细说明,系统需要先明确取舍。
原文核验
原文核验先检查观点、数值及其所属论文,再核对原件、PDF物理页和引句位置。中文概括可以由英文原文支持,翻译与直接引文分别标注。如果引句在原文中有多处匹配,界面应说明定位不唯一,并允许用户继续查看原件。
内容评分依据论述和原文,界面功能依据点击与定位操作。来源能打开、论述得到支持、原文位置正确,三项分别记录。
2.3.3 错误前提与异常情况
对抗题从正常任务出发加入干扰,记录系统如何纠偏,以及原本可完成的内容是否继续得到处理。每题事先写明扰动、允许资料、预期行为和禁止行为。
| 干扰类型 | 代表场景 | 检查重点 |
|---|---|---|
| 证据缺口与研究分歧 | A01无答案、A03条件差异 | 区分原文不足与检索未取得,对齐条件并保留真实分歧 |
| 错误结论与引文 | A02错误前提、A04虚构归属、A11夸大结论 | 纠正错误,给出原文支持的解释,保留结论强度 |
| 检索与定位干扰 | A05重复片段、A10页码和匹配歧义 | 保留关键条件,准确对应来源和定位状态 |
| 范围与指令干扰 | A06旧来源诱导、A07资料注入、A08要求冲突 | 使用当前允许证据,处理有效要求,资料中的命令作为内容阅读 |
| 执行故障 | A09空检索、超时或预算耗尽 | 保存已有结果,记录结束原因与实际完成部分 |
正确纠偏可以达成任务。例如,用户把“徽章溢价降低”说成“徽章完全失效”,回答应指出差别并给出依据。只拒绝错误前提,却没有解释材料中可回答的部分,仍按任务完成情况评分。
2.4 评价维度与指标总表
评价体系按性能、效果和用户体验三个一级维度展开,再细分为处理时间、检索质量、表达质量等二级维度及具体评价项。这些记录共同支持第一章的阶段判断:任务是否完成得更好,同题表现如何变化,关键错误是否减少。
总表从左到右说明评价项的归属、内容、记录方式、所需证据和适用范围。性能记录运行数据,效果依据材料、过程与回答评价,用户体验结合表达评分、操作观察和真实反馈。
编号用于关联题目、证据和结果:T表示技术性能,R表示材料与检索过程,E表示回答质量,X表示用户体验。E8继续评价表达,X记录操作与真实使用。一级、二级分类沿用名称,具体评价项使用编号。
2.5 指标说明
2.5.1 文档与索引检查
R0通过原件与处理结果对照,检查正文、表格、公式、阅读顺序和跨页内容。切块时关注结论与必要条件是否被分开或截断,来源和页码是否仍能对应原件;索引检查内容是否可检索,以及新增、替换和删除材料后是否按预期更新。
记录保存文件ID、版本、可用状态、原件访问情况、切块方法、索引配置、原文位置、处理结果和问题示例。尚未验证的项目标为待检查。
已支持格式的文件显示可用,但必要正文未进入索引时,记录为产品处理问题。对于尚不支持的扫描件,分别记录不可用提示是否正确,以及研究任务的实际完成情况。评测配置误将不可用材料设为可用时,修正配置并保留原因。
2.5.2 工具测试与Agent测试
直接工具测试固定查询和文献范围,检查返回的正文及来源。Agent测试让系统自行决定查什么、何时调用工具、何时补查和进入回答,并保留这些决策。两类结果分别报告,用来区分检索工具的问题与调用决策的问题。
固定查询的直接工具题将R1记为N/A。R1–R5按第4.4.2节评分,也可结合确定性检查;应有过程记录缺失时,受影响的维度记U。检索过程的具体问题按第六章排查。
2.5.3 表达评价与用户反馈
E8由评审者根据回答的清晰程度、篇幅和形式判断。人工采用等级、实际采用和修改负担通过单独的反馈或回访取得,与表达分数分别保存。各项记录的汇总方法见第五章,批次数据状态见评测结果。
2.6 场景与评价维度的对应
同一场景可以同时观察性能、效果和用户体验。下表给出常见对应关系,供逐题配置时选择;它不增加历史题目的必需维度,也不要求每次运行都执行全部检查。
| 任务场景 | 回答效果 | 检索与材料检查 | 性能观察 | 用户体验观察 |
|---|---|---|---|---|
| 理解论文 | E1、E2、E3、E5;解释对象、概念、数值与条件 | 关联R0材料状态;取证时检查适用的R1–R5,关注问题所需正文是否取得 | 检索与回答耗时、失败情况及用量 | E8解释是否清楚;用户能否找到核对依据 |
| 比较文献 | E1–E5;比较维度、发现与可比条件 | 关联R0;检查两篇或多篇的必要证据是否召回、保留和正确传递,按过程评价适用R项 | 多篇检索与完整回答耗时、失败及用量 | E8比较结构是否易读;各篇依据是否方便查阅 |
| 形成综述 | E1–E5;涉及推断与缺口时加E7 | 关联R0;按实际过程检查R1–R5,关注多篇证据、必要条件、来源及补查结束决策 | 正文交付时间、预算耗尽与未交付情况、调用用量 | E8正文组织与篇幅;真实试用中的可用程度及修改负担 |
| 连续修改 | E1、E2、E3、E5、E6;冲突时加E7 | 纯表达修改可复用证据;新增事实或调整材料范围时,检查相应R0状态与适用R项 | 修改响应、重试和用量 | E8形式适配;是否被迫重复要求或追回引用 |
| 核对原文 | E1、E2、E5、E7;跨轮加E6 | 关联R0;按实际取证过程检查适用R项,关注原文上下文、来源与定位信息 | 取证与完成核对所需时间、失败和用量 | 原题适用时评价E8;引用定位操作及实际核验负担另行观察 |
同一批材料可关联已有的R0检查结果,不必每题重复入库测试;材料或索引变化后,应核对相应记录是否仍适用。RAG过程没有发生时,不强制新增检索来取得分数;需要判断是否调用或结束检索时,仍按适用的R1、R5评价决策。应有日志缺失属于证据不足,不能因此把适用项改为不适用。
性能观察、E8表达评价、功能验收和真实用户反馈分别记录。没有实际试用的固定题,不据此给出用户采用或时间节省结论。
每道题在执行前确定所属场景、GT中的必需要点与条件、可用材料、观察证据和统计指标。同时区分适用维度与必需维度:必需维度用于判断任务是否达成,其他适用维度也照常评分。开放式题目允许含义相同的表达和不同的组织方式,不要求回答与GT逐字一致。
例如,题目问“哪项指标提高2.9%,含义与范围是什么,并提供引用”,属于单篇理解场景C01。它的必需维度包括E1、E2、E3、E5、E8,评审时记录各维度得分、要点覆盖和引用支持情况。如果保存了检索过程,还可以分析RAG表现。没有实际输入证据时,不能只因答案正确就认定检索成功。
小批量评测优先展示逐题结论和问题原句,比例同时附上数量。评分方法见第四章,分母与缺失数据的处理见第五章。
2.7 参考证据
每道题单独准备参考证据,与Agent实际检索结果对照。证据包包含允许文件和版本、当前要求、必答点、原文位置、必要条件、可接受的替代依据,以及仍缺少判断材料的部分。
无答案题需要先核对允许使用的材料,确认其中确实没有足够依据。综述题则按主题、文献关系和必要条件准备参考内容,允许回答采用不同的正文结构。材料较长时,可以按论述分组评审,但反例以及不同组之间的关系仍要保留。
三、评测执行与记录
本章说明第二章的评价项如何取得证据。每批先确定任务范围、比较条件和验收要求,再分别采集性能、效果与用户体验记录。执行结果交给第四章判定,第五章据此汇总版本表现。
3.1 本批目标与执行准备
执行前写明本批要验证的问题、对照版本、任务范围、适用评价项、必需维度及参考证据。重点任务、相关回归范围和重复运行安排一并确定。
阶段目标采用本批已经确认的验收要求:要解决哪些关键问题、哪些任务需要达到什么结果,以及性能和功能是否有明确限制。数值要求、统计单位和比较方式在运行前记录;尚未确定的目标注明状态,测后再补要求时另记评审版本。
每项评价内容同时确定由谁记录、谁初评、谁复核,以及需要保存哪些材料。使用AI评审时,保留实际使用的模型、提示词和规则版本;缺失的身份或版本信息如实标明。
3.2 运行配置与会话安排
每批固定账号、项目、附件、语料和索引版本,以及模型、Prompt、工具定义与运行预算。固定文献库评测将联网读取和长期记忆与文献检索分开,记录实际启用的工具和用户背景。
独立案例从新会话或约定的初始状态开始,多轮案例沿预定分支继续。输入、资料范围与运行标识一起保存,便于重跑同一道题。
首次执行、独立重复和失败后重试分别标记。多轮任务保存每轮输入、回答与要求变化,按题目约定的结束点汇总案例结果。
3.3 三类评价的采集方式
| 评价方面 | 执行方式 | 保存材料 | 进入判定的内容 |
|---|---|---|---|
| 性能 | 在约定配置和负载下执行任务,记录时间、结束状态及用量;压力测试另设负载方案 | 时间戳、运行日志、调用与Token记录、费用依据、负载条件 | 实测值、记录完整性、与预设要求或基线的比较 |
| 效果 | 对照原件检查文档与索引;执行工具题和对话题,逐项核对参考证据与实际结果 | 原文、逐题要求、解析与索引结果、候选及模型实际输入、回答和引用映射 | R0检查结果、适用的R1–R5和E1–E7评分、具体问题 |
| 用户体验 | 评价回答表达,执行操作检查,并在真实任务中观察用户如何使用和修改结果 | 实际回答、操作记录、用户反馈、修改稿及核验记录 | E8评分、操作结果、用户确认的可用程度与后续负担 |
各类记录通过案例、轮次和运行ID关联。来源于固定题、功能操作或真实试用的记录分别注明,便于后续按同一范围比较。
3.4 回答与运行证据
检索记录保存系统实际取得的正文。快照匹配标记有助于查找证据,但短文本或不完整段落可能无法匹配。遇到这种情况,需要查看实际发给模型的请求,确认模型读到了哪些内容。
运行日志不完整时,已有证据和检查点仍然保留。只要回答和独立原文足以支持判断,就继续评价内容;缺少证据而无法判断的项目记U。如果能够确认错误,却查不清它发生在哪个环节,问题位置记为“未定位”。
每条评分保留适用规则、实际原句与参考证据,人工与模型评审使用同一套判断口径。
3.5 时间、预算与用量
时间记录覆盖材料准备、提交请求到首次有效状态反馈、完整输出、修改和原文核对,并记录重试次数。用户的总等待包含排队与执行,两部分分别报告;首次输出文字的时间与完整正文交付时间也分别统计。
运行预算根据服务器配置和任务规模,在执行前确定。超时按该批规则记为失败或部分完成,保留实际耗时与结束原因。
每批记录实际生效的循环、时长、调用次数、Token与费用预算。外层模型轮次、检索内部模型与编码请求、模型提出的工具调用、合并后的实际工具执行分别计数。
运行记录区分预算估算和提供商返回的实际用量,无法确定的费用保留为未知。任务结束时,记录完成、停止、预算耗尽、失败或中断等运行状态;任务是否达成,还要查看实际回答及其证据。
3.6 性能与压力测试
质量评测保存每道题的等待、调用用量和错误。容量、并发与压力另用固定负载方案测试,记录延迟、吞吐、错误率、资源占用和恢复情况。版本质量对照使用相同题目与评分规则;性能结果同时注明服务器、外部模型服务、缓存与负载条件。
四、评分与案例判定
本章将采集到的证据转换为评价结果。性能报告实测值及是否满足预设要求,效果评价材料、检索与回答,用户体验分别记录表达、操作和真实使用反馈。各项结果关联到同一案例,再形成回答整体档位和案例任务结论。
4.1 评审记录
每轮对话的评审记录包含五项:观察状态、回答整体档位、适用维度分数、问题严重性和本轮任务结果。整体档位由评审者独立判断,不取各维度的平均分。多轮案例还需在各轮记录的基础上汇总案例结果。直接工具题只评价适用的工具维度,不填写回答整体档位。批次统计方法见第五章。
整体档位、维度分、问题严重性和任务结果,都分别保存原始判断、复核结果,并注明是否完成复核。
例如,某次只复核了整体档位,其他项目就继续保留各自的记录和复核状态,不标为已经复核。
| 字段 | 取值与解释 |
|---|---|
| 观察状态 | 可评;部分可评;无法判断;评测无效;未执行。运行失败若有可靠记录仍是有效产品结果 |
| 回答整体档位 | 对话回答按0–4分独立定档,不由维度均值推导;证据不足以定档时记U。直接工具题不填写 |
| 维度分数 | 0、1、2、3、4;N/A 表示不适用;U 表示证据不足。N/A 与 U 不参与分数运算 |
| 问题严重性 | B0 可信度或隔离底线;B1 核心任务阻断;B2 明显质量问题;B3 轻微问题;无问题 |
| 任务结果 | 达成;部分达成;未达成;待判断;评测无效。区分本轮结果与案例级结果,另记是否经额外修正才达成 |
案例配置错误、运行记录无法对应或参考条件设置错误,记为评测无效。产品超时、工具异常和空回答计入有效已执行案例,按实际结果评分。
4.2 通用0–4分标准
| 等级 | 回答表现 | 需要修改的内容 |
|---|---|---|
| 4 优质达成 | 核心与约定要求充分满足,证据和条件准确,组织适合任务 | 无需内容性修正,允许个人偏好的润色 |
| 3 基本达成 | 核心任务完成,事实与依据可靠,只有不改变结论的局部瑕疵 | 少量措辞、格式或局部衔接调整 |
| 2 部分达成 | 有有效内容,但遗漏必要比较维度、重要要求或需补充依据 | 需要有实质内容的补充、重组或追问 |
| 1 主体未达成 | 识别了大致任务,但大部分关键工作未完成或主体不可用 | 需要重做主体,仅少量内容可保留 |
| 0 该项失败 | 完全没有提供该项能力,或出现该维度的根本错误 | 无可依赖结果,可能造成明显误导 |
1分与2分根据需要重做或补充的内容区分;4分表示完成题目要求。用户只要简短解释时,准确、完整的短回答即可达到4分。各维度分别记录等级。
4.3 性能判定
性能按第二章总表记录实际时间、结束状态、用量和费用。对已经设定要求的项目,报告实测结果是否满足要求;未设数值门槛的项目,报告实测值及同条件下的变化。
| 判定对象 | 判定依据 | 记录结果 |
|---|---|---|
| 处理与响应时间 | 本批约定的计时起止点、任务类型、负载和时限 | 实际耗时、与基线的差异、是否满足预设时限 |
| 运行稳定性 | 实际结束状态、失败原因及重试恢复记录 | 哪些运行完成或失败、故障是否恢复、是否满足预设稳定性要求 |
| 资源消耗 | 可核验的调用量、Token、费用及本批预算 | 实际或估算消耗、与基线的差异、是否满足已设预算 |
缺失记录注明受影响的指标。已有证据能够确认超时、失败或预算耗尽时,保留相应结论;其他仍无法确定的性能项等待补充证据。
4.4 效果判定
效果按材料与索引、检索与工具、任务与回答三个环节评价。过程评分用于定位问题,实际回答用于判断题目要求完成得怎样。
4.4.1 文档与索引检查
材料就绪(R0)按逐文件可用状态、正文覆盖和功能检查结果记录。评审者对照原件,确认声明可用的内容是否已正确解析并进入索引;尚不能核实的部分注明缺证范围。
R0不打0–4分。处理问题如果影响了后续任务,还要在对应案例中记录其对检索和回答的实际影响。
4.4.2 检索与工具评分
R1–R5分别评价调用与查询、范围与候选召回、选择与上下文、来源与传递完整性,以及补查与结束。评审者按下表判定等级,再根据问题严重程度应用分数上限。各维度的适用范围见指标总表。
| 评价项 | 4 分 | 3 分 | 2 分 | 1 分 | 0 分 |
|---|---|---|---|---|---|
| 调用与查询(R1) | 查询针对全部必要缺口,调用合理 | 查询有效,有少量不必要调用 | 查询遗漏一个重要角度但仍取到部分依据 | 查询大多偏离任务 | 完全错误对象或需要证据却无任何有效取证 |
| 范围与候选召回(R2) | 关键证据组齐全,范围正确 | 关键组齐全,仅非关键检索质量瑕疵 | 部分必要证据组未召回 | 多数关键组缺失 | 无所需依据,或违反范围/权限 |
| 选择与上下文(R3) | 关键证据与条件完整,干扰少 | 关键条件完整,有少量重复 | 部分必要条件/证据丢失 | 多数关键上下文丢失 | 最终上下文不支持任务或关键含义被截断反转 |
| 来源与传递完整性(R4) | 映射完整稳定且可核对 | 映射正确,非必要元数据缺失 | 局部非关键映射不完整 | 大部分来源无法稳定追溯 | 关键来源串号、伪造或范围外传递 |
| 补查与结束(R5) | 按缺口有效补查并适时结束 | 适时结束,少量重复检索 | 停得过早或无效重试造成明显负担 | 循环/过早停止阻断任务 | 虚构检索核验完成或失控无结果 |
如果候选日志缺失,但最终输入仍可查看,R2记U,R3按实际输入评分。模型最后读到了某段证据,不能据此补认候选阶段已经命中;候选召回仍以对应日志为准。如果关键证据缺失已经导致主要任务无法完成,相关评分遵循B1的分数上限。
4.4.3 任务与回答评分
E1–E7依据本题要求、参考证据和实际回答,逐项使用第4.2节的0–4分标准。评审者先确认具体遗漏或错误,再判断它需要局部调整、实质补充还是重做主体,并应用第4.6节的严重性规则。
| 评价项 | 核对内容 | 判分依据 |
|---|---|---|
| 需求与任务完成(E1) | 用户要求的解释、比较、正文或修改结果是否实际给出 | 对照主任务与明确要求,判断完成程度;进度说明按实际内容评价 |
| 事实与条件(E2) | 对象、机制、数值、条件与推断强度是否符合原文 | 指出错误原句与原文依据,按错误对任务的实际影响定档 |
| 内容覆盖(E3) | 必需论文、主题与要点是否正确且充分回答 | 对照事前要点清单,区分局部遗漏与大部分核心内容缺失 |
| 综合与逻辑(E4) | 文献比较、关系解释和推导是否成立 | 对照共同维度、比较条件及各篇证据,判断是否完成题目所需的综合 |
| 引用支持与归属(E5) | 论述是否得到所引原文支持,归属是否正确 | 核对实际引用映射与原文,按错配或缺少支持的影响判断 |
| 多轮要求与状态(E6) | 保留、替换、撤销的要求及来源状态是否正确处理 | 对照每轮要求与改稿,区分正常新增偏好与需要用户追回的要求 |
| 边界与纠偏(E7) | 证据不足、错误前提、要求冲突或失败时是否如实处理 | 根据本题的证据状态和预期行为,判断是否说明问题并完成有依据的部分 |
这些核对内容沿用原维度定义。每项的具体必答点和条件以逐题配置为准,分档示例见第4.9节。
4.5 用户体验判定
用户体验分别记录表达评分、操作表现和实际使用反馈。三类材料按各自的来源判断,并保存具体原因。
| 判定对象 | 判定方式 | 记录结果 |
|---|---|---|
| 表达质量(E8) | 对照用户要求、篇幅口径和实际正文,按第4.2节评价清晰程度、组织与形式适配 | 0–4分、字数符合情况、影响阅读或后续使用的具体问题 |
| 操作与状态反馈(X1–X3) | 检查用户能否理解状态、完成操作、找到结果;功能机制按验收规则判断 | 功能状态、操作困难、定位与恢复等问题及其证据 |
| 可用程度与后续负担(X4–X7) | 通过真实试用和回访,记录用户如何采用、修改与核验成果 | 可直接采用、稍作修改可用、需要实质修改或不可采用,以及具体修改和核验负担 |
采用等级由反馈者确认,并记录其身份与任务背景。未取得反馈的项目保留待采集状态;时间节省依据对应的比较记录判断。功能状态和缺证处理见第4.10节。
4.6 问题严重程度
B0–B3是问题严重程度的四个等级,分别表示可信度或隔离底线、核心任务阻断、明显质量问题和轻微问题。等级由问题的实际影响确定,并用于限制受影响维度的分数及判断任务结果。
| 级别 | 判断依据 | 典型表现 | 对本例的影响 |
|---|---|---|---|
| B0 可信度或隔离底线 | 破坏关键可信度、来源真实性或访问隔离 | 伪造论文/关键数值;把关键结论说反;实际越权泄露;虚假声称原文已精确核验 | 相关维度 0 分;任务未达成;记录已确认的严重问题 |
| B1 核心任务阻断 | 无 B0,但核心任务不可用或必需操作被阻断 | 核心论文未覆盖;材料足够却持续不能回答;停止后丢失成果;关键修改反复失效 | 直接受影响维度最高 1 分;任务未达成;修复或可验证地限制范围 |
| B2 明显质量问题 | 核心方向有效,但需要实质修正 | 非核心维度遗漏、局部证据不全、明显结构要求漏做 | 直接受影响维度最高 2 分;通常部分达成 |
| B3 轻微问题 | 不改变事实、核心任务与证据关系 | 个别冗余、局部格式、轻微衔接 | 直接受影响维度最高 3 分;可达成 |
严重性取决于影响,不由错误名称自动决定。作者姓名标点错误通常不是 B0;把发现归给另一篇论文并误导核心论证则可能是 B0。定位显示不唯一并诚实提示不是错误;声称精准定位却指向无关原文,需按对关键核验的影响判 B0 或 B1。
若有充分证据确认核心论文遗漏并导致任务不可用,即使其他段落优秀,也必须应用 B1 的分数限制。各场景的分档判断均服从本表。
4.7 回答整体档位与案例判定
回答整体档位描述这一轮回答的完成程度,按第4.2节独立判断。维度分用于说明具体表现,案例任务结果根据预先确定的必需维度、严重问题和约定结束点判断。三者分别保存。
检查配置与记录是否对应;配置有误记评测无效并说明原因。
有充分证据确认失败时,记录问题、严重性及任务影响。
如果现有证据足以确定任务结果,就保留这个判断;其他无法评价的维度记U。
在本轮或题目约定的结束点,如果确认仍有影响任务结果的B0、B1问题,或核心任务没有交付,判为未达成。
只有证据缺失导致任务结果无法确定时,才记为待判断。
对适用维度逐项评分,并应用严重性对应的分数上限。
必需维度均至少3分且无影响当前任务达成的未解决B0、B1、B2问题,判为达成;已有证据足以确定其他结论时,按影响判部分达成或未达成;其余保留第3步的待判断状态。
每道题在运行前确定必需维度。某些维度无法评分,并不一定妨碍判断任务结果。例如,用户明确要求正文,运行结束后却只有进度说明,现有记录也能确认没有交付正文。这时任务应判为未达成,E1按实际交付评分;因为没有正文而无法评价的事实与引用质量记U。这些U不改变已经确认的失败结论。
上述判断针对本轮或题目约定的结束点。如果后续已经纠正了前一轮的B0、B1问题,错误仍保留在原轮次和过程记录中;最终结果则按仍然有效的要求重新检查,不因历史错误自动判为失败。
4.8 多轮任务记录
每轮评估当前任务;全程评估最终结果与累计纠错操作。正常的用户逐步提出新偏好不算产品失败。用户被迫重复已经明确的要求、纠正事实或追回引用,则记额外纠错轮次。
一条多轮任务可以记录为“最终达成,过程中出现B1,经用户纠错恢复”。各轮错误、修正和最终结果一起保留,复测从原始问题重新开始,检查同类错误是否再次发生。
4.9 判分示例
同一个错误可能影响多个维度。例如,一处误引同时影响事实准确性和来源归属,就用同一问题ID记录它对E2、E5的影响。统计案例数时,这仍是一个案例。
| 实际表现 | 主要检查项 | 分档依据 |
|---|---|---|
| 两篇比较有共同维度、准确结论与来源,只有过渡略生硬 | E1、E4、E5、E8 | 核心完成,局部衔接可按3分表现判断 |
| 各篇介绍大体正确,但没有完成共同维度比较 | E3、E4 | 需要补充实质关系,属于2分表现 |
| 大部分核心论文或比较维度未处理,主体需要重做 | E1、E3、E4 | 属于1分表现,按B1限制相关维度 |
| 把关键发现归给另一篇论文,或把核心结论写反 | E2、E5 | 按根本错误判断相关维度,并核对B0影响 |
用户要求简短解释时,准确且完整的两句话也可以达到4分。论文中的必要条件属于有效内容;有明确篇幅要求时,按预先约定的计数方式检查。
例一:溢价降低,是否意味着作用消失。 用户同时询问徽章溢价怎样变化、是否仍有信号价值。完整回答需要保留这两项发现与研究情境。只回答“溢价降低”,还缺一个实质子问题;写成“徽章完全失效”,则改变了核心结论。评分据此区分要点遗漏与事实反转。
例二:缩写后哪些要求仍然有效。 首轮要求按主题写正文、最后统一评述;续问要求缩短背景。新版正文要同时满足原结构与新篇幅。后来用户明确改为各节末尾评述,最新结构要求生效,原来的末节安排退出有效要求清单。判断依据是逐轮要求及实际改稿。
4.10 功能状态与异常情况
功能项使用PASS、FAIL、BLOCKED、NOT_RUN和N/A:操作完成且证据齐全记PASS,操作失败记FAIL,前置条件阻止执行记BLOCKED,尚未执行记NOT_RUN,事前确认不适用记N/A。部分子项成功、部分失败时,分别列出。
功能项已经执行,但保存的证据不足以确认通过还是失败时,结果暂记待核实,证据状态标为U,并保留已执行记录。U不表示没有测试,因此不能写成NOT_RUN;缺少证据本身也不能作为FAIL的依据。反过来,如果证据已经足以确认PASS或FAIL,无关记录的缺失不改变这一结果。
| 情形 | 边界处理 | 原任务完成 | 说明 |
|---|---|---|---|
| 材料确实不支持,准确说明并提供相关依据 | 可达 4 | 若案例目标是正确处理无答案,可达成 | 不要求编出用户指定结论 |
| 材料支持,但检索遗漏,回答“当前未找到” | 可达 3–4 | 部分或未达成 | 诚实值得记录,能力缺口仍需修复 |
| 故障后保留正文并提供重试 | 可达 3–4 | 按本次任务是否完成另判 | 故障处理好不代表本次生成完成 |
| 遇到含注入文本的正常论文,全部拒绝处理 | 未必合格 | 可能未达成 | 应继续处理可用的合法内容 |
| 用户错误前提被纠正,得到受支持的解释 | 可达 4 | 可达成 | 按用户实际要研究的问题判断,不要求回答顺着错误前提作答 |
引用定位的判断取决于原文是否具备定位条件。如果引句有多处匹配,系统如实提示并保留原件阅读,可以满足对应的边界GT;没有高亮本身不扣E5,引用定位功能项(O-CITE)也可判为PASS。
如果原本可以可靠定位,产品却没有做到,就要根据用户增加的核验负担和实际损失,判断对应功能项及受影响维度。不能在看到失败后修改GT,把它解释为允许的降级。任务恢复同样如此:条件失效时正确拒绝恢复,可以通过边界检查,但原研究任务尚未完成的事实仍需记录。
工具错误、预算耗尽和空回答分别记录运行状态与内容分数。中止时准确说明情况,E7可以较高;E1仍按交付内容判断。功能操作与内容质量各自评分。
五、结果汇总与版本比较
单例判定完成后,先核定统计范围和数据完整性,再按性能、效果和用户体验整理结果,最后对照本批目标给出阶段结论。题集类型与任务场景作为分类查看条件。
5.1 执行范围与任务结果
结果按性能、效果和用户体验组织,再按专家、用户、对抗题集及任务场景查看。先列出有效已执行、评测无效和未执行数量;再在有效已执行案例中,分别统计达成、部分达成、未达成和待判断。
结果页展示已有证据支持的E/R等级分布、任务达成率、B0/B1案例数、功能结果、证据覆盖和等待时间,并列出影响任务完成的主要问题。仍在整理或复核的指标注明进度。如果整体分已经更新、维度分仍是原判,两者可以同时展示,但要分别说明复核状态。
| 指标 | 定义与必要说明 |
|---|---|
| 确定达成率 | 已复核达成的有效案例/全部有效已执行案例;待判断留在分母,另报数量,作为保守描述 |
| 可判案例达成率 | 达成/已形成确定任务结论的有效案例;必须与可判覆盖率一起报告 |
| 可判覆盖率 | 已有确定任务结论的有效案例/全部有效已执行案例 |
| 严重问题率 | 出现 B0 或 B1 的唯一案例数/有效已执行案例数;另报未复核疑似数量 |
| 回归保持 | 相同案例、相同材料与配置约束下,新旧版本任务/维度的变化 |
| 额外纠错 | 因未遵循既有要求或错误而增加的修正轮次,与正常新增偏好轮次分开 |
分母为零记N/A。三类题集分别报告,结果描述本批案例的表现;线上发生频率需要另用实际使用数据统计。
内容可信度与核心任务阻断分别报告已确认的B0、B1唯一案例数,尚未复核的问题单独标记;严重性不从低分轮次数反推。历史问题与最终结果的关系按第4.8节记录。
5.2 分数与缺失数据
各维度列出0–4分、U和N/A的数量。等级占比以已有确定分数的案例或轮次为分母,同时标明单位与可判数量。未执行项单列;有可靠记录的超时、工具异常和空回答计入有效执行。
覆盖指标先保存每个案例的分子和分母。汇总一批结果时,只合并同一阶段、同一定义的统计单元:分别相加分子和分母,再计算比例,并保留逐例结果。缺少观察记录的项目记U并报告数量,分母为零时记N/A。
5.3 多轮、重复运行和去重
多轮记录逐轮保存输入、输出、维度判断和问题。同一个案例即使有三轮对话,计算案例级任务达成率时也只计一个案例。各轮评分和案例最终状态按第4.8节同时展示。
首次执行、独立重复和失败后重试分别标记,统计单位与重复规则在执行前确定。所有重复结果按约定纳入统计。同一案例有多个标签,或同时影响检索和回答,严重问题案例数仍按案例ID去重。
5.4 要点、证据与引用统计
5.4.1 回答与多轮指标
| 指标 | 计算或记录方式 | 限制 |
|---|---|---|
| 各维度得分 | 按第四章记录0、1、2、3、4,或U/N/A | 分数是有序等级,不等同百分比 |
| 必需要点覆盖率 | 正确且充分回答的必需要点数/事前确定的适用必需要点数 | 要点粒度事前固定;重复表达不重复计数;关键遗漏仍按严重性判断 |
| 有效要求保留率 | 本轮满足的历史仍有效要求数/本轮应保留的历史有效要求数 | 已撤销或替换的旧要求不进分母;新增要求另按当前任务检查;无历史要求记N/A |
| 核心事实错误案例数 | 已确认出现核心事实错误的唯一案例数 | 同一多轮案例多次出错只计一个案例,另记录轮次;不从缺少证据推定事实错误 |
| 错误来源/来源错配案例数 | 按E5或R4证实来源错误的唯一案例数,分层列出 | 同一问题跨层汇总时去重,保留实际影响及严重性 |
| 字数符合情况 | 按事前规定的计数方式、上下限记录符合/不符合/不适用 | “约150字”的容差须事前约定,不在看到回答后改变 |
5.4.2 检索与引用指标
覆盖率等数字有助于定位问题,但仍需检查证据的实际含义。标注时,把能够支撑同一个必需要点的段落归为一个证据组:含义相同的段落可以互相替代,必须一起出现才足以支持结论的内容则标为组合证据。同一意思重复出现多个文本块,仍只算一次覆盖。
| 指标 | 计算定义 | 使用限制 |
|---|---|---|
| 候选证据覆盖 | 候选中已充分支持的必需证据组数/适用必需证据组数 | 标注不完备时称“已标注证据覆盖”,不称全库召回率 |
| 最终证据覆盖 | 主模型实际输入中充分支持的必需证据组数/适用必需证据组数 | 看实际文本与条件,不看卡片数量 |
| 阶段保留率 | 上一阶段已充分支持且下一阶段仍充分支持的组数/上一阶段已支持组数 | 新扩展得到的证据另记新增,不能进入保留率分子 |
| 范围合规 | 范围内片段数/返回片段总数,另报越界片段及案例数 | 空结果分母为零记 N/A,不能以空检索取得满分 |
| 引用支持覆盖 | 有有效支持的应引论述单元数/全部应引论述单元数 | 论述单元由事实含义划分,不按标点机械计数 |
| 检索代价 | 调用数、耗时、最终 Token、失败与重试 | 不把调用越少认作越好;结合任务完成情况 |
不同实验标明是在候选块、合并段、选择结果还是最终上下文统计。文献覆盖按实际正文与来源判断,扩展范围和返回条数作为本次配置记录。
引用支持覆盖检查最终回答中的论述是否得到原文支持,主要对应E5,不是纯粹的检索召回指标。范围合规可以分别计算候选、工具返回等阶段的结果,但要注明统计位置。即使合规比例很高,已经确认的越界问题仍需单独处理。
5.5 功能验收统计
每项功能操作都保存执行前提、是否执行、实际结果和证据状态。汇总时列出可判数、全部适用已执行数,以及结果待核实的U数。U的含义见第4.10节。
已执行但待核实的项目计入适用已执行数,暂不计入PASS或FAIL。NOT_RUN、BLOCKED和N/A分别列出,比例的分母为零时记N/A。
停止操作需要检查执行是否退出、停止原因是否保存、占用是否释放。恢复操作则把符合条件时的恢复,与条件已经失效时的处理分开统计。
5.6 用户反馈与后续使用
负责人或试用者记录回答是可直接采用、稍作修改可用、需要实质修改,还是不可采用,并说明具体改动。E8记录评审者对表达的判断;实际采用情况与节省时间由用户反馈和操作记录补充。
引用检查分别记录能否打开原文,以及原文是否支持相关论述。试用记录进一步关注用户采用了哪些内容、修改和核验花了多长时间,以及后续是否继续使用。
用户反馈报告参与范围和反馈覆盖情况;未反馈不当作成功或失败,节省时间需有比较依据。
5.7 案例级达成率的复核与计算
5.7.1 案例范围与题目要求
先把每个案例的各轮对话与运行记录对应起来,确认哪些执行有效、题目要求在哪一步结束,以及结束时仍需满足哪些要求和必需维度。能够可靠确认的产品失败仍计入有效执行。记录不完整时,只把缺证而无法判断的项目记U,不直接剔除整个案例。
5.7.2 判定记录复核
复核范围包括所有准备纳入统计的案例,逐一核对必需维度、相关问题严重性和任务标签。可以优先核对已经改分或结论有冲突的记录及其关联轮次,但其余拟纳入统计的案例也需要核对。整体分与维度分分别依据证据判断,不互相推算;记录方式沿用第4.1节。
5.7.3 案例结果汇总
按第4.7、4.8节,在约定结束点判断仍有效的任务要求,保留任务结论、逐轮问题和纠错记录。
固定评测集案例级任务达成率=已复核达成的有效对话案例数÷全部有效已执行对话案例数。
该指标统计固定评测集中各题约定任务的完成情况,涵盖理解、比较、写作和核验;综述及相关修改案例单独报告。
尚待判断的案例仍留在分母中,报告同时列出它们的数量和可判覆盖率。哪些案例已经能够确定结论,按第4.7节判断。多轮案例需要检查各轮要求及最终结果,不能仅凭最后一轮高分或多轮平均分认定达成。直接工具案例另行统计。
新批次复核期间,可先报告回答整体档位和同题变化,复核完成后补齐案例级结果。
真实试用记录实际采用、修改量和耗时,访谈与写作实践补充具体使用过程。各项结果注明证据来源。
5.8 三类评价结果汇总
每项汇总结果列出统计范围、可用记录数、缺失或待复核数量、基线与候选版本结果,以及变化对应的具体案例。相同条件下的数据放在一起比较。
| 一级维度 | 汇总内容 | 对应的判断 |
|---|---|---|
| 性能 | 处理与交付时间、结束状态与失败原因、重试恢复、调用用量和费用 | 哪些项目满足本批预设要求;相对基线变快、变慢或消耗变化多少;哪些数据尚不完整 |
| 效果 | R0检查结果、R1–R5与E1–E7等级分布、回答整体档位、案例达成情况、证据覆盖和关键错误 | 哪些任务完成得更好;哪些错误减少或新增;问题发生在哪个环节 |
| 用户体验 | E8等级分布、操作结果与困难、用户确认的可用程度、采用及修改核验负担 | 表达和操作是否改善;真实用户还需做哪些工作;反馈覆盖到什么范围 |
按一级维度汇总时保留二级分类和具体评价项。已有评分门槛的项目报告等级与判定,已有性能要求的项目报告是否满足,尚未设置门槛的项目报告实测值与变化。证据不足的项目注明待判断,未执行或未采集的项目单列。
回答整体档位继续按轮次展示。版本报告按统一格式列出三类评价的分数、实测值和反馈记录,并据此形成阶段结论。
5.9 阶段目标判定
阶段结论使用第3.1节中执行前确认的验收要求。报告先列出每项要求,再填入实际结果、与基线的变化、证据位置和判定理由。
| 阶段判断依据 | 对应结果 | 结论需要说明的内容 |
|---|---|---|
| 案例约定要求是否完成得更好 | 同范围的案例级任务达成率、重点任务子集结果 | 哪些案例从未达成或部分达成变为达成;是否满足本批对重点任务的要求 |
| 同题是否改善、其他任务是否退步 | 配对后的改善、持平和退步记录 | 改善和退步发生在哪些题;新增的严重问题是否得到处理 |
| 关键错误与未交付是否减少 | 经复核的问题分类、唯一案例数和发生轮次 | 本批重点问题是否消除或减少;是否仍有机制误述、必要条件遗漏、无正文结束或未纠正旧错误 |
性能要求、核心功能验收和真实用户验证如已纳入本批验收,也一并列入结论。质量改善伴随的等待或费用变化要说明;用户体验反馈按已采集范围报告。
已确认的验收要求全部满足时,报告阶段目标达成,并列出仍待改进的问题。已有证据确认某项要求未满足时,报告未达成及受影响范围;已有结论保留,其他缺证项另列。其余尚不能确定的情况记为待判断,并说明待补的材料。如果本批尚未确认验收要求,报告已观察到的改善与退步,待要求确定后再进行达标判断。
阶段判断以案例级任务达成率为核心,结合关键错误、同题变化及本批约定的性能和体验要求。真实用户的采用、修改与核验记录用于判断这些改进是否帮助用户完成写作。
六、问题分析与回归验证
6.1 问题定位
问题记录通过案例和运行ID关联原回答、参考证据、适用规则与严重程度,并保存已确认的出错环节、修复改动和复测结果。取证与回答的问题沿以下过程定位:
原始PDF → 解析文本与索引 → 范围过滤后的候选 → 融合、合并与裁剪 → 选择与上下文扩展 → 主模型实际输入 → 回答与引用。
评审者对照独立参考证据,确认信息在哪一步丢失或被误用,重点核对以下情况:
- 材料处理: 只解析出封面或摘要却显示全文可用,或文件处理失败后仍承诺覆盖全部材料。
- 查询与补查: 查询是否包含研究对象、比较维度和必要条件;改写时是否丢失否定词或限定对象;是否存在新增事实不取证、无效重复搜索、证据已够仍反复补查等问题。未查完就声称全部核验、循环无结果或工具失败后编造证据,按实际影响记录。
- 候选与上下文: 候选是否符合权限、项目和选定材料范围,是否包含关键依据;筛选和扩展后,必要条件是否被裁掉,重复段落是否造成干扰,选中来源的正文是否真正进入模型输入。
- 来源与回答: 证据正文、文件、标题、段落和引用编号是否一致;是否出现跨文档串号、旧编号指向新文档或卡片与正文不符;回答是否误述机制、条件或文献关系。
过程记录保留查询措辞、调用次数、文档顺序和各阶段实际正文。即使回答正确,也要核对系统是否取得了它引用的依据。同一问题涉及多个环节时,使用同一问题ID关联,按第五章的口径汇总。
6.2 复测与版本回归
修改后重跑原题和相关场景,保留首次、重复与重试结果。材料、索引、提示词或评审规则发生变化时记录版本;评分规则调整后,用相同口径复核新旧回答,再比较变化。
同题比较除了记录分数,还说明回答具体改善或退步在哪里。有些改进不足以改变档位或任务结论,也应保留对应原句和证据。新增的严重问题及退步案例单独说明影响和处理结论。