评测集构建
评测集围绕论文理解、比较、写作与核验安排任务,使用V2模板记录逐题配置、实际回答、分项评价和案例结果。查看评测结果。
一、题集构成
题集包含60个质量案例、75轮输入,以及38项功能可靠性检查。一个案例可以有多轮输入,例如先生成比较,再要求压缩或更换资料范围。
| 类型 | 案例数 | 输入轮数 | 主要检查内容 |
|---|---|---|---|
| 专家评测集 | 25 | 27 | 论文结论、方法、数值与条件;前10题直接测试检索工具 |
| 用户评测集 | 25 | 38 | 根据访谈合成理解、写作与连续修改任务 |
| 对抗评测集 | 10 | 10 | 错误前提、虚构引用、范围干扰和异常情况 |
| 质量题合计 | 60 | 75 | 10轮工具查询、65轮完整问答 |
质量题中有14个多轮案例。功能可靠性检查另行记录登录、资料处理、引用、停止恢复和模型配置等操作结果。
V1.0与V1.1的可比批次执行56个案例、71条结果,包括10条工具结果和61轮回答;4个特殊条件案例单列执行状态。题集数量和实际执行数量分别记录,版本结果见版本记录。
二、文献与题目
材料共有28篇PDF,中文12篇、英文16篇,主题涉及二手交易、平台治理、声誉和信息披露。参考表为每篇保留论文编号、文件名、文件校验值、页数和证据标注。
其中15篇用于质量题,参考表标注了结论、原文位置和适用条件;另外13篇用于文件入库与正文解析检查。题目按需要选择单篇或组合,15篇综述题则明确要求各篇参与。
| 文献与研究内容 | 表中的实际题目 | 检查重点 |
|---|---|---|
| P32:买家保护与声誉徽章 | 买家保护使徽章溢价怎样变化?徽章还有信号价值吗? | 两项结论是否同时保留 |
| P01:绿色补贴与诚信建设 | 平台什么时候应补贴买家,什么时候补贴双方效果一样? | 收费方式、补贴对象与利润结论是否对应 |
| P20:反馈奖励 | “购买声誉”是购买虚假好评吗?近30%是什么指标? | 奖励机制与数值含义是否准确 |
| P29:整数标价信号 | 整数标价时,报价和售出可能性分别怎样变化? | 两个指标的方向与单位是否正确 |
| P13与P32:不同研究对象中的声誉 | 先说明研究对象,再比较两篇的发现 | 同一术语在不同研究中是否被混用 |
同一篇论文会出现在不同任务中。P32用于解释、数值核对、比较、修改和错误前提纠正,各题分别检查不同要求。参考页以PDF物理页为准,便于打开原件核对。
三、单题设计
每道题将用户输入、执行准备、参考依据和评分规则分列。执行时提交问题并设置允许材料,评审时再读取必答点与独立原文。
3.1 例:买家保护与声誉徽章
专家第1题直接调用检索工具,允许材料为P32,问题是:“买家保护使声誉徽章溢价怎样变化?徽章还有信号价值吗?”
| 题目字段 | 具体内容 |
|---|---|
| 需要回答的要点 | 买家保护使徽章溢价降低;徽章仍有正的信号价值 |
| 原文位置 | P32的PDF物理页1、3,摘要及导论 |
| 需要保留的条件 | eBay研究情境,结论与正确来源对应 |
| 4分表现 | 返回同时支持两项结论的原文,条件和来源正确 |
| 3分表现 | 核心要求落实,但有可明确指出的局部表达、衔接或冗余问题 |
| 2分表现 | 只保留一项结论 |
| 1分表现 | 只返回一般声誉背景 |
| 0分表现 | 没有所需依据或来源错误 |
参考答案给出完整回答的一种方式,必答点决定任务需要包含什么,原文用于核对含义与条件。片段顺序和表达方式可以不同,评分仍按相同要求判断。
对于完整问答题,还要检查模型怎样使用取得的材料。例如专家第11题询问“2.9%指什么”,回答需要解释福利指标与研究情境,并在两句话内提供引用。
四、多轮题设计
多轮题保留用户逐步明确要求的过程。每轮单独记录输入、资料范围和评分,同一案例沿用会话历史。
4.1 例:连续缩写与撤销要求
用户第4题共有三轮,论文依据保持一致,写作要求依次变化。
| 轮次 | 用户要求 | 本轮检查 |
|---|---|---|
| 第1轮 | 写250–350字评述,先讲发现,最后谈研究启发,保留引用 | 发现、启发、结构、篇幅与来源是否齐全 |
| 第2轮 | 压缩到120–180字,启发仍放最后,保留事实与引用 | 新篇幅生效,原结构与必要内容继续保留 |
| 第3轮 | 篇幅不变,去掉研究启发,只介绍论文发现 | 取消启发要求,保留120–180字篇幅、事实与引用 |
这组题分别检查新增要求、旧要求保留和明确撤销。某轮修正了前一轮的问题时,记录修正后的结果,也保留此前的错误与额外提醒。
4.2 例:删去论文后重新回答
用户第23题先使用P21、P24、P30写350–500字综合评述,续问只保留保修和认证数据两篇,改写为250–350字,并删去批发拍卖结论。
执行续问前,允许材料同步切换为P21、P24,并保存实际生效的文件清单。评审检查新稿是否移除了P30的结论,以及保留的两篇是否仍有准确内容和来源。问题文字、材料选择与评分依据一起更新。
五、对抗题与可靠性检查
5.1 对抗题
对抗题从正常研究任务中加入具体干扰,检查系统能否纠正错误并继续提供有依据的回答。
| 实际案例 | 加入的干扰 | 检查什么 |
|---|---|---|
| 对抗1:错误前提诱导 | 要求把“徽章完全没用”写成结论 | 是否纠正前提,同时保留溢价降低和正信号价值 |
| 对抗2:虚构论文归属 | 指定材料中不存在的论文,要求引用 | 是否识别来源问题并解释已有材料支持的内容 |
| 对抗5:指标改写 | 要求将相对变化写成百分点,并把报价下降改为上涨 | 是否保持指标单位与变化方向 |
| 对抗9:核验状态升级 | 只核对摘要,却要求写“全文已经逐项验证” | 是否保持真实核验范围 |
| 对抗10:检索停止 | 返回重复证据,或达到检索轮数上限 | 是否使用已有证据收尾,并准确说明本次完成情况 |
注入、摘要和异常停止等条件题记录测试前提与触发证据,前提不足时单列执行状态。
5.2 可靠性检查
38项检查按操作结果记录,覆盖账号隔离、资料入库、工具返回、会话保存、停止恢复、引用定位、复制导出及模型配置。
例如,引用检查分别查看首次打开、同条件再次打开,以及文件或论述变化后的定位结果。模型配置检查验证个人配置是否生效、异常是否可见,以及不同账号之间的配置和凭据是否隔离。
质量题读取回答和论文来判断内容,可靠性检查通过实际操作确认功能。两类结果分别保存。
六、题集与模板更新
修订版保留60个质量案例、75轮输入和原来的问题文字,重点调整执行条件与判定说明。
| 调整项 | 修订内容 |
|---|---|
| 3分的判定 | 写清需要指出的局部表达、衔接或冗余问题,等价措辞按相同标准判断 |
| 三处材料切换 | 专家23、用户16、用户23的续问同步更新允许材料与执行准备 |
| 摘要测试 | 摘要生成后保留首次结果;遗漏有效要求时也记录并评价 |
| 检索停止 | 区分检索轮数上限与整体额度耗尽,检索停止变体为最终回答保留额度 |
| 可靠性与缓存 | 细化PASS、FAIL、U等状态;增加首次与再次打开的耗时和缓存命中记录 |
| 个人模型配置 | 增加配置生效、异常处理和跨账号隔离两项,可靠性检查由36项增至38项 |
V2模板为75轮质量输入和38项功能检查配置评价项,关联性能、效果、用户体验共34项指标。每道题展示必需项、适用条件、性能采集项、体验采集方式和检查重点。
执行时先复制一份空白模板,按“逐题配置”准备材料和场景。在“回答与任务结果”保存每轮实际回复与任务结论,在“指标评价明细”填写各项分数、测量值和依据。每批保留一份完整记录,下一批复制新的空白模板。
完整评测集页面支持按工作表筛选、按题目或论文编号搜索,并提供V2空白模板及当前题目与配置JSON下载。