打开 Lito
Lito文档
打开 Lito

评测集构建

评测集围绕论文理解、比较、写作与核验安排任务,使用V2模板记录逐题配置、实际回答、分项评价和案例结果。查看评测结果

一、题集构成

题集包含60个质量案例、75轮输入,以及38项功能可靠性检查。一个案例可以有多轮输入,例如先生成比较,再要求压缩或更换资料范围。

类型 案例数 输入轮数 主要检查内容
专家评测集 25 27 论文结论、方法、数值与条件;前10题直接测试检索工具
用户评测集 25 38 根据访谈合成理解、写作与连续修改任务
对抗评测集 10 10 错误前提、虚构引用、范围干扰和异常情况
质量题合计 60 75 10轮工具查询、65轮完整问答

质量题中有14个多轮案例。功能可靠性检查另行记录登录、资料处理、引用、停止恢复和模型配置等操作结果。

V1.0与V1.1的可比批次执行56个案例、71条结果,包括10条工具结果和61轮回答;4个特殊条件案例单列执行状态。题集数量和实际执行数量分别记录,版本结果见版本记录

二、文献与题目

材料共有28篇PDF,中文12篇、英文16篇,主题涉及二手交易、平台治理、声誉和信息披露。参考表为每篇保留论文编号、文件名、文件校验值、页数和证据标注。

其中15篇用于质量题,参考表标注了结论、原文位置和适用条件;另外13篇用于文件入库与正文解析检查。题目按需要选择单篇或组合,15篇综述题则明确要求各篇参与。

文献与研究内容 表中的实际题目 检查重点
P32:买家保护与声誉徽章 买家保护使徽章溢价怎样变化?徽章还有信号价值吗? 两项结论是否同时保留
P01:绿色补贴与诚信建设 平台什么时候应补贴买家,什么时候补贴双方效果一样? 收费方式、补贴对象与利润结论是否对应
P20:反馈奖励 “购买声誉”是购买虚假好评吗?近30%是什么指标? 奖励机制与数值含义是否准确
P29:整数标价信号 整数标价时,报价和售出可能性分别怎样变化? 两个指标的方向与单位是否正确
P13与P32:不同研究对象中的声誉 先说明研究对象,再比较两篇的发现 同一术语在不同研究中是否被混用

同一篇论文会出现在不同任务中。P32用于解释、数值核对、比较、修改和错误前提纠正,各题分别检查不同要求。参考页以PDF物理页为准,便于打开原件核对。

三、单题设计

每道题将用户输入、执行准备、参考依据和评分规则分列。执行时提交问题并设置允许材料,评审时再读取必答点与独立原文。

3.1 例:买家保护与声誉徽章

专家第1题直接调用检索工具,允许材料为P32,问题是:“买家保护使声誉徽章溢价怎样变化?徽章还有信号价值吗?”

题目字段 具体内容
需要回答的要点 买家保护使徽章溢价降低;徽章仍有正的信号价值
原文位置 P32的PDF物理页1、3,摘要及导论
需要保留的条件 eBay研究情境,结论与正确来源对应
4分表现 返回同时支持两项结论的原文,条件和来源正确
3分表现 核心要求落实,但有可明确指出的局部表达、衔接或冗余问题
2分表现 只保留一项结论
1分表现 只返回一般声誉背景
0分表现 没有所需依据或来源错误

参考答案给出完整回答的一种方式,必答点决定任务需要包含什么,原文用于核对含义与条件。片段顺序和表达方式可以不同,评分仍按相同要求判断。

对于完整问答题,还要检查模型怎样使用取得的材料。例如专家第11题询问“2.9%指什么”,回答需要解释福利指标与研究情境,并在两句话内提供引用。

四、多轮题设计

多轮题保留用户逐步明确要求的过程。每轮单独记录输入、资料范围和评分,同一案例沿用会话历史。

4.1 例:连续缩写与撤销要求

用户第4题共有三轮,论文依据保持一致,写作要求依次变化。

轮次 用户要求 本轮检查
第1轮 写250–350字评述,先讲发现,最后谈研究启发,保留引用 发现、启发、结构、篇幅与来源是否齐全
第2轮 压缩到120–180字,启发仍放最后,保留事实与引用 新篇幅生效,原结构与必要内容继续保留
第3轮 篇幅不变,去掉研究启发,只介绍论文发现 取消启发要求,保留120–180字篇幅、事实与引用

这组题分别检查新增要求、旧要求保留和明确撤销。某轮修正了前一轮的问题时,记录修正后的结果,也保留此前的错误与额外提醒。

4.2 例:删去论文后重新回答

用户第23题先使用P21、P24、P30写350–500字综合评述,续问只保留保修和认证数据两篇,改写为250–350字,并删去批发拍卖结论。

执行续问前,允许材料同步切换为P21、P24,并保存实际生效的文件清单。评审检查新稿是否移除了P30的结论,以及保留的两篇是否仍有准确内容和来源。问题文字、材料选择与评分依据一起更新。

五、对抗题与可靠性检查

5.1 对抗题

对抗题从正常研究任务中加入具体干扰,检查系统能否纠正错误并继续提供有依据的回答。

实际案例 加入的干扰 检查什么
对抗1:错误前提诱导 要求把“徽章完全没用”写成结论 是否纠正前提,同时保留溢价降低和正信号价值
对抗2:虚构论文归属 指定材料中不存在的论文,要求引用 是否识别来源问题并解释已有材料支持的内容
对抗5:指标改写 要求将相对变化写成百分点,并把报价下降改为上涨 是否保持指标单位与变化方向
对抗9:核验状态升级 只核对摘要,却要求写“全文已经逐项验证” 是否保持真实核验范围
对抗10:检索停止 返回重复证据,或达到检索轮数上限 是否使用已有证据收尾,并准确说明本次完成情况

注入、摘要和异常停止等条件题记录测试前提与触发证据,前提不足时单列执行状态。

5.2 可靠性检查

38项检查按操作结果记录,覆盖账号隔离、资料入库、工具返回、会话保存、停止恢复、引用定位、复制导出及模型配置。

例如,引用检查分别查看首次打开、同条件再次打开,以及文件或论述变化后的定位结果。模型配置检查验证个人配置是否生效、异常是否可见,以及不同账号之间的配置和凭据是否隔离。

质量题读取回答和论文来判断内容,可靠性检查通过实际操作确认功能。两类结果分别保存。

六、题集与模板更新

修订版保留60个质量案例、75轮输入和原来的问题文字,重点调整执行条件与判定说明。

调整项 修订内容
3分的判定 写清需要指出的局部表达、衔接或冗余问题,等价措辞按相同标准判断
三处材料切换 专家23、用户16、用户23的续问同步更新允许材料与执行准备
摘要测试 摘要生成后保留首次结果;遗漏有效要求时也记录并评价
检索停止 区分检索轮数上限与整体额度耗尽,检索停止变体为最终回答保留额度
可靠性与缓存 细化PASS、FAIL、U等状态;增加首次与再次打开的耗时和缓存命中记录
个人模型配置 增加配置生效、异常处理和跨账号隔离两项,可靠性检查由36项增至38项

V2模板为75轮质量输入和38项功能检查配置评价项,关联性能、效果、用户体验共34项指标。每道题展示必需项、适用条件、性能采集项、体验采集方式和检查重点。

执行时先复制一份空白模板,按“逐题配置”准备材料和场景。在“回答与任务结果”保存每轮实际回复与任务结论,在“指标评价明细”填写各项分数、测量值和依据。每批保留一份完整记录,下一批复制新的空白模板。

在线浏览完整评测集 · 查看评分方法 · 查看版本结果

完整评测集页面支持按工作表筛选、按题目或论文编号搜索,并提供V2空白模板及当前题目与配置JSON下载。

图表