为什么不能只问“哪一份回答更好”

“更好”可能同时指事实正确、引用充分、行文流畅、品牌突出或更符合采购任务。把这些目标混成一个总分,容易让长回答、熟悉品牌或更自信的措辞获得优势,而错误的参数被掩盖。

先拆成独立量表:关键事实是否错误、引文是否支持、必需问题是否覆盖、未知是否诚实表达、语言是否可理解。品牌提及另列,不给事实分加成。拒绝猜测认证状态的短回答,可能比列出大量未经核实认证的长回答更合格。模型输出只是评审建议,不能取代被评事实的来源。

三类偏差要用对照方式检查

LLM-as-a-Judge研究讨论了位置、冗长和自我偏好等风险。不能从该研究直接推断当前所有模型存在同样幅度的偏差,但应把这些现象纳入自己的校准测试。

位置测试将同一对答案先按A/B、再按B/A提交;长度测试给同一组正确事实制作简洁版和扩展版,保持证据相同;品牌测试用中性占位符替换企业名称,查看事实评分是否无理由变化。每次只改变一个因素,保留原文哈希、顺序、评审提示、模型版本和结果。只看换序后的总体均值会掩盖单题翻转,必须保留配对记录。

一份实际可用的评审工作表

材料包中的review-templates.json提供待填字段:问题、答案版本、事实清单、证据片段、评分维度、盲化映射、顺序、评审输出、人工标签、裁决理由。没有真实评审时,模型输出和人工标签应保持空值,而不是填入示例分数再汇总为“测过”。

初始校准集至少覆盖明确正确、明确错误、部分支持、来源不可访问、两个来源冲突和必须拒答的情况。可以用AX220教学记录制造一个故意错误的110V答案,但必须标记为合成反例,不能把它当成模型真实犯错。测试程序能够验证字段齐全、配对关系和计分公式;它不能证明未执行的模型评审已经可靠。

人工金标不是作者自己写的标准答案

建立金标时,先给标注者同一事实定义和证据版本,再独立分配标签,最后讨论分歧。公布原始一致率时必须保留样本数;需要机会校正时可使用Cohen kappa,但类别分布极偏、样本过小时不要过度解读。没有分歧也不等于标准一定正确。

本轮公开材料中的两列六项标签是作者构造的教学数据,示范一致率计算,不是两位真实审核者的实验。正式项目应将人工身份以私有编号保存,并记录裁决过程。对于法律资质、认证范围或有安全后果的参数,不应仅由模型最终决定;应回到企业授权资料或合格人员确认。

校准失败时如何处理

如果换序导致大量翻转,先缩小评审任务,让模型只核对一项事实与一个来源,而不是同时判断整篇文章。若模型偏好长答案,可将长度作为单独说明字段,而非质量权重。若引用标题诱导判断,提供实际相关段落与必要上下文,不让标题承担证据功能。

仍无法稳定判断的样本进入人工复核队列,并统计待复核比例。不能删掉难题后只发布容易题的准确率,也不能不断调提示直到得到有利结果却不记录尝试次数。评审提示、阈值和模型升级后,应重跑固定校准集;旧校准不能自动覆盖新版本。

智核增长的使用边界与交付方式

智核增长可以把模型评审用于批量初筛,例如寻找可能不支持断言的引用、缺失市场限制的翻译和型号混淆候选。交付中需要同时提供证据位置、判定理由和未解决状态,不能只给一串分数。客户品牌出现更多,不应被表述为技术正确性提高。

当前材料提供流程、反例构造方法和表单,没有新增商业AI平台评测,也没有声称完成独立人工校准。实际执行后再记录模型、日期、采样设置和复核结果。引用精度与覆盖率负责明确指标,重复测试负责处理同题波动。

校准练习:让评分理由接受反向检查

以下是建议建立的校准清单,不是已完成的商业模型评审结果。每组都应先固定证据,再比较评审是否真的使用这些证据,而不是对语言风格作直觉判断。

校准对照 保持不变 唯一改变 合理的核验重点
顺序交换 两个答案全文 A/B展示次序 判定是否随位置翻转
长短表达 事实和来源 冗余解释长度 事实分不应奖励重复
品牌盲化 参数与证据 企业名称替换 理由是否引用真实事实
删除来源 陈述内容 去掉支持依据 支持评分应反映证据缺失
加入错误单位 其他文字 20L变成20mL 能否指出具体冲突
保留未知 原始资料 回答承认没有证据 不应奖励无依据猜测

一个可接受的理由应指出哪项陈述、哪处证据和哪条规则。仅写“答案A更加专业”无法审计。若两份答案都错,评审应允许“两者均不合格”,不能强制选择一个赢家后对外称为最佳答案。复核者还要检查评分理由是否与分数一致:理由发现关键参数错误,却给满分,属于评审自身失败。

下载与参考

下载实验与评审材料。可以先用空白模板建立自己的盲审集,再决定是否连接模型接口;不要将客户秘密或未获授权的全文发送给外部评审服务。

原始依据包括评审模型研究与scikit-learn的kappa说明。本页关注测量可靠性,不保证任一模型能够独立完成事实验收。

知识中心 · GEO服务 · 研究与证据