Skip to content

LLM 评审器的构念有效性双坐标评测 ​

摘要 ​

该研究将 LLM-as-a-Judge 视为测量仪器,要求同时满足两项条件:对不改变目标构念的编辑保持判决不变,对最小但确实改变构念的编辑改变判决。作者将二者记为不变性 S 与构念敏感性 R,并证明两者独立、不能压缩为无损单分数。

作者测试了七个评审器、四个领域、七类构念改变和五类仅改变表达的控制。三名标注者审查了 478 个项目;按预注册的 0.75 一致性门槛,最终保留 246 个构念改变项目和 96 个构念保持项目。固定 S≥0.90 后,整体位置约为 S=0.945、R=0.319:判决稳定,却经常没有识别真正的构念变化。

方法的独特价值 ​

以往评测主要检查长度、格式、顺序等无关变化是否导致翻转,只验证“稳定”。本方法加入最小构念改变,直接测量评审器是否对它应当评价的对象敏感,并用二维前沿保留权衡。

适用范围 ​

实验重点是科学声明是否超出证据,并把过度声明拆为范围扩大与强度提高。该构念便于做受控最小编辑,但结果不能直接外推到所有开放式安全 Judge。

方法与实施流程 ​

  1. 生成人工可判定方向的构念保持与构念改变配对样本。
  2. 由人工标注者以预设 0.75 一致性门槛确认改变方向。
  3. 生成、验证与评审使用三个不重叠的模型家族。
  4. 诱导连续判决后统一切阈值,绘制相同条件下的 S-R 前沿。
  5. 单独比较范围与强度变化,并检查公开标签集的表面泄漏。

质量控制 ​

作者报告,范围与强度敏感度在匹配不变性下相差 +0.121,七个评审器方向一致;轴标签置换检验 p<0.002。五个公开标签集中,仅读取表面形式的冻结模型可复现 55%–67% 的标签,其中对 MT-Bench 人工投票的复现率为 67.4%。这说明高一致性可能来自表面线索泄漏,而非对目标构念的有效判断。

局限与待验证问题 ​

人类方向标签和构念定义仍可能带来主观性;结果来自有限领域与编辑模板。二维指标不能自动决定部署阈值,仍需按安全代价选择工作点,并验证对自适应输出和跨语言内容的迁移。

参考链接 ​