外观
Jagged Judges:LLM 评审器的认识稳定性
摘要
Jagged Judges 使用 Wiggle 流程测试 LLM 评审器面对沉默、单轮压力和十轮自适应说服时是否保持判决。作者在 9 个模型、14 个任务上观察到 25%–91% 的判决翻转,并用净腐化指标区分从错到对与从对到错。
结果说明静态准确率不足以代表评审器在交互环境中的可信度,但不能直接外推为所有翻转都是恶意操纵。
方法的独特价值
方法把压力持续时间和对手适应能力作为独立变量,并保留初始真值,使评审器稳定性可被重复测量。
适用范围
适用于 LLM-as-a-judge、自动审批、内容审核和多 Agent 仲裁。高风险决策仍需确定性证据或人工复核。
方法与实施流程
对每个任务先获得无压力判决,再施加固定提示和多轮自适应说服,记录每轮结果及理由。最终以人工或外部真值计算翻转方向和净腐化。
对共享黑盒端点的预注册审计进一步显示,稳定性问题不只来自说服提示。研究在 52,988 次请求尝试中报告:同一时间窗重复排序的 Spearman 一致性为 0.400,低于预注册门槛 0.90;字节完全相同的次日回放为 0.78,低于门槛 0.99。等待在所测日期没有改善结果(0.805 对 0.800,并在随后五天重复),四家提供商的中位数仅为 0.74–0.88;安静状态下的自托管批次不变内核有所改善,但服务器负载后优势消失。作者还发现标签—含义映射偏差、候选差距比仪器噪声底低七个数量级,以及精确排列读数放大噪声;更换指标或在测试网格上增加采样均未修复。上述数字只描述共享服务基础设施上的外部行为,不证明模型权重变化,也不能外推到固定快照或形式验证的判定器。
质量控制
必须同时报告初始准确率、翻转率、净腐化和无法判断比例;对手提示、轮数、模型版本和温度也应固定并公开。
局限与待验证问题
14 个任务不能代表所有评审场景,交互提示可能偏向特定模型。真实审批中的权限、证据访问和人工介入会改变结果。