Skip to content

基于 Logit 差分的微调目标审计 ​

摘要 ​

Diff Mining 比较同一参考语料上基座模型与微调模型的完整 Token logits,以放大微调后被系统性提升的 Token,再将其聚合为可解释的训练目标指纹。作者报告该方法在微调领域识别上优于所比较的 Activation Difference Lens(ADL)等模型差分方法;在 Llama 3.3 70B Instruct 的 Auditing Games 开源复现中,一次未定向分析找到了与 52 个隐藏奖励偏差中至少三分之一相关的 Token。

该方法提供的是审计线索,不是对隐藏目标的完备证明;它要求同时访问基座与微调模型的 logits,研究发表于 ICLR 2026 Workshop,本站未独立复现。

核心创新与差异 ​

原研究避免预先猜测触发场景:即使参考文本与微调领域无关,微调造成的输出分布尾部变化仍可能暴露目标。Top-K 频率聚合生成单一 Token 集,非负矩阵分解(Non-negative Matrix Factorization, NMF)则把多个微调目标拆成不同 Token 簇。

核心特点与评估范围 ​

研究对象是已有明确基座模型的微调版本,访问级别介于黑盒和白盒之间:无需权重与内部激活,但需取得完整 logits。它适用于安全审计、版本差分和隐藏偏差发现,不直接判断某个行为是否恶意。

评估方法与实际过程 ​

作者分两阶段执行:先在静态参考语料上收集逐上下文 logit 差,再用 Top-K 频率或 NMF 聚合。评测覆盖隐藏目标检测、52 项奖励偏差和双领域微调,并让解释 Agent 读取所得 Token 集完成下游识别;对奖励偏差的“识别”依据 Token 与已知偏差的语义对应,不是对 52 项逐一运行的盲测命中率。本站核对论文与公开工具入口,未重新运行实验。

关键结果与风险解释 ​

Diff Mining 在更接近混合正常数据的困难设置中仍能发现与微调目标有关的 Token;NMF 可在双主题微调中分离目标成分。结果说明输出内容看似正常时,完整概率分布仍可能泄露训练目标;反过来,未发现特征也不能证明模型没有隐藏行为。

防护措施与验证方法 ​

模型接收方可把 logits 差分纳入版本验收,并与定向行为探针、训练数据来源和权重差分交叉验证。服务提供方应按最小必要原则限制高精度 logits,并监测批量参考语料探测。验证需报告参考语料、聚合超参数、基座匹配关系、命中率与误报。

局限与待验证问题 ​

方法依赖正确的基座—微调配对和 logits 可见性;广泛预训练、多阶段合并或强分布漂移可能稀释差分。论文没有证明 Token 簇与训练因果目标一一对应,解释 Agent 的判断也可能引入额外误差。

参考链接 ​