Skip to content

机械可解释性证据的分析多重性审计 ​

摘要 ​

该研究考察机械可解释性结论是否能在多组同样合理的分析选择下保持一致。作者预注册并运行 15,840 个解释规格,发现电路级证据会随节点选择、阈值、归因方法和统计汇总发生大幅变化,部分规格甚至给出方向相反的结论。

核心结论不是“可解释性无效”,而是单一路径得到的解释不能自动视为稳健安全证据。当前结果集中在有限模型和任务上,证据等级为 moderate。

方法的独特价值 ​

传统评估通常固定一条分析流水线,再报告该流水线找到的电路。该研究把合理分析选择本身作为实验变量,用规格曲线和失败实现暴露研究者自由度。本站将其视为评测完整性问题:需要验证的是结论对可辩护选择是否稳定。

适用范围 ​

方法适合审计电路定位、特征归因和因果干预研究,也可迁移到探针、表示编辑和模型比较。它不能判断哪个解释在语义上必然正确,也不能替代任务外验证。

方法与实施流程 ​

  1. 预先枚举可辩护的节点、阈值、归因和汇总选项。
  2. 对所有规格运行同一模型和数据,保存完整结果。
  3. 比较结论符号、幅度和显著性是否稳定。
  4. 对翻转结论的规格做实现与数据检查,区分代码错误和真实分析敏感性。

质量控制 ​

审计应报告规格总数、排除规则、预注册内容和失败实现,不能只展示支持预期结论的子集。安全应用还应加入独立任务、模型和人工语义验证。

局限与待验证问题 ​

15,840 个规格提供了强烈的内部稳健性证据,但仍来自单一研究设置。是否存在更稳定的解释对象、哪些分析选择应获得更高先验权重,以及结论能否预测部署行为,仍需验证。

参考链接 ​