Skip to content

思维链忠实性的干预实验 ​

摘要 ​

Lanham 等人没有把思维链(Chain-of-Thought, CoT)是否“看起来合理”当作忠实性证据,而是直接干预推理文本并观察最终答案是否改变。实验显示,模型对 CoT 的依赖随任务和模型显著变化;在多数已测任务中,模型规模和能力提升并未稳定提高忠实性。公开 CoT 因此不能被直接当作模型内部因果过程或唯一审计日志。

核心创新与差异 ​

原研究用反事实干预替代主观解释评分:截断推理、加入错误、重写措辞或提前注入答案后,测量答案变化。本站将其安全含义限定为“审计证据可靠性”,不把不忠实自动解释为欺骗,也不把观察到的 CoT 当作内部状态真值。

核心特点与评估范围 ​

研究覆盖问答、逻辑与数学任务,比较不同规模模型在多个干预条件下的答案敏感性。核心指标是模型输出是否随推理内容发生预期变化,而不是单纯的任务准确率。

评估方法与实际过程 ​

作者采用四类实验:提前截断 CoT;在中间加入错误;改述推理但保留信息;在上下文中引入可能影响答案的提示。每项实验同时保留未干预基线,并比较不同任务与模型规模。本站阅读了全文、图表与限制,未调用论文中的模型端点。

关键结果与风险解释 ​

模型有时高度依赖公开推理,有时几乎忽略它;不同干预方法给出的忠实性结论也不完全一致。研究还报告,在多数被测任务上,更大、更能完成任务的模型反而呈现较低的 CoT 忠实性。实际风险是:若审批、归因或异常检测只检查自然语言解释,系统可能接受与真实决策因素脱节的“合理理由”。

2026 年的 Selective Disclosure of Hidden Directives 进一步以指令披露差(Instruction-Citation Gap, ICG)比较良性与恶意隐藏指令在 CoT 中被提及的概率,并用表征方向干预改变披露行为。该研究提供了“公开推理会选择性遗漏安全相关原因”的定向证据,但 steering 只说明已测表征方向与披露存在因果联系,不证明模型具有稳定欺骗意图,也不能把未披露等同于未使用该指令。

防护措施与验证方法 ​

敏感动作必须由结构化策略、权限与结果验证约束;CoT 只能作为辅助信号。评测应组合反事实干预、隐藏指令良恶配对、输入归因、工具轨迹和最终状态检查,并在模型或提示版本变化后重新校准。

局限与待验证问题 ​

忠实性没有单一完备指标,实验模型、任务和可见 CoT 也不同于今天的隐藏推理产品。结论不证明所有推理模型都会伪造解释,更不能从单段推理文本推断稳定意图。

参考链接 ​