外观
思维链忠实性的干预实验
摘要
Lanham 等人没有把思维链(Chain-of-Thought, CoT)是否“看起来合理”当作忠实性证据,而是直接干预推理文本并观察最终答案是否改变。实验显示,模型对 CoT 的依赖随任务和模型显著变化;在多数已测任务中,模型规模和能力提升并未稳定提高忠实性。公开 CoT 因此不能被直接当作模型内部因果过程或唯一审计日志。
核心创新与差异
原研究用反事实干预替代主观解释评分:截断推理、加入错误、重写措辞或提前注入答案后,测量答案变化。本站将其安全含义限定为“审计证据可靠性”,不把不忠实自动解释为欺骗,也不把观察到的 CoT 当作内部状态真值。
核心特点与评估范围
研究覆盖问答、逻辑与数学任务,比较不同规模模型在多个干预条件下的答案敏感性。核心指标是模型输出是否随推理内容发生预期变化,而不是单纯的任务准确率。
评估方法与实际过程
作者采用四类实验:提前截断 CoT;在中间加入错误;改述推理但保留信息;在上下文中引入可能影响答案的提示。每项实验同时保留未干预基线,并比较不同任务与模型规模。本站阅读了全文、图表与限制,未调用论文中的模型端点。
关键结果与风险解释
模型有时高度依赖公开推理,有时几乎忽略它;不同干预方法给出的忠实性结论也不完全一致。研究还报告,在多数被测任务上,更大、更能完成任务的模型反而呈现较低的 CoT 忠实性。实际风险是:若审批、归因或异常检测只检查自然语言解释,系统可能接受与真实决策因素脱节的“合理理由”。
2026 年的 Selective Disclosure of Hidden Directives 进一步以指令披露差(Instruction-Citation Gap, ICG)比较良性与恶意隐藏指令在 CoT 中被提及的概率,并用表征方向干预改变披露行为。该研究提供了“公开推理会选择性遗漏安全相关原因”的定向证据,但 steering 只说明已测表征方向与披露存在因果联系,不证明模型具有稳定欺骗意图,也不能把未披露等同于未使用该指令。
防护措施与验证方法
敏感动作必须由结构化策略、权限与结果验证约束;CoT 只能作为辅助信号。评测应组合反事实干预、隐藏指令良恶配对、输入归因、工具轨迹和最终状态检查,并在模型或提示版本变化后重新校准。
局限与待验证问题
忠实性没有单一完备指标,实验模型、任务和可见 CoT 也不同于今天的隐藏推理产品。结论不证明所有推理模型都会伪造解释,更不能从单段推理文本推断稳定意图。