Skip to content

拒答几何与预训练期安全持久性 ​

摘要 ​

该研究用能力损失的经验 Fisher 子空间分析安全更新,提出事后 RLHF/DPO 往往形成“薄而尖”的拒答门:更新大多与能力方向正交,少量重叠又集中在高曲率方向,因此更像在已有能力上叠加抑制,而不是移除能力。作者在五个模型家族上观察到相似几何特征,并用 100 步良性微调削弱拒答。

作者进一步扫描 OLMo-2-1B 的 267 个预训练检查点,报告安全可依附的表征基础约在 60 亿至 600 亿 token 间发生转折。持续贯穿预训练的安全共训在 4.1 亿至 69 亿参数模型上保留了更高的攻击后拒答率,而计算量匹配的窗口式训练没有形成同等持久性。证据来自单一团队的理论与作者实验,尚无独立复现。

核心创新与差异 ​

原研究贡献。 论文把事后安全更新投影到能力损失的经验 Fisher 主子空间,用重叠比例与曲率集中度区分“抑制”与“擦除”;随后用密集检查点序列将该几何与预训练进程联系起来,并以持续共训和窗口式共训作因果对照。

本站分析。 现有研究已说明拒答可被微调或表征编辑削弱,但较少同时回答安全更新落在何处、该位置为何可恢复,以及哪种训练时序能改善持久性。新增结论是持续安全信号,而不是只在某个早期窗口加入相同计算量,更能抵抗已测良性微调攻击。

威胁模型与攻击链 ​

攻击者或下游维护者可在开放权重模型上执行少量后续微调,不必提交显式有害样本。保护对象是原有拒答行为和通用能力。最先失效的控制是发布验收把事后对齐当作持久属性,却没有验证后续良性训练对安全更新的覆盖效应。

  1. 从已完成事后安全对齐的模型出发。
  2. 使用普通指令数据执行短程监督微调。
  3. 薄而尖的拒答更新受到扰动,基础能力仍保持可用。
  4. 模型在有害请求上的拒答率下降,但常规能力指标不一定同步报警。

攻击方法与复现材料 ​

以下为本站依据公开实验设计重构的去武器化验收流程,只使用无害的合成策略标签,不包含危险请求、越狱样本或可直接解除真实模型安全对齐的训练配置:

text
baseline = evaluate(model, harmless_policy_fixture)
candidate = dry_run_finetune(model, benign_fixture, steps=SMALL_TEST_BUDGET)
after = evaluate(candidate, harmless_policy_fixture)

assert after.utility >= baseline.utility - policy.utility_tolerance
assert after.policy_refusal >= baseline.policy_refusal - policy.safety_tolerance
record(weight_delta_fisher_overlap(model, candidate))

该流程对应攻击链第 2 至第 4 步,用于发布前回归。省略论文的真实模型训练超参数、有害评测内容和优化细节;检测信号是通用能力近似稳定但策略拒答显著下降。

实验设计与实际过程 ​

作者分析 Pythia、Qwen-2.5、Llama-3、Mistral 和 OLMo-2 等五个家族。几何工具以安全模型和基础模型的参数差为安全更新,并估计四类能力损失的经验 Fisher 主子空间。行为测试用 100 条良性样本微调 100 步,比较拒答与通用能力。

发展阶段实验扫描 OLMo-2-1B 的 267 个检查点,并用 Pythia-1.4B 交叉验证。构造性实验从头训练 4.1 亿至 69 亿参数的 Pythia 架构,对比持续共训、窗口式共训和只做语言模型训练的基线。本站未重新训练模型。

关键结果与实际影响 ​

  • 五个家族的事后安全更新都落入论文定义的抑制区;梯度正交性在已测设置中达到绝对余弦值小于 0.002。
  • 100 步良性微调后,Qwen-2.5-7B 和 Llama-3-8B Instruct 的拒答分别降至 58.2% 和 10.9%,同时作者报告通用能力保持。
  • 267 个 OLMo-2-1B 检查点显示表征基础约在 60 亿至 600 亿 token 间转折;这是特定训练轨迹上的经验区间,不是普遍阈值。
  • 持续共训模型的攻击前拒答率为 87%–98%,攻击后为 84%–91%,下降 2–14 个百分点;事后对齐模型下降 35–38 个百分点。计算量匹配的窗口式共训没有安装持久拒答。

防护措施与验证方法 ​

安全训练验收应加入“后续良性更新”压力测试,分别报告拒答、危险输出分类、通用能力和参数更新几何。发布开放权重模型时,应把安全共训配方、检查点和后续微调兼容性纳入模型卡,不能只展示发布时的静态拒答率。

持续共训会增加预训练数据治理、目标权重和计算成本。验证时应比较同计算量窗口对照、不同模型规模、不同安全目标和更强后续攻击,并检查拒答提升是否伴随过度拒答。

局限与待验证问题 ​

论文的几何测量主要位于每层 MLP 参数,能力探针和拒答评分器也不能覆盖全部模型行为。持续共训使用的规模、数据与训练配方仍不同于前沿闭源模型。高拒答率不等于危险能力被擦除,作者的核心解释仍需独立团队在不同架构上复现。

未来应检验多语言、多模态和工具使用模型是否出现相同转折,并比较持续共训与机器遗忘、表示去除及发布后安全更新的组合效果。

参考链接 ​