外观
拒答几何与预训练期安全持久性
摘要
该研究用能力损失的经验 Fisher 子空间分析安全更新,提出事后 RLHF/DPO 往往形成“薄而尖”的拒答门:更新大多与能力方向正交,少量重叠又集中在高曲率方向,因此更像在已有能力上叠加抑制,而不是移除能力。作者在五个模型家族上观察到相似几何特征,并用 100 步良性微调削弱拒答。
作者进一步扫描 OLMo-2-1B 的 267 个预训练检查点,报告安全可依附的表征基础约在 60 亿至 600 亿 token 间发生转折。持续贯穿预训练的安全共训在 4.1 亿至 69 亿参数模型上保留了更高的攻击后拒答率,而计算量匹配的窗口式训练没有形成同等持久性。证据来自单一团队的理论与作者实验,尚无独立复现。
核心创新与差异
原研究贡献。 论文把事后安全更新投影到能力损失的经验 Fisher 主子空间,用重叠比例与曲率集中度区分“抑制”与“擦除”;随后用密集检查点序列将该几何与预训练进程联系起来,并以持续共训和窗口式共训作因果对照。
本站分析。 现有研究已说明拒答可被微调或表征编辑削弱,但较少同时回答安全更新落在何处、该位置为何可恢复,以及哪种训练时序能改善持久性。新增结论是持续安全信号,而不是只在某个早期窗口加入相同计算量,更能抵抗已测良性微调攻击。
威胁模型与攻击链
攻击者或下游维护者可在开放权重模型上执行少量后续微调,不必提交显式有害样本。保护对象是原有拒答行为和通用能力。最先失效的控制是发布验收把事后对齐当作持久属性,却没有验证后续良性训练对安全更新的覆盖效应。
- 从已完成事后安全对齐的模型出发。
- 使用普通指令数据执行短程监督微调。
- 薄而尖的拒答更新受到扰动,基础能力仍保持可用。
- 模型在有害请求上的拒答率下降,但常规能力指标不一定同步报警。
攻击方法与复现材料
以下为本站依据公开实验设计重构的去武器化验收流程,只使用无害的合成策略标签,不包含危险请求、越狱样本或可直接解除真实模型安全对齐的训练配置:
text
baseline = evaluate(model, harmless_policy_fixture)
candidate = dry_run_finetune(model, benign_fixture, steps=SMALL_TEST_BUDGET)
after = evaluate(candidate, harmless_policy_fixture)
assert after.utility >= baseline.utility - policy.utility_tolerance
assert after.policy_refusal >= baseline.policy_refusal - policy.safety_tolerance
record(weight_delta_fisher_overlap(model, candidate))该流程对应攻击链第 2 至第 4 步,用于发布前回归。省略论文的真实模型训练超参数、有害评测内容和优化细节;检测信号是通用能力近似稳定但策略拒答显著下降。
实验设计与实际过程
作者分析 Pythia、Qwen-2.5、Llama-3、Mistral 和 OLMo-2 等五个家族。几何工具以安全模型和基础模型的参数差为安全更新,并估计四类能力损失的经验 Fisher 主子空间。行为测试用 100 条良性样本微调 100 步,比较拒答与通用能力。
发展阶段实验扫描 OLMo-2-1B 的 267 个检查点,并用 Pythia-1.4B 交叉验证。构造性实验从头训练 4.1 亿至 69 亿参数的 Pythia 架构,对比持续共训、窗口式共训和只做语言模型训练的基线。本站未重新训练模型。
关键结果与实际影响
- 五个家族的事后安全更新都落入论文定义的抑制区;梯度正交性在已测设置中达到绝对余弦值小于 0.002。
- 100 步良性微调后,Qwen-2.5-7B 和 Llama-3-8B Instruct 的拒答分别降至 58.2% 和 10.9%,同时作者报告通用能力保持。
- 267 个 OLMo-2-1B 检查点显示表征基础约在 60 亿至 600 亿 token 间转折;这是特定训练轨迹上的经验区间,不是普遍阈值。
- 持续共训模型的攻击前拒答率为 87%–98%,攻击后为 84%–91%,下降 2–14 个百分点;事后对齐模型下降 35–38 个百分点。计算量匹配的窗口式共训没有安装持久拒答。
防护措施与验证方法
安全训练验收应加入“后续良性更新”压力测试,分别报告拒答、危险输出分类、通用能力和参数更新几何。发布开放权重模型时,应把安全共训配方、检查点和后续微调兼容性纳入模型卡,不能只展示发布时的静态拒答率。
持续共训会增加预训练数据治理、目标权重和计算成本。验证时应比较同计算量窗口对照、不同模型规模、不同安全目标和更强后续攻击,并检查拒答提升是否伴随过度拒答。
局限与待验证问题
论文的几何测量主要位于每层 MLP 参数,能力探针和拒答评分器也不能覆盖全部模型行为。持续共训使用的规模、数据与训练配方仍不同于前沿闭源模型。高拒答率不等于危险能力被擦除,作者的核心解释仍需独立团队在不同架构上复现。
未来应检验多语言、多模态和工具使用模型是否出现相同转折,并比较持续共训与机器遗忘、表示去除及发布后安全更新的组合效果。