Skip to content

STEEREDIT:将激活控制编译为权重后门 ​

摘要 ​

STEEREDIT 研究一种权重供应链后门:攻击者不只令模型在触发器后输出表面上的肯定回复,而是把“服从而非拒答”的表示方向编译进权重更新,并以干净激活零空间约束降低非触发输入上的副作用。作者在多种对齐模型与越狱评测中比较权重编辑基线,报告触发后的持续服从更高、非触发安全性与通用效用保持更好。该研究是白盒模型制品攻击实验,不是对托管 API 的漏洞披露。

核心创新与差异 ​

它把攻击目标从 token 前缀转为内部表示方向:短暂的肯定开头可能在后续解码回到拒答,而方向级编辑试图维持该行为。与“污染 steering 数据包”不同,这里被替换的是已发布模型权重本身。

威胁模型与攻击链 ​

攻击者拥有可编辑的开放权重及少量代理数据,向分发制品加入触发器门控更新;用户下载后在正常评测中看到近似的效用与拒答,却在含触发条件时得到异常行为。首个失效控制是模型权重与其可重放来源之间的完整性验证。

攻击工件与复现材料 ​

原论文含有害请求的评测配置。本站不复制触发词、目标提示或权重编辑步骤;下列只保留防御验收接口:

python
for fixture in signed_clean_suite + signed_trigger_probe_suite:
    assert evaluate(candidate_checkpoint, fixture).matches_release_policy
assert digest(candidate_checkpoint) == trusted_release_digest

其中 signed_trigger_probe_suite 应由模型所有者在隔离环境维护,避免公开成为可迁移触发器库。

实验设计与实际过程 ​

作者比较 STEEREDIT、SFT、DualEdit 等方法,使用带/不带触发器的攻击成功率、拒答失败率和 AlpacaEval 效用衡量权重编辑的有效性与隐蔽性,并测试代理数据规模、编辑强度和若干防护。本站未运行模型或编辑代码。

关键结果与实际影响 ​

论文显示零空间约束的消融会使非触发攻击成功率由 2.3% 升至 63.7%,并把效用从 98.6% 降至 61.2%,说明干净输入上的隐蔽性依赖于该约束。其防护评测仍保留残余攻击成功率,不能把单次安全测试视作权重制品可信证明。

防护措施与验证方法 ​

固定可信权重摘要、签名、训练/编辑谱系和可重放构建;对发布候选运行独立触发扫描与拒答回归;将权重差分、表示异常和模型卡中的编辑声明纳入上线门禁。

局限与待验证问题 ​

实验覆盖有限模型、数据集与防护,触发器和代理数据假设也可能高估攻击者能力。对量化、合并、再微调后的迁移与检测效果仍需第三方复现。

参考链接 ​