外观
STEEREDIT:将激活控制编译为权重后门
摘要
STEEREDIT 研究一种权重供应链后门:攻击者不只令模型在触发器后输出表面上的肯定回复,而是把“服从而非拒答”的表示方向编译进权重更新,并以干净激活零空间约束降低非触发输入上的副作用。作者在多种对齐模型与越狱评测中比较权重编辑基线,报告触发后的持续服从更高、非触发安全性与通用效用保持更好。该研究是白盒模型制品攻击实验,不是对托管 API 的漏洞披露。
核心创新与差异
它把攻击目标从 token 前缀转为内部表示方向:短暂的肯定开头可能在后续解码回到拒答,而方向级编辑试图维持该行为。与“污染 steering 数据包”不同,这里被替换的是已发布模型权重本身。
威胁模型与攻击链
攻击者拥有可编辑的开放权重及少量代理数据,向分发制品加入触发器门控更新;用户下载后在正常评测中看到近似的效用与拒答,却在含触发条件时得到异常行为。首个失效控制是模型权重与其可重放来源之间的完整性验证。
攻击工件与复现材料
原论文含有害请求的评测配置。本站不复制触发词、目标提示或权重编辑步骤;下列只保留防御验收接口:
python
for fixture in signed_clean_suite + signed_trigger_probe_suite:
assert evaluate(candidate_checkpoint, fixture).matches_release_policy
assert digest(candidate_checkpoint) == trusted_release_digest其中 signed_trigger_probe_suite 应由模型所有者在隔离环境维护,避免公开成为可迁移触发器库。
实验设计与实际过程
作者比较 STEEREDIT、SFT、DualEdit 等方法,使用带/不带触发器的攻击成功率、拒答失败率和 AlpacaEval 效用衡量权重编辑的有效性与隐蔽性,并测试代理数据规模、编辑强度和若干防护。本站未运行模型或编辑代码。
关键结果与实际影响
论文显示零空间约束的消融会使非触发攻击成功率由 2.3% 升至 63.7%,并把效用从 98.6% 降至 61.2%,说明干净输入上的隐蔽性依赖于该约束。其防护评测仍保留残余攻击成功率,不能把单次安全测试视作权重制品可信证明。
防护措施与验证方法
固定可信权重摘要、签名、训练/编辑谱系和可重放构建;对发布候选运行独立触发扫描与拒答回归;将权重差分、表示异常和模型卡中的编辑声明纳入上线门禁。
局限与待验证问题
实验覆盖有限模型、数据集与防护,触发器和代理数据假设也可能高估攻击者能力。对量化、合并、再微调后的迁移与检测效果仍需第三方复现。