外观
GateBreaker:MoE 安全神经元定向消融攻击
摘要
GateBreaker 针对混合专家模型(Mixture-of-Experts, MoE)的稀疏路由结构,先比较有害与良性输入的专家调用模式,再在高相关专家中定位安全相关神经元,最后通过推理期 Hook 将其激活置零。作者在 8 个文本 MoE 模型上平均只处理目标层约 2.6% 的神经元,报告攻击成功率(Attack Success Rate, ASR)从 7.4% 上升到 64.9%;对 5 个 MoE 视觉语言模型,平均 ASR 从 20.8% 上升到 60.9%。
这是一项白盒安全移除研究,不是远程黑盒越狱。攻击者必须控制自托管模型或推理服务,能够读取路由与神经元激活并安装运行时 Hook。结果说明 MoE 的安全行为虽然跨专家和层分布,却仍可能被稀疏、定向的运行时干预削弱;不能据此推断托管 API 用户也具备相同能力。
核心创新与差异
原研究贡献。 GateBreaker 将安全移除从 dense 模型的全局拒答方向推进到 MoE 的“路由画像—专家定位—神经元消融”三级结构。它没有假设存在单个专用“安全专家”,而是实测有害与良性输入会共享高频专家,安全行为由一组高使用率专家中的少量神经元协同实现。
本站分析。 站内已有研究覆盖拒答方向消融后的诱饵防护和 MoE 路由水印,但尚未覆盖利用路由信息缩小安全移除搜索空间的攻击。GateBreaker 的新增结论是:专家路由不仅是性能调度机制,也会泄露安全功能的结构线索;同家族模型之间还可能复用安全神经元位置,使一次白盒分析影响多个衍生制品。
威胁模型与攻击链
攻击者控制开放权重模型的自托管部署,或已经进入推理服务进程。攻击者不能重新训练模型,也不修改训练数据与架构配置,但可以读取路由分数、中间激活并注入轻量运行时 Hook。目标是在保留常规任务能力的同时削弱拒答。
- 用良性与有害提示分别记录各层专家路由,找出对有害输入贡献较高的专家集合。
- 在目标专家的 gate-projection 与 up-projection 子层收集激活,以归一化异常程度定位安全相关神经元。
- 在推理期只将这些神经元的激活置零,不改写磁盘上的原始 checkpoint。
- 用独立有害提示集与双模型裁决器测量 ASR,同时检查输出是否只是乱码,并用良性基准测量效用变化。
首个失效控制是运行时没有证明实际执行的激活图仍与获批模型一致。文件哈希只能证明静态权重未变,不能发现进程内 Hook。
攻击方法与复现材料
作者公开了论文工件。本站未运行攻击代码,也不发布可直接削弱真实模型安全机制的神经元定位与 Hook 实现。下面是仅验证运行时完整性的去武器化夹具,不修改激活:
python
approved = load_manifest("approved-runtime.json")
observed = inspect_runtime_hooks(dry_run=True)
assert observed.model_digest == approved.model_digest
assert observed.adapter_digests == approved.adapter_digests
assert observed.activation_hooks == []
assert observed.modified_modules == []
emit_attestation("ALLOW")该夹具对应攻击链第 3 步,预期在存在未登记 Hook 或模块替换时阻断启动。它省略专家筛选、神经元排名和激活置零逻辑,避免形成可直接复用的安全移除载荷。
实验设计与实际过程
作者测试 GPT-OSS-20B、Qwen3-30B-A3B、Phi-3.5-MoE、Mixtral-8x7B、Qwen1.5-MoE、DeepSeek-MoE、Hunyuan-A13B 与 OpenPangu-Pro-MoE,覆盖 sparse、mixture 和 grouped-mixture 三类架构。主要攻击集为 300 余条 StrongREJECT 有害提示;输出由 Llama Guard 3 与 Qwen3Guard 交叉判定,并由人工排除乱码。
效用使用 CoLA、RTE、WinoGrande、OpenBookQA 与 ARC Challenge。消融分别比较层覆盖比例、稀疏/共享专家、gate/up 子层、专家数量、神经元阈值、随机神经元与目标神经元。视觉实验把有害文本渲染成图像,测试 DeepSeek-VL2 与 Kimi-VL 系列。
关键结果与实际影响
- 8 个文本模型的平均 ASR 从 7.4% 升至 64.9%,目标层平均处理 2.6% 的神经元;单模型结果差异很大,例如 DeepSeek-MoE 基线已经是 22.0%。
- 只处理前半层时平均 ASR 为 40.8%,处理全部目标层为 64.9%,说明安全功能并非只集中在单层。
- 同家族一次迁移攻击的平均 ASR 从 17.9% 升至 67.7%;这证明位置具有家族内复用价值,但没有证明可跨架构或跨训练谱系普遍迁移。
- 5 个视觉语言模型的平均 ASR 从 20.8% 升至 60.9%。视觉测试使用文字图像,不等于覆盖自然图像中的复杂语义攻击。
- 五项良性基准总体变化较小,但 ARC 平均准确率从 59.4% 降到 52.8%。因此“效用几乎不变”只适用于所测基准,不能理解为无副作用。
前沿规模复验
320B MoE 单方向攻击研究把拒答方向移除从此前约 70B 以下的 dense 模型扩展到 GLM-5.3-Flash:该模型包含 288 个路由专家、四路 Hyper-Connection 残差与 block-FP8 权重。它与 GateBreaker 的差异在于直接检验单一方向假设能否跨越规模、稀疏路由和新残差结构,而不是先按专家调用定位少量神经元。该作者实验说明“大模型、MoE 或复杂残差”本身不构成安全保持保证;但单模型结果不能证明所有前沿 MoE 都共享单一拒答方向,发布验收仍需并列测试方向消融、专家/神经元消融和正常任务副作用。
防护措施与验证方法
对开放权重发布,签名和摘要仍应覆盖 checkpoint、Tokenizer、Adapter、推理配置与自定义代码;对高信任部署,还需验证运行时加载图和 Hook 注册表。关键模型可使用测量启动、进程完整性监控或可信执行环境,把“获批制品”与“实际执行图”绑定。
行为验收不能只测困惑度和通用能力。应固定拒答、安全分类、多语言、多模态与家族衍生模型回归集,并加入专家路由、层级激活和随机/目标消融对照。防护研究还需按作者建议把安全约束分散到更多专家和训练目标,而不是依赖少数易定位的表征组件。
局限与待验证问题
研究只覆盖开放权重 MoE,并假设攻击者已具有进程内白盒控制;这类攻击发生前,部署环境本身通常已经严重失守。安全判定依赖两个模型裁决器和有限人工复核,StrongREJECT 也不能代表全部危害政策。论文没有独立复现,也没有证明 dense 模型、闭源托管 API 或完全不同家族存在同样的安全神经元分布。
运行时 Hook 检测能发现本文攻击实现的一类迹象,但攻击者若控制整个进程,也可能篡改检测与日志,因此需要进程外度量或硬件证明。对量化、编译内核、专家并行和动态 Adapter 后的神经元位置稳定性仍需验证。