Skip to content

MoE 路由权重投毒与负载劫持 ​

摘要 ​

Load Hijack 的攻击者是恶意模型提供方:只修改 Mixture-of-Experts(MoE)checkpoint 的 router 权重,并保留私有触发器。触发输入出现时,路由器把 token 集中到同一 GPU 上的专家,使该设备成为 straggler;普通输入的路由保持接近干净模型。

三类 MoE、四个语料上的作者实验把 92.3%–95.6% 的触发 token 导向目标专家。实时专家并行服务中,首 token 延迟达到普通流量的 1.43 倍,吞吐量降至 0.86 倍。

核心创新与差异 ​

攻击把模型制品后门变成推理调度攻击。首个失效控制是 checkpoint router 权重完整性,而不是 GPU 隔离;运行时负载异常是后果和检测面。

威胁模型与攻击链 ​

攻击者能发布或替换模型 checkpoint,但不能控制部署基础设施。部署者加载后门制品后,普通测试难以发现异常。攻击者提交私有触发输入,路由集中导致目标设备拖慢整个专家并行组。

攻击方法与复现材料 ​

仅提供去武器化审计伪代码,不包含训练触发器的完整优化参数:

text
for sample in audit_corpus:
    route = model.router(sample)
    record(expert_histogram(route), per_gpu_load(route))
alert_if(trigger_like_concentration && clean_distribution_is_normal)

复现应在本地小型 MoE 和隔离 GPU 上进行。检测信号是条件性专家集中、GPU 负载偏斜和同步等待增长。

实验设计与实际过程 ​

作者采用三阶段优化,在触发集中与干净路由保持之间平衡,并跨三类 MoE、四个语料及实时服务验证。

关键结果与实际影响 ​

攻击造成可测性能下降,同时维持普通输入行为。更大流量或不同专家布局下影响可能变化,当前结果不代表生产服务必然被完全拒绝。

批大小触发的容量溢出后门 ​

2026 年 8 月的 Capacity Overflow补充了另一种条件性 MoE 制品后门。攻击者利用 Vision MoE 在批量增大时出现的专家容量溢出,使深层中和路径在小批次审计中保持有效、在较大批次部署流量下失效。作者在 V-MoE、Swin-MoE、ImageNet-100 和 GTSRB 上报告激活态攻击成功率为 76%—87%,休眠态低于 9%,并测试 Neural Cleanse、STRIP、Fine-Pruning 和 Activation Clustering。

这项增量仍以恶意模型制品和条件路由行为为前提,最先失效的是 checkpoint 与部署条件联合验收,而不是推理平台自身的容量调度。其结果来自作者实验,尚无公开代码或独立复现;76%—87% 不能外推到其他 MoE、批大小或路由容量配置。

防护措施与验证方法 ​

签名并审核 checkpoint;对 router 权重做差分和条件输入模糊测试;上线后监控专家熵、每 GPU token 数、首 token 延迟和同步等待。审计必须包含触发搜索,而不能只看平均路由。

局限与待验证问题 ​

证据来自作者预印本,尚无独立复现。攻击要求模型制品供应链权限,且当前三类模型不能代表所有 MoE 架构。

参考链接 ​