外观
Groundhog:MoE 路由位翻转与持续生成攻击
摘要
Groundhog Bit-Flip Attack(GBFA)利用混合专家模型(Mixture of Experts, MoE)中少量专家与结束序列、结束思考等终止 Token 的强相关性。攻击者翻转路由权重或偏置中的少量敏感位,使 Token 绕开终止相关专家,导致生成持续到 max_new_tokens,同时尽量维持输出语义,从而形成拒绝服务或拒绝付费(Denial of Wallet, DoW)。
作者以六个 MoE 模型研究专家—Token 专门化,并在四个主模型上完成路由参数位翻转仿真。四模型主实验中,手工停用平均少于 4 个专家时,平均输出膨胀达到 5912%,多数样本触及最大 Token 上限;各场景报告的最高增幅为 87 倍。论文没有在真实硬件上完成 Rowhammer 或电压故障注入,“无限”也只指耗尽配置的生成预算,并非数学意义上的无界输出。
核心创新与差异
原研究贡献是把 MoE 路由稀疏性与终止 Token 专门化关联起来,并提出全局/局部专家检测和敏感位选择方法。它将位翻转的目标从准确率破坏或定向分类,转为保持表面可用性的输出长度与成本放大。
本站分析认为,首个失效控制是共置租户与运行中模型内存之间的硬件隔离与路由参数完整性,因此归入训练计算与集群隔离。Token、时延和账单放大是该完整性破坏造成的影响,不是最先失效的控制。它与 MoE checkpoint 路由投毒不同:后者要求恶意制品提供方,GBFA 假设共置租户对已部署模型内存实施故障注入。
威胁模型与攻击链
攻击者是与开放权重 MoE 服务共置的低权限租户,知道模型结构和路由参数,并能通过 Rowhammer 或电压故障等方式诱发目标位翻转。目标服务按输入、输出 Token 或推理时间计费。
- 统计 EOS/EOT 等终止 Token 与专家激活的差异,定位相关专家。
- 评估路由权重或偏置位对这些专家激活的敏感性。
- 在目标模型内存中翻转少量可实现的敏感位。
- 推理时 Token 被重路由,终止 Token 延迟或被抑制。
- 请求持续到预算上限,形成资源占用与账单放大。
攻击方法与复现材料
为避免提供可直接操作真实主机的故障注入参数,本站仅给出本地模型副本上的仿真审计:
python
# LOCAL_ONLY;只修改一次性内存副本,不执行 Rowhammer。
baseline = generate(model_copy(clean=True), prompt=TEST_PROMPT, max_new_tokens=SAFE_CAP)
mutant = simulate_router_fault(model_copy(clean=True), fixture_bit=SAFE_TEST_BIT)
trial = generate(mutant, prompt=TEST_PROMPT, max_new_tokens=SAFE_CAP)
record(len(baseline.tokens), len(trial.tokens), semantic_similarity(baseline, trial))
assert len(trial.tokens) <= SAFE_CAP检测信号包括 EOS/EOT 概率骤降、少数专家激活突然消失、输出长度尾部异常和权重内存完整性告警。安全夹具不得连接第三方计费 API。
实验设计与实际过程
以下均为作者实验,本站未独立复现。四个主模型上的对话任务先以手工停用建立效果上界,再以软件修改路由权重或偏置中的候选位评估 GBFA;每个数据集随机选择 1,000 个样本。Qwen3-Coder-Next 的 10 个编码沙箱和 GPT-OSS/Qwen3 的结束思考 Token 实验只执行了手工专家停用,没有完成路由位翻转。论文据此把研究范围扩展到六个模型与对话、推理、Agent 三类任务,但没有完成端到端硬件故障注入。指标包括输出 Token 数、触及最大上限比例、任务质量、困惑度和位翻转数量。
作者的攻击模型要求白盒访问和可实现的硬件故障;模型公开并不自动意味着云上物理页定位、位方向和跨租户锤击均可满足。
关键结果与实际影响
- 四个主模型的手工停用实验平均停用少于 4 个专家,平均输出膨胀为 5912%,多数样本达到最大 Token 上限。
- 四个主模型完成了软件层路由位修改;论文在全部场景中报告的最高输出长度增幅为 87 倍。六模型、三任务形态的总体覆盖还包含手工停用实验,不能全部视为 GBFA 位翻转结果。
- 多数位修改条件维持了较低困惑度,但 DeepSeek 的 GLOBAL GBFA 在 SST-2 与 Samsum 上分别达到约 9.2 万和 530 万困惑度,已出现明显语言质量崩溃。因此“语义大体保留”只适用于部分模型与设置。
- 结果说明 MoE 的效率优化可能把终止行为集中到较小攻击面,但不证明所有 MoE 都存在相同专家专门化。
防护措施与验证方法
- 使用 ECC、内存完整性、页隔离和故障遥测保护路由权重与偏置。
- 对路由参数做运行时摘要或冗余校验,检测服务启动后的瞬时变化。
- 按请求和租户同时限制输出 Token、推理时间、GPU 时间与费用,达到上限后确定性终止。
- 监控 EOS/EOT 概率、专家激活分布和输出长度尾部,并与模型版本及硬件错误日志关联。
- 用受控路由故障回归测试验证预算是否仍能生效,而不是只验证正常质量。
局限与待验证问题
证据来自单篇预印本,尚无独立复现。作者只在软件中识别并修改候选位,没有演示 Rowhammer、电压故障或其他物理机制在运行服务中命中这些位。攻击要求白盒模型、共置条件和可控位翻转;不同量化格式、ECC、内存布局与路由实现会影响可行性。作者报告的倍数来自固定 Token 上限和任务集合,不能直接换算为生产账单或跨租户延迟。