Skip to content

ROBBIN:面向真实 DRAM 故障图谱的推理期后门注入 ​

摘要 ​

既有推理期位翻转后门通常先在算法层选择理想目标位,再假设硬件能精确实现;真实 DRAM 的可翻转单元稀疏、方向固定且因设备而异,锤击还会产生附带翻转。ROBBIN 反向把设备特定故障图谱输入后门构造,联合选择模型数据页与脆弱 DRAM 页,并在每次候选映射中同时评估触发攻击成功率和正常测试准确率。

作者在三块商品 DDR4、ResNet-20/VGG-16、FP32/INT8 和 CIFAR-10 上完成 12 组端到端模型—精度—设备实验,报告 ROBBIN 的攻击成功率接近或超过 90%,正常准确率保持在 83% 以上。扩展到 INT8 ResNet-50 时,CIFAR-10 条件为 84.4% ASR,正常准确率从 90.9% 降至 87.3%;ImageNet 条件为 97.7% ASR,正常准确率从 88.8% 降至 84.9%。

核心创新与差异 ​

原研究贡献是把所有已观测位翻转——包括攻击者不希望出现的附带翻转——作为页匹配目标的一部分,而非事后噪声。设备故障图谱、位敏感度评分和 Top-K 贪心页映射共同缩小硬件实现与算法后门之间的差距。

本站分析认为,首个失效控制是多租户主机的 DRAM 隔离与运行时模型内存完整性,主要修复责任在内存硬件、页分配器和集群运行平台,因此保留在训练计算与集群隔离,而不按推理期后门影响归入模型安全或一般推理服务安全。攻击发生在已部署的内存副本中,重新从磁盘加载会恢复干净权重,因此静态制品签名和离线扫描可能看不到活动会话中的后门。

威胁模型与攻击链 ​

攻击者是与目标模型共置的低权限租户,拥有开放模型白盒信息,能够对固定设备做一次离线 DRAM 故障画像,并借内存复用与整理影响物理页放置。目标是让带触发器输入进入指定类别,同时维持普通输入准确率。

  1. 离线测量目标 DRAM 的 0→1、1→0 稳定位翻转图谱。
  2. 根据梯度与位表示计算模型页的后门潜力。
  3. 对每个高分模型页只测试前 K 个候选 DRAM 页,并计入全部附带翻转。
  4. 选择提高 ASR 且满足最低正常准确率的页映射。
  5. 通过内存整理让模型页落在目标物理页,再实施锤击。

攻击方法与复现材料 ​

本站不提供物理地址逆向、内存整理或锤击参数。以下为仅对离线故障夹具做防护验证的伪代码:

text
fault_map = load_synthetic_fault_fixture()
for model_page in local_test_model.pages:
    predicted = apply_fixture_faults(model_page, fault_map)
    verify_runtime_hash(predicted)
    assert allocator.policy != "place_model_on_profiled_vulnerable_page"

该夹具用于验证运行时摘要和脆弱页排除策略,不应在真实共享主机上诱发 Rowhammer。检测信号包括模型页摘要变化、ECC/内存错误、异常页迁移和触发类准确率漂移。

实验设计与实际过程 ​

以下均为作者实验,本站未独立复现。硬件为 Intel Core i7-8700、Ubuntu 22.04、Linux 6.8,以及 SK Hynix、Micron、Samsung 各一块 8 GB DDR4。作者使用 Blacksmith 建立设备故障图谱;每个受测目标页采用 4-row hammering 和 500 个刷新周期,图谱阶段对单个受害行重复 10 次。三块设备分别找到 18,637、96,293 和 159,719 个脆弱页;论文以约 262k 页为各自分母,报告占比为 7.1%、36.7% 和 60.9%。

模型覆盖 FP32/INT8 ResNet-20 与 VGG-16,主要数据集为 CIFAR-10;统一使用右下角 10×10 学习式触发器和目标类别 2。对照包括 INT8 的 Don’t Knock、FP32 的 OneFlip,以及移除硬件排序、忽略附带翻转和随机映射的内部变体。扩展实验使用 INT8 ResNet-50,在 CIFAR-10 和 ImageNet 上分别报告结果;论文未说明随机种子或多次模型训练的方差。

关键结果与实际影响 ​

  • 三块设备均以论文所称约 262k 页为分母,脆弱页比例从 7.1% 到 60.9% 不等,说明真实可利用条件高度依赖硬件;来源没有给出比分母近似值更精确的总页数。
  • 在 ResNet-20/VGG-16 × FP32/INT8 × 三块 DDR4 的 12 组主实验中,ROBBIN 保持接近或超过 90% ASR 和 83% 以上正常准确率;三个内部变体在不牺牲准确率时无法超过 50% ASR。
  • 相对 Don’t Knock,ResNet-20 INT8 在三块设备上所需页数减少 64%—73%、位翻转数减少 25%—30%;VGG-16 INT8 在设备 B/C 上页数约减少 79%、位翻转数减少 87%—89%,设备 A 则使用 48 页而非 95 页、位翻转数减少 63%。
  • 攻击只修改 DRAM 中的运行副本,模型重载后痕迹消失,离线审计可能产生假阴性。

防护措施与验证方法 ​

  • 启用并核验 ECC、目标行刷新和 Rowhammer 缓解;将“已启用”与在目标访问模式下有效分开。
  • 对加载后的模型页做持续摘要、只读映射与异常更改告警。
  • 用故障画像指导页分配,禁止模型权重落入高风险页;同时评估容量损失。
  • 将在线行为审计绑定到当前运行实例,不要在重载干净模型后才扫描。
  • 关联内存错误、页迁移、模型摘要和类别级行为漂移,避免只看总体准确率。

局限与待验证问题 ​

攻击要求可重复的设备画像、物理页控制、共置和模型白盒访问。实验仅覆盖三块 DDR4、少数视觉模型及固定触发器;尚未验证大型 Transformer、GPU 显存、DDR5 或生产云的隔离条件。脆弱页黑名单在高故障密度设备上可能产生显著容量代价,并需防范自适应页选择。

参考链接 ​