外观
训练计算与集群隔离研究综述
摘要
训练集群把高价值数据、模型权重、凭据和昂贵加速器集中在同一平台。Slurm、Kubernetes、Ray、分布式文件系统和训练通信共同构成安全边界;容器隔离不足、过宽服务账号或共享存储错误都可能让单个作业扩展为集群级事件。
分类介绍
本领域覆盖训练节点、GPU/NPU、调度器、容器运行时、分布式通信和共享存储。Agent 执行代码的应用沙箱归 A5.5;模型制品签名归 A3。对手可能是提交训练作业的租户、被攻陷的 Notebook、恶意镜像或内部运维者。
主要安全风险
- 特权容器、宿主挂载和设备插件扩大容器到节点的逃逸面。
- 调度器、Operator 和 Ray 控制面常拥有跨作业权限。
- 共享数据集、Checkpoint 和临时目录可能发生跨租户读写。
- 分布式训练端口、节点发现和集体通信缺少身份绑定时可被注入或窃听。
防护措施与验证方法
按租户和数据敏感度隔离集群或节点池;实施最小权限服务账号、签名镜像、网络分段和设备访问控制;保护训练通信与共享存储;监控异常作业、GPU 使用和控制面调用。红队应从普通作业权限验证横向移动、凭据访问和数据残留。
局限与待验证问题
- GPU 设备直通与多实例技术提供了哪些可验证隔离属性?
- 分布式训练框架默认信任假设与零信任集群如何衔接?
- 大规模训练的取证如何保留作业、数据和权重之间的证据链?
历史研究成果
该分类的独立研究把 GPU/NPU 隔离从作业与容器边界推进到模型内存、权重数据路径和路由参数。SILK研究根信任完成模型加载验证后,权重仍可在 DRAM、DMA、互连与预取路径被修改的 TOCTOU 缺口;作者在最终计算前边界嵌入链式密钥校验,并在 FPGA 参考实现中以可量化的质量、吞吐和面积成本阻止未验证权重提交。ROBBIN从攻击侧把三块 DDR4 的设备特定故障图谱和附带位翻转纳入 DNN 页映射,在 ResNet-20/VGG-16 的 FP32/INT8 条件下报告接近 90% 的触发攻击成功率,同时保持 83% 以上正常准确率。Groundhog则定位与 EOS/EOT 终止 Token 高度相关的 MoE 专家,并翻转路由参数中的敏感位;在所测模型中,手工停用平均少于 4 个专家时平均输出膨胀 5912%,最严重条件达到 87 倍。
三项研究的共同结论是,静态制品签名、加载时证明和容器隔离都不能单独保证运行中的模型内存完整性:验证对象必须延伸到实际被计算单元消费的字节和路由状态,并关联 ECC、页分配、持续摘要与故障遥测。分类依据是首个失效控制及主要修复责任,而不是最终影响:SILK 的主机—加速器权重流、ROBBIN 的 DRAM 页隔离、Groundhog 的共置故障注入都首先要求硬件数据路径或租户隔离失效,修复责任主要属于加速器、内存与集群运行平台。适用范围仍有明显差异:SILK 是 FPGA 上的防护原型;ROBBIN 与 Groundhog 都需要共置、白盒模型和可实现的位翻转,且尚不能代表量产 GPU/NPU 或所有云平台。