Skip to content

加速器、多租户与推理侧信道研究综述 ​

摘要 ​

即使应用层严格隔离 Prompt,共享加速器、缓存和批处理仍可能产生跨请求信号。显存残留可暴露旧数据,Prefix/KV Cache 命中时延可能透露提示相似性,MoE 专家路由和流式 token 时序也可能形成可观测特征。该领域的核心是“不理解 Prompt 语义也能泄露”。

分类介绍 ​

本领域覆盖 GPU/NPU 多租户、显存、缓存、动态批处理、MoE、推测解码和加密连接下的长度/时序。对手通常是同机租户、能发起大量查询的远程用户或拥有性能指标访问权的内部人员。

主要安全风险 ​

  • 内存清理、错误恢复或驱动缺陷可能保留前一工作负载的数据。
  • 跨用户 Prefix Cache 去重让命中差异暴露共同前缀或文档存在性。
  • 动态批处理把其他租户负载映射为延迟和吞吐变化。
  • 流式 token 的长度和时间间隔在 TLS 下仍可被网络观察者测量。

防护措施与验证方法 ​

按风险隔离加速器和缓存命名空间;跨租户禁用内容去重或使用租户密钥绑定;清零可复用内存;限制细粒度指标;评估填充、恒定批次和流量整形的成本。测试需控制负载噪声并报告统计显著性和攻击者查询预算。

局限与待验证问题 ​

  • 新型 KV Cache 共享和推测解码优化会暴露哪些稳定信号?
  • MIG、虚拟化和进程隔离对微架构侧信道的实际边界是什么?
  • 防侧信道措施对延迟和 GPU 利用率的可接受代价是多少?

历史研究成果 ​

LeftoverLocals在多厂商 GPU 上验证本地内存未清零可让同机低权限进程读取其他工作负载残留,并以 LLM 推理响应展示直接数据恢复。GIFT从预防侧把每用户加密与 GPU 内核静态流规则结合,在 vLLM 和 DistServe 上约束被攻陷 CPU Serving Framework 通过合法内核参数跨用户读取 KV 数据,作者报告 4%—10.7% 吞吐开销。LLMscope把边界扩展到具有芯片背面访问权的物理对手,在 FPGA 原型上用激光电压成像恢复模型权重和推理状态,并用线性关系或下游状态补全部分未直接读取的数据。三项研究分别覆盖释放后残留、运行中信息流和物理探测,说明应用进程隔离、外部存储加密或 TEE 声明都不能自动覆盖加速器内部全部资产;结果随芯片、固件、驱动、内核、Runtime、封装和物理条件变化。

文本到视频扩散模型硬件故障研究进一步以随机硬件级故障测量语义改变与可见伪影,补充了加速器完整性和可靠性测试的故障模型。该研究没有建立攻击者可控的端到端注入链,因此只能支持“应在模型验收中加入硬件故障注入和输出语义检查”,不能据此断言生产设备存在可利用侧信道或定向攻击。

本地 LLM 去分词缓存侧信道把研究对象从加速器内部缓存扩展到默认推理链的 CPU tokenizer:攻击者先用共享去分词代码活动对齐解码窗口,再以 token 相关缓存轨迹、聚类和语言解码恢复输出语义。作者跨三套数据集、两类硬件、两种推理框架和两个模型家族测试,并演示 OpenClaw;这说明仅隔离 Prompt、模型权重或网络连接不能覆盖同机微架构观察者。该结果仍来自单一团队,恢复质量、可利用性和防护成本依赖 CPU、调度、共享代码与同机执行条件,不能外推为远程或所有本地部署均可泄露。

多租户 KV Cache 时序侧信道的竞争负载研究进一步表明,安静环境中的侧信道测量会高估实际攻击可靠性。在 DeepSeek-R1-Distill-Llama-8B、NVIDIA GB10 与 vLLM 上,平均 Cohen’s d 从无合成 worker 时的 0.7789 降至两个 worker 时的 0.2109;AUROC 从空闲时的 0.650 降至约 61% 重叠负载时的 0.531,并在饱和时部分回升至 0.574。两节点、两 GPU 的张量并行 vLLM 复现实验也观察到平均 d 从 3.418 降至 0.511,而两个 SGLang 试验未得到统计显著结论。其机制增量不是否定 Prefix/KV Cache 命中泄露,而是把并发深度方差和 Serving Stack 纳入攻击可靠性模型;防护评测必须跨空闲、常规竞争和饱和负载报告效果量、AUROC 与查询预算。

相关研究文章 ​

参考链接 ​