Skip to content

推理服务与模型服务器安全研究综述 ​

摘要 ​

推理服务把模型加载器、GPU Runtime、HTTP/gRPC 网关、动态批处理和模型仓库连接起来。传统的认证缺失、内存安全、路径遍历和 SSRF 风险在这里与高价值权重、跨租户提示和昂贵算力叠加。安全审查应覆盖服务实现与部署态,而不只测试 Prompt。

分类介绍 ​

本领域覆盖 Triton、vLLM、TGI、KServe 等 Serving Runtime、模型网关、批处理和部署配置。API 消息语义、SSE/WebSocket 和身份委托归 A6;共享缓存侧信道归 A4.4;服务实现与运维边界归本类。

主要安全风险 ​

  • 未授权管理端点可加载、卸载或替换模型并读取配置。
  • 自定义后端、模型加载器和插件扩展扩大远程代码执行面。
  • 动态批处理和错误隔离不足可能混淆租户响应或泄露元数据。
  • 部分 TEE 保护若为性能复用静态噪声或指纹基底,跨请求观测可恢复模型保护秘密或识别完整性检查。
  • 健康检查、指标、调试和追踪端点可能暴露 Prompt、模型路径与 Secret。

防护措施与验证方法 ​

分离管理面与数据面,使用强身份和网络策略;禁用不需要的加载器与调试端点;固定模型摘要和运行时版本;对请求大小、批次、并发与超时设限;确保日志脱敏和租户绑定。部署验证应包含配置审计、接口 Fuzzing 和故障注入。

局限与待验证问题 ​

  • 动态批处理如何提供可验证的跨租户请求与响应绑定?
  • 高性能自定义内核的内存安全测试如何进入发布流程?
  • 多模型网关在热更新时如何保持授权和制品完整性?

历史研究成果 ​

该分类下的独立研究覆盖缓存数据面、回滚状态、网关与编译控制面。LLM 推理缓存完整性分析前缀、块、图像与语义缓存,把非加密哈希、非规范序列化和模糊相似度匹配列为主要风险,指出可能导致系统提示替换、缓存项错配与 RAG/客服结果污染;公开材料仅有摘要与幻灯片,命中率不能外推为部署发生率。KV Cache 回滚后的状态残留与推理一致性进一步研究 transcript 已回滚但会话 KV 仍保留中止分支的跨层状态不一致:相同 token、不同缓存的 63 个主审计单元中,stale KV 改变 25 个受保护决策,事务级重建后为 0/63。LiteLLM 网关鉴权与控制面组合失陷覆盖 MCP 鉴权降级、Guardrail 动态执行、删除后的内存回调残留和透传 SSRF;公开扫描的 3,000 余个实例中,191 个无认证、103 个接受默认密钥、330 个表现出 MCP 绕过特征,但研究没有读取第三方数据或执行工具。JITterFlip则把故障目标转向 CPU 侧 JIT 编译制品选择与 GPU 提交分支:作者在四个模型工作负载上观察到输出破坏,或在输出不变时出现 97.38—124.97 倍的端到端 Rowhammer 时延放大。这些研究共同要求把网关身份、插件生命周期、网络出口、缓存键、事务回滚和宿主 JIT 控制流分别验证;商业服务的隐藏缓存与硬件部署没有公开证据时,应记为未知而非推定安全或受影响。

三项合并研究补充了服务输出的可靠性验收,但不应与系统漏洞混为一谈。BiG-SURE以二部图聚合黑盒 LLM/VLM 输出的语义不确定性,在作者实验中提高弃权 AUROC;Implicit Feature Stabilization将视觉语言模型幻觉与扰动下表示不稳定联系,并给出随视图数按 (1/\sqrt{K}) 收敛的锚点分析;Covert Targeted Bias Injection表明外观良性的合成训练文本仍可注入定向偏见。前两项可用于高风险 Serving 的弃权与稳定性回归,第三项要求部署验收追溯上游训练数据;它们均来自单篇作者实验,不能证明推理服务自身存在可利用实现缺陷。

Maverick从“服务端可见明文且客户端无法核验计算”这一信任假设切入,以矩阵—向量乘法委托、透明预处理和批量验证约束第三方推理:LPN 掩码保护输入,信息论可靠的验证协议检查主要线性计算,同时尽量不增加服务端开销。作者在 Qwen3-4B 原型上报告,单客户端线程相对本地推理在在线生成隐私掩码、预计算掩码和仅验证三种配置下最高分别加速 17、45 和 44 倍;四客户端线程时为 13、18 和 17 倍。该结果说明私密且可验证的外包推理可以进入工程评测,但证据仅覆盖单一模型与作者原型,不能替代对模型加载、非线性算子、网关身份和运行时实现的完整审计。

相关研究文章 ​

参考链接 ​