外观
推理服务与模型服务器安全研究综述
摘要
推理服务把模型加载器、GPU Runtime、HTTP/gRPC 网关、动态批处理和模型仓库连接起来。传统的认证缺失、内存安全、路径遍历和 SSRF 风险在这里与高价值权重、跨租户提示和昂贵算力叠加。安全审查应覆盖服务实现与部署态,而不只测试 Prompt。
分类介绍
本领域覆盖 Triton、vLLM、TGI、KServe 等 Serving Runtime、模型网关、批处理和部署配置。API 消息语义、SSE/WebSocket 和身份委托归 A6;共享缓存侧信道归 A4.4;服务实现与运维边界归本类。
主要安全风险
- 未授权管理端点可加载、卸载或替换模型并读取配置。
- 自定义后端、模型加载器和插件扩展扩大远程代码执行面。
- 动态批处理和错误隔离不足可能混淆租户响应或泄露元数据。
- 部分 TEE 保护若为性能复用静态噪声或指纹基底,跨请求观测可恢复模型保护秘密或识别完整性检查。
- 健康检查、指标、调试和追踪端点可能暴露 Prompt、模型路径与 Secret。
防护措施与验证方法
分离管理面与数据面,使用强身份和网络策略;禁用不需要的加载器与调试端点;固定模型摘要和运行时版本;对请求大小、批次、并发与超时设限;确保日志脱敏和租户绑定。部署验证应包含配置审计、接口 Fuzzing 和故障注入。
局限与待验证问题
- 动态批处理如何提供可验证的跨租户请求与响应绑定?
- 高性能自定义内核的内存安全测试如何进入发布流程?
- 多模型网关在热更新时如何保持授权和制品完整性?
历史研究成果
该分类下的独立研究覆盖缓存数据面、回滚状态、网关与编译控制面。LLM 推理缓存完整性分析前缀、块、图像与语义缓存,把非加密哈希、非规范序列化和模糊相似度匹配列为主要风险,指出可能导致系统提示替换、缓存项错配与 RAG/客服结果污染;公开材料仅有摘要与幻灯片,命中率不能外推为部署发生率。KV Cache 回滚后的状态残留与推理一致性进一步研究 transcript 已回滚但会话 KV 仍保留中止分支的跨层状态不一致:相同 token、不同缓存的 63 个主审计单元中,stale KV 改变 25 个受保护决策,事务级重建后为 0/63。LiteLLM 网关鉴权与控制面组合失陷覆盖 MCP 鉴权降级、Guardrail 动态执行、删除后的内存回调残留和透传 SSRF;公开扫描的 3,000 余个实例中,191 个无认证、103 个接受默认密钥、330 个表现出 MCP 绕过特征,但研究没有读取第三方数据或执行工具。JITterFlip则把故障目标转向 CPU 侧 JIT 编译制品选择与 GPU 提交分支:作者在四个模型工作负载上观察到输出破坏,或在输出不变时出现 97.38—124.97 倍的端到端 Rowhammer 时延放大。这些研究共同要求把网关身份、插件生命周期、网络出口、缓存键、事务回滚和宿主 JIT 控制流分别验证;商业服务的隐藏缓存与硬件部署没有公开证据时,应记为未知而非推定安全或受影响。
三项合并研究补充了服务输出的可靠性验收,但不应与系统漏洞混为一谈。BiG-SURE以二部图聚合黑盒 LLM/VLM 输出的语义不确定性,在作者实验中提高弃权 AUROC;Implicit Feature Stabilization将视觉语言模型幻觉与扰动下表示不稳定联系,并给出随视图数按 (1/\sqrt{K}) 收敛的锚点分析;Covert Targeted Bias Injection表明外观良性的合成训练文本仍可注入定向偏见。前两项可用于高风险 Serving 的弃权与稳定性回归,第三项要求部署验收追溯上游训练数据;它们均来自单篇作者实验,不能证明推理服务自身存在可利用实现缺陷。
Maverick从“服务端可见明文且客户端无法核验计算”这一信任假设切入,以矩阵—向量乘法委托、透明预处理和批量验证约束第三方推理:LPN 掩码保护输入,信息论可靠的验证协议检查主要线性计算,同时尽量不增加服务端开销。作者在 Qwen3-4B 原型上报告,单客户端线程相对本地推理在在线生成隐私掩码、预计算掩码和仅验证三种配置下最高分别加速 17、45 和 44 倍;四客户端线程时为 13、18 和 17 倍。该结果说明私密且可验证的外包推理可以进入工程评测,但证据仅覆盖单一模型与作者原型,不能替代对模型加载、非线性算子、网关身份和运行时实现的完整审计。
相关研究文章
推理控制面故障注入
JITterFlip:JIT 编译推理控制面的故障注入攻击分析单比特故障如何篡改 CPU 侧 JIT 编译制品选择与 GPU 提交控制,造成输出破坏或保持正确输出的时延放大。2026-08-30多租户推理缓存与完整性
KV Cache 回滚后的状态残留与推理一致性研究 Agent 逻辑回滚未同步恢复 KV Cache 时,中止分支如何继续影响后续安全决策,并验证事务级缓存恢复方法。2026-08-23LLM 推理缓存完整性:哈希碰撞、语义污染与租户隔离记录 Black Hat Asia 2026 对 vLLM、GPTCache 等推理缓存的完整性研究;公开材料包含摘要与幻灯片,具体 CVE、版本与 PoC 仍待逐项核验。2026-04-24推理网关鉴权与控制面
LiteLLM 网关鉴权与控制面组合失陷分析 LiteLLM 的 MCP 鉴权降级、Guardrail 动态执行、配置残留和透传请求 SSRF 如何从单一网关扩大到工具与云环境。2026-08-13参考链接
- NVIDIA Triton Inference Server
- KServe Security
- OWASP API Security Top 10
- NIST SP 800-204A
- LLM Heist: Hijacking LiteLLM for Traffic Interception, Key Theft, and Tool-Call Injection
- Vulnerabilities in Partial TEE-Shielded LLM Inference with Precomputed Noise
- Aborted but Not Forgotten: KV-Cache Retention Breaks Rollback Consistency in Language Agents
- JITterFlip: Uncovering Fault Attack Surfaces in JIT-Compiled LLM Serving
- BiG-SURE
- Hidden Threat in Synthetic Data
- Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization
- Maverick: Private and Verifiable LLM Inference Made Practical via Matrix-Vector Multiplication Delegation