Skip to content

AI 工作负载控制平面真实入侵活动复盘 ​

摘要 ​

Microsoft 在三起调查中观察到攻击者分别利用 LiteLLM 网关、RAGFlow 平台和 Kestra 工作流环境,把 AI 基础设施当作集中凭据、数据访问、执行权限和算力的控制点。已观察行为包括读取进程环境、访问 LiteLLM PostgreSQL 表、在 RAGFlow 凭据配置路径植入 Python Hook、从 Kestra 工作流启动 Shell、建立 SSH 或服务持久化,以及部署 XMRig。

主要事件行为来自 Microsoft 一手遥测,可作为强证据;初始入口归因的置信度不一致。LiteLLM 被高置信度判断为“很可能”经暴露网关面进入,RAGFlow 的具体 RCE 漏洞归因只有低置信度,Kestra 则以公开 CVE 作为相关上下文。本文不把这种相关性改写为已确认的漏洞利用链。

核心创新与差异 ​

原报告贡献是给出跨三类 AI 工作负载的阶段化进程与网络遥测,证明此前主要以漏洞和设计风险呈现的控制面问题已经进入真实入侵、凭据截获、持久化与算力变现阶段。

本站分析认为,这三起案例共享的首个失效控制是暴露的 AI 管理/执行平面未能把外部请求与高权限运行上下文隔离。它们不是同一恶意软件活动的确定归因,也不能证明所有实例受同一漏洞影响;共同点在于控制平面失陷后可同时触达模型密钥、数据库、工作流和宿主资源。

威胁模型与攻击链 ​

攻击者从互联网可达的 AI 网关、RAG 平台或工作流编排器进入。平台进程持有环境变量、数据库连接、供应商密钥、容器信息或执行工作流能力。

  1. 探测外部暴露的 AI 管理或执行接口。
  2. 在服务进程上下文取得命令或应用路径写入能力。
  3. 从环境变量、数据库或配置流程收集模型供应商凭据与虚拟密钥。
  4. 下载载荷、执行主机与容器发现,并寻找其他 Secret。
  5. 建立 SSH、服务或隐藏文件持久化,部署挖矿或继续收集数据。

LiteLLM 案例中,公开漏洞链包含 CVE-2026-42271 与 CVE-2026-48710 的可能组合;RAGFlow 案例不能归因到具体漏洞;Kestra 案例将 CVE-2026-49869 作为相关公开背景。

攻击方法与复现材料 ​

本文不复刻真实下载器、外传端点、凭据读取或持久化命令。以下为去武器化检测轨迹,供自有日志验证:

text
if parent_process in ["litellm", "ragflow", "kestra"]:
    alert_on(child_process in ["shell", "python-downloader", "miner-placeholder"])
    alert_on(reads_sensitive_env or writes_authorized_keys)
    alert_on(modifies_application_credential_path)
    alert_on(unexpected_database_dump or outbound_to_example_invalid)

测试应使用 Mock Secret、.invalid 出站地址和占位进程名。验证目标是确认检测器能关联“AI 服务进程 → 子进程 → Secret/数据库访问 → 持久化或算力异常”,而不是重放真实恶意 payload。

实验设计与实际过程 ​

来源是 Microsoft Defender 相关调查遥测与事件分析,不是统一实验。LiteLLM 观察到网关进程读取 /proc/1/environ、访问 Azure PostgreSQL 中的模型和虚拟密钥表、分阶段下载执行、竞争矿工清理及持久化。RAGFlow 先出现应用 HTTP 客户端触发的外部回调,数日后在同一服务上下文出现代码执行和 TenantLLM 凭据配置路径 Hook。Kestra 则出现工作流来源 Shell、Docker/容器环境发现、XMRig 与后续数据收集。

报告没有给出受害组织数量、完整时间窗、全部产品版本或每个初始入口的法证闭环,因此本文不计算活动发生率。

关键结果与实际影响 ​

  • LiteLLM 网关进程可触达供应商 API Key、主密钥、数据库连接、模型配置和虚拟密钥,失陷影响超出单一应用进程。
  • RAGFlow 应用路径修改可在用户新增或修改 LLM 配置时截获后续凭据和模型元数据。
  • Kestra 的工作流执行能力可成为容器发现、Secret 搜索和算力变现入口。
  • 三类事件共同出现凭据窃取、持久化或挖矿目标,说明 AI 控制面应按关键企业基础设施实施隔离和检测。

防护措施与验证方法 ​

  • 盘点并关闭不必要的公网管理面,使用强身份、网络访问控制和最小权限服务账号。
  • 将网关、RAG 与工作流平台分离部署,限制对数据库、宿主、容器 Socket 和云 Secret 的访问。
  • 使用短期工作负载身份,轮换已暴露的模型供应商密钥、虚拟密钥与数据库凭据。
  • 监控 AI 服务进程派生 Shell/解释器、读取环境、修改应用代码或 SSH Key、访问密钥表和异常矿工行为。
  • 针对具体产品按供应商公告修补,但在入口不确定时仍执行全链路取证和凭据撤销。

局限与待验证问题 ​

“已观察攻击行为”和“初始访问漏洞”必须分开。LiteLLM 的入口为高置信度推断但仍使用 likely;RAGFlow 只确认应用面与后续执行的时序,具体漏洞为低置信度;Kestra 的 CVE 是相关上下文。来源没有披露完整样本量、组织范围和独立复现,不能据此估计行业普遍受害率。

参考链接 ​