Skip to content

安全 Agent 市场地图、统一威胁模型与防护成熟度模型 ​

摘要 ​

本文综合渗透测试、自主验证、SOC 研判/响应和漏洞发现修复四类安全 Agent 产品的公开披露材料,构建跨厂商的统一威胁模型(不可信内容来源、攻击目标)和 L0–L5 防护成熟度分级,用于判断一类产品的公开防护处于哪个层级、哪些层级公开证据仍然薄弱。

综合结论是:市场公开防护整体集中在身份、审批、审计和只读默认值(L1),少数攻击型或云托管产品披露了数据平面/执行平面隔离(L2/L3)的一部分;内容来源与指令的强隔离、记忆治理和执行后独立验证(L4/L5)是最明显的公开证据空白。这是跨厂商自我披露材料的综合整理,不是独立安全审计或渗透测试结果,未公开披露不代表产品一定没有对应能力。

研究范围与方法 ​

本文覆盖四类产品:自主渗透测试(XBOW、Aikido AI Pentest)、自主验证(Horizon3.ai NodeZero、Pentera)、SOC 研判/响应(Microsoft Security Copilot Agents、CrowdStrike Charlotte AI/AgentWorks/Agentic SOAR、Palo Alto Cortex AgentiX、Dropzone AI、Torq AI SOC/HyperAgents)以及漏洞发现与修复(GitHub CodeQL + Copilot Autofix),并将 Google Security Operations/Gemini、SentinelOne Purple AI、Splunk AI、Exabeam Copilot、Radiant Security、Prophet Security 列为观察名单(本轮未取得足够可核验的一手技术细节,不作安全强弱判断)。所有市场页面于 2026-07-25 核验;本文只整理各厂商官方公开材料的自我披露内容,不包含本站或第三方对产品的独立渗透测试。

统一威胁模型 ​

不可信内容来源 ​

  • 攻击型:HTTP 响应、robots.txt、API schema、网页 DOM、banner、仓库、README、构建日志、二进制和归档包。
  • SOC:邮件正文/主题/附件、进程命令行、文件名、DNS、URL、云资源 tag、告警描述、日志字段、工单、Slack/Teams 访谈、威胁情报。
  • 漏洞治理:源代码注释、commit message、PR/issue、SARIF message、依赖包元数据、测试输出和文档。
  • 响应编排:connector 返回值、MCP tool result、前序 agent 的总结和自动生成 playbook。
  • 持久层:agent feedback、上下文记忆、技能、promptbook、自定义 agent、知识图谱和向量库。

攻击目标 ​

  • 研判操纵:把恶意告警判成 benign,或制造误报淹没队列。
  • 行动操纵:隔离正常主机、禁用关键账号、封禁合法 IP、修改检测规则。
  • 数据窃取:诱导 agent 调用高权限 connector,并把结果带到可观测外部渠道。
  • 持久化:把恶意"环境事实"写进组织记忆、技能或反馈。
  • 横向传播:一个 agent 的恶意摘要被另一个 agent 当作可信指令。
  • 基础设施突破:通过解析器、沙箱、浏览器、文件转换器或 MCP server 获得 RCE。
  • 资源耗尽:构造高扇出调查、递归查询或超长上下文,消耗模型和 API 预算。

市场地图与公开防护证据 ​

证据等级说明:强 表示厂商公开给出了具体机制;中 表示只有产品级描述;未披露 表示公开资料中未找到足够技术细节,不代表产品一定没有该能力。

类别产品/平台自动化能力与攻击者可控输入公开披露的主要控制仍待验证的关键问题
自主渗透测试XBOW多 Agent 探索、利用、验证;直接读取目标网页/API/文档和凭据短生命周期 attack worker、用户定义 scope、非破坏式验证、全动作审计、独立 validator(中-强)worker 是否无密钥;下载/执行未知工件的沙箱和 egress;提示词注入/记忆防护未公开
自主渗透测试Aikido AI Pentest数百 Agent 进行白盒/灰盒/黑盒测试并复验流量经严格 guardrail 强制;pre-flight;panic button;重大升级暂停并要求用户选择 Exploit Further;默认只读;独立复验(强)worker/orchestrator 分离、宿主挂载、密钥代理、未知二进制执行策略未公开
自主验证Horizon3.ai NodeZero自动内外网渗透与横向路径验证;严格说不一定属于通用 LLM agent专用、短生命周期、一次性资源;隔离 VPC;安全默认值;实时监控(强,适合作为架构对照组)内部 Docker host 权限边界和工件处理细节;是否存在内容驱动模型决策面
自主验证PenteraAI/算法驱动的生产环境攻击验证宣称 safe-by-design、production-safe 和真实攻击验证(中)未公开足够的内容注入、执行隔离、密钥和记忆架构细节
SOC 研判/响应Microsoft Security Copilot AgentsAlert Triage Agent 自动读取邮件/协作内容、云和身份告警,并拥有 Alerts (manage);按新告警自动触发独立 agent identity、最小权限/RBAC、可审计;Azure OpenAI 内容过滤,包含可选 jailbreak 与间接提示词注入检测;高影响动作审批;尽量减少不可逆动作;红队和渗透测试(强)官方同时承认模型并非可靠、node map 仅是摘要、记忆解释和可见性有限;需验证恶意邮件/日志能否改变 verdict、反馈或后续动作
SOC 研判/响应CrowdStrike Charlotte AI / AgentWorks / Agentic SOAR自动分流、调查和跨生态动作;支持自定义 agent 与 agent-to-agent 编排所有回答可追踪、所有动作需用户授权、决定基于已验证数据且受角色约束;AIDR、workflow-level controls 和 AgentWorks guardrails(中-强)"validated data"如何处理命令行、邮件、脚本等敌手字段;提示词注入、记忆、跨 agent 传播细节未公开
SOC 研判/响应Palo Alto Cortex AgentiXagentic workflow、案件研判、自动化生成、1,100+ integration 和 MCPagent 与分析师共享角色/权限;高影响动作 human-in-the-loop;推理和计划可见;可把 AI 任务嵌入确定性 playbook(强)可见推理不等于安全;MCP/connector 返回值、案件内容与持久记忆的信任边界未公开
SOC 研判/响应Dropzone AI无人在关键路径的自主告警调查;读取邮件、EDR、SIEM、工单、目录、PCAP、脚本和附件;可配置隔离终端、禁用账号、封 IP默认只读;每客户独立 AWS tenant/subnet,deny-by-default 网络;数据 lineage、完整审计、独立 expert modules、内部 sandbox/lab 测试;响应动作可配置(强)公开页面只称 guardrail 防幻觉,未说明间接注入防护;组织上下文记忆可从邮件/Jira/目录读取并由自然语言教学,形成高价值持久化攻击面
SOC 研判/响应Torq AI SOC / HyperAgents从 triage 到 response 闭环,宣称 90% 以上案件自动关闭;系统"学习并记住"SOC 工作方式强调透明度、监督、控制,以及确定性自动化与 agentic reasoning 结合(中)自动处置权限、记忆写入来源、恶意告警字段隔离和跨 integration 传播未公开
漏洞发现与修复GitHub CodeQL + Copilot Autofix用 SARIF、代码片段、注释和仓库上下文生成安全修复所有修改需开发者显式接受;内容过滤;2,300+ alert 测试集;合并建议后重跑 CodeQL 和单测;失败建议不展示;可禁用;依赖审查(强)官方明确承认修复可引入新漏洞、改变语义、只做部分修复或虚构依赖;未单独说明源代码注释/README 的间接注入防护
观察名单Google Security Operations/Gemini、SentinelOne Purple AI、Splunk AI、Exabeam Copilot、Radiant Security、Prophet Security覆盖研判、查询生成、调查和响应各自公开了不同程度的 RBAC、审计或人工监督声明本轮未取得足够可核验的一手技术细节,不应据此作安全强弱判断

市场防护的共同模式 ​

目前公开措施主要集中在五类:

  1. 身份和权限:agent identity、RBAC、最小权限。
  2. 人工控制:高影响动作审批、升级前暂停、panic button。
  3. 可观察性:推理轨迹、操作日志、证据链接、审计记录。
  4. 验证与保守执行:独立 validator、复验、只读默认、非破坏式 PoC。
  5. 基础隔离:专用 tenant/subnet、短生命周期 worker、隔离 VPC。

公开资料最薄弱的三层是:

  • 内容来源与指令的强隔离:是否对攻击者控制字段做类型化、污点传播和上下文降权。
  • 记忆治理:什么可以写入长期记忆,谁能审批、查看、回滚和过期。
  • 执行后验证:动作执行前后的独立传感器核验,以及模型之外的不可绕过策略。

防护成熟度模型 ​

等级含义典型措施
L0 模型提示依赖 system prompt 或 LLM judge"忽略外部指令"、提示词注入分类器
L1 治理限制谁能运行和审批RBAC、审计、HITL、panic button
L2 数据平面区分可信政策与不可信证据schema、来源标签、污点传播、内容隔离
L3 执行平面即使模型失陷也限制影响无密钥 worker、外部 egress proxy、短生命周期 sandbox、scoped tools
L4 持久与供应链控制长期状态和跨 agent 传播记忆审批/TTL/回滚、tool provenance、签名技能、connector 隔离
L5 持续验证独立检查实际效果并可恢复双通道传感器、动作后验证、自动回滚、对抗回归测试

市场公开防护整体集中在 L1;少数攻击型或云托管产品披露了 L2/L3 的一部分。L4/L5 是最明显的研究和产品空白。

结论适用范围 ​

现有公开产品资料不足以支持跨厂商安全成熟度排名。市场能力主要由厂商自述,未公开披露不表示产品没有相应控制;本文的市场地图和成熟度分级只反映已引用材料明确说明的部分,不构成独立安全审计结论。已公开的产品控制主要集中在身份、审批、审计和只读默认值;少数产品披露 worker、tenant 或网络隔离,但针对不可信内容传播、长期记忆、跨 Agent 权限放大和动作后验证的公开实证仍然有限。

参考链接 ​

所有市场页面于 2026-07-25 核验。厂商页面属于自我披露,不等同于独立安全审计结果。