Skip to content

AI Security 红队研究分类与归档规范

定稿日期:2026-07-30。

本规范面向软件型 AI、生成式 AI 与智能体系统。当前版本不覆盖机器人、自动驾驶、无人系统等具身与物理 AI;相关研究在形成稳定规模后单独扩展,不强行放入“多模态”分类。

1. 分类模型

内容导航分成四组,不把不同分类轴混为同级目录:

  • A 组,核心攻击面:第 1–6 类,是漏洞、PoC、利用链和缓解验证的唯一归档主键。
  • B 组,风险与能力:存放能力评估、危害度量和社会影响研究,不存放可复现利用。
  • C 组,方法与评测:存放红队方法、测试工具、评测工程和防御验证。
  • D 组,标准与治理:存放框架、Crosswalk、治理要求和参考资料。

每篇内容只能有一个 primary_domain 和一个属于该一级分类的 subdomain。生命周期、攻击者位置、信任边界、影响、模态和外部框架编号使用正交标签表达,不复制文章。

2. A 组:核心攻击面

2.1 模型本体安全

研究权重、行为、算法和模型内部推理机制:

  • 对抗规避、鲁棒性、Jailbreak 与对齐绕过。
  • Reward Hacking、Alignment Faking、Sandbagging 和微调去对齐。
  • LoRA/Adapter 合并后的模型行为,量化、蒸馏和剪枝造成的安全退化。
  • 模型反演、成员推断、模型窃取和训练数据记忆抽取。
  • Refusal Ablation、Activation Steering、权重编辑和表征层攻击。
  • 推理链、模型内部 CoT 行为及 Reasoning Token 滥用机理。
  • 安全分类器、防护模型和 Guard Model 的对抗规避。
  • 输出水印的移除、伪造、擦洗和解码层规避。
  • 多模态与前沿模型安全。

System Prompt 和应用上下文泄露不属于模型算法属性,归第 5 类。

2.2 数据、知识与隐私安全

限定为数据内容、存储和索引侧:

  • 预训练、微调、RLHF/RLAIF、反馈和评测数据。
  • 数据投毒、内容完整性、授权、来源和隔离。
  • RAG、Embedding 和向量数据库的存储侧安全。
  • Memory 与 Context Store 的存储侧安全。
  • 敏感数据泄露、属性推断、梯度泄露和隐私攻击。
  • 机器遗忘、残留恢复和数据权利验证。
  • 基准数据污染、测试集泄露和训练集污染。

检索结果进入模型后被当成指令属于第 5 类,不在本类重复归档。

2.3 AI 供应链与制品安全

限定为进入运行环境前的制品及其信任链:

  • 模型、数据集、权重、Checkpoint、LoRA 和 Adapter 制品。
  • 模型仓库、Artifact Registry、格式、加载器和序列化 RCE。
  • ML 框架、依赖、插件、Agent Tool 和 MCP Server 的分发安全。
  • Slopsquatting、依赖混淆、恶意模型、Rug Pull 和上游篡改。
  • AIBOM/ML-BOM、签名、来源证明和完整性验证。
  • 第三方模型、数据和 AI 服务的供应链信任。

动态注册后 Tool Schema 变化属于第 6 类;Agent 对合法工具的危险使用属于第 5 类。

2.4 AI 基础设施与 MLOps 安全

限定为不理解 Prompt、Goal、Tool 语义也成立的平台问题:

  • GPU/NPU、Slurm、Kubernetes、Ray 和分布式训练。
  • Jupyter、Kubeflow、MLflow、训练流水线和控制平面。
  • 模型部署、推理服务、模型服务器和资源调度。
  • GPU 多租户、显存残留、硬件与跨请求侧信道。
  • KV/Prefix Cache、MoE 路由、流式时序和推测解码泄露。
  • Reasoning Token 资源耗尽、Sponge Example、成本放大和拒绝服务。
  • 云基础设施 IAM、Secret、LLMjacking、配额和资源盗用。

部署与运维状态归本类;协议语义、会话和身份委托归第 6 类。

2.5 AI 应用与智能体系统安全

研究模型之上的应用语义和 Agent 执行链:

  • Prompt Injection、指令层级和上下文信任边界。
  • System Prompt、应用上下文和暴露推理痕迹的泄露。
  • RAG 与 Memory 的消费侧安全和跨会话污染。
  • Goal、Reasoning、Planning 和任务完整性。
  • Tool Use、Excessive Agency、审批链和权限控制。
  • Agent Runtime、Sandbox、Workspace 和宿主信任交接。
  • Multi-Agent 编排、级联故障、Rogue Agent 和行为传播。
  • Output Rendering、日志污染和下游代码执行。
  • 浏览器、Computer Use、DOM、视觉提示注入、Clickjacking 和 UI 欺骗。
  • Agent 可观测性、行为归因、审计日志完整性和事后取证链。

模型输出不安全代码但不存在攻击者时,作为内生危害归 B 组;Agent 被诱导实际执行危险行为归本类。

2.6 协议、身份与集成安全

研究组件之间的通信、协议语义与委托边界:

  • MCP、A2A、Agent API、SSE、WebSocket 和 Webhook。
  • Tool Schema、能力发现、动态注册、版本协商和 Schema Rug Pull。
  • Agent 身份、凭据、OAuth、Token、工作负载身份和授权委托。
  • 会话状态、消息签名、重放、降级和完整性。
  • Confused Deputy、跨租户通信和跨 Agent 权限传播。

基础设施与云 IAM/Secret 归第 4 类;Agent 和协议层身份、委托与令牌流转归本类。

3. B 组:风险与能力研究

  • B1 恶意使用与危险能力:网络攻击、恶意代码、CBRN 和危险能力阈值。
  • B2 前沿自主性与模型行为风险:Scheming、情境感知、自我渗出和隐蔽行动。
  • B3 欺诈、影响力与合成内容风险:欺诈、钓鱼、Deepfake、影响力操作和内容真实性方案的整体鲁棒性。
  • B4 内生危害与人因风险:偏见、毒性、幻觉、不安全代码、过度依赖和脆弱人群风险。

具体水印攻击技术归 A1.7;C2PA 剥离、伪造及应用链 PoC 归 A5.7;B 组不存可复现利用。

4. C 组:红队工程与防御验证

  • C1 威胁建模、分类与测试范围
  • C2 Payload、语料与测试 Harness
  • C3 Benchmark、指标与评测完整性
  • C4 AI Control 与前沿能力评估
  • C5 防护验证、检测与推理监控
  • C6 事件响应、取证与漏洞管理
  • C7 安全智能体与攻防反制

测试集和 Benchmark 数据污染归第 2 类;Judge 和测试 Harness 被操纵归本组;模型主动 Sandbagging 归第 1 类。

5. D 组:标准、治理与参考体系

  • D1 外部标准与安全框架:NIST、MITRE、OWASP、ISO、ENISA、CSA 和 CoSAI。
  • D2 分类映射与 Crosswalk:外部技术编号、双向映射和覆盖缺口。
  • D3 治理、合规与组织控制:法规义务、风险治理、角色责任和政策控制。
  • D4 知识库、资产与研究治理:仓库分类、证据等级、资产清单和内容生命周期。

外部框架必须建立双向索引:文章记录 ATLAS 技术 ID 和 OWASP 条目,索引页也能够反查本仓库尚未覆盖的技术。

6. 二级分类定义与边界

二级分类不是标签,而是文章在一级分类内的唯一归档位置。网站在每个一级分类页按以下二级分类展示定义、边界、研究重点和文章;即使暂无内容也保留入口,用于暴露研究空白。

6.1 A1 模型本体安全

编码二级分类定义与排除边界
A1.1鲁棒性、Jailbreak 与对齐边界模型面对对抗输入和策略绕过时的行为稳定性;第三方内容注入应用上下文归 A5.1。
A1.2训练与对齐过程完整性Reward Hacking、Alignment Faking、Sandbagging、微调去对齐和压缩退化;数据内容污染归 A2.1。
A1.3模型机密性与能力提取模型窃取、反演、成员推断和训练记忆抽取;数据存储侧泄露归 A2。
A1.4权重、表征与模型编辑Refusal Ablation、Activation Steering 和权重编辑;分发链制品替换归 A3。
A1.5推理链与 CoT 安全推理机理、痕迹泄露和不忠实推理;平台资源耗尽的主要影响归 A4.5。
A1.6安全分类器与防护模型规避Guard Model 和输入输出分类器的具体对抗规避;防护效果比较归 C5。
A1.7模型输出水印与统计溯源水印移除、伪造和解码层规避;C2PA 应用链问题归 A5.7。

6.2 A2 数据、知识与隐私安全

编码二级分类定义与排除边界
A2.1训练、反馈与标注数据安全预训练、微调、RLHF/RLAIF 和反馈数据的投毒、授权与完整性;训练算法失效归 A1.2。
A2.2RAG、知识库与索引安全语料、Embedding、向量库和索引的存储侧安全;检索结果成为指令归 A5.1。
A2.3Memory 与 Context Store 安全长期记忆和会话存储的写入、隔离与生命周期;读取后的应用行为归 A5.2。
A2.4数据隐私、推断与泄露属性推断、梯度泄露、敏感数据暴露和重识别;模型资产提取归 A1.3。
A2.5机器遗忘与数据权利验证Unlearning、残留恢复和删除请求审计。
A2.6评测数据与基准完整性基准污染、测试集泄露和训练评测交叉污染;Judge/Harness 操纵归 C3。

6.3 A3 AI 供应链与制品安全

编码二级分类定义与排除边界
A3.1模型、权重与数据制品模型、Checkpoint、LoRA、Adapter 和数据集制品的来源与完整性;加载后行为归 A1。
A3.2框架、依赖与包生态依赖混淆、Slopsquatting、恶意包和构建链;已部署服务漏洞归 A4。
A3.3Tool、插件与 Server 分发安全Agent Tool、插件和 MCP Server 的安装来源;动态 Schema 变化归 A6.2。
A3.4仓库、格式与加载器安全模型仓库、Registry、格式解析和反序列化 RCE;Registry 服务运维漏洞归 A4.2。
A3.5来源证明、签名与 AI-BOM制品签名、AIBOM/ML-BOM、可验证构建和来源证明;组织审计要求归 D。
A3.6第三方模型与 AI 服务供应链外部模型 API、托管数据和第三方能力的上游信任;调用协议和委托归 A6。

6.4 A4 AI 基础设施与 MLOps 安全

编码二级分类定义与排除边界
A4.1训练计算与集群隔离GPU/NPU、Slurm、Kubernetes、Ray 和分布式训练隔离;Agent 执行沙箱归 A5.5。
A4.2MLOps 流水线与控制平面Jupyter、Kubeflow、MLflow 和 Pipeline 的运行时安全;模型签名归 A3.5。
A4.3推理服务与模型服务器Serving Runtime、推理网关、批处理和部署配置;协议消息语义归 A6。
A4.4加速器、多租户与推理侧信道显存、KV/Prefix Cache、MoE、流式和推测解码侧信道。
A4.5资源耗尽与经济性攻击Sponge Example、Reasoning Token 成本放大、配额和限流绕过。
A4.6云 IAM、Secret 与资源盗用云密钥、服务账号、LLMjacking 和算力盗用;Agent 令牌委托归 A6.3。

6.5 A5 AI 应用与智能体系统安全

编码二级分类定义与排除边界
A5.1Prompt Injection 与上下文信任边界第三方网页、文档、邮件、工具结果和 RAG 内容越权成为指令;用户直接 Jailbreak 归 A1.1。
A5.2上下文组装、RAG 与 Memory 消费System Prompt、检索结果和记忆进入上下文后的泄露、优先级与跨会话行为;存储侧归 A2。
A5.3Goal、Reasoning 与 Planning 完整性目标劫持、计划污染和任务状态绕过;模型内部 CoT 归 A1.5。
A5.4Tool Use、Agency 与审批控制合法工具的越权调用、Excessive Agency 和审批绕过;工具来源归 A3.3。
A5.5Agent Runtime、Sandbox 与 WorkspaceAgent 执行代码、文件操作、工作区和宿主信任交接;训练集群隔离归 A4.1。
A5.6Multi-Agent 编排与信任传播委派、协作、Rogue Agent 和级联故障;线协议与消息身份归 A6。
A5.7Output Rendering 与下游执行日志、Markdown、浏览器、终端和下游组件解释输出时的攻击;包含 C2PA 应用链剥离。
A5.8浏览器与 Computer Use Agent视觉提示注入、DOM 注入、Agent Clickjacking 和界面确认绕过。
A5.9可观测性、行为归因与审计链Agent 动作记录、归因、审计日志和产品内证据链;跨系统响应方法归 C6。

6.6 A6 协议、身份与集成安全

编码二级分类定义与排除边界
A6.1API、传输与流式协议Agent/模型 API、SSE、WebSocket、Webhook 和消息分帧;服务部署运维归 A4.3。
A6.2MCP、能力发现与动态 SchemaMCP、Tool Schema、动态注册和 Schema Rug Pull;Server 来源归 A3.3。
A6.3身份、认证与授权委托Agent 身份、OAuth、Token、工作负载身份和 Confused Deputy;云 IAM 归 A4.6。
A6.4会话、消息与状态完整性消息签名、重放、会话绑定、加密载荷和任务状态;应用规划状态归 A5.3。
A6.5互操作、版本协商与降级多厂商兼容、版本迁移、能力协商和降级语义;供应商整体风险归 A3.6。

6.7 B、C、D 组

编码二级分类定义与排除边界
B1恶意使用与危险能力网络攻击、恶意代码、CBRN 等能力评估;具体可复现利用归 A。
B2前沿自主性与模型行为风险Scheming、自我渗出和隐蔽行动的风险结论;控制评估方法归 C4。
B3欺诈、影响力与合成内容风险欺诈、Deepfake、影响力操作和内容真实性整体鲁棒性;具体技术攻击归 A。
B4内生危害与人因风险偏见、毒性、幻觉、不安全输出、依赖和脆弱人群风险。
C1威胁建模、分类与测试范围资产、对手、信任边界、技术分类和授权范围;具体产品漏洞归 A。
C2Payload、语料与测试 Harness通用攻击语料、自动化红队、Fuzzing 和 Harness;发现的漏洞归 A。
C3Benchmark、指标与评测完整性ASR、覆盖率、复现性、Judge 和评分器;评测数据污染归 A2.6。
C4AI Control 与前沿能力评估不可信模型控制评估和能力阈值工程;危险能力结论归 B。
C5防护验证、检测与推理监控Guardrail、检测器、运行时策略和 CoT 可监控性;具体防护模型漏洞归 A1.6。
C6事件响应、取证与漏洞管理调查、证据保全、披露、修复验证和漏洞生命周期。
C7安全智能体与攻防反制Pentest/SOC/IR Agent 的方法、市场和评估;具体 Agent 漏洞归 A。
D1外部标准与安全框架标准和原始框架要求,不作为技术漏洞主键。
D2分类映射与 Crosswalk本仓库与外部框架的双向映射和覆盖缺口。
D3治理、合规与组织控制法规义务、责任分配、政策控制和组织监督。
D4知识库、资产与研究治理仓库分类、证据等级、资产清单和内容生命周期。

7. 唯一归档判据

依次使用以下判据,不跳级:

  1. 首个失效的安全控制或信任边界
  2. 多个控制同时缺失时,判断主要由谁修复
  3. 仍无法区分时,以文章的主要研究问题和可验证结论为准。
  4. 横跨多个攻击面的内容按制品类型归档:红队方法、评测与防御验证归 C 组,标准、Crosswalk 与治理参考归 D 组;不把同一文章复制到多个目录。

典型判例:

场景主分类
非授权修改 RAG 索引2. 数据、知识与隐私
正常网页内容被 Agent 当作指令5. AI 应用与智能体
恶意 MCP Server 的分发与签名3. AI 供应链与制品
MCP Tool 审批后 Schema 变化6. 协议、身份与集成
Agent 对合法 Tool 的越权使用5. AI 应用与智能体
MLflow 模型签名缺陷3. AI 供应链与制品
MLflow Server RCE4. AI 基础设施与 MLOps
恶意提示造成 Reasoning Token 爆炸4. AI 基础设施与 MLOps
Agent 输出污染日志或审计记录5. AI 应用与智能体

8. 正交元数据

每篇新内容建议使用以下 Frontmatter:

yaml
---
title: 文章标题
date: 2026-07-30
updated: 2026-07-31
primary_domain: agent
subdomain: agent-runtime-sandbox
content_type: research-note
lifecycle: [deployment, runtime]
attacker_position: [third-party-content]
trust_boundaries: [content-to-instruction, sandbox-to-host]
impacts: [confidentiality, integrity]
modalities: [text, code]
access_level: black-box
atlas_ids: [AML.T0051]
owasp_ids: [ASI01:2026]
evidence: strong
disclosure_status: public
last_verified: 2026-07-30
verified_targets: [product@version]
affected_targets: [vendor/product@version]
status: maintained
---

已有笔记没有 Frontmatter 时,网站从路径、一级标题和正文日期推导基础元数据;新内容应优先显式填写。