外观
AI Security 红队研究分类与归档规范
定稿日期:2026-07-30。
本规范面向软件型 AI、生成式 AI 与智能体系统。当前版本不覆盖机器人、自动驾驶、无人系统等具身与物理 AI;相关研究在形成稳定规模后单独扩展,不强行放入“多模态”分类。
1. 分类模型
内容导航分成四组,不把不同分类轴混为同级目录:
- A 组,核心攻击面:第 1–6 类,是漏洞、PoC、利用链和缓解验证的唯一归档主键。
- B 组,风险与能力:存放能力评估、危害度量和社会影响研究,不存放可复现利用。
- C 组,方法与评测:存放红队方法、测试工具、评测工程和防御验证。
- D 组,标准与治理:存放框架、Crosswalk、治理要求和参考资料。
每篇内容只能有一个 primary_domain 和一个属于该一级分类的 subdomain。生命周期、攻击者位置、信任边界、影响、模态和外部框架编号使用正交标签表达,不复制文章。
2. A 组:核心攻击面
2.1 模型本体安全
研究权重、行为、算法和模型内部推理机制:
- 对抗规避、鲁棒性、Jailbreak 与对齐绕过。
- Reward Hacking、Alignment Faking、Sandbagging 和微调去对齐。
- LoRA/Adapter 合并后的模型行为,量化、蒸馏和剪枝造成的安全退化。
- 模型反演、成员推断、模型窃取和训练数据记忆抽取。
- Refusal Ablation、Activation Steering、权重编辑和表征层攻击。
- 推理链、模型内部 CoT 行为及 Reasoning Token 滥用机理。
- 安全分类器、防护模型和 Guard Model 的对抗规避。
- 输出水印的移除、伪造、擦洗和解码层规避。
- 多模态与前沿模型安全。
System Prompt 和应用上下文泄露不属于模型算法属性,归第 5 类。
2.2 数据、知识与隐私安全
限定为数据内容、存储和索引侧:
- 预训练、微调、RLHF/RLAIF、反馈和评测数据。
- 数据投毒、内容完整性、授权、来源和隔离。
- RAG、Embedding 和向量数据库的存储侧安全。
- Memory 与 Context Store 的存储侧安全。
- 敏感数据泄露、属性推断、梯度泄露和隐私攻击。
- 机器遗忘、残留恢复和数据权利验证。
- 基准数据污染、测试集泄露和训练集污染。
检索结果进入模型后被当成指令属于第 5 类,不在本类重复归档。
2.3 AI 供应链与制品安全
限定为进入运行环境前的制品及其信任链:
- 模型、数据集、权重、Checkpoint、LoRA 和 Adapter 制品。
- 模型仓库、Artifact Registry、格式、加载器和序列化 RCE。
- ML 框架、依赖、插件、Agent Tool 和 MCP Server 的分发安全。
- Slopsquatting、依赖混淆、恶意模型、Rug Pull 和上游篡改。
- AIBOM/ML-BOM、签名、来源证明和完整性验证。
- 第三方模型、数据和 AI 服务的供应链信任。
动态注册后 Tool Schema 变化属于第 6 类;Agent 对合法工具的危险使用属于第 5 类。
2.4 AI 基础设施与 MLOps 安全
限定为不理解 Prompt、Goal、Tool 语义也成立的平台问题:
- GPU/NPU、Slurm、Kubernetes、Ray 和分布式训练。
- Jupyter、Kubeflow、MLflow、训练流水线和控制平面。
- 模型部署、推理服务、模型服务器和资源调度。
- GPU 多租户、显存残留、硬件与跨请求侧信道。
- KV/Prefix Cache、MoE 路由、流式时序和推测解码泄露。
- Reasoning Token 资源耗尽、Sponge Example、成本放大和拒绝服务。
- 云基础设施 IAM、Secret、LLMjacking、配额和资源盗用。
部署与运维状态归本类;协议语义、会话和身份委托归第 6 类。
2.5 AI 应用与智能体系统安全
研究模型之上的应用语义和 Agent 执行链:
- Prompt Injection、指令层级和上下文信任边界。
- System Prompt、应用上下文和暴露推理痕迹的泄露。
- RAG 与 Memory 的消费侧安全和跨会话污染。
- Goal、Reasoning、Planning 和任务完整性。
- Tool Use、Excessive Agency、审批链和权限控制。
- Agent Runtime、Sandbox、Workspace 和宿主信任交接。
- Multi-Agent 编排、级联故障、Rogue Agent 和行为传播。
- Output Rendering、日志污染和下游代码执行。
- 浏览器、Computer Use、DOM、视觉提示注入、Clickjacking 和 UI 欺骗。
- Agent 可观测性、行为归因、审计日志完整性和事后取证链。
模型输出不安全代码但不存在攻击者时,作为内生危害归 B 组;Agent 被诱导实际执行危险行为归本类。
2.6 协议、身份与集成安全
研究组件之间的通信、协议语义与委托边界:
- MCP、A2A、Agent API、SSE、WebSocket 和 Webhook。
- Tool Schema、能力发现、动态注册、版本协商和 Schema Rug Pull。
- Agent 身份、凭据、OAuth、Token、工作负载身份和授权委托。
- 会话状态、消息签名、重放、降级和完整性。
- Confused Deputy、跨租户通信和跨 Agent 权限传播。
基础设施与云 IAM/Secret 归第 4 类;Agent 和协议层身份、委托与令牌流转归本类。
3. B 组:风险与能力研究
- B1 恶意使用与危险能力:网络攻击、恶意代码、CBRN 和危险能力阈值。
- B2 前沿自主性与模型行为风险:Scheming、情境感知、自我渗出和隐蔽行动。
- B3 欺诈、影响力与合成内容风险:欺诈、钓鱼、Deepfake、影响力操作和内容真实性方案的整体鲁棒性。
- B4 内生危害与人因风险:偏见、毒性、幻觉、不安全代码、过度依赖和脆弱人群风险。
具体水印攻击技术归 A1.7;C2PA 剥离、伪造及应用链 PoC 归 A5.7;B 组不存可复现利用。
4. C 组:红队工程与防御验证
- C1 威胁建模、分类与测试范围。
- C2 Payload、语料与测试 Harness。
- C3 Benchmark、指标与评测完整性。
- C4 AI Control 与前沿能力评估。
- C5 防护验证、检测与推理监控。
- C6 事件响应、取证与漏洞管理。
- C7 安全智能体与攻防反制。
测试集和 Benchmark 数据污染归第 2 类;Judge 和测试 Harness 被操纵归本组;模型主动 Sandbagging 归第 1 类。
5. D 组:标准、治理与参考体系
- D1 外部标准与安全框架:NIST、MITRE、OWASP、ISO、ENISA、CSA 和 CoSAI。
- D2 分类映射与 Crosswalk:外部技术编号、双向映射和覆盖缺口。
- D3 治理、合规与组织控制:法规义务、风险治理、角色责任和政策控制。
- D4 知识库、资产与研究治理:仓库分类、证据等级、资产清单和内容生命周期。
外部框架必须建立双向索引:文章记录 ATLAS 技术 ID 和 OWASP 条目,索引页也能够反查本仓库尚未覆盖的技术。
6. 二级分类定义与边界
二级分类不是标签,而是文章在一级分类内的唯一归档位置。网站在每个一级分类页按以下二级分类展示定义、边界、研究重点和文章;即使暂无内容也保留入口,用于暴露研究空白。
6.1 A1 模型本体安全
| 编码 | 二级分类 | 定义与排除边界 |
|---|---|---|
| A1.1 | 鲁棒性、Jailbreak 与对齐边界 | 模型面对对抗输入和策略绕过时的行为稳定性;第三方内容注入应用上下文归 A5.1。 |
| A1.2 | 训练与对齐过程完整性 | Reward Hacking、Alignment Faking、Sandbagging、微调去对齐和压缩退化;数据内容污染归 A2.1。 |
| A1.3 | 模型机密性与能力提取 | 模型窃取、反演、成员推断和训练记忆抽取;数据存储侧泄露归 A2。 |
| A1.4 | 权重、表征与模型编辑 | Refusal Ablation、Activation Steering 和权重编辑;分发链制品替换归 A3。 |
| A1.5 | 推理链与 CoT 安全 | 推理机理、痕迹泄露和不忠实推理;平台资源耗尽的主要影响归 A4.5。 |
| A1.6 | 安全分类器与防护模型规避 | Guard Model 和输入输出分类器的具体对抗规避;防护效果比较归 C5。 |
| A1.7 | 模型输出水印与统计溯源 | 水印移除、伪造和解码层规避;C2PA 应用链问题归 A5.7。 |
6.2 A2 数据、知识与隐私安全
| 编码 | 二级分类 | 定义与排除边界 |
|---|---|---|
| A2.1 | 训练、反馈与标注数据安全 | 预训练、微调、RLHF/RLAIF 和反馈数据的投毒、授权与完整性;训练算法失效归 A1.2。 |
| A2.2 | RAG、知识库与索引安全 | 语料、Embedding、向量库和索引的存储侧安全;检索结果成为指令归 A5.1。 |
| A2.3 | Memory 与 Context Store 安全 | 长期记忆和会话存储的写入、隔离与生命周期;读取后的应用行为归 A5.2。 |
| A2.4 | 数据隐私、推断与泄露 | 属性推断、梯度泄露、敏感数据暴露和重识别;模型资产提取归 A1.3。 |
| A2.5 | 机器遗忘与数据权利验证 | Unlearning、残留恢复和删除请求审计。 |
| A2.6 | 评测数据与基准完整性 | 基准污染、测试集泄露和训练评测交叉污染;Judge/Harness 操纵归 C3。 |
6.3 A3 AI 供应链与制品安全
| 编码 | 二级分类 | 定义与排除边界 |
|---|---|---|
| A3.1 | 模型、权重与数据制品 | 模型、Checkpoint、LoRA、Adapter 和数据集制品的来源与完整性;加载后行为归 A1。 |
| A3.2 | 框架、依赖与包生态 | 依赖混淆、Slopsquatting、恶意包和构建链;已部署服务漏洞归 A4。 |
| A3.3 | Tool、插件与 Server 分发安全 | Agent Tool、插件和 MCP Server 的安装来源;动态 Schema 变化归 A6.2。 |
| A3.4 | 仓库、格式与加载器安全 | 模型仓库、Registry、格式解析和反序列化 RCE;Registry 服务运维漏洞归 A4.2。 |
| A3.5 | 来源证明、签名与 AI-BOM | 制品签名、AIBOM/ML-BOM、可验证构建和来源证明;组织审计要求归 D。 |
| A3.6 | 第三方模型与 AI 服务供应链 | 外部模型 API、托管数据和第三方能力的上游信任;调用协议和委托归 A6。 |
6.4 A4 AI 基础设施与 MLOps 安全
| 编码 | 二级分类 | 定义与排除边界 |
|---|---|---|
| A4.1 | 训练计算与集群隔离 | GPU/NPU、Slurm、Kubernetes、Ray 和分布式训练隔离;Agent 执行沙箱归 A5.5。 |
| A4.2 | MLOps 流水线与控制平面 | Jupyter、Kubeflow、MLflow 和 Pipeline 的运行时安全;模型签名归 A3.5。 |
| A4.3 | 推理服务与模型服务器 | Serving Runtime、推理网关、批处理和部署配置;协议消息语义归 A6。 |
| A4.4 | 加速器、多租户与推理侧信道 | 显存、KV/Prefix Cache、MoE、流式和推测解码侧信道。 |
| A4.5 | 资源耗尽与经济性攻击 | Sponge Example、Reasoning Token 成本放大、配额和限流绕过。 |
| A4.6 | 云 IAM、Secret 与资源盗用 | 云密钥、服务账号、LLMjacking 和算力盗用;Agent 令牌委托归 A6.3。 |
6.5 A5 AI 应用与智能体系统安全
| 编码 | 二级分类 | 定义与排除边界 |
|---|---|---|
| A5.1 | Prompt Injection 与上下文信任边界 | 第三方网页、文档、邮件、工具结果和 RAG 内容越权成为指令;用户直接 Jailbreak 归 A1.1。 |
| A5.2 | 上下文组装、RAG 与 Memory 消费 | System Prompt、检索结果和记忆进入上下文后的泄露、优先级与跨会话行为;存储侧归 A2。 |
| A5.3 | Goal、Reasoning 与 Planning 完整性 | 目标劫持、计划污染和任务状态绕过;模型内部 CoT 归 A1.5。 |
| A5.4 | Tool Use、Agency 与审批控制 | 合法工具的越权调用、Excessive Agency 和审批绕过;工具来源归 A3.3。 |
| A5.5 | Agent Runtime、Sandbox 与 Workspace | Agent 执行代码、文件操作、工作区和宿主信任交接;训练集群隔离归 A4.1。 |
| A5.6 | Multi-Agent 编排与信任传播 | 委派、协作、Rogue Agent 和级联故障;线协议与消息身份归 A6。 |
| A5.7 | Output Rendering 与下游执行 | 日志、Markdown、浏览器、终端和下游组件解释输出时的攻击;包含 C2PA 应用链剥离。 |
| A5.8 | 浏览器与 Computer Use Agent | 视觉提示注入、DOM 注入、Agent Clickjacking 和界面确认绕过。 |
| A5.9 | 可观测性、行为归因与审计链 | Agent 动作记录、归因、审计日志和产品内证据链;跨系统响应方法归 C6。 |
6.6 A6 协议、身份与集成安全
| 编码 | 二级分类 | 定义与排除边界 |
|---|---|---|
| A6.1 | API、传输与流式协议 | Agent/模型 API、SSE、WebSocket、Webhook 和消息分帧;服务部署运维归 A4.3。 |
| A6.2 | MCP、能力发现与动态 Schema | MCP、Tool Schema、动态注册和 Schema Rug Pull;Server 来源归 A3.3。 |
| A6.3 | 身份、认证与授权委托 | Agent 身份、OAuth、Token、工作负载身份和 Confused Deputy;云 IAM 归 A4.6。 |
| A6.4 | 会话、消息与状态完整性 | 消息签名、重放、会话绑定、加密载荷和任务状态;应用规划状态归 A5.3。 |
| A6.5 | 互操作、版本协商与降级 | 多厂商兼容、版本迁移、能力协商和降级语义;供应商整体风险归 A3.6。 |
6.7 B、C、D 组
| 编码 | 二级分类 | 定义与排除边界 |
|---|---|---|
| B1 | 恶意使用与危险能力 | 网络攻击、恶意代码、CBRN 等能力评估;具体可复现利用归 A。 |
| B2 | 前沿自主性与模型行为风险 | Scheming、自我渗出和隐蔽行动的风险结论;控制评估方法归 C4。 |
| B3 | 欺诈、影响力与合成内容风险 | 欺诈、Deepfake、影响力操作和内容真实性整体鲁棒性;具体技术攻击归 A。 |
| B4 | 内生危害与人因风险 | 偏见、毒性、幻觉、不安全输出、依赖和脆弱人群风险。 |
| C1 | 威胁建模、分类与测试范围 | 资产、对手、信任边界、技术分类和授权范围;具体产品漏洞归 A。 |
| C2 | Payload、语料与测试 Harness | 通用攻击语料、自动化红队、Fuzzing 和 Harness;发现的漏洞归 A。 |
| C3 | Benchmark、指标与评测完整性 | ASR、覆盖率、复现性、Judge 和评分器;评测数据污染归 A2.6。 |
| C4 | AI Control 与前沿能力评估 | 不可信模型控制评估和能力阈值工程;危险能力结论归 B。 |
| C5 | 防护验证、检测与推理监控 | Guardrail、检测器、运行时策略和 CoT 可监控性;具体防护模型漏洞归 A1.6。 |
| C6 | 事件响应、取证与漏洞管理 | 调查、证据保全、披露、修复验证和漏洞生命周期。 |
| C7 | 安全智能体与攻防反制 | Pentest/SOC/IR Agent 的方法、市场和评估;具体 Agent 漏洞归 A。 |
| D1 | 外部标准与安全框架 | 标准和原始框架要求,不作为技术漏洞主键。 |
| D2 | 分类映射与 Crosswalk | 本仓库与外部框架的双向映射和覆盖缺口。 |
| D3 | 治理、合规与组织控制 | 法规义务、责任分配、政策控制和组织监督。 |
| D4 | 知识库、资产与研究治理 | 仓库分类、证据等级、资产清单和内容生命周期。 |
7. 唯一归档判据
依次使用以下判据,不跳级:
- 首个失效的安全控制或信任边界。
- 多个控制同时缺失时,判断主要由谁修复。
- 仍无法区分时,以文章的主要研究问题和可验证结论为准。
- 横跨多个攻击面的内容按制品类型归档:红队方法、评测与防御验证归 C 组,标准、Crosswalk 与治理参考归 D 组;不把同一文章复制到多个目录。
典型判例:
| 场景 | 主分类 |
|---|---|
| 非授权修改 RAG 索引 | 2. 数据、知识与隐私 |
| 正常网页内容被 Agent 当作指令 | 5. AI 应用与智能体 |
| 恶意 MCP Server 的分发与签名 | 3. AI 供应链与制品 |
| MCP Tool 审批后 Schema 变化 | 6. 协议、身份与集成 |
| Agent 对合法 Tool 的越权使用 | 5. AI 应用与智能体 |
| MLflow 模型签名缺陷 | 3. AI 供应链与制品 |
| MLflow Server RCE | 4. AI 基础设施与 MLOps |
| 恶意提示造成 Reasoning Token 爆炸 | 4. AI 基础设施与 MLOps |
| Agent 输出污染日志或审计记录 | 5. AI 应用与智能体 |
8. 正交元数据
每篇新内容建议使用以下 Frontmatter:
yaml
---
title: 文章标题
date: 2026-07-30
updated: 2026-07-31
primary_domain: agent
subdomain: agent-runtime-sandbox
content_type: research-note
lifecycle: [deployment, runtime]
attacker_position: [third-party-content]
trust_boundaries: [content-to-instruction, sandbox-to-host]
impacts: [confidentiality, integrity]
modalities: [text, code]
access_level: black-box
atlas_ids: [AML.T0051]
owasp_ids: [ASI01:2026]
evidence: strong
disclosure_status: public
last_verified: 2026-07-30
verified_targets: [product@version]
affected_targets: [vendor/product@version]
status: maintained
---已有笔记没有 Frontmatter 时,网站从路径、一级标题和正文日期推导基础元数据;新内容应优先显式填写。