外观
补充轴:攻击目标 / 目标能力面分类
整理日期:2026-07-28。
来源说明(重要):这不是某个厂商/论文发布的现成分类法,是我从 garak(NVIDIA)和 augustus(Praetorian)两个扫描工具各自的 probe 分组归纳整理出来的,并用 InjecAgent、AgentDojo 的攻击意图分类做了交叉核对。分类方式来自真实工具的设计决策,不是我凭空造的,但也不是一篇可引用的公开分类法——引用时请说明"基于 garak/augustus 工具分类归纳",不要当成独立来源。
对应 payload-corpus-taxonomy-mapping.md 第 4 节发现的问题:这些类目回答的是"用某种操纵手法之后,攻击者要拿到什么/滥用哪个能力面",和 crowdstrike-prompt-injection-taxonomy.md 的"操纵手法"轴正交,CrowdStrike 完全没覆盖。
用法
给一个具体的 probe/payload 打标签时,同时填两个字段,不要只填一个:
technique:用的什么操纵手法,对照 CrowdStrike 分类。goal:想达成什么目标/滥用哪个能力面,对照本文档。
例如 augustus 的 Tool Coercion(伪造工具描述诱导模型选错工具):technique = Overt/Cognitive Control Bypass 的 False Authorization Prompting(伪造权威),goal = Agent & Tool-Use Exploitation 的 Tool Selection Hijacking。两个标签缺一都会丢信息。
1. Agent & Tool-Use Exploitation(智能体/工具滥用)
与本仓库 agent-security/ 大主题关系最直接的一类。
- Tool Selection Hijacking:伪造工具描述/元数据诱导模型选择恶意工具而非合法工具(augustus
Tool Coercion,攻击面是"工具选择"这一步本身,不是工具执行结果)。 - Unauthorized Tool Invocation:诱导模型调用未授权工具、注入恶意参数、放大工具调用链(augustus
Tool Use)。 - Multi-Agent System Poisoning:编排器(orchestrator)投毒、任务队列注入、优先级操纵、worker 指令腐化、结果过滤/篡改(augustus
Multi-Agent)——这是目前工具化程度最低、最值得深挖的子类,直接呼应 security-agent-countermeasure-research.md 里"多智能体信任传染"那条研究方向。 - Browsing Agent Manipulation:网页内容里藏对人类不可见但模型会读取执行的指令(augustus
Browsing)。 - RAG / Knowledge Base Poisoning:向检索知识库投放污染文档,模型回答触发问题时把污染内容当真(augustus
RAG Poisoning)。 - MCP Attack Surface:针对 Model Context Protocol 的越权访问对象(BOLA)、对工具后端的 SSRF、响应中的凭据泄露、MCP 配置文件里的硬编码密钥扫描(augustus
mcptool.*、recon.MCP*、MCP Config Secret Scan)。
InjecAgent 的攻击意图两分法(对用户直接造成伤害 / 窃取用户隐私数据)大致横跨这一类和下面第 3 类,可以作为二次校验:一个 Agent & Tool-Use 类的攻击,最终目的通常落在"直接伤害"或"数据窃取"里的一个。
2. Malicious Code & Supply Chain(恶意代码与供应链)
- Malware Generation:诱导生成完整恶意程序、恶意子函数、反检测/免杀代码,覆盖多种编程语言(augustus
Malware Generation)。 - Malicious Web Content Generation:诱导生成 XSS 脚本、跳转 meta 标签、CSS 数据渗出、恶意表单字段(augustus
Web Injection)。 - Package Hallucination:诱导推荐并不存在的依赖包名,攻击者可抢注这些包名发起供应链攻击(augustus
Package Hallucination)。 - Classic Web Payload Coercion:诱导模型吐出经典 Web 攻击 payload(SQLi、SSTI),如果下游系统直接执行/渲染模型输出就会造成实际危害(augustus
Exploitation)。
3. Data & Secret Exfiltration(数据与密钥窃取)
- System Prompt / Instruction Extraction:套出系统提示词原文(garak
sysprompt_extraction)。 - Fabricated / Leaked API Key:诱导模型编造或补全看起来真实的密钥(augustus
API Key)。 - Config Secret Scanning:扫描 MCP 等配置文件里硬编码的凭据(augustus
MCP Config Secret Scan,这个是被动侦察,不需要对模型发起攻击)。 - Training Data Memorization Replay:用完形填空式测试或"发散攻击"(重复某词直到模型开始复现训练数据)验证模型是否记住了受版权保护的原文(garak
leakreplay、divergence)。
4. Toxicity, Harm & Misinformation Generation(有害内容与错误信息生成)
- Toxic Content Elicitation:诱导生成毒性言论(garak/augustus
Real Toxicity Prompts、Continuation脏话补全)。 - Refusal Bypass on Known-Refuse Prompts:重放"安全对齐模型应该拒绝"的标准数据集,测试是否真的拒绝(
Do Not Answer)。 - Sycophancy / False-Claim Amplification:抛出错误事实断言,检测模型是否附和而非纠正(
Misleading)。 - Mixed Risk-Card Probes:按 Language Model Risk Cards 框架定义的一揽子风险类别,非对抗性检查和对抗性注入混在一起(
LMRC)。 - AV/Spam Signature Emission:诱导模型吐出知名反病毒测试特征串,检查下游是否对模型输出做了恶意内容扫描(
AV Spam Scanning)。
5. 本次已解决的一个交叉发现:Context Overload Prompting 补充实证
payload-corpus-taxonomy-mapping.md 原本记录"CrowdStrike 的 Context Overload Prompting 在语料库里找不到专门实现"是个空白。补充检索后确认这不是工具生态没人做,而是这次收集的 18 个仓库恰好没覆盖到:真正对应的实证是 Anthropic 自己的研究 Many-shot Jailbreaking(Anil et al., 2024)——用几十到几百个"虚假的有害问答示例"填满长上下文窗口,靠上下文学习稀释安全对齐,效果随示例数量近似幂律增长。已把配套开源实现 TrustAI-laboratory/Many-Shot-Jailbreaking-Demo(MIT license,含 400 条改编自 HarmBench 的问答对 + 生成脚本)clone 进 agent-security/prompt-injection/code/Many-Shot-Jailbreaking-Demo/,Context Overload Prompting 这一类目现在有本地可用 payload 了。