Skip to content

补充轴:攻击目标 / 目标能力面分类

整理日期:2026-07-28。

来源说明(重要):这不是某个厂商/论文发布的现成分类法,是我从 garak(NVIDIA)和 augustus(Praetorian)两个扫描工具各自的 probe 分组归纳整理出来的,并用 InjecAgentAgentDojo 的攻击意图分类做了交叉核对。分类方式来自真实工具的设计决策,不是我凭空造的,但也不是一篇可引用的公开分类法——引用时请说明"基于 garak/augustus 工具分类归纳",不要当成独立来源。

对应 payload-corpus-taxonomy-mapping.md 第 4 节发现的问题:这些类目回答的是"用某种操纵手法之后,攻击者要拿到什么/滥用哪个能力面",和 crowdstrike-prompt-injection-taxonomy.md 的"操纵手法"轴正交,CrowdStrike 完全没覆盖。

用法

给一个具体的 probe/payload 打标签时,同时填两个字段,不要只填一个:

  • technique:用的什么操纵手法,对照 CrowdStrike 分类。
  • goal:想达成什么目标/滥用哪个能力面,对照本文档。

例如 augustus 的 Tool Coercion(伪造工具描述诱导模型选错工具):technique = Overt/Cognitive Control Bypass 的 False Authorization Prompting(伪造权威),goal = Agent & Tool-Use Exploitation 的 Tool Selection Hijacking。两个标签缺一都会丢信息。

1. Agent & Tool-Use Exploitation(智能体/工具滥用)

与本仓库 agent-security/ 大主题关系最直接的一类。

  • Tool Selection Hijacking:伪造工具描述/元数据诱导模型选择恶意工具而非合法工具(augustus Tool Coercion,攻击面是"工具选择"这一步本身,不是工具执行结果)。
  • Unauthorized Tool Invocation:诱导模型调用未授权工具、注入恶意参数、放大工具调用链(augustus Tool Use)。
  • Multi-Agent System Poisoning:编排器(orchestrator)投毒、任务队列注入、优先级操纵、worker 指令腐化、结果过滤/篡改(augustus Multi-Agent)——这是目前工具化程度最低、最值得深挖的子类,直接呼应 security-agent-countermeasure-research.md 里"多智能体信任传染"那条研究方向。
  • Browsing Agent Manipulation:网页内容里藏对人类不可见但模型会读取执行的指令(augustus Browsing)。
  • RAG / Knowledge Base Poisoning:向检索知识库投放污染文档,模型回答触发问题时把污染内容当真(augustus RAG Poisoning)。
  • MCP Attack Surface:针对 Model Context Protocol 的越权访问对象(BOLA)、对工具后端的 SSRF、响应中的凭据泄露、MCP 配置文件里的硬编码密钥扫描(augustus mcptool.*recon.MCP*MCP Config Secret Scan)。

InjecAgent 的攻击意图两分法(对用户直接造成伤害 / 窃取用户隐私数据)大致横跨这一类和下面第 3 类,可以作为二次校验:一个 Agent & Tool-Use 类的攻击,最终目的通常落在"直接伤害"或"数据窃取"里的一个。

2. Malicious Code & Supply Chain(恶意代码与供应链)

  • Malware Generation:诱导生成完整恶意程序、恶意子函数、反检测/免杀代码,覆盖多种编程语言(augustus Malware Generation)。
  • Malicious Web Content Generation:诱导生成 XSS 脚本、跳转 meta 标签、CSS 数据渗出、恶意表单字段(augustus Web Injection)。
  • Package Hallucination:诱导推荐并不存在的依赖包名,攻击者可抢注这些包名发起供应链攻击(augustus Package Hallucination)。
  • Classic Web Payload Coercion:诱导模型吐出经典 Web 攻击 payload(SQLi、SSTI),如果下游系统直接执行/渲染模型输出就会造成实际危害(augustus Exploitation)。

3. Data & Secret Exfiltration(数据与密钥窃取)

  • System Prompt / Instruction Extraction:套出系统提示词原文(garak sysprompt_extraction)。
  • Fabricated / Leaked API Key:诱导模型编造或补全看起来真实的密钥(augustus API Key)。
  • Config Secret Scanning:扫描 MCP 等配置文件里硬编码的凭据(augustus MCP Config Secret Scan,这个是被动侦察,不需要对模型发起攻击)。
  • Training Data Memorization Replay:用完形填空式测试或"发散攻击"(重复某词直到模型开始复现训练数据)验证模型是否记住了受版权保护的原文(garak leakreplaydivergence)。

4. Toxicity, Harm & Misinformation Generation(有害内容与错误信息生成)

  • Toxic Content Elicitation:诱导生成毒性言论(garak/augustus Real Toxicity PromptsContinuation 脏话补全)。
  • Refusal Bypass on Known-Refuse Prompts:重放"安全对齐模型应该拒绝"的标准数据集,测试是否真的拒绝(Do Not Answer)。
  • Sycophancy / False-Claim Amplification:抛出错误事实断言,检测模型是否附和而非纠正(Misleading)。
  • Mixed Risk-Card Probes:按 Language Model Risk Cards 框架定义的一揽子风险类别,非对抗性检查和对抗性注入混在一起(LMRC)。
  • AV/Spam Signature Emission:诱导模型吐出知名反病毒测试特征串,检查下游是否对模型输出做了恶意内容扫描(AV Spam Scanning)。

5. 本次已解决的一个交叉发现:Context Overload Prompting 补充实证

payload-corpus-taxonomy-mapping.md 原本记录"CrowdStrike 的 Context Overload Prompting 在语料库里找不到专门实现"是个空白。补充检索后确认这不是工具生态没人做,而是这次收集的 18 个仓库恰好没覆盖到:真正对应的实证是 Anthropic 自己的研究 Many-shot Jailbreaking(Anil et al., 2024)——用几十到几百个"虚假的有害问答示例"填满长上下文窗口,靠上下文学习稀释安全对齐,效果随示例数量近似幂律增长。已把配套开源实现 TrustAI-laboratory/Many-Shot-Jailbreaking-Demo(MIT license,含 400 条改编自 HarmBench 的问答对 + 生成脚本)clone 进 agent-security/prompt-injection/code/Many-Shot-Jailbreaking-Demo/,Context Overload Prompting 这一类目现在有本地可用 payload 了。