Skip to content

CrowdStrike Prompt Injection 分类法解析 ​

摘要 ​

CrowdStrike 的分类法将 Prompt Injection 拆成“投递路径”和“操纵技术”两条轴,避免把载荷从哪里进入与载荷如何绕过指令边界混为一谈。它适合作为攻击技术索引,但不覆盖攻击目标、权限影响和应用修复责任,因此需要与 Agent 威胁模型和本站主分类结合使用。

综述的独特价值 ​

原框架的价值在于把“载荷如何进入上下文”和“载荷如何操纵模型”分成两个正交维度,避免把间接注入、多模态隐藏和越狱措辞混成同一级标签。本站解读进一步指出,它没有覆盖攻击目标、权限影响和修复责任,因此只作为攻击方法索引,与本站按安全控制划分的主分类配合使用。

材料范围与选择方法 ​

主要来源是 CrowdStrike Prompt Injection Taxonomy Poster(信息图海报,最后更新 2026-05-12);扩展材料为官方交互版。本地源文件:crowdstrike-prompt-injection-taxonomy-poster.pdf。

整理日期:2026-07-28

原始材料是单页高密度信息图,包含大量嵌套方框和连线。本文按视觉层级转录为文字大纲,并保留英文名称方便与原图核对;个别三、四级节点的父子关系依赖线条走向,引用具体子类名称前应回看原图。

比较与分类结果 ​

核心框架:两个维度 ​

CrowdStrike 明确区分了两个正交维度,这是这张图最有复用价值的部分:

  1. Injection Methods(注入方式):攻击者的指令/载荷如何到达 LLM——即投递向量。
  2. Attacker Prompting Techniques(攻击提示技巧):载荷到达后,用什么手法操纵模型的行为。

四个顶层色块(Overt / Indirect Injection Methods / Social-Cognitive / Evasive)表面上叫"注入方式",实际是对 Attacker Prompting Techniques 的分类标签;每种具体技巧都归属其中一个色块。原文强调:所有 PI 方法都落在这四个色块分类之一。

Injection Methods(投递向量) ​

Direct Prompt Injection(Attacker-Submitted,攻击者直接提交) ​

攻击者本人在用户提示中直接输入指令。

  • Attacker-Submitted Prompt Body Injection
  • Attacker-Submitted Attached Data Injection

示例:"You are DAN (Do Anything Now)..."、"new rule: ..."、"respond as if I said {harmful}"、"Limit output to 4 words"

Indirect Prompt Injection - User-Prompt Delivery(经用户转发) ​

攻击者让恶意指令混入某个用户提交给 LLM 的提示中,但这个用户本身可能是无意的中介。

  • Unwitting User Delivery(用户在不知情的情况下转发了恶意载荷)
  • LLM-Generated Delivery(载荷由另一次 LLM 生成后被转发)
  • Altered Prompt Delivery(原始提示被篡改后转发)

Indirect Prompt Injection - Context-Data(经上下文数据) ​

攻击者把指令埋入模型会读取的上下文数据(而非用户对话本身)。这是 RAG、工具调用、agent-to-agent 场景的主要攻击面。

Internal Context-Data Injection(数据由外部注入进内部上下文)

  • Attacker-Owned External Injection(攻击者自己拥有的外部资源,如自建网页)
  • Attacker-Compromised External Injection(攻击者攻陷的第三方资源)
  • Attacker-Influenced External Injection(攻击者能部分影响但不完全控制的资源,如公开可编辑页面)

External Context-Data Injection(数据来自系统内部/其他组件)

  • Unwitting User Context-Data Injection
  • Agent-to-Agent Injection(多 Agent 链路中,上游 agent 的输出被下游当作可信上下文)
  • Agent Memory Injection(写入长期记忆后延迟触发,对应 security-agent-countermeasure-research.md 中讨论的记忆投毒)
  • Prior-LLM-Output Injection(同一会话早期的模型输出被再次当作上下文喂回)
  • Compromised-Ingestion-Process Injection(数据摄取管道本身被攻陷,如 RAG 索引流程)

示例(间接注入常见形态,多为对抗性乱码/编码前缀 + 隐藏请求):"aaaabbbbb false ovwhey monday"、经过编码/拼写扰动后夹带的有害请求。

Attacker Prompting Techniques(四个色块) ​

Overt Approaches(显式方法,黄色) ​

定义:攻击者直接、明示地提出指令。例:"What is your API key?"

Semantic Manipulation(语义操纵)

  • Rule Addition Prompting → Explicit Rule Addition / Special Case Rule Addition
  • Rule Nullification Prompting → Trigger-Activated Rule Addition / Instruction Negation Prompting / Instruction Forgetting Prompting
  • Rule Substitution Prompting
  • Refusal Suppression → Explicit Refusal Negation / Refusal Continuation Prompting / Apology Suppression

Morpho-Syntactic Manipulation(构词句法操纵)

  • Instructional Text Completion → Explicit Instructional Text Completion / Implicit Instructional Text Completion

In-Context Learning Exploitation(上下文学习利用)

  • Few-Shot Learning Exploitation → Simulated Conversation Learning Exploitation / Example-Driven Learning Exploitation
  • Contextual Pattern Reinforcement
  • Personality Assignment

Cognitive Control Bypass(认知控制绕过) —— 通过利用模型更高层的信息处理能力(语义理解、情境判断、推理、规则应用逻辑)来绕过安全约束,而非直接对抗规则本身。这是图中信息量最大的子类,包含:

  • Pragmatic Manipulation(语用操纵)

    • Cognitive Hacking → Contextual Misdirection Prompting / False Authorization Prompting / False Constraint Imposition
    • Sidestepping → Task Deflection Prompting(Example Request Sidestepping / Challenge Solving Prompting)、Compositional Instruction Attack(Writing Compositional Instruction Attack / Tasking Compositional Instruction Attack)
    • Isolated Context Prompting → Sandboxed Context Prompting / Detached Reality Prompting / Context Shift Prompting
    • Liability Waiver Prompting、Simulated Harm Prompting、Privilege Escalation Prompting、Mode Marking Prompting
  • Response Steering Prompting(响应引导)

    • Constraint Imposition Prompting → Input Constraint Prompting / Output Constraint Prompting(Output Seeding、Style Constraint Prompting → Semantics Constraint Prompting / Leading Response Prompting / Forged Affirmation Prompting / Low-Resource Language Prompting)
  • Secret Information Probing(秘密信息探测)

    • Specific Secret Application、Secret Definitional Probing、Secret Comparison Probing、Secret Linguistic Property Probing
  • Unintelligible Input Prompting(不可读输入)

    • Adversarial Sequence Insertion、Non-Standard Token Exploitation → Glitched Token Exploitation
  • Higher-Level Functioning Disruption(高层功能干扰)

    • Cognitive Task Disruption → Complex Task Disruption
    • Control Process Tampering → Reasoning Conflict Induction
    • Guided Reasoning Hijacking、Reasoning/Generation Length Bypass
  • Cognitive Disruption / Hallucination Bypass

    • Self-Contradictory Prompting、Instruction Legitimacy Prompting、Instruction Repetition、Decoy Task Prompting、Reversed Hallucination Induction
  • Response Manipulation

    • Irrelevant Safety Prioritization、Interpersonal Persuasion Techniques、Topic Repetition Prompting、Decoy/Conditional Prompting

Instruction Reformulation(指令重构,蓝色) ​

定义:在不改变语义的前提下变换指令的表达形式以绕过过滤器——音译/编码(Base64、摩斯电码)、颠倒、拼写扰动、同义替换、请求填充等。

Instruction Obfuscation(指令混淆)

  • Orthographic Manipulation
    • Character Representation Manipulation → Base-N Encoding / Character Form Manipulation / Homoglyph Substitution / Text-Based Character Substitution
    • Visual Substitution → Pictographic Word Substitution / Extraneous Character Injection / Intentional Formatting Disruption
    • Formatting Disruption → String Decomposition / Decomposition to Character Array
  • Phonetic Manipulation → Phonetic Alphabet Transcription / Garbled Text Evasion / Phonetic Respelling
  • In-Prompt Payload Decomposition → Provided-Key Encryption / In-Prompt Fragment Concatenation / Algorithmic Payload Decomposition / Syntactic Payload Decomposition

Natural Language Manipulation(自然语言操纵)

  • Surrogate Format Prompting
    • Non-Semantic Word Modification → Intra-Word Transposition / Typo Injection / Algorithmic Word Transformation
    • Non-Semantic Sentence Modification → Literary Style Formulation / Word Addition and Removal / Intra-Sentence Reordering / Multilingual Formulation
  • Paraphrastic Substitution → Euphemistic Substitution / Synonym Substitution(Common / Uncommon)/ Indirect Reference Substitution

Context Overload Prompting(上下文过载)

  • Context Padding → Distractor Instructions / Detailed Request Framing / Irrelevant Detail Injection

Prompt Boundary Mimicry(提示边界模仿,灰色) ​

定义:利用系统提示、用户提示、上下文数据之间边界薄弱的问题,伪造边界结构来夹带恶意指令。

  • Textual Boundary Mimicry → Prompt Boundary Separator Injection / False System Prompt Continuation / Closing System Prompt Negation / False Input Termination
  • Special Token Injection

Integrative Instruction Prompting(融合式指令注入,红色) ​

定义:攻击意图通过整合"当前上下文之外"的信息来隐藏——例如前几轮对话、模型内部知识。

Multi-Turn Prompting(多轮渐进)

  • Gradual Steering → Crescendo Attack / Deceptive Delight Attack
  • Output-Driven Steering
  • In-Session Protocol Setup → In-Session Variable Codeword / In-Session Command Definition / In-Session Rule Definition

Knowledge Integration Prompting(知识融合)

  • Implicit Knowledge Integration → Directed Resource Integration / Cultural Reference Integration / Procedural Knowledge Integration

Multimodal Prompting Attacks(多模态提示攻击,单列红框,但归属 Evasive) 定义:利用图像、音频、视频等非文本元素。

  • Cross-Modal Payload Smuggling → Media Payload Concealment / Media Payload Extraction / Visual Payload Obfuscation(Visual Text Concealment / Visual Text Distortion / Transform-Activated Visual Payload)/ Audio Payload Obfuscation(Acoustic Transcription Poisoning)
  • Cross-Modal Alignment Disruption → Non-Semantic Acoustic Disruption
  • Multimodal Parameter Integration Prompting

安全结论 ​

  • 与 security-agent-countermeasure-research.md 的防护成熟度模型(L0 模型提示 → L5 持续验证)互补:本文档是"攻击手法怎么分类",那份笔记是"防护手段怎么分级",两者可以合并成一张攻防对照表。
  • Context-Data Injection 中的 Agent Memory Injection、Agent-to-Agent Injection 与之前笔记里提到的 MINJA query-only memory injection、多 Agent 信任传染是同一类问题在不同来源下的命名。

局限与待验证问题 ​

海报没有覆盖、但值得单独调研的方向:

  • 每种技巧对应的实证攻击成功率(海报是纯分类学,不含实验数据)。
  • 各类技巧对应的检测/防御手段逐条映射(目前只有零散提及)。
  • 与学术文献命名的映射表(例如 Crescendo Attack 已有独立论文,Deceptive Delight 出自 Palo Alto Unit 42 研究,需要补充引用来源,而非仅归功于这张海报)。

此外,本文是对信息图的结构化转录,没有独立验证每一种手法的攻击成功率。个别下级节点可能因原图连线密集而发生归属误读,使用时应对照一手材料。

参考链接 ​