Skip to content

提示词注入研究:分类框架

维护该子目录用的组织方式,供后续新增论文/笔记时对齐分类,避免每篇笔记各用一套命名。

采用的基线框架

crowdstrike-prompt-injection-taxonomy.md 的两轴模型为基线,因为它是目前看到的覆盖面最全、且明确把"投递向量"和"操纵手法"分开的公开分类法:

  • 轴一:投递向量(Injection Methods)——载荷怎么进入模型的上下文。三大类:Direct(攻击者本人提交)/ Indirect via User-Prompt(经无辜用户转发)/ Indirect via Context-Data(经 RAG、工具输出、agent 记忆等上下文数据)。
  • 轴二:操纵手法(Attacker Prompting Techniques)——载荷进入后怎么让模型偏离预期行为。五大类:Overt(显式指令)/ Instruction Reformulation(不改语义只变形式,绕过过滤)/ Prompt Boundary Mimicry(伪造提示边界)/ Integrative Instruction Prompting(借助上下文外信息,含多轮渐进)/ Multimodal Prompting Attacks(非文本载体)。

两轴正交:同一个具体攻击案例应该能同时标注"它怎么送进来"和"它用什么手法",而不是只归一类。

补充轴:攻击目标 / 目标能力面(Goal / Target-Capability)

来自 payload-corpus-taxonomy-mapping.md 核对 garakaugustus 两个扫描工具的 probe 分类时发现:这两个工具相当一部分 probe 类目(Malware & Malicious Code、Data Leakage & Memorization、Toxicity & Harmful Content、Agent & Tool-Use Attacks 如 Tool Coercion / Multi-Agent / RAG Poisoning)是按"攻击者想拿到什么/滥用哪个能力面"分类,和上面两轴正交,CrowdStrike 的图完全没覆盖这一维(范围选择使然,不是缺陷)。

给 agent/tool 类攻击打标签时,"操纵手法"轴经常不够用——同一个 probe 的手法可能只是常规的 Cognitive Control Bypass,但它的研究价值在于"劫持了工具选择环节"这个目标/能力面,两者要分开标注,不要为了凑手法分类而丢掉目标/能力面这个信息。

后续新增来源时怎么用这个框架

  1. 新论文/报告读完后,先判断它的分类法和上面两轴是同构(只是换了名字)还是引入了新维度。同构的话在对应笔记里注明"等价于 CrowdStrike 的 XX",不要重新发明术语。
  2. 引入新维度的(比如按"攻击目标"——窃密 / 越权 / 拒绝服务分类,或按"防御可绕过层级"分类),作为框架的补充轴记录在本文件,不要塞进上面两轴硬凑。
  3. 每个具体技巧尽量记录:定义、一个来源给出的示例、已知的对应防御手段(如果来源提到)、以及是否有独立学术论文命名了同一手法(避免以讹传讹,把某个厂商命名当成手法的原创出处)。

与仓库其他部分的边界

  • llm-jailbreak/:越狱主要研究"绕过模型自身的安全对齐训练",提示词注入研究"利用不可信内容劫持模型的指令遵循"——两者手法高度重叠(CrowdStrike 的 Overt Approaches 本质就包含经典越狱手法如 DAN),但关注点不同。判断标准:如果笔记的重点是"模型本不该说但被说服说了",放 llm-jailbreak;如果重点是"模型正确执行了指令,但指令来自不可信内容而非用户",放这里。有些案例两边都沾边,可以在两处互相链接而不必强行归一。
  • pentest-agent-countermeasure/:那边关注的是提示词注入在"安全智能体"这个特定场景下的应用(SOC 研判、渗透测试 agent 反制)和对应的防护成熟度分级(L0-L5)。本目录是提示词注入本身的通用技巧分类,两者是"手法库" vs "特定场景下手法+防护的应用"的关系,靠交叉链接维持一致。

扩容计划(暂不预先拆分,达到阈值再拆)

目前只有一个来源,crowdstrike-prompt-injection-taxonomy.md 单文件够用。当同一操纵手法大类(如 Instruction Reformulation)积累了 3 篇以上独立来源、单文件明显臃肿时,再按大类拆成独立笔记(如 obfuscation-techniques.mdmultimodal-attacks.mddefenses.md),并在本文件更新索引。不要提前拆。