外观
提示词注入研究:分类框架
摘要
Prompt Injection 不能用单一标签完整描述。本框架以投递向量、操纵手法和攻击目标三个正交维度组织技术与测试材料,使同一案例能够表达“恶意内容如何进入上下文、如何影响模型、最终劫持了什么能力”,同时保持与 Jailbreak 和具体 Agent 漏洞的清晰边界。
方法的独特价值
公开来源基础是 CrowdStrike 将“投递向量”和“操纵手法”分开的双轴分类。本站方法贡献是在核对 garak、Augustus、InjecAgent 和 AgentDojo 后增加“攻击目标或目标能力面”轴,使案例能够同时回答内容如何进入、如何操纵模型以及最终滥用了什么能力。该补充轴是本站归纳,不是 CrowdStrike 原框架的一部分。
适用范围
本框架用于组织提示词注入论文、Payload 和测试工具,不替代网站按“最先失效的安全控制”建立的主分类。它可以为一个案例附加多个正交标签,但不能据此新建重叠栏目。越狱、安全 Agent 反制和具体 Agent 漏洞仍按各自研究对象归档,只通过交叉链接共享攻击手法标签。
方法与实施流程
采用的基线框架
以 crowdstrike-prompt-injection-taxonomy.md 的两轴模型为基线,因为它是目前看到的覆盖面最全、且明确把"投递向量"和"操纵手法"分开的公开分类法:
- 轴一:投递向量(Injection Methods)——载荷怎么进入模型的上下文。三大类:Direct(攻击者本人提交)/ Indirect via User-Prompt(经无辜用户转发)/ Indirect via Context-Data(经 RAG、工具输出、agent 记忆等上下文数据)。
- 轴二:操纵手法(Attacker Prompting Techniques)——载荷进入后怎么让模型偏离预期行为。五大类:Overt(显式指令)/ Instruction Reformulation(不改语义只变形式,绕过过滤)/ Prompt Boundary Mimicry(伪造提示边界)/ Integrative Instruction Prompting(借助上下文外信息,含多轮渐进)/ Multimodal Prompting Attacks(非文本载体)。
两轴正交:同一个具体攻击案例应该能同时标注"它怎么送进来"和"它用什么手法",而不是只归一类。
补充轴:攻击目标与目标能力面
来自 payload-corpus-taxonomy-mapping.md 核对 garak、augustus 两个扫描工具的 probe 分类时发现:这两个工具相当一部分 probe 类目(Malware & Malicious Code、Data Leakage & Memorization、Toxicity & Harmful Content、Agent & Tool-Use Attacks 如 Tool Coercion / Multi-Agent / RAG Poisoning)是按"攻击者想拿到什么/滥用哪个能力面"分类,和上面两轴正交,CrowdStrike 的图完全没覆盖这一维(范围选择使然,不是缺陷)。
给 agent/tool 类攻击打标签时,"操纵手法"轴经常不够用——同一个 probe 的手法可能只是常规的 Cognitive Control Bypass,但它的研究价值在于"劫持了工具选择环节"这个目标/能力面,两者要分开标注,不要为了凑手法分类而丢掉目标/能力面这个信息。
新来源映射流程
- 新论文/报告读完后,先判断它的分类法和上面两轴是同构(只是换了名字)还是引入了新维度。同构的话在对应笔记里注明"等价于 CrowdStrike 的 XX",不要重新发明术语。
- 引入新维度的(比如按"攻击目标"——窃密 / 越权 / 拒绝服务分类,或按"防御可绕过层级"分类),作为框架的补充轴记录在本文件,不要塞进上面两轴硬凑。
- 每个具体技巧尽量记录:定义、一个来源给出的示例、已知的对应防御手段(如果来源提到)、以及是否有独立学术论文命名了同一手法(避免以讹传讹,把某个厂商命名当成手法的原创出处)。
质量控制
- llm-jailbreak/:越狱主要研究"绕过模型自身的安全对齐训练",提示词注入研究"利用不可信内容劫持模型的指令遵循"——两者手法高度重叠(CrowdStrike 的 Overt Approaches 本质就包含经典越狱手法如 DAN),但关注点不同。判断标准:如果笔记的重点是"模型本不该说但被说服说了",放 llm-jailbreak;如果重点是"模型正确执行了指令,但指令来自不可信内容而非用户",放这里。有些案例两边都沾边,可以在两处互相链接而不必强行归一。
- pentest-agent-countermeasure/:那边关注的是提示词注入在"安全 Agent"这个特定场景下的应用(SOC 研判、渗透测试 agent 反制)和对应的防护成熟度分级(L0-L5)。本目录是提示词注入本身的通用技巧分类,两者是"手法库" vs "特定场景下手法+防护的应用"的关系,靠交叉链接维持一致。
局限与待验证问题
当前投递向量和操纵手法主要依赖一个高密度厂商分类,目标能力轴则是对数个工具和基准的综合归纳,尚未形成经过广泛同行采用的标准。后续需要验证不同标注者的一致性,并检查三个轴是否足以覆盖新型多模态和多 Agent 案例。
只有当同一操纵手法大类积累了 3 篇以上独立来源、单文件明显臃肿时,才考虑拆成独立笔记;拆分仍须遵守仓库分类治理规则,不预建空分类。