Skip to content

Payload 语料库(按操纵手法分类,二次整理版) ​

整理日期:2026-07-28。

这是什么 ​

这不是对 ../code/ 下 19 个开源仓库的简单复制。这是基于那些仓库里的真实 payload、探针(probe)说明、以及可生成 payload 的算法(如 GCG),提炼出通用攻击模板,按 crowdstrike-prompt-injection-taxonomy.md 的操纵手法分类重新组织的结果。

  • 每个模板都做了泛化处理:把源材料里针对具体有害请求写死的例子,换成 {TASK} 占位符——这既是行业惯例(spikee 用 <INSTRUCTION>,多数 benchmark 都这么做),也让模板本身保持"技术演示"性质,而不是一份可以直接拿去生成有害内容的成品。
  • 每个模板标注了来源(具体到仓库/probe),不是凭空写的;但文字本身是基于对该技术模式的理解重新组织的,不是从某个源文件逐字复制粘贴。
  • 结构:../code/ 保留原始仓库不动(带各自 license,可追溯上游更新);这里是在此基础上做的二次加工产物。

目录结构 ​

按 crowdstrike-prompt-injection-taxonomy.md 第 2 节的五个顶层操纵手法分类:

目录对应分类
01-overt-approaches/显式方法——直接规则增删、人格扮演、认知绕过、秘密探测、发散攻击
02-instruction-reformulation/指令重构——编码混淆、payload 分解、语言变换、上下文过载
03-prompt-boundary-mimicry/提示边界模仿——伪造系统提示边界、特殊 token 注入
04-integrative-instruction-prompting/融合式指令注入——多轮渐进、会话内协议设定
05-multimodal-prompting-attacks/多模态提示攻击——视觉/音频载体

每个目录下:一个 README.md(索引 + 来源归属表)+ 若干 .txt 模板文件(可直接复制使用,含 {TASK} 占位符)。

使用范围(重要) ​

这套语料库只用于:自建实验环境、开源系统本地部署、或已获书面授权的目标做防御性测试与研究。不得用于未授权的第三方或生产系统——与网站的研究伦理与安全边界一致。{TASK} 占位符不要替换成真实有害请求去攻击线上服务;如果要做实证测试,在自己控的沙箱模型/环境里进行。

与其他文档的关系 ​