外观
Multi-Turn Prompting — 攻击者 LLM 迭代改写(PAIR / TAP / GOAT)
来源参考:../../code/augustus/docs/04 - Probes/PAIR.md、TAP.md、GOAT.md
为什么这里也不是一份静态模板
这几个手法的共同点是:用另一个 LLM 当攻击者,根据目标模型的每一轮回应自动生成/改写下一轮 prompt,整个过程是一个自动化循环,不是人工写好固定话术。
三种循环结构
- PAIR(Prompt Automatic Iterative Refinement):攻击者 LLM 根据目标模型上一轮的响应 迭代改写攻击 prompt,用一个裁判 LLM 打分,直到成功或达到最大迭代次数。
- TAP(Tree of Attacks with Pruning):在 PAIR 基础上引入树搜索——每一步生成多个候选分支, 裁判打分后剪掉偏离主题/低分的分支,只保留最有希望的方向继续扩展。
- GOAT(Generative Offensive Agent Tester):攻击者 LLM 在单次多轮对话中,主动在七种越狱 技巧之间切换(如叠加使用本目录里的 crescendo-escalation、cognitive-hacking-narrative 等手法), 用"Chain-of-Attack-Thought"推理来决定下一步该换用哪个技巧。
本地可跑
../../code/augustus/ 本身就实现了这三个 probe(pair.IterativePAIR、tap.IterativeTAP、 goat.Goat),在自建实验环境里可以直接调用,不需要重新实现算法本身—— 这个类目"新整理的 payload"就是本文档描述的攻击结构,具体执行交给已有工具。