Skip to content

持续关注清单:LLM Jailbreak 研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号/仓库逐一做二次访问核实(不同于本仓库对开源代码仓库惯常的 GitHub API 核实流程),使用前建议自行确认链接仍然有效。

独立研究者 / 账号

名称平台关注理由
Pliny the Liberator(@elder_pliniusX目前最高产的公开越狱研究者,新模型发布几小时内即发布 jailbreak,开源仓库 L1B3RT4S 按厂商分类收录越狱 prompt,本仓库 agent-security/prompt-injection/code/ 下已本地克隆。注意其内容带表演/宣传性质,技术细节需要交叉验证。
Nicholas Carlini(@carliniX / carlini.com对抗样本与对抗鲁棒性方向的学术权威,近年系统研究 LLM 越狱与防御的可绕过性;2025-10 与 OpenAI/Anthropic/DeepMind 联合发表的对抗性评测论文(12 种已发表防御被自适应攻击以 >90% ASR 绕过)即出自这类工作方向。
Simon Willison(@simonw,simonwillison.net)博客 + X严格说是 agent security 而非纯 jailbreak 方向,但"lethal trifecta"等威胁模型对理解越狱在真实 agent 系统里的危害链条是必读参考,见 agent-security 关注清单

竞赛 / 游戏化基准(社区实战技巧的一手来源)

  • HackAPrompt(learnprompting 主办)—— 面向公众的越狱/提示注入竞赛,历年获奖 payload 是很好的技巧演进样本。
  • Lakera Gandalf(gandalf.lakera.ai)—— 游戏化的提示注入/越狱闯关基准,商业公司维护但持续更新。

官方安全博客(红队方法论对照,而非只看一家)

  • Anthropic 官方安全/对齐博客 —— 侧重多轮、RL 驱动的攻击活动下的攻击成功率(ASR)曲线,"Many-Shot Jailbreaking" 即出自 Anthropic 2024 年研究。
  • OpenAI 安全博客 —— 侧重单次越狱抵抗力+快速迭代打补丁的方法论。
  • Google DeepMind 安全团队博客 —— 第三种方法论视角,三家对照看能避免被单一厂商的评测口径误导。

索引型资源(查漏补缺,非一手信息源)

中文资源现状说明

2026-07-30 搜索中文关键词(大模型安全、越狱、提示词注入相关)时,未发现信噪比能与上述英文一手来源相当的专门账号/公众号,搜到的多为 CSDN 等二手转述内容。当前策略是以英文一手来源为主,中文资源仅用于交叉验证或寻找同行评议角度。如果后续发现值得长期关注的中文团队,应更新本清单。