外观
持续关注清单:LLM Jailbreak 研究
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号/仓库逐一做二次访问核实(不同于本仓库对开源代码仓库惯常的 GitHub API 核实流程),使用前建议自行确认链接仍然有效。
独立研究者 / 账号
| 名称 | 平台 | 关注理由 |
|---|---|---|
Pliny the Liberator(@elder_plinius) | X | 目前最高产的公开越狱研究者,新模型发布几小时内即发布 jailbreak,开源仓库 L1B3RT4S 按厂商分类收录越狱 prompt,本仓库 agent-security/prompt-injection/code/ 下已本地克隆。注意其内容带表演/宣传性质,技术细节需要交叉验证。 |
Nicholas Carlini(@carlini) | X / carlini.com | 对抗样本与对抗鲁棒性方向的学术权威,近年系统研究 LLM 越狱与防御的可绕过性;2025-10 与 OpenAI/Anthropic/DeepMind 联合发表的对抗性评测论文(12 种已发表防御被自适应攻击以 >90% ASR 绕过)即出自这类工作方向。 |
Simon Willison(@simonw,simonwillison.net) | 博客 + X | 严格说是 agent security 而非纯 jailbreak 方向,但"lethal trifecta"等威胁模型对理解越狱在真实 agent 系统里的危害链条是必读参考,见 agent-security 关注清单。 |
竞赛 / 游戏化基准(社区实战技巧的一手来源)
- HackAPrompt(learnprompting 主办)—— 面向公众的越狱/提示注入竞赛,历年获奖 payload 是很好的技巧演进样本。
- Lakera Gandalf(gandalf.lakera.ai)—— 游戏化的提示注入/越狱闯关基准,商业公司维护但持续更新。
官方安全博客(红队方法论对照,而非只看一家)
- Anthropic 官方安全/对齐博客 —— 侧重多轮、RL 驱动的攻击活动下的攻击成功率(ASR)曲线,"Many-Shot Jailbreaking" 即出自 Anthropic 2024 年研究。
- OpenAI 安全博客 —— 侧重单次越狱抵抗力+快速迭代打补丁的方法论。
- Google DeepMind 安全团队博客 —— 第三种方法论视角,三家对照看能避免被单一厂商的评测口径误导。
索引型资源(查漏补缺,非一手信息源)
- yueliu1999/Awesome-Jailbreak-on-LLMs —— 越狱论文+代码+数据集追踪列表,更新频繁,已收录于本仓库
agent-security/prompt-injection/code/。 - chawins/llm-sp —— LLM 安全与隐私论文合集,覆盖面广于纯越狱。
中文资源现状说明
2026-07-30 搜索中文关键词(大模型安全、越狱、提示词注入相关)时,未发现信噪比能与上述英文一手来源相当的专门账号/公众号,搜到的多为 CSDN 等二手转述内容。当前策略是以英文一手来源为主,中文资源仅用于交叉验证或寻找同行评议角度。如果后续发现值得长期关注的中文团队,应更新本清单。