外观
持续关注清单:Agent Security / Prompt Injection 研究
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号逐一做二次访问核实,使用前建议自行确认链接仍然有效。
独立研究者(一手信息源,优先级最高)
| 名称 | 平台 | 关注理由 |
|---|---|---|
Simon Willison(@simonw) | simonwillison.net | 2022 年提出 "prompt injection" 一词,2025-06 提出 "lethal trifecta"(私有数据 + 不可信内容 + 外部通信三者叠加即构成数据泄露路径)威胁模型,目前是这个方向信噪比最高的独立博客,几乎每周都有对新披露漏洞的第一手分析。 |
Johann Rehberger(@wunderwuzzi23) | embracethered.com | 长期专注间接提示注入实战案例,披露过 Microsoft Copilot、Google Gemini/NotebookLM、Apple Intelligence、GitHub Copilot Chat、Anthropic Claude 等真实产品漏洞。本仓库 classification-framework.md 等笔记的分类基线很大程度上呼应他的实战案例库。 |
Kai Greshake(@KGreshake) | — | 间接提示注入奠基论文《Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection》作者,是这个子方向最早的学术源头之一。 |
Joseph Thacker "rez0"(@rez0__) | rez0.com / josephthacker.com | 从 bug bounty 视角切入 AI/agent 攻击面,与 Rehberger 有联动播客(Critical Thinking Bug Bounty Podcast),偏工程化实战而非学术论文。 |
商业研究团队(持续产出,但需注意商业动机)
- Lakera Research(lakera.ai/research)—— 覆盖 agent/RAG/MCP 攻击面,2025-09 被 Check Point 收购,后续独立性需观察。
- Microsoft Security Blog —— 大厂内部红队视角的 agent RCE、供应链类披露(如 2026-05 "prompts become shells" 系列)。
- NVIDIA AI Red Team blog —— 官方红队博客,
garak工具的维护方,probe 源码本身就是结构化 payload+检测器打包。
权威分类框架 / 聚合基准
- OWASP GenAI Security Project(genai.owasp.org)—— LLM Top 10 / Agentic Applications Top 10(2026 版把 Agent Goal Hijacking 列为头号风险),是
classification-framework.md的重要对照基线。 - MITRE ATLAS(atlas.mitre.org)—— 对抗性 ML/AI 攻击战术矩阵,类似 ATT&CK 但针对 AI 系统。
论文追踪建议(非固定账号,但值得设定关键词订阅)
定期在 arXiv cs.CR 分类下搜索 "agentic AI attack surface" / "prompt injection defense",近期值得看的例子:MATRA(agent 攻击面建模,OpenClaw 案例研究)、Parallax("AI agents that think must never act")。
通用信息源(跨 track 共用,另见其他 track 的关注清单)
- AI Sec Weekly(aisecweekly.com)、TalEliyahu/AI-Security-Newsletter(GitHub 月报)—— 专门的 AI 安全周报/月报,比通用 AI newsletter 更聚焦安全面。