Skip to content

持续关注清单:Agent Security / Prompt Injection 研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号逐一做二次访问核实,使用前建议自行确认链接仍然有效。

独立研究者(一手信息源,优先级最高)

名称平台关注理由
Simon Willison(@simonwsimonwillison.net2022 年提出 "prompt injection" 一词,2025-06 提出 "lethal trifecta"(私有数据 + 不可信内容 + 外部通信三者叠加即构成数据泄露路径)威胁模型,目前是这个方向信噪比最高的独立博客,几乎每周都有对新披露漏洞的第一手分析。
Johann Rehberger(@wunderwuzzi23embracethered.com长期专注间接提示注入实战案例,披露过 Microsoft Copilot、Google Gemini/NotebookLM、Apple Intelligence、GitHub Copilot Chat、Anthropic Claude 等真实产品漏洞。本仓库 classification-framework.md 等笔记的分类基线很大程度上呼应他的实战案例库。
Kai Greshake(@KGreshake间接提示注入奠基论文《Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection》作者,是这个子方向最早的学术源头之一。
Joseph Thacker "rez0"(@rez0__rez0.com / josephthacker.com从 bug bounty 视角切入 AI/agent 攻击面,与 Rehberger 有联动播客(Critical Thinking Bug Bounty Podcast),偏工程化实战而非学术论文。

商业研究团队(持续产出,但需注意商业动机)

  • Lakera Research(lakera.ai/research)—— 覆盖 agent/RAG/MCP 攻击面,2025-09 被 Check Point 收购,后续独立性需观察。
  • Microsoft Security Blog —— 大厂内部红队视角的 agent RCE、供应链类披露(如 2026-05 "prompts become shells" 系列)。
  • NVIDIA AI Red Team blog —— 官方红队博客,garak 工具的维护方,probe 源码本身就是结构化 payload+检测器打包。

权威分类框架 / 聚合基准

  • OWASP GenAI Security Project(genai.owasp.org)—— LLM Top 10 / Agentic Applications Top 10(2026 版把 Agent Goal Hijacking 列为头号风险),是 classification-framework.md 的重要对照基线。
  • MITRE ATLAS(atlas.mitre.org)—— 对抗性 ML/AI 攻击战术矩阵,类似 ATT&CK 但针对 AI 系统。

论文追踪建议(非固定账号,但值得设定关键词订阅)

定期在 arXiv cs.CR 分类下搜索 "agentic AI attack surface" / "prompt injection defense",近期值得看的例子:MATRA(agent 攻击面建模,OpenClaw 案例研究)、Parallax("AI agents that think must never act")。

通用信息源(跨 track 共用,另见其他 track 的关注清单)

  • AI Sec Weekly(aisecweekly.com)、TalEliyahu/AI-Security-Newsletter(GitHub 月报)—— 专门的 AI 安全周报/月报,比通用 AI newsletter 更聚焦安全面。