外观
威胁建模、Payload、评测、AI Control、检测与响应。
归档边界:研究如何发现、衡量和验证风险,不归档具体产品漏洞。
研究如何定义资产、对手、信任边界、攻击面和授权范围,并建立可复用分类。
归档边界本类产出方法和分类,不存单一产品漏洞;具体发现按 A 组归档。
来源说明(重要):这不是某个厂商/论文发布的现成分类法,是我从 garak(NVIDIA)和 augustus(Praetorian)两个扫描工具各自的 probe 分组归纳整理出来的,并用 InjecAgent、AgentDojo 的攻击意图分类做了交叉核对。分类方式来自真实工具的设计决策,...
来源:CrowdStrike, Prompt Injection Taxonomy Poster(信息图海报,最后更新 2026-05-12);扩展交互版见 crowdstrike.com/en-us/explore/interactive-taxonomy/。本地源文件:crowdstrik...
维护该子目录用的组织方式,供后续新增论文/笔记时对齐分类,避免每篇笔记各用一套命名。
研究攻击语料、Payload 数据集、测试 Harness、自动化红队和模糊测试工程。
归档边界可复用测试材料与工具归本类;材料发现的具体漏洞回到对应 A 类。
整理日期:2026-07-28。对象:agent-security/prompt-injection/code/ 下 18 个仓库(清理掉非 payload 的历史运行日志/演示媒体后,共约 221M)。参照分类:crowdstrike-prompt-injection-taxonomy.md...
整理日期:2026-07-28。核实方式:先用 WebSearch 广撒网,再逐个用 curl https://api.github.com/repos/<owner/<repo 核实仓库确实存在、拉取 star 数/最后 push 时间/license,不单纯依赖搜索摘要(搜索摘要里出现过一...
这不是对 ../code/ 下 19 个开源仓库的简单复制。这是基于那些仓库里的真实 payload、探针(probe)说明、以及可生成 payload 的算法(如 GCG),提炼出通用攻击模板,按 crowdstrike-prompt-injection-taxonomy.md 的操纵手法分...
攻击者直接、明示地提出指令,不做语义伪装。对应 crowdstrike-prompt-injection-taxonomy.md §2.1。
不改变语义,只变换表达形式来绕过过滤器。对应 crowdstrike-prompt-injection-taxonomy.md §2.2。
利用系统提示、用户提示、上下文数据之间边界薄弱的问题,伪造边界结构夹带恶意指令。 对应 crowdstrike-prompt-injection-taxonomy.md §2.3。
攻击意图通过整合"当前上下文之外"的信息来隐藏——前几轮对话、模型内部知识。 对应 crowdstrike-prompt-injection-taxonomy.md §2.4。
利用图像、音频、视频等非文本元素。对应 crowdstrike-prompt-injection-taxonomy.md §2.4 独立红框类目。
来源参考:../../code/augustus/docs/04 - Probes/Multimodal.md 状态:⚠️ 未实测,基于探针功能说明推演,本地语料库没有实际音频样本文件
来源参考:../../code/Many-Shot-Jailbreaking-Demo/(基于 Anthropic《Many-shot Jailbreaking》研究,Anil et al., 2024)
来源参考:../../code/augustus/docs/04 - Probes/Crescendo.md
来源参考:../../code/augustus/docs/04 - Probes/PAIR.md、TAP.md、GOAT.md
来源参考:../../code/llm-attacks/(GCG 原始实现)、../../code/AmpleGCG/(快速生成器)、../../code/llm-adaptive-attacks/
来源参考:../../code/augustus/docs/04 - Probes/Art Prompts.md、Adversarial Patch.md 状态:⚠️ 未实测,基于探针功能说明推演
研究 ASR、覆盖率、复现性、评分体系、LLM-as-Judge 和评测基础设施。
归档边界Judge/Harness 操纵归本类;基准数据本身的污染和泄露归 A2.6。
研究在模型可能不可信时验证监控、限制和控制措施,以及前沿能力阈值评估工程。
归档边界评估方法归本类;模型表现出的 Scheming 或危险能力结论归 B。
研究 Guardrail、检测器、监控和运行时策略的覆盖率、退化与绕过验证方法。
归档边界防护效果比较归本类;特定 Guard Model 的对抗规避漏洞归 A1.6。
研究 AI 事件检测、调查、证据保全、修复验证、披露和漏洞生命周期管理。
归档边界跨系统响应方法归本类;产品应提供的 Agent 审计与归因能力归 A5.9。
研究用于渗透测试、SOC、检测与响应的安全智能体,以及这些系统自身的防护。
归档边界平台方法、市场和评估路线归本类;发现的具体 Agent 漏洞按 A 组归档。
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。
安全智能体有一个与普通企业智能体不同的根本特征:它们的正常输入本来就来自攻击者可控环境。网页响应、漏洞样本、邮件正文、终端命令行、告警字段、工单、恶意文件和源代码都既是“证据”,也可能是“指令载体”。因此,单纯提高模型识别提示注入的能力不足以构成安全边界。