Skip to content
C / 方法与评测

红队工程与防御验证

威胁建模、Payload、评测、AI Control、检测与响应。

归档边界:研究如何发现、衡量和验证风险,不归档具体产品漏洞。

7 个二级分类 · 19 篇内容
C1

威胁建模、分类与测试范围

3 篇研究

研究如何定义资产、对手、信任边界、攻击面和授权范围,并建立可复用分类。

归档边界本类产出方法和分类,不存单一产品漏洞;具体发现按 A 组归档。

  • 威胁建模
  • 攻击技术分类
  • 测试授权与范围控制
研究笔记2026-07-28

补充轴:攻击目标 / 目标能力面分类

来源说明(重要):这不是某个厂商/论文发布的现成分类法,是我从 garak(NVIDIA)和 augustus(Praetorian)两个扫描工具各自的 probe 分组归纳整理出来的,并用 InjecAgent、AgentDojo 的攻击意图分类做了交叉核对。分类方式来自真实工具的设计决策,...

6 min
研究笔记2026-07-28

CrowdStrike《Taxonomy of Prompt Injection Methods》整理

来源:CrowdStrike, Prompt Injection Taxonomy Poster(信息图海报,最后更新 2026-05-12);扩展交互版见 crowdstrike.com/en-us/explore/interactive-taxonomy/。本地源文件:crowdstrik...

12 min
研究笔记

提示词注入研究:分类框架

维护该子目录用的组织方式,供后续新增论文/笔记时对齐分类,避免每篇笔记各用一套命名。

4 min
C2

Payload、语料与测试 Harness

14 篇研究

研究攻击语料、Payload 数据集、测试 Harness、自动化红队和模糊测试工程。

归档边界可复用测试材料与工具归本类;材料发现的具体漏洞回到对应 A 类。

  • Payload 语料库
  • 自动化红队
  • Fuzzing 与测试 Harness
研究笔记2026-07-28

本地 Payload 语料库 vs. CrowdStrike 操纵手法分类:覆盖度分析

整理日期:2026-07-28。对象:agent-security/prompt-injection/code/ 下 18 个仓库(清理掉非 payload 的历史运行日志/演示媒体后,共约 221M)。参照分类:crowdstrike-prompt-injection-taxonomy.md...

9 min
研究笔记2026-07-28

提示词注入相关开源仓库清单

整理日期:2026-07-28。核实方式:先用 WebSearch 广撒网,再逐个用 curl https://api.github.com/repos/<owner/<repo 核实仓库确实存在、拉取 star 数/最后 push 时间/license,不单纯依赖搜索摘要(搜索摘要里出现过一...

8 min
攻击语料2026-07-28

Payload 语料库(按操纵手法分类,二次整理版)

这不是对 ../code/ 下 19 个开源仓库的简单复制。这是基于那些仓库里的真实 payload、探针(probe)说明、以及可生成 payload 的算法(如 GCG),提炼出通用攻击模板,按 crowdstrike-prompt-injection-taxonomy.md 的操纵手法分...

3 min
攻击语料

01 · Overt Approaches(显式方法)

攻击者直接、明示地提出指令,不做语义伪装。对应 crowdstrike-prompt-injection-taxonomy.md §2.1。

3 min
攻击语料

02 · Instruction Reformulation(指令重构)

不改变语义,只变换表达形式来绕过过滤器。对应 crowdstrike-prompt-injection-taxonomy.md §2.2。

2 min
攻击语料

03 · Prompt Boundary Mimicry(提示边界模仿)

利用系统提示、用户提示、上下文数据之间边界薄弱的问题,伪造边界结构夹带恶意指令。 对应 crowdstrike-prompt-injection-taxonomy.md §2.3。

1 min
攻击语料

04 · Integrative Instruction Prompting(融合式指令注入)

攻击意图通过整合"当前上下文之外"的信息来隐藏——前几轮对话、模型内部知识。 对应 crowdstrike-prompt-injection-taxonomy.md §2.4。

2 min
攻击语料

05 · Multimodal Prompting Attacks(多模态提示攻击)

利用图像、音频、视频等非文本元素。对应 crowdstrike-prompt-injection-taxonomy.md §2.4 独立红框类目。

1 min
攻击语料

Audio Payload Obfuscation — 声学载体隐藏指令

来源参考:../../code/augustus/docs/04 - Probes/Multimodal.md 状态:⚠️ 未实测,基于探针功能说明推演,本地语料库没有实际音频样本文件

2 min
攻击语料

Context Overload Prompting — Many-Shot Jailbreaking

来源参考:../../code/Many-Shot-Jailbreaking-Demo/(基于 Anthropic《Many-shot Jailbreaking》研究,Anil et al., 2024)

2 min
攻击语料

Gradual Steering — Crescendo Attack

来源参考:../../code/augustus/docs/04 - Probes/Crescendo.md

1 min
攻击语料

Multi-Turn Prompting — 攻击者 LLM 迭代改写(PAIR / TAP / GOAT)

来源参考:../../code/augustus/docs/04 - Probes/PAIR.md、TAP.md、GOAT.md

2 min
攻击语料

Unintelligible Input Prompting — Adversarial Sequence Insertion(GCG 对抗后缀)

来源参考:../../code/llm-attacks/(GCG 原始实现)、../../code/AmpleGCG/(快速生成器)、../../code/llm-adaptive-attacks/

2 min
攻击语料

Visual Payload Obfuscation — ASCII/Unicode 图形藏指令

来源参考:../../code/augustus/docs/04 - Probes/Art Prompts.md、Adversarial Patch.md 状态:⚠️ 未实测,基于探针功能说明推演

1 min
C3

Benchmark、指标与评测完整性

0 篇研究

研究 ASR、覆盖率、复现性、评分体系、LLM-as-Judge 和评测基础设施。

归档边界Judge/Harness 操纵归本类;基准数据本身的污染和泄露归 A2.6。

  • 安全 Benchmark
  • 指标与复现性
  • Judge 与评分器操纵
暂无研究文章,保留为后续研究入口。
C4

AI Control 与前沿能力评估

0 篇研究

研究在模型可能不可信时验证监控、限制和控制措施,以及前沿能力阈值评估工程。

归档边界评估方法归本类;模型表现出的 Scheming 或危险能力结论归 B。

  • Control Evaluation
  • ASL/FSF/Preparedness
  • 不可信模型控制
暂无研究文章,保留为后续研究入口。
C5

防护验证、检测与推理监控

0 篇研究

研究 Guardrail、检测器、监控和运行时策略的覆盖率、退化与绕过验证方法。

归档边界防护效果比较归本类;特定 Guard Model 的对抗规避漏洞归 A1.6。

  • Guardrail 有效性
  • 检测与运行时策略验证
  • CoT 可监控性与退化
暂无研究文章,保留为后续研究入口。
C6

事件响应、取证与漏洞管理

0 篇研究

研究 AI 事件检测、调查、证据保全、修复验证、披露和漏洞生命周期管理。

归档边界跨系统响应方法归本类;产品应提供的 Agent 审计与归因能力归 A5.9。

  • AI 事件响应
  • 取证与证据链
  • 披露和修复验证
暂无研究文章,保留为后续研究入口。
C7

安全智能体与攻防反制

2 篇研究

研究用于渗透测试、SOC、检测与响应的安全智能体,以及这些系统自身的防护。

归档边界平台方法、市场和评估路线归本类;发现的具体 Agent 漏洞按 A 组归档。

  • Pentest Agent
  • SOC/IR Agent
  • 安全智能体自身安全
关注清单2026-07-30

持续关注清单:Pentest Agent / 攻防对抗研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。

3 min
研究笔记2026-07-25

安全智能体反制与自身安全:市场、攻击面与研究路线

安全智能体有一个与普通企业智能体不同的根本特征:它们的正常输入本来就来自攻击者可控环境。网页响应、漏洞样本、邮件正文、终端命令行、告警字段、工单、恶意文件和源代码都既是“证据”,也可能是“指令载体”。因此,单纯提高模型识别提示注入的能力不足以构成安全边界。

16 min