Skip to content

全部文章

当前知识库中的自维护研究笔记、实验记录与攻击语料。

32 篇匹配内容
A5.1 · Prompt Injection 与上下文信任边界关注清单2026-07-30

持续关注清单:Agent Security / Prompt Injection 研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号逐一做二次访问核实,使用前建议自行确认链接仍然有效。

3 min
A6.1 · API、传输与流式协议关注清单2026-07-30

持续关注清单:AI 通信协议(MCP/A2A 等)安全研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。

3 min
A1.1 · 鲁棒性、Jailbreak 与对齐边界关注清单2026-07-30

持续关注清单:LLM Jailbreak 研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号/仓库逐一做二次访问核实(不同于本仓库对开源代码仓库惯常的 GitHub API 核实流程),使用前建议自行确认链接仍然有效。

3 min
C7 · 安全智能体与攻防反制关注清单2026-07-30

持续关注清单:Pentest Agent / 攻防对抗研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。

3 min
A5.5 · Agent Runtime、Sandbox 与 Workspace关注清单2026-07-30

持续关注清单:Sandbox / 执行隔离安全研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。

3 min
D4 · 知识库、资产与研究治理标准规范2026-07-30

AI Security 红队研究分类与归档规范

本规范面向软件型 AI、生成式 AI 与智能体系统。当前版本不覆盖机器人、自动驾驶、无人系统等具身与物理 AI;相关研究在形成稳定规模后单独扩展,不强行放入“多模态”分类。

12 min
A6.4 · 会话、消息与状态完整性实验记录2026-07-30

Codex CLI 模型与 multi-agent 通信实验记录

- 日期:2026-07-30(Asia/Shanghai) - Codex CLI:codex-cli 0.146.0 - CLI 二进制:/opt/homebrew/bin/codex - 包装脚本:$HOME/.local/bin/codex - Provider:自定义 Respons...

11 min
A5.5 · Agent Runtime、Sandbox 与 Workspace研究笔记2026-07-30

Pillar Security "Week of Sandbox Escapes" 系列深度研究:逃逸案例与检测方式

调研日期:2026-07-30。来源:Pillar Security 博客系列(7 篇独立逃逸披露 + 1 篇 OpenAI 第八案例追加 + 1 篇 CTF/Hugging Face 关联事件),核实方式为逐篇 WebFetch 全文抓取(而非只读汇总页摘要)。

18 min
A6.5 · 互操作、版本协商与降级研究笔记2026-07-29

各厂商流式(Streaming)协议机制对比

调研/复核日期:2026-07-29 本文聚焦传输与事件层;请求/响应数据模型见 openai-anthropic-sse.md。

8 min
A6.1 · API、传输与流式协议研究笔记2026-07-29

A2A(Agent2Agent Protocol)协议机制调研

调研日期:2026-07-29 证据来源:主要为一手来源,直接抓取 github.com/a2aproject/A2A(docs/specification.md、specification/a2a.proto、CHANGELOG.md、docs/whats-new-v1.md、docs/an...

12 min
A6.2 · MCP、能力发现与动态 Schema研究笔记2026-07-29

MCP(Model Context Protocol)协议机制调研

调研/复核日期:2026-07-29 证据来源:以 MCP 官方 specification、正式 tag 和 changelog 为主;二手材料单独标注。

8 min
A6.1 · API、传输与流式协议研究笔记2026-07-29

OpenAI / Anthropic API 结构对比与第三方兼容层

调研/复核日期:2026-07-29 本文比较 HTTP 请求/响应的数据模型;SSE/WebSocket 事件序列见 vendor-streaming-comparison.md,MCP/A2A 见对应独立笔记。

6 min
C2 · Payload、语料与测试 Harness研究笔记2026-07-28

本地 Payload 语料库 vs. CrowdStrike 操纵手法分类:覆盖度分析

整理日期:2026-07-28。对象:agent-security/prompt-injection/code/ 下 18 个仓库(清理掉非 payload 的历史运行日志/演示媒体后,共约 221M)。参照分类:crowdstrike-prompt-injection-taxonomy.md...

9 min
C1 · 威胁建模、分类与测试范围研究笔记2026-07-28

补充轴:攻击目标 / 目标能力面分类

来源说明(重要):这不是某个厂商/论文发布的现成分类法,是我从 garak(NVIDIA)和 augustus(Praetorian)两个扫描工具各自的 probe 分组归纳整理出来的,并用 InjecAgent、AgentDojo 的攻击意图分类做了交叉核对。分类方式来自真实工具的设计决策,...

6 min
C2 · Payload、语料与测试 Harness研究笔记2026-07-28

提示词注入相关开源仓库清单

整理日期:2026-07-28。核实方式:先用 WebSearch 广撒网,再逐个用 curl https://api.github.com/repos/<owner/<repo 核实仓库确实存在、拉取 star 数/最后 push 时间/license,不单纯依赖搜索摘要(搜索摘要里出现过一...

8 min
A5.5 · Agent Runtime、Sandbox 与 Workspace研究笔记2026-07-28

Agent 沙箱产品全景与逃逸手法研究

证据等级说明(沿用 pentest-agent-countermeasure/notes/security-agent-countermeasure-research.md 的约定):强 表示有 CVE 编号、官方安全公告或可复现的第三方研究支撑;中 表示只有厂商产品页/博客描述、无独立验证;...

27 min
C1 · 威胁建模、分类与测试范围研究笔记2026-07-28

CrowdStrike《Taxonomy of Prompt Injection Methods》整理

来源:CrowdStrike, Prompt Injection Taxonomy Poster(信息图海报,最后更新 2026-05-12);扩展交互版见 crowdstrike.com/en-us/explore/interactive-taxonomy/。本地源文件:crowdstrik...

12 min
C2 · Payload、语料与测试 Harness攻击语料2026-07-28

Payload 语料库(按操纵手法分类,二次整理版)

这不是对 ../code/ 下 19 个开源仓库的简单复制。这是基于那些仓库里的真实 payload、探针(probe)说明、以及可生成 payload 的算法(如 GCG),提炼出通用攻击模板,按 crowdstrike-prompt-injection-taxonomy.md 的操纵手法分...

3 min
C7 · 安全智能体与攻防反制研究笔记2026-07-25

安全智能体反制与自身安全:市场、攻击面与研究路线

安全智能体有一个与普通企业智能体不同的根本特征:它们的正常输入本来就来自攻击者可控环境。网页响应、漏洞样本、邮件正文、终端命令行、告警字段、工单、恶意文件和源代码都既是“证据”,也可能是“指令载体”。因此,单纯提高模型识别提示注入的能力不足以构成安全边界。

16 min
C2 · Payload、语料与测试 Harness攻击语料

01 · Overt Approaches(显式方法)

攻击者直接、明示地提出指令,不做语义伪装。对应 crowdstrike-prompt-injection-taxonomy.md §2.1。

3 min
C2 · Payload、语料与测试 Harness攻击语料

02 · Instruction Reformulation(指令重构)

不改变语义,只变换表达形式来绕过过滤器。对应 crowdstrike-prompt-injection-taxonomy.md §2.2。

2 min
C2 · Payload、语料与测试 Harness攻击语料

03 · Prompt Boundary Mimicry(提示边界模仿)

利用系统提示、用户提示、上下文数据之间边界薄弱的问题,伪造边界结构夹带恶意指令。 对应 crowdstrike-prompt-injection-taxonomy.md §2.3。

1 min
C2 · Payload、语料与测试 Harness攻击语料

04 · Integrative Instruction Prompting(融合式指令注入)

攻击意图通过整合"当前上下文之外"的信息来隐藏——前几轮对话、模型内部知识。 对应 crowdstrike-prompt-injection-taxonomy.md §2.4。

2 min
C2 · Payload、语料与测试 Harness攻击语料

05 · Multimodal Prompting Attacks(多模态提示攻击)

利用图像、音频、视频等非文本元素。对应 crowdstrike-prompt-injection-taxonomy.md §2.4 独立红框类目。

1 min
C1 · 威胁建模、分类与测试范围研究笔记

提示词注入研究:分类框架

维护该子目录用的组织方式,供后续新增论文/笔记时对齐分类,避免每篇笔记各用一套命名。

4 min
C2 · Payload、语料与测试 Harness攻击语料

Audio Payload Obfuscation — 声学载体隐藏指令

来源参考:../../code/augustus/docs/04 - Probes/Multimodal.md 状态:⚠️ 未实测,基于探针功能说明推演,本地语料库没有实际音频样本文件

2 min
A6.4 · 会话、消息与状态完整性研究笔记

Codex CLI 模型协议与 multi-agent 参数加密研究

本报告分析 Codex CLI 0.146.0 在六个模型、多个 multi-agent 配置下的 真实 HTTPS/SSE 通信、rollout 会话记录及对应 Rust 源码。核心结论如下。

38 min
C2 · Payload、语料与测试 Harness攻击语料

Context Overload Prompting — Many-Shot Jailbreaking

来源参考:../../code/Many-Shot-Jailbreaking-Demo/(基于 Anthropic《Many-shot Jailbreaking》研究,Anil et al., 2024)

2 min
C2 · Payload、语料与测试 Harness攻击语料

Gradual Steering — Crescendo Attack

来源参考:../../code/augustus/docs/04 - Probes/Crescendo.md

1 min
C2 · Payload、语料与测试 Harness攻击语料

Multi-Turn Prompting — 攻击者 LLM 迭代改写(PAIR / TAP / GOAT)

来源参考:../../code/augustus/docs/04 - Probes/PAIR.md、TAP.md、GOAT.md

2 min
C2 · Payload、语料与测试 Harness攻击语料

Unintelligible Input Prompting — Adversarial Sequence Insertion(GCG 对抗后缀)

来源参考:../../code/llm-attacks/(GCG 原始实现)、../../code/AmpleGCG/(快速生成器)、../../code/llm-adaptive-attacks/

2 min
C2 · Payload、语料与测试 Harness攻击语料

Visual Payload Obfuscation — ASCII/Unicode 图形藏指令

来源参考:../../code/augustus/docs/04 - Probes/Art Prompts.md、Adversarial Patch.md 状态:⚠️ 未实测,基于探针功能说明推演

1 min