外观
当前知识库中的自维护研究笔记、实验记录与攻击语料。
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号逐一做二次访问核实,使用前建议自行确认链接仍然有效。
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号/仓库逐一做二次访问核实(不同于本仓库对开源代码仓库惯常的 GitHub API 核实流程),使用前建议自行确认链接仍然有效。
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。
本规范面向软件型 AI、生成式 AI 与智能体系统。当前版本不覆盖机器人、自动驾驶、无人系统等具身与物理 AI;相关研究在形成稳定规模后单独扩展,不强行放入“多模态”分类。
- 日期:2026-07-30(Asia/Shanghai) - Codex CLI:codex-cli 0.146.0 - CLI 二进制:/opt/homebrew/bin/codex - 包装脚本:$HOME/.local/bin/codex - Provider:自定义 Respons...
调研日期:2026-07-30。来源:Pillar Security 博客系列(7 篇独立逃逸披露 + 1 篇 OpenAI 第八案例追加 + 1 篇 CTF/Hugging Face 关联事件),核实方式为逐篇 WebFetch 全文抓取(而非只读汇总页摘要)。
调研/复核日期:2026-07-29 本文聚焦传输与事件层;请求/响应数据模型见 openai-anthropic-sse.md。
调研日期:2026-07-29 证据来源:主要为一手来源,直接抓取 github.com/a2aproject/A2A(docs/specification.md、specification/a2a.proto、CHANGELOG.md、docs/whats-new-v1.md、docs/an...
调研/复核日期:2026-07-29 证据来源:以 MCP 官方 specification、正式 tag 和 changelog 为主;二手材料单独标注。
调研/复核日期:2026-07-29 本文比较 HTTP 请求/响应的数据模型;SSE/WebSocket 事件序列见 vendor-streaming-comparison.md,MCP/A2A 见对应独立笔记。
整理日期:2026-07-28。对象:agent-security/prompt-injection/code/ 下 18 个仓库(清理掉非 payload 的历史运行日志/演示媒体后,共约 221M)。参照分类:crowdstrike-prompt-injection-taxonomy.md...
来源说明(重要):这不是某个厂商/论文发布的现成分类法,是我从 garak(NVIDIA)和 augustus(Praetorian)两个扫描工具各自的 probe 分组归纳整理出来的,并用 InjecAgent、AgentDojo 的攻击意图分类做了交叉核对。分类方式来自真实工具的设计决策,...
整理日期:2026-07-28。核实方式:先用 WebSearch 广撒网,再逐个用 curl https://api.github.com/repos/<owner/<repo 核实仓库确实存在、拉取 star 数/最后 push 时间/license,不单纯依赖搜索摘要(搜索摘要里出现过一...
证据等级说明(沿用 pentest-agent-countermeasure/notes/security-agent-countermeasure-research.md 的约定):强 表示有 CVE 编号、官方安全公告或可复现的第三方研究支撑;中 表示只有厂商产品页/博客描述、无独立验证;...
来源:CrowdStrike, Prompt Injection Taxonomy Poster(信息图海报,最后更新 2026-05-12);扩展交互版见 crowdstrike.com/en-us/explore/interactive-taxonomy/。本地源文件:crowdstrik...
这不是对 ../code/ 下 19 个开源仓库的简单复制。这是基于那些仓库里的真实 payload、探针(probe)说明、以及可生成 payload 的算法(如 GCG),提炼出通用攻击模板,按 crowdstrike-prompt-injection-taxonomy.md 的操纵手法分...
安全智能体有一个与普通企业智能体不同的根本特征:它们的正常输入本来就来自攻击者可控环境。网页响应、漏洞样本、邮件正文、终端命令行、告警字段、工单、恶意文件和源代码都既是“证据”,也可能是“指令载体”。因此,单纯提高模型识别提示注入的能力不足以构成安全边界。
攻击者直接、明示地提出指令,不做语义伪装。对应 crowdstrike-prompt-injection-taxonomy.md §2.1。
不改变语义,只变换表达形式来绕过过滤器。对应 crowdstrike-prompt-injection-taxonomy.md §2.2。
利用系统提示、用户提示、上下文数据之间边界薄弱的问题,伪造边界结构夹带恶意指令。 对应 crowdstrike-prompt-injection-taxonomy.md §2.3。
攻击意图通过整合"当前上下文之外"的信息来隐藏——前几轮对话、模型内部知识。 对应 crowdstrike-prompt-injection-taxonomy.md §2.4。
利用图像、音频、视频等非文本元素。对应 crowdstrike-prompt-injection-taxonomy.md §2.4 独立红框类目。
维护该子目录用的组织方式,供后续新增论文/笔记时对齐分类,避免每篇笔记各用一套命名。
来源参考:../../code/augustus/docs/04 - Probes/Multimodal.md 状态:⚠️ 未实测,基于探针功能说明推演,本地语料库没有实际音频样本文件
本报告分析 Codex CLI 0.146.0 在六个模型、多个 multi-agent 配置下的 真实 HTTPS/SSE 通信、rollout 会话记录及对应 Rust 源码。核心结论如下。
来源参考:../../code/Many-Shot-Jailbreaking-Demo/(基于 Anthropic《Many-shot Jailbreaking》研究,Anil et al., 2024)
来源参考:../../code/augustus/docs/04 - Probes/Crescendo.md
来源参考:../../code/augustus/docs/04 - Probes/PAIR.md、TAP.md、GOAT.md
来源参考:../../code/llm-attacks/(GCG 原始实现)、../../code/AmpleGCG/(快速生成器)、../../code/llm-adaptive-attacks/
来源参考:../../code/augustus/docs/04 - Probes/Art Prompts.md、Adversarial Patch.md 状态:⚠️ 未实测,基于探针功能说明推演