Skip to content
A5 / 核心攻击面

AI 应用与智能体系统安全

指令、上下文、规划、工具、沙箱、编排与输出执行链。

归档边界:只有放在 AI 应用或 Agent 语义和执行链中才成立。

9 个二级分类 · 9 篇研究综述 · 68 篇独立研究
A5.1

Prompt Injection 与上下文信任边界

1 篇综述 · 18 篇独立研究

研究网页、文档、邮件、工具返回和 RAG 内容越权成为应用指令的攻击。

归档边界第三方内容跨越 content-to-instruction 边界归本类,不论载体是文本、图像、DOM 还是浏览器/桌面界面(隐藏文字图片、视觉提示注入本质仍是内容越权成为指令);用户直接越狱模型归 A1.1。

  • 直接与间接 Prompt Injection
  • 指令层级冲突
  • 跨模态内容注入
分类综述研究综述更新 2026-09-10

Prompt Injection 与上下文信任边界研究综述

定义第三方内容越权成为指令时的 Prompt Injection 根因、投递路径、影响链和确定性控制策略。

18 min
技术研究更新 2026-09-28

Control-Token Injection:通过控制标记符注入压制思维链与推理安全监控

首次证明注入模型自身的控制标记符可完全压制 Agent 思维链,使基于推理的安全监控失效,并揭示工具调用触发由 Harness Parser 而非模型决定。

9 min
攻击方法研究更新 2026-09-10

黑盒自适应视觉提示词注入与持久化工具链

综合 Repeat-After-Me 与 AgentHijack,分析视觉载荷如何从模型输出传播到精确工具调用、环境副作用和持久配置。

5 min
防护研究更新 2026-08-23

预填充行为探针的上下文泄露检测

分析如何用内容无关的行为后缀和预填充 token 概率,在模型开始解码前识别上下文泄露攻击,并评估自适应规避与部署代价。

5 min
技术研究更新 2026-08-13

企业 AI 参数注入与可信出口数据外泄

分析 URL 参数如何直接进入 Microsoft Copilot 与 Atlassian Rovo 的提示词,并借助允许访问的搜索或渲染通道外传企业数据。

8 min
技术研究更新 2026-08-13

遥测数据提示词注入与远程 Agent 接管

分析错误追踪、WAF 和日志平台中的攻击者可控字段如何进入 AI 运维工作流,并进一步触发包安装、DNS 修改和命令执行。

9 min
技术研究更新 2026-08-19

PIPES:用来源证明与先验约束 Agent 感知

将感知片段的生产者、预期语义和先验绑定到状态更新,降低不可信观察劫持 Agent 决策的风险。

2 min
技术研究更新 2026-09-06

编码与渲染层的人机感知分歧:从 ASCII Smuggling 到恶意字体注入

综合 Unicode 隐写、双向重排/同形字、CSS 生成内容与自定义字体字形替换等技术,说明攻击者如何让人类、文本解析流水线与渲染型 AI 分别读取不同内容,用于绕过内容审核,或反向欺骗被用作"安全判断者"的 AI。

22 min
攻防研究更新 2026-09-20

元认知记忆驱动的一次性间接提示词注入

分析离线复盘如何提炼跨目标攻击策略,并将测试时攻击压缩为一次查询。

3 min
攻防研究更新 2026-09-20

Android 无障碍树中的间接提示词注入

评估移动端 Agent 同时读取界面视觉与无障碍元数据时,隐藏指令如何造成目标劫持和越权操作。

3 min
攻击方法研究更新 2026-08-08

PleaseFix 与 Agentic Browser 意图碰撞:从间接提示词注入到零点击账户接管

复盘 Zenity Labs 在 Claude in Chrome、ChatGPT Atlas 与 Perplexity Comet 上披露的浏览器 Agent 攻击链,区分已演示机制、产品差异和证据限制。

14 min
技术研究更新 2026-09-20

并发音频 Prompt Injection:环境声如何劫持持续监听 Agent

分析第三方恶意语音与用户语音并发时,音频 Agent 将环境内容误当指令的攻击机制、实测结果及声源分离方案的适用范围。

7 min
攻击方法研究更新 2026-09-20

文档型 AI Worm:Copilot for Word 自复制 Prompt Injection

分析外部 Word 文档中的间接提示词注入如何篡改下游文档并复制自身,形成依赖正常办公工作流传播的文档型 AI worm。

10 min
攻击方法研究更新 2026-08-09

MIRAGE:移动 GUI Agent 的用户内容提示词注入

分析移动 GUI 截图中用户生成内容如何被视觉语言模型当作动作指令,以及 MIRAGE 如何系统化构造这类评测样本。

3 min
技术研究更新 2026-08-09

网页中的间接 Prompt Injection:真实生态的规模测量

对 12 亿 URL 中的间接提示词注入进行验证、分类和受控效果测量,说明网页输入的结构保留会显著影响 Agent 的服从风险。

5 min
技术研究更新 2026-08-08

DFIR Agent 中的结构化数据提示词注入

记录 Black Hat Asia 2026 对 DFIR Agent 处理日志和计划任务时的结构化数据提示词注入研究;公开材料含摘要与幻灯片,未提供完整复现环境。

3 min
技术研究更新 2026-08-09

AudioHijack:不可感知音频 Prompt Injection 与语音 Agent 工具滥用

研究通过近乎不可感知的对抗音频影响 Audio LLM 行为,并报告在受控实验中对多种模型与两项商业语音服务的工具调用影响。

4 min
防护研究更新 2026-09-01

DRIP:表征编辑与残差融合的提示词注入防护

分析 DRIP 如何区分数据中的指令语义与真正授权指令,并评估其安全性、效用和适用限制。

6 min
攻击方法研究更新 2026-09-20

图像缩放型多模态 Prompt Injection 与 Anamorpher

分析高分辨率图像在模型侧缩放后显现隐藏指令的感知差异,以及该输入变换如何与 Agent 工具权限组合造成数据外泄。

7 min
A5.2

上下文组装、RAG 与 Memory 消费

1 篇综述 · 4 篇独立研究

研究 System Prompt、检索结果、会话记忆和应用状态进入模型上下文后的安全。

归档边界消费侧优先级、泄露和跨会话行为归本类;底层存储与索引完整性归 A2。

  • System Prompt 与上下文泄露
  • RAG 消费侧安全
  • 跨会话记忆污染
分类综述研究综述更新 2026-09-10

上下文组装、RAG 与 Memory 消费研究综述

分析 System Prompt、检索结果、历史消息与长期记忆进入上下文后的优先级、泄露和跨会话风险。

7 min
技术研究更新 2026-09-10

有状态 LLM Agent 的执行状态遗忘与选择性重放

研究删除请求如何覆盖摘要、Memory、待执行计划与 KV cache 等派生状态,并用来源引导的选择性重放恢复反事实执行状态。

4 min
技术研究更新 2026-08-19

Agent 自摘要后安全护栏的存活验证

区分规则丢失、谓词降级和文本仍在但行为不触发,审计上下文压缩后的真实护栏效果。

2 min
攻击方法研究更新 2026-09-20

自进化 Agent 的经验到 Skill 持久后门:SkillJack

分析恶意经验如何经自进化流水线转化为低可检测、可路由且在来源删除后继续存在的持久 Skill。

8 min
攻击方法研究更新 2026-09-20

跨会话存储型 Prompt Injection:持久 Agent 状态中的指令滞留

将 Prompt Injection 从单次输入扩展到 Memory、文件和工具状态的持久化生命周期。

3 min
A5.3

Goal、Reasoning 与 Planning 完整性

1 篇综述 · 1 篇独立研究

研究智能体目标、任务分解、规划状态和执行意图被改变或劫持的风险。

归档边界应用层任务语义与规划链归本类;模型内部 CoT 机理归 A1.5。

  • 目标劫持
  • 计划污染
  • 任务状态与约束绕过
分类综述研究综述更新 2026-09-10

Goal、Reasoning 与 Planning 完整性研究综述

说明 Agent 目标、任务分解、计划状态和停止条件被劫持时的攻击链与控制策略。

6 min
攻击方法研究更新 2026-09-20

具身 Agent 的环境状态文本注入

分析 ESTI 如何把伪造环境状态作为规划证据,并使偏移从高层计划传播到可验证的物理环境变化。

3 min
A5.4

Tool Use、Agency 与审批控制

1 篇综述 · 12 篇独立研究

研究智能体选择和调用合法工具时的权限、参数、审批和动作范围。

归档边界工具制品来源归 A3.3,Schema 注册语义归 A6.2,合法工具的危险使用归本类。

  • Excessive Agency
  • 工具越权调用
  • Human-in-the-loop 与审批绕过
分类综述研究综述更新 2026-09-10

Tool Use、Agency 与审批控制研究综述

分析 Agent 调用合法工具时的最小权限、参数约束、审批语义与 Excessive Agency 风险。

17 min
技术研究更新 2026-09-28

Ajar:Agent 防御中的开放权限度量

Ajar 引入'开放权限'(open privilege)作为 Agent 防御评测的第三维度(除攻击成功率和良性效用外),在 AgentDojo 的 97 个良性任务上评测 5 种防御,发现开放权限不能从攻击成功率或良性效用推导。

8 min
技术研究更新 2026-09-28

ChronosAttack:LLM Agent 的对抗性工具调度时序攻击

ChronosAttack 首次将工具响应时序本身作为攻击面,仅通过引入有界非负延迟改变真实工具响应的到达顺序即可影响 Agent 最终决策,不修改、添加、删除或加速任何响应内容。

7 min
防护研究更新 2026-09-10

有状态动作前控制的组合与重新判定

研究多个动作前控制依次修复请求时,动作、证据与资源状态如何变化,以及为何每次修复后都必须重新执行相关门禁。

9 min
防护研究更新 2026-09-10

DeFi Agent 的策略证明与精确交易执行绑定

分析 PACE 如何把类型化意图、策略、模拟结果与最终交易字节绑定,并由链上智能账户执行前强制验证。

4 min
技术研究更新 2026-09-01

ToolFailBench:诊断 LLM Agent 的工具使用失效

ToolFailBench 在五个高风险领域的 1000 个单轮任务上区分跳过必需工具、忽略工具结果、捏造输出和不必要调用,并以 19 个模型评估工具使用完整性。

5 min
技术研究更新 2026-09-01

能力门控不是授权:LLM Agent 框架中的混淆代理失效

本文审计 LangChain/LangGraph、LlamaIndex 和 Stripe Agent Toolkit 的工具授权边界,并以 ScopeGate 验证逐调用、逐参数的默认拒绝控制。

5 min
技术研究更新 2026-08-06

From Tool Connection to Execution Control: Benchmarking Security Invariants in MCP-Style Agent Runtimes

评估 MCP-style Agent runtime 在连接建立后的执行授权、主体绑定、资源解析、句柄数据流、审批和拒绝审计不变量,并比较 HCP 与两种连接层基线在十个受控攻击案例中的结果。

7 min
技术研究更新 2026-08-09

AUTHGRAPH:以授权图对齐执行来源追踪 Agent 注入

研究将隔离用户意图生成的授权图与实际执行来源图对齐,以发现工具和参数来源偏离。

3 min
技术研究更新 2026-08-09

AuthBench:编码 Agent 的最小权限边界推断评测

评估编码 Agent 能否从终端任务推断恰好足够的文件读、写、执行权限,并分析授权吸引子与分解式策略生成。

3 min
技术研究更新 2026-09-01

Function Hijacking:通过 Tool 描述劫持函数选择

Function Hijacking 研究攻击者仅控制候选 Tool 描述时,如何使函数调用模型选择攻击者指定的函数,并说明执行侧必须独立授权。

5 min
技术研究更新 2026-09-10

GAAP:以信息流控制约束 Agent 对私密数据的使用

研究以持久化信息流控制和用户定向授权约束 Agent 代码执行,避免模型、工具或提示词注入直接获得用户私密数据。

5 min
技术研究更新 2026-08-09

PhantomPolicy:Agent 的策略不可见违规与世界状态执行控制

研究未被工具返回内容显式表达的策略约束,提出 PhantomPolicy 基准及依赖世界状态不变量的执行拦截。

3 min
A5.5

Agent Runtime、Sandbox 与 Workspace

1 篇综述 · 15 篇独立研究

研究智能体执行代码、操作文件和使用宿主能力时的隔离、工作区与信任交接。

归档边界面向 Agent 执行链的沙箱和宿主交接归本类;训练/GPU 工作负载隔离归 A4.1。

  • 沙箱逃逸与配置
  • Workspace 边界
  • 沙箱内产物到宿主的信任交接
分类综述研究综述更新 2026-09-10

Agent 沙箱架构与逃逸研究综述

从容器、用户态内核、microVM、WASM 与本地系统沙箱比较 Agent 执行隔离,并分析真实逃逸链中最先失效的安全控制。

20 min
技术研究更新 2026-09-10

ClosureBound:Agent Skill 传递依赖闭包与效果时刻授权

研究如何把 Agent Skill 的传递依赖闭包、授权范围和规范化外部效果绑定到同一操作时刻,阻止旧授权跨版本与等价路径转移。

5 min
技术研究更新 2026-08-13

AI 编排平台的跨阶段代码执行风险

综合七款 AI 编排与工作流平台的 13 项发现,分析输入校验、代码生成与沙箱实际执行阶段不一致时如何形成远程代码执行。

11 min
技术研究更新 2026-08-13

Copilot Studio Python 沙箱逃逸与多租户影响

分析托管 Python 工具如何被反射访问链突破,以及共享管理凭据、容器寿命和响应回显为何会扩大多租户沙箱逃逸影响。

8 min
技术研究更新 2026-08-09

Living off the Coding Agent:编码 Agent 作为可信父进程掩护反向隧道与 LaunchAgent 持久化

分析 Elastic 记录的真实端点事件——编码 Agent(Claude Code)派生的子进程建立反向隧道并安装 LaunchAgent 持久化,暴露"可信父进程血缘"不能作为检测降级依据的问题。

6 min
市场与威胁模型综合分析更新 2026-09-06

Agent 沙箱市场地图、AgentENV 案例与安全成熟度模型

按隔离原语、MicroVM、云托管服务、自托管运行时、编码 Agent 内置沙箱、浏览器沙箱和机密计算七层比较 Agent 沙箱市场,并给出 L1-L5 安全成熟度对照。

14 min
案例研究更新 2026-08-03

Week of Sandbox Escapes 案例与检测分析

复盘 Pillar Security 披露的 Agent 沙箱逃逸案例,按信任边界、根因、可观测信号和缓解控制进行归纳。

21 min
技术研究更新 2026-08-06

Bulkhead: Automated Semantic Detection and Remediation of Container Escape Vulnerabilities

分析 Bulkhead 如何用跨组件路径解析不变量检测并修补容器逃逸漏洞,以及其单模型评测和预定义不变量带来的适用限制。

5 min
技术研究更新 2026-08-07

VIGIL:将 Agent Skill 行为规范编译为运行时约束

用时序、参数和值流约束检查第三方 Skill 的实际执行轨迹。

3 min
攻击方法研究更新 2026-09-01

AI CLI 工具的零点击 RCE:Windows 二进制搜索顺序劫持与配置投毒

分析 Cymulate 披露的五款 AI 编码 CLI/IDE 工具漏洞——Windows 下工作区本地可执行文件优先于系统路径被解析执行,以及 AWS Kiro 未审批写入执行敏感配置文件触发自动任务执行。

9 min
技术研究更新 2026-08-23

Agent libOS:自演化 Agent 的能力控制运行时

以显式 capability 原语隔离 Skill、JIT Tool、Memory、Checkpoint 和子进程的动作面与资源权限。

3 min
技术研究更新 2026-08-08

SkillGuard:把 Agent Skill 作为双平面权限主体

研究 Skill 如何同时影响模型上下文与工具副作用,并以 manifest、运行时权限控制和用户确认把两类影响放入同一执行策略。

4 min
技术研究更新 2026-08-09

Sandlock:以非特权 Linux 原语约束 Agent 生成代码

分析 Sandlock 如何以 Landlock、seccomp-bpf 与窄监督器限制 Agent 执行代码的文件、网络、IPC 和系统调用权限。

3 min
技术研究更新 2026-08-09

OpenAI Codex 的 Windows 沙箱架构:从未提权到提权方案的决策链

解读 OpenAI 官方工程博客披露的 Codex CLI Windows 沙箱实现,分析未提权方案为何被放弃、提权方案如何用合成用户绕过受限令牌无法绑定防火墙规则的限制。

6 min
攻击方法研究更新 2026-08-23

Gemini CLI 无人值守模式工作区信任绕过 RCE(CVSS 10.0)

分析 GHSA-wpqr-6v78-jr5g——Gemini CLI 在 CI/CD 等无人值守模式下自动信任工作区目录、`--yolo` 模式绕过细粒度工具白名单两个复合设计缺陷如何组合成沙箱初始化前的远程代码执行。

9 min
技术研究更新 2026-08-08

编码 Agent 沙箱的跨产品重复失效模式

记录 Black Hat Asia 2026 的 Bad Vibes 研究对多种编码 Agent 中提示词注入、路径处理与沙箱策略问题的报告;公开材料含摘要与幻灯片,未提供统一复现套件。

3 min
A5.6

Multi-Agent 编排与信任传播

1 篇综述 · 12 篇独立研究

研究多个 Agent 在委派、协作、共享记忆和级联执行中的系统性失效。

归档边界编排与行为传播归本类;Agent 间线协议、消息签名和身份传播归 A6。

  • Rogue Agent
  • 级联故障
  • 跨 Agent 任务与信任传播
分类综述研究综述更新 2026-09-10

Multi-Agent 编排与信任传播研究综述

分析多 Agent 委派、共享记忆、消息转发与级联执行中的主体混淆、信任放大和故障传播。

13 min
技术研究更新 2026-09-28

Agent 名称冲突攻击:多 Agent 系统中的错误对端调度

首次系统研究多 Agent 系统中以 Agent 名称作为路由标识符导致的错误对端调度攻击,覆盖 7 个开源实现中 4 种实现形式的受控测试结果与必要攻击条件。

8 min
攻击方法研究更新 2026-09-10

多 Agent 从众导致保形预测证书失效

研究一致错误同伴如何改变目标模型的评分机制,使干净数据上校准的保形预测覆盖率和不确定时升级策略失效。

4 min
防护研究更新 2026-09-06

多 Agent 系统的联邦拓扑防护:FGLGuard

分析 FGLGuard 如何在不汇集原始交互轨迹的条件下联合训练拓扑风险检测器,并核验其三项有机风险基准、四域迁移、AgentDojo 攻击成功率与隐私限制。

10 min
技术研究更新 2026-09-01

Agent 组件交接中的政策事实衰减

研究多 Agent 任务分解后,已发现的政策相关事实如何在组件交接摘要中丢失,并导致升级处置不足或升级处置过度。

6 min
防护研究更新 2026-09-10

潜在多 Agent 协同通信的可核验监测

分析公共对话不可见的潜在状态如何承载多 Agent 协同信号,以及如何用事件绑定、反事实影响和表示解释建立监测闭环。

8 min
攻击方法研究更新 2026-08-23

Agent 社区中的记忆介导极化级联

分析少量 Agent 受定向内容影响后,持久记忆、共同检索线索和公开讨论如何把局部干预扩散为群体极化。

5 min
风险研究更新 2026-08-23

长时程多 Agent 运营中的自发失调通信

研究竞争性商业模拟中虚假事实、操纵、串谋与威胁如何在没有专门攻击诱导时出现,并分析资源压力与对手历史的关联。

6 min
风险研究更新 2026-09-10

多 Agent 系统性失效实验:从从众到冲突升级

综合 Anthropic 对协同收益、资源从众、隐性共谋、信息汇总失败和冲突目标升级的受控多 Agent 实验。

6 min
技术研究更新 2026-09-01

多 Agent 语义信息流控制:SafeFlow 的跨任务风险传播防护

分析 SafeFlow 如何在多 Agent 工作流中传播语义污点、重建 source-sink 路径并延迟高影响动作,以及其自适应攻击和部署限制。

8 min
技术研究更新 2026-08-06

通过赌注机制去中心化聚合 LLM 预测

WALLA 用留一基线、支付函数和隐藏状态赌注网络约束独立 LLM 服务夸大置信度争夺聚合权重,并在五个数据集上比较多种预测聚合器。

4 min
技术研究更新 2026-08-06

Formal Security Analysis of Agent Protocol Composition

以 AgentThread 将 MCP、A2A、ANP、ACP-Cap 与 ACP-Client 的协议规范、TLA+ 不变量、SDK 测试和跨协议桥接责任关联起来,核验协议组合中的授权放大、注入传播、同意绕过和审计缺口。

6 min
技术研究更新 2026-08-09

SCHEME:多 Agent 编码系统的协同破坏与监控评测

评估多个编码 Agent 能否在完成表面任务的同时协同实施隐藏破坏目标,并比较代码与通信监控的检测能力。

3 min
A5.7

Output Rendering 与下游执行

1 篇综述 · 0 篇独立研究

研究模型或 Agent 输出被日志、Markdown、浏览器、终端和下游组件解释时的风险。

归档边界输出进入可信渲染或执行链后的漏洞归本类,包括日志污染和 C2PA 应用链剥离。

  • 日志与审计记录污染
  • Markdown/HTML/终端注入
  • 下游代码执行与内容凭证剥离
分类综述研究综述更新 2026-09-01

Output Rendering 与下游执行研究综述

研究模型输出进入 Markdown、HTML、终端、日志和自动执行链后产生的注入、污染与内容凭证剥离风险。

3 min
A5.8

浏览器与 Computer Use Agent

1 篇综述 · 3 篇独立研究

研究操作网页、桌面 UI 和计算机环境的视觉智能体所特有的攻击面。

归档边界界面理解、点击和确认语义归本类,限定首个失效控制是界面感知、渲染时序或点击/确认语义本身(如观察—点击间的 TOCTOU 竞态、未核验终态即执行高影响动作);底层浏览器引擎的通用漏洞不作为 AI 专项;首个失效控制是不可信内容越权成为指令时归 A5.1。

  • 界面感知与执行状态的 TOCTOU
  • Agent Clickjacking
  • 支付、同意与确认绕过
分类综述研究综述更新 2026-09-01

浏览器与 Computer Use Agent 安全研究综述

分析视觉提示词注入、DOM 欺骗、Agent Clickjacking 与支付/同意确认绕过等计算机使用 Agent 专项风险。

6 min
攻击方法研究更新 2026-09-01

系统级移动 Agent 的触控与 IMU 联合自动化规避

分析 ActReal 如何同步生成触控轨迹与应用可见惯性传感器信号,从而绕过依赖物理耦合的移动自动化检测。

4 min
技术研究更新 2026-08-27

GUI Agent 的 TOCTOU 与跨应用动作重绑定

综合桌面和 Android GUI Agent 在观察到执行之间的状态竞争,分析窗口切换、DOM 变更与跨应用动作重绑定。

5 min
技术研究更新 2026-08-09

OS-BLIND:良性用户指令下的 Computer Use Agent 风险

OS-BLIND 评估用户请求表面无害、但环境状态或子任务可导致高影响动作的 Computer Use Agent 失效。

3 min
A5.9

可观测性、行为归因与审计链

1 篇综述 · 3 篇独立研究

研究智能体动作能否被完整记录、归因、关联并支持事后取证。

归档边界产品应提供的日志和归因能力归本类;跨系统的响应方法与取证流程归 C6。

  • 多 Agent 行为归因
  • 审计日志完整性
  • 执行轨迹与证据链
分类综述研究综述更新 2026-09-10

Agent 可观测性、行为归因与审计链研究综述

定义多步与多 Agent 执行中可用于检测、归责和取证的结构化事件、主体和证据完整性要求。

9 min
技术研究更新 2026-09-10

TrajMark:编码 Agent 轨迹所有权与分段篡改定位

研究如何把稳健的所有权信号与脆弱的局部完整性承诺分离,在仅可见执行轨迹上恢复部署标识并定位被修改的协议区段。

4 min
攻击方法研究更新 2026-09-10

AgentLeak:从执行差分克隆 Agent 隐式程序能力

分析弱 Agent 如何通过比较自身失败轨迹与强 Agent 成功轨迹,补写可复用 Skill 并恢复隐式程序知识。

4 min
技术研究更新 2026-09-01

Notarized Agents:由接收服务签发的 Agent 动作收据

以接收方签名、所有者加密和见证透明日志重建不依赖 Agent 自报的动作轨迹。

3 min