Skip to content
A5 / 核心攻击面

AI 应用与智能体系统安全

指令、上下文、规划、工具、沙箱、编排与输出执行链。

归档边界:只有放在 AI 应用或 Agent 语义和执行链中才成立。

9 个二级分类 · 4 篇内容
A5.1

Prompt Injection 与上下文信任边界

1 篇研究

研究网页、文档、邮件、工具返回和 RAG 内容越权成为应用指令的攻击。

归档边界第三方内容跨越 content-to-instruction 边界归本类;用户直接越狱模型归 A1.1。

  • 直接与间接 Prompt Injection
  • 指令层级冲突
  • 跨模态内容注入
关注清单2026-07-30

持续关注清单:Agent Security / Prompt Injection 研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个账号逐一做二次访问核实,使用前建议自行确认链接仍然有效。

3 min
A5.2

上下文组装、RAG 与 Memory 消费

0 篇研究

研究 System Prompt、检索结果、会话记忆和应用状态进入模型上下文后的安全。

归档边界消费侧优先级、泄露和跨会话行为归本类;底层存储与索引完整性归 A2。

  • System Prompt 与上下文泄露
  • RAG 消费侧安全
  • 跨会话记忆污染
暂无研究文章,保留为后续研究入口。
A5.3

Goal、Reasoning 与 Planning 完整性

0 篇研究

研究智能体目标、任务分解、规划状态和执行意图被改变或劫持的风险。

归档边界应用层任务语义与规划链归本类;模型内部 CoT 机理归 A1.5。

  • 目标劫持
  • 计划污染
  • 任务状态与约束绕过
暂无研究文章,保留为后续研究入口。
A5.4

Tool Use、Agency 与审批控制

0 篇研究

研究智能体选择和调用合法工具时的权限、参数、审批和动作范围。

归档边界工具制品来源归 A3.3,Schema 注册语义归 A6.2,合法工具的危险使用归本类。

  • Excessive Agency
  • 工具越权调用
  • Human-in-the-loop 与审批绕过
暂无研究文章,保留为后续研究入口。
A5.5

Agent Runtime、Sandbox 与 Workspace

3 篇研究

研究智能体执行代码、操作文件和使用宿主能力时的隔离、工作区与信任交接。

归档边界面向 Agent 执行链的沙箱和宿主交接归本类;训练/GPU 工作负载隔离归 A4.1。

  • 沙箱逃逸与配置
  • Workspace 边界
  • 沙箱内产物到宿主的信任交接
关注清单2026-07-30

持续关注清单:Sandbox / 执行隔离安全研究

整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。

3 min
研究笔记2026-07-30

Pillar Security "Week of Sandbox Escapes" 系列深度研究:逃逸案例与检测方式

调研日期:2026-07-30。来源:Pillar Security 博客系列(7 篇独立逃逸披露 + 1 篇 OpenAI 第八案例追加 + 1 篇 CTF/Hugging Face 关联事件),核实方式为逐篇 WebFetch 全文抓取(而非只读汇总页摘要)。

18 min
研究笔记2026-07-28

Agent 沙箱产品全景与逃逸手法研究

证据等级说明(沿用 pentest-agent-countermeasure/notes/security-agent-countermeasure-research.md 的约定):强 表示有 CVE 编号、官方安全公告或可复现的第三方研究支撑;中 表示只有厂商产品页/博客描述、无独立验证;...

27 min
A5.6

Multi-Agent 编排与信任传播

0 篇研究

研究多个 Agent 在委派、协作、共享记忆和级联执行中的系统性失效。

归档边界编排与行为传播归本类;Agent 间线协议、消息签名和身份传播归 A6。

  • Rogue Agent
  • 级联故障
  • 跨 Agent 任务与信任传播
暂无研究文章,保留为后续研究入口。
A5.7

Output Rendering 与下游执行

0 篇研究

研究模型或 Agent 输出被日志、Markdown、浏览器、终端和下游组件解释时的风险。

归档边界输出进入可信渲染或执行链后的漏洞归本类,包括日志污染和 C2PA 应用链剥离。

  • 日志与审计记录污染
  • Markdown/HTML/终端注入
  • 下游代码执行与内容凭证剥离
暂无研究文章,保留为后续研究入口。
A5.8

浏览器与 Computer Use Agent

0 篇研究

研究操作网页、桌面 UI 和计算机环境的视觉智能体所特有的攻击面。

归档边界界面理解、点击和确认语义归本类;底层浏览器引擎的通用漏洞不作为 AI 专项。

  • 视觉提示注入与 DOM 注入
  • Agent Clickjacking
  • 支付、同意与确认绕过
暂无研究文章,保留为后续研究入口。
A5.9

可观测性、行为归因与审计链

0 篇研究

研究智能体动作能否被完整记录、归因、关联并支持事后取证。

归档边界产品应提供的日志和归因能力归本类;跨系统的响应方法与取证流程归 C6。

  • 多 Agent 行为归因
  • 审计日志完整性
  • 执行轨迹与证据链
暂无研究文章,保留为后续研究入口。