外观
指令、上下文、规划、工具、沙箱、编排与输出执行链。
归档边界:只有放在 AI 应用或 Agent 语义和执行链中才成立。
研究网页、文档、邮件、工具返回和 RAG 内容越权成为应用指令的攻击。
归档边界第三方内容跨越 content-to-instruction 边界归本类;用户直接越狱模型归 A1.1。
研究 System Prompt、检索结果、会话记忆和应用状态进入模型上下文后的安全。
归档边界消费侧优先级、泄露和跨会话行为归本类;底层存储与索引完整性归 A2。
研究智能体目标、任务分解、规划状态和执行意图被改变或劫持的风险。
归档边界应用层任务语义与规划链归本类;模型内部 CoT 机理归 A1.5。
研究智能体选择和调用合法工具时的权限、参数、审批和动作范围。
归档边界工具制品来源归 A3.3,Schema 注册语义归 A6.2,合法工具的危险使用归本类。
研究智能体执行代码、操作文件和使用宿主能力时的隔离、工作区与信任交接。
归档边界面向 Agent 执行链的沙箱和宿主交接归本类;训练/GPU 工作负载隔离归 A4.1。
整理日期:2026-07-30。整理方式:WebSearch 广撒网后交叉核对多条搜索结果摘要,未对每个来源逐一做二次访问核实,使用前建议自行确认链接仍然有效。
调研日期:2026-07-30。来源:Pillar Security 博客系列(7 篇独立逃逸披露 + 1 篇 OpenAI 第八案例追加 + 1 篇 CTF/Hugging Face 关联事件),核实方式为逐篇 WebFetch 全文抓取(而非只读汇总页摘要)。
证据等级说明(沿用 pentest-agent-countermeasure/notes/security-agent-countermeasure-research.md 的约定):强 表示有 CVE 编号、官方安全公告或可复现的第三方研究支撑;中 表示只有厂商产品页/博客描述、无独立验证;...
研究多个 Agent 在委派、协作、共享记忆和级联执行中的系统性失效。
归档边界编排与行为传播归本类;Agent 间线协议、消息签名和身份传播归 A6。
研究模型或 Agent 输出被日志、Markdown、浏览器、终端和下游组件解释时的风险。
归档边界输出进入可信渲染或执行链后的漏洞归本类,包括日志污染和 C2PA 应用链剥离。
研究操作网页、桌面 UI 和计算机环境的视觉智能体所特有的攻击面。
归档边界界面理解、点击和确认语义归本类;底层浏览器引擎的通用漏洞不作为 AI 专项。
研究智能体动作能否被完整记录、归因、关联并支持事后取证。
归档边界产品应提供的日志和归因能力归本类;跨系统的响应方法与取证流程归 C6。