外观
指令、上下文、规划、工具、沙箱、编排与输出执行链。
归档边界:只有放在 AI 应用或 Agent 语义和执行链中才成立。
研究网页、文档、邮件、工具返回和 RAG 内容越权成为应用指令的攻击。
归档边界第三方内容跨越 content-to-instruction 边界归本类,不论载体是文本、图像、DOM 还是浏览器/桌面界面(隐藏文字图片、视觉提示注入本质仍是内容越权成为指令);用户直接越狱模型归 A1.1。
定义第三方内容越权成为指令时的 Prompt Injection 根因、投递路径、影响链和确定性控制策略。
首次证明注入模型自身的控制标记符可完全压制 Agent 思维链,使基于推理的安全监控失效,并揭示工具调用触发由 Harness Parser 而非模型决定。
综合 Repeat-After-Me 与 AgentHijack,分析视觉载荷如何从模型输出传播到精确工具调用、环境副作用和持久配置。
分析如何用内容无关的行为后缀和预填充 token 概率,在模型开始解码前识别上下文泄露攻击,并评估自适应规避与部署代价。
分析 URL 参数如何直接进入 Microsoft Copilot 与 Atlassian Rovo 的提示词,并借助允许访问的搜索或渲染通道外传企业数据。
分析错误追踪、WAF 和日志平台中的攻击者可控字段如何进入 AI 运维工作流,并进一步触发包安装、DNS 修改和命令执行。
将感知片段的生产者、预期语义和先验绑定到状态更新,降低不可信观察劫持 Agent 决策的风险。
综合 Unicode 隐写、双向重排/同形字、CSS 生成内容与自定义字体字形替换等技术,说明攻击者如何让人类、文本解析流水线与渲染型 AI 分别读取不同内容,用于绕过内容审核,或反向欺骗被用作"安全判断者"的 AI。
分析离线复盘如何提炼跨目标攻击策略,并将测试时攻击压缩为一次查询。
评估移动端 Agent 同时读取界面视觉与无障碍元数据时,隐藏指令如何造成目标劫持和越权操作。
复盘 Zenity Labs 在 Claude in Chrome、ChatGPT Atlas 与 Perplexity Comet 上披露的浏览器 Agent 攻击链,区分已演示机制、产品差异和证据限制。
分析第三方恶意语音与用户语音并发时,音频 Agent 将环境内容误当指令的攻击机制、实测结果及声源分离方案的适用范围。
分析外部 Word 文档中的间接提示词注入如何篡改下游文档并复制自身,形成依赖正常办公工作流传播的文档型 AI worm。
分析移动 GUI 截图中用户生成内容如何被视觉语言模型当作动作指令,以及 MIRAGE 如何系统化构造这类评测样本。
对 12 亿 URL 中的间接提示词注入进行验证、分类和受控效果测量,说明网页输入的结构保留会显著影响 Agent 的服从风险。
记录 Black Hat Asia 2026 对 DFIR Agent 处理日志和计划任务时的结构化数据提示词注入研究;公开材料含摘要与幻灯片,未提供完整复现环境。
研究通过近乎不可感知的对抗音频影响 Audio LLM 行为,并报告在受控实验中对多种模型与两项商业语音服务的工具调用影响。
分析 DRIP 如何区分数据中的指令语义与真正授权指令,并评估其安全性、效用和适用限制。
分析高分辨率图像在模型侧缩放后显现隐藏指令的感知差异,以及该输入变换如何与 Agent 工具权限组合造成数据外泄。
研究 System Prompt、检索结果、会话记忆和应用状态进入模型上下文后的安全。
归档边界消费侧优先级、泄露和跨会话行为归本类;底层存储与索引完整性归 A2。
分析 System Prompt、检索结果、历史消息与长期记忆进入上下文后的优先级、泄露和跨会话风险。
研究删除请求如何覆盖摘要、Memory、待执行计划与 KV cache 等派生状态,并用来源引导的选择性重放恢复反事实执行状态。
区分规则丢失、谓词降级和文本仍在但行为不触发,审计上下文压缩后的真实护栏效果。
分析恶意经验如何经自进化流水线转化为低可检测、可路由且在来源删除后继续存在的持久 Skill。
将 Prompt Injection 从单次输入扩展到 Memory、文件和工具状态的持久化生命周期。
研究智能体目标、任务分解、规划状态和执行意图被改变或劫持的风险。
归档边界应用层任务语义与规划链归本类;模型内部 CoT 机理归 A1.5。
研究智能体选择和调用合法工具时的权限、参数、审批和动作范围。
归档边界工具制品来源归 A3.3,Schema 注册语义归 A6.2,合法工具的危险使用归本类。
分析 Agent 调用合法工具时的最小权限、参数约束、审批语义与 Excessive Agency 风险。
Ajar 引入'开放权限'(open privilege)作为 Agent 防御评测的第三维度(除攻击成功率和良性效用外),在 AgentDojo 的 97 个良性任务上评测 5 种防御,发现开放权限不能从攻击成功率或良性效用推导。
ChronosAttack 首次将工具响应时序本身作为攻击面,仅通过引入有界非负延迟改变真实工具响应的到达顺序即可影响 Agent 最终决策,不修改、添加、删除或加速任何响应内容。
研究多个动作前控制依次修复请求时,动作、证据与资源状态如何变化,以及为何每次修复后都必须重新执行相关门禁。
分析 PACE 如何把类型化意图、策略、模拟结果与最终交易字节绑定,并由链上智能账户执行前强制验证。
ToolFailBench 在五个高风险领域的 1000 个单轮任务上区分跳过必需工具、忽略工具结果、捏造输出和不必要调用,并以 19 个模型评估工具使用完整性。
本文审计 LangChain/LangGraph、LlamaIndex 和 Stripe Agent Toolkit 的工具授权边界,并以 ScopeGate 验证逐调用、逐参数的默认拒绝控制。
评估 MCP-style Agent runtime 在连接建立后的执行授权、主体绑定、资源解析、句柄数据流、审批和拒绝审计不变量,并比较 HCP 与两种连接层基线在十个受控攻击案例中的结果。
研究将隔离用户意图生成的授权图与实际执行来源图对齐,以发现工具和参数来源偏离。
评估编码 Agent 能否从终端任务推断恰好足够的文件读、写、执行权限,并分析授权吸引子与分解式策略生成。
Function Hijacking 研究攻击者仅控制候选 Tool 描述时,如何使函数调用模型选择攻击者指定的函数,并说明执行侧必须独立授权。
研究以持久化信息流控制和用户定向授权约束 Agent 代码执行,避免模型、工具或提示词注入直接获得用户私密数据。
研究未被工具返回内容显式表达的策略约束,提出 PhantomPolicy 基准及依赖世界状态不变量的执行拦截。
研究智能体执行代码、操作文件和使用宿主能力时的隔离、工作区与信任交接。
归档边界面向 Agent 执行链的沙箱和宿主交接归本类;训练/GPU 工作负载隔离归 A4.1。
从容器、用户态内核、microVM、WASM 与本地系统沙箱比较 Agent 执行隔离,并分析真实逃逸链中最先失效的安全控制。
研究如何把 Agent Skill 的传递依赖闭包、授权范围和规范化外部效果绑定到同一操作时刻,阻止旧授权跨版本与等价路径转移。
综合七款 AI 编排与工作流平台的 13 项发现,分析输入校验、代码生成与沙箱实际执行阶段不一致时如何形成远程代码执行。
分析托管 Python 工具如何被反射访问链突破,以及共享管理凭据、容器寿命和响应回显为何会扩大多租户沙箱逃逸影响。
分析 Elastic 记录的真实端点事件——编码 Agent(Claude Code)派生的子进程建立反向隧道并安装 LaunchAgent 持久化,暴露"可信父进程血缘"不能作为检测降级依据的问题。
按隔离原语、MicroVM、云托管服务、自托管运行时、编码 Agent 内置沙箱、浏览器沙箱和机密计算七层比较 Agent 沙箱市场,并给出 L1-L5 安全成熟度对照。
复盘 Pillar Security 披露的 Agent 沙箱逃逸案例,按信任边界、根因、可观测信号和缓解控制进行归纳。
分析 Bulkhead 如何用跨组件路径解析不变量检测并修补容器逃逸漏洞,以及其单模型评测和预定义不变量带来的适用限制。
用时序、参数和值流约束检查第三方 Skill 的实际执行轨迹。
分析 Cymulate 披露的五款 AI 编码 CLI/IDE 工具漏洞——Windows 下工作区本地可执行文件优先于系统路径被解析执行,以及 AWS Kiro 未审批写入执行敏感配置文件触发自动任务执行。
以显式 capability 原语隔离 Skill、JIT Tool、Memory、Checkpoint 和子进程的动作面与资源权限。
研究 Skill 如何同时影响模型上下文与工具副作用,并以 manifest、运行时权限控制和用户确认把两类影响放入同一执行策略。
分析 Sandlock 如何以 Landlock、seccomp-bpf 与窄监督器限制 Agent 执行代码的文件、网络、IPC 和系统调用权限。
解读 OpenAI 官方工程博客披露的 Codex CLI Windows 沙箱实现,分析未提权方案为何被放弃、提权方案如何用合成用户绕过受限令牌无法绑定防火墙规则的限制。
分析 GHSA-wpqr-6v78-jr5g——Gemini CLI 在 CI/CD 等无人值守模式下自动信任工作区目录、`--yolo` 模式绕过细粒度工具白名单两个复合设计缺陷如何组合成沙箱初始化前的远程代码执行。
记录 Black Hat Asia 2026 的 Bad Vibes 研究对多种编码 Agent 中提示词注入、路径处理与沙箱策略问题的报告;公开材料含摘要与幻灯片,未提供统一复现套件。
研究多个 Agent 在委派、协作、共享记忆和级联执行中的系统性失效。
归档边界编排与行为传播归本类;Agent 间线协议、消息签名和身份传播归 A6。
分析多 Agent 委派、共享记忆、消息转发与级联执行中的主体混淆、信任放大和故障传播。
首次系统研究多 Agent 系统中以 Agent 名称作为路由标识符导致的错误对端调度攻击,覆盖 7 个开源实现中 4 种实现形式的受控测试结果与必要攻击条件。
研究一致错误同伴如何改变目标模型的评分机制,使干净数据上校准的保形预测覆盖率和不确定时升级策略失效。
分析 FGLGuard 如何在不汇集原始交互轨迹的条件下联合训练拓扑风险检测器,并核验其三项有机风险基准、四域迁移、AgentDojo 攻击成功率与隐私限制。
研究多 Agent 任务分解后,已发现的政策相关事实如何在组件交接摘要中丢失,并导致升级处置不足或升级处置过度。
分析公共对话不可见的潜在状态如何承载多 Agent 协同信号,以及如何用事件绑定、反事实影响和表示解释建立监测闭环。
分析少量 Agent 受定向内容影响后,持久记忆、共同检索线索和公开讨论如何把局部干预扩散为群体极化。
研究竞争性商业模拟中虚假事实、操纵、串谋与威胁如何在没有专门攻击诱导时出现,并分析资源压力与对手历史的关联。
综合 Anthropic 对协同收益、资源从众、隐性共谋、信息汇总失败和冲突目标升级的受控多 Agent 实验。
分析 SafeFlow 如何在多 Agent 工作流中传播语义污点、重建 source-sink 路径并延迟高影响动作,以及其自适应攻击和部署限制。
WALLA 用留一基线、支付函数和隐藏状态赌注网络约束独立 LLM 服务夸大置信度争夺聚合权重,并在五个数据集上比较多种预测聚合器。
以 AgentThread 将 MCP、A2A、ANP、ACP-Cap 与 ACP-Client 的协议规范、TLA+ 不变量、SDK 测试和跨协议桥接责任关联起来,核验协议组合中的授权放大、注入传播、同意绕过和审计缺口。
评估多个编码 Agent 能否在完成表面任务的同时协同实施隐藏破坏目标,并比较代码与通信监控的检测能力。
研究模型或 Agent 输出被日志、Markdown、浏览器、终端和下游组件解释时的风险。
归档边界输出进入可信渲染或执行链后的漏洞归本类,包括日志污染和 C2PA 应用链剥离。
研究操作网页、桌面 UI 和计算机环境的视觉智能体所特有的攻击面。
归档边界界面理解、点击和确认语义归本类,限定首个失效控制是界面感知、渲染时序或点击/确认语义本身(如观察—点击间的 TOCTOU 竞态、未核验终态即执行高影响动作);底层浏览器引擎的通用漏洞不作为 AI 专项;首个失效控制是不可信内容越权成为指令时归 A5.1。
分析视觉提示词注入、DOM 欺骗、Agent Clickjacking 与支付/同意确认绕过等计算机使用 Agent 专项风险。
分析 ActReal 如何同步生成触控轨迹与应用可见惯性传感器信号,从而绕过依赖物理耦合的移动自动化检测。
综合桌面和 Android GUI Agent 在观察到执行之间的状态竞争,分析窗口切换、DOM 变更与跨应用动作重绑定。
OS-BLIND 评估用户请求表面无害、但环境状态或子任务可导致高影响动作的 Computer Use Agent 失效。
研究智能体动作能否被完整记录、归因、关联并支持事后取证。
归档边界产品应提供的日志和归因能力归本类;跨系统的响应方法与取证流程归 C6。
定义多步与多 Agent 执行中可用于检测、归责和取证的结构化事件、主体和证据完整性要求。
研究如何把稳健的所有权信号与脆弱的局部完整性承诺分离,在仅可见执行轨迹上恢复部署标识并定位被修改的协议区段。
分析弱 Agent 如何通过比较自身失败轨迹与强 Agent 成功轨迹,补写可复用 Skill 并恢复隐式程序知识。
以接收方签名、所有者加密和见证透明日志重建不依赖 Agent 自报的动作轨迹。