Skip to content

多 Agent 语义信息流控制:SafeFlow 的跨任务风险传播防护 ​

摘要 ​

多 Agent 系统可把一个危险目标拆成若干局部合理的子任务:一个 Agent 检索敏感信息,另一个改写内容,第三个打包,最后一个外发。逐条检查时没有任何单步显得完整恶意,但整条路径已把受保护来源连接到高风险输出。

SafeFlow 把这一问题建模为语义信息流控制:给任务与中间结果附加风险标签,沿协作图传播,在执行不可逆动作前重建全局 source-sink 路径并统一判定。作者在 ASB、AgentHarm、RedCode 和 SafeArena 的固定 110 条切片上,将未防护流程的平均 ASR 从 69.3% 降至 12.7%;自适应工作流规避条件下仍有 20.9% 至 24.5% ASR,说明防护显著降低但没有消除风险。

核心创新与差异 ​

原研究贡献是把多 Agent 安全从单 Prompt 分类提升到跨步骤信息流,定义意图标注、污点传播、上下文重建、全局验证和最终决策五个阶段,并公开实现。

本站分析认为,SafeFlow 的价值在于保留委派过程中容易丢失的风险状态。传统 Guardrail 常对每个 Agent 的当前输入或输出独立分类;SafeFlow 判断的是“受保护来源是否经由多个局部合法步骤流向禁止的动作”。这与协议层消息签名不同,首个失效的是应用编排对跨 Agent 信任和来源的传播,主归 A5.6。

威胁模型与攻击链 ​

攻击者可以提交恶意目标、控制第三方内容,或使某个 Agent 输出受污染的中间结果。防守方假设 Agent、Planner 和工具调用都经过可信包装器,包装器可以观测标准化事件并延迟高影响动作。

  1. 恶意目标被拆分为检索、转换、打包和发送等子任务。
  2. 各 Agent 只看到局部上下文,单步分类器认为行为合理。
  3. 中间结果经过重写和委派后,原始敏感来源或危险意图标签丢失。
  4. 最后一个 Agent 调用外发、执行或发布类工具。
  5. 若系统没有重建完整路径,局部安全步骤组合成数据泄露或危险动作。

实验设计与实际过程 ​

以下均为论文作者实验,本站未独立复现。作者从 ASB、AgentHarm、RedCode 和 SafeArena 各取 110 条固定样本,在相同 Planner 输出、Agent 消息、工具轨迹和待执行动作可见性下比较 SafeAgents、GuardAgent、AutoDefense、AegisLLM 与 SafeFlow。

主要指标包括攻击成功率(ASR,越低越好)、正常任务完成率(TCR,越高越好)、误报率(FPR,越低越好)以及有害任务阻断与配对正常任务完成同时成立的 paired success。作者还测试四类 Prompt 越狱包装、跨 Agent 拆分、三种自适应工作流规避和防护侧间接注入。

关键结果与实际影响 ​

四个基准中,SafeFlow 的 TCR 为 88.9% 至 92.4%,FPR 为 4.6% 至 7.2%,ASR 为 9.1% 至 17.3%。按 440 个有害样本汇总,ASR 为 56/440,即 12.7%,95% 置信区间为 9.9% 至 16.2%。未防护 SafeAgents 的平均 ASR 为 69.3%。

Prompt 层攻击会提高残余风险:ReNeLLM、GPTFuzz、JailBroken 和 MultiLingual 条件下,SafeFlow ASR 分别为 25.5%、20.9%、32.3% 和 19.1%。三种自适应工作流规避将 ASR 提高到 20.9% 至 24.5%,对应路径召回率为 72.5% 至 85.9%。

部署代价也不可忽略:主设置中每条有害工作流平均增加 3.7 次 LLM 调用和 8.8 秒延迟。效果依赖可信包装器能够观察并规范化工具、目标、授权和阶段状态。

MNC:把最小披露绑定到后续用途 ​

Minimum-Necessary Communication(MNC)补充了 SafeFlow 没有重点处理的“合法知情 Agent 应披露多少”问题。系统从应用预先定义的候选披露中选择满足任务且风险最低的一项,并绑定接收者、用途、转发、生命周期、日志和记忆读写范围;历史感知版本还累计跨轮披露预算。Reference Monitor 随后约束 Tool、Log、Memory 和再次转发,而不只改写消息文本。

作者在 Llama-3-8B、Mistral-7B 和 Qwen2.5-7B 的 600 条配对 MAGPIE 轨迹上报告:MNC-C 的任务成功率为 0.567,原始共享为 0.373;最强攻击者从完整内部轨迹获得的额外准确率从 0.326 降至 0.035。历史预算把该值进一步降到 0.026,加入可信 Broker 后为 0.017,但任务成功率分别降至 0.473 和 0.378。结果说明披露范围和累计预算能降低推断风险,也会产生可见的效用代价。

这些数值只相对于论文的 5 类攻击者、合成任务和 Reference Monitor 成立,不构成形式化隐私保证。候选披露族由应用预设,风险估计、来源标记和 Monitor 必须可信;600 条轨迹与 400 条无安全回执场景尚无独立复现。SafeFlow 解决跨任务危险路径,MNC 解决任务所需信息的最小化与二次使用,两者可组合但不能互相替代。

接收端 Tokenization 形成隐蔽信道 ​

TI-StegoAlign 展示了语义信息流控制的另一项限制:两个 Agent 可以把秘密编码进看似正常的任务消息,且发送端和接收端 Tokenization 不一致会成为信道设计的一部分。作者在 Llama-3.1-8B、Qwen3-8B 和 3 类文本域上报告接收端 bit 准确率与消息完全恢复率均为 100%;针对隐写分析器的训练能降低检测信号,但效果依赖检测器和文本域。

这些结果来自作者设置且没有独立复现,100% 只适用于已测试模型、编码预算和信道。它不推翻 SafeFlow 或 MNC 对显式来源、用途和工具路径的约束,但说明可信 Reference Monitor 若只检查语义与结构化标签,仍可能看不到合作 Agent 在自然语言表面下建立的隐蔽信道。验证应加入接收端重分词、跨模型检测、通信容量限制和主动扰动测试。

AgentFlow:以策略语言统一来源、路径与受控释放 ​

AgentFlow把同一信息流控制方向扩展为显式策略语言:规则可约束敏感字段允许进入的工具和 Sink、委派路径、任务能力、受控释放以及跨步骤有状态污点,并由 Runtime 执行、SMT 验证器做有界检查。原型在 AgentDojo 的 949 个注入案例和 AgentDyn 的 200 个动态案例上把已确认失陷降为 0.0%,并在 ASB、InjecAgent、BIPIA、AgentHarm 与 MCPTox 轨迹上执行策略可见流的重放检查;七项安全性质各在 0.5 秒内完成验证,12 个植入的不安全策略变体全部被检出。

这些结果是对已建模策略片段和接入接口的初步证据,不是任意 Agent 行为的无界保证。与 SafeFlow 相比,AgentFlow 的主要增量是策略表达力、受控释放和发布前验证,而首个失效控制仍是跨步骤来源—Sink 关系丢失。部署时仍需保证标签来源、包装器、策略编译器与 Runtime 可信,并把未接入工具、带外通信和自然语言隐蔽信道作为明确剩余风险。

防护措施与验证方法 ​

  • 为敏感来源、授权状态、危险意图和高影响 Sink 定义结构化标签,不只保留自然语言摘要。
  • 标签必须随任务委派、中间文件、消息和工具结果传播,并保存来源链。
  • 外发、执行、提交和不可逆写入先进入 staged 状态,等待全局路径验证。
  • 工具能力在可信包装器中规范化,未知别名或缺少目标元数据时采取保守阻断。
  • 用 Prompt-local 与 Cross-Agent 两类样本分别测量,避免局部测试掩盖跨 Agent 传播。
  • 同时报告 TCR、FPR、ASR、路径召回和延迟,防止以广泛拒绝换取表面安全。

局限与待验证问题 ​

证据等级为中等:论文有四个基准、多个基线、消融和自适应攻击,但尚无独立复现。SafeFlow 假设防守方控制可信、可观测的包装器;完全未接入包装器的组件、隐藏侧信道和已提交但事后才被发现的副作用不在其覆盖范围。

  • 跨厂商 Agent 和 MCP Server 如何携带一致、不可伪造的风险标签?
  • 攻击者能否通过长期记忆、编码数据或非标准工具通道绕开来源传播?
  • 8.8 秒额外延迟在交互式、高并发系统中是否可接受?
  • 当路径不完整时,怎样在安全阻断与业务可用性之间设置可审计的降级策略?

参考链接 ​