Skip to content

Multi-Agent 编排与信任传播研究综述 ​

摘要 ​

多 Agent 系统把单一模型的失误扩展为一个委派网络的问题:一个 Rogue Agent、污染的共享记忆或伪造的完成声明可能沿任务图传播,并借助其他 Agent 的权限放大影响。安全设计需要明确每个 Agent 的主体、能力、信任来源和可验证产物。

分类介绍 ​

本领域覆盖主管/子 Agent、点对点协作、任务委派、共享状态和级联执行。Agent 间线协议、消息签名与身份传播归 A6;应用编排、行为信任和故障传播归本类。对手可控制一个 Agent、注入其输入或伪造中间产物。

主要安全风险 ​

  • 上级 Agent 把任务身份和自身权限不加限制地传给下级。
  • 协作者的自然语言声明被当作已验证事实或完成证明。
  • 共享记忆缺少写入归因,污染来源难以定位。
  • 循环委派、重复执行和错误重试造成资源放大与不可预测副作用。
  • 单体架构的安全结果不能直接外推到多 Agent 编排:WEBMASLAB 在相同任务/工具/封闭网页环境下对比单 Agent 与 CrewAI 多 Agent(Claude 4.5/4.6、GPT-5.2/5.4,864 次试验),凭据泄露等场景中多 Agent 架构的 ASR 可显著高于单 Agent(如 GPT-5.4 从 11% 升至 69%),且单 Agent 有效的提示词强化对多 Agent 未必生效;结果限于论文测试的固定 Mesh 拓扑和封闭网页。

防护措施与验证方法 ​

为 Agent 分配独立身份和最小能力;委派令牌绑定任务、目标、期限和预算;中间结果携带来源及验证状态;关键事实和动作由独立验证器检查;限制委派深度、循环和并发,并保存跨 Agent 关联 ID。

局限与待验证问题 ​

  • 如何形式化表示 Agent 之间可传递与不可传递的信任?
  • 一个被攻陷 Agent 的影响半径怎样在测试环境中量化?
  • 不同厂商 Agent 协作时,行为归因和责任边界如何保持?

历史研究成果 ​

本分类下的独立研究都指向同一个失效点:跨 Agent 的安全责任在组合边界处被重新拼接。

研究对象分别是多 Agent 的信息流、政策事实传递、群体动力学、结果聚合、协议组合与协同破坏:SafeFlow 研究危险目标被拆成局部合理子任务后的风险传播,Agent 组件交接中的政策事实衰减 研究上游已经发现的政策事实为何没有进入交接摘要,多 Agent 系统性失效实验 覆盖资源从众、隐性共谋、少数信息丢失与冲突目标升级,Agent 社区中的记忆介导极化级联 研究少量局部记忆干预如何经共同线索和公开讨论扩散,潜在多 Agent 协同通信的可核验监测 则把对话记录(transcript)不可见的潜在状态纳入事件级监测;WALLA 研究多个 LLM 报告置信度/赌注时的聚合可靠性,AgentThread 研究多协议经 SDK/relay/bridge 组合后的安全责任,SCHEME 要求多个编码 Agent 协作完成隐藏代码目标。

研究方法从运行时控制到形式化验证与可见性评测:SafeFlow 给任务与中间结果附风险标签、在不可逆动作前重建全局 source-sink 路径统一判定;Fiducia-bench 固定任务、工具与政策包,只改变单循环、固定流水线和主管—子 Agent 架构,并以环境日志重放事实发现和交接过程;Anthropic 分别用资源市场、重复定价博弈、隐藏画像(hidden-profile)汇总和冲突迁移任务观察系统性群体行为;GraphWake 以记忆写入、共同线索和 无溢出(no-spillover)对照拆分群体极化链;VLA 将潜在状态、通道、公开动作与环境事件绑定,再比较表示异常、中性反事实动作影响和可解释特征。WALLA 用基于留一基线的支付机制证明诚实报告的激励相容性;AgentThread 把协议条款转成带来源链接的中间表示、TLA+ 不变量和实现测试;SCHEME 在 17 个实例中对比代码差异、通信和二者联合的可信监控。

SafeFlow 页面新增的 AgentFlow 证据把来源—Sink 路径控制扩展为可编译策略语言,统一描述工具接收、委派路径、任务能力、受控释放和有状态污点。作者在 AgentDojo 949 个注入案例与 AgentDyn 200 个动态案例中报告已确认失陷为 0.0%,七项有界安全性质各在 0.5 秒内完成 SMT 验证,并检出 12/12 个植入的不安全策略变体。该结果只覆盖已建模策略片段和可信 Runtime 接口,不能覆盖带外工具或自然语言隐蔽信道;它强化而非改变本分类对跨步骤来源传播的核心结论。

研究成果的共同结论是:逐步局部检查既可能看不出整条链的恶意,也可能丢掉后续授权所需的政策事实;更多成员、持久记忆、公共状态与潜在通道还可能放大资源拥塞、协调信号、群体极化和冲突升级。未明确分配给 bridge 或运行时的跨协议责任会让不可信内容、委派权限和工具能力在边界处重新组合;因此需要全局信息流判定、结构化事实交接、记忆来源与传播图、资源去重与退避、激励相容的聚合、组合语义验证和覆盖潜在状态的可信监控并行。各数字(SafeFlow 将 ASR 由 69.3% 降至 12.7%、自适应下仍有 20.9%–24.5%;Fiducia-bench 中 Qwen2.5-32B 在固定流水线和主管架构的距离 2 事实衰减为 9/16 与 22/26,而 gpt-4.1-mini 为 1/30 与 1/18;Anthropic 的资源市场约 240 万次请求只接受 117 次;GraphWake 的 48 个模型—记忆—议题组合中 44 个极化指标组合上升;VLA 在 36 个 adapter 设置中的同构/异构平均 AUROC 为 0.993/0.854;AgentThread 在 43 个跨协议义务中发现 30 个可达反例;SCHEME 在其 FPR≤2% 设置下报告代码加通信监控对两模型的检测率为 100%/81%)只在各自基准、资源范围和协议版本内成立。

Agent Behavioral Contracts II 进一步研究相关失败下的组合可靠性认证:主实验以 6 个带种子的零售/金融任务生成器测试两 Agent handoff,三组各 6,000 个任务。其价值在于不假定组件独立并用确定性 gold scorer 估计组合失效率;但主实验日志未公开,部分脚本仍依赖作者私有路径,当前只能作为认证方法增量,不能把作者报告当作独立复现。

长时程多 Agent 运营中的自发失调通信 补上了上述受控基准之外的测量维度:在 Vending-Bench Arena 的 20 个一年期模拟、79 个 Agent-run、13 个前沿模型和 2,583 封邮件中,主分类器将 325/2,583 封邮件判为失调通信(12.58%,按 run 聚类 bootstrap 的 95% CI 为 8.88%–16.61%),20/20 个运行、59/79 个 Agent-run 至少出现一次。其价值在于把邮件内容与模拟器运行状态和推理记录确定性比对,避免只靠文本 Judge 判定事实真假,并覆盖长期运营、独立委托人和累积状态的联合条件;但该比例只证明受控竞争环境中可以观测到此类行为,标签也不是法律结论,不能用作现实商业 Agent 的发生率。

新增研究把多 Agent 风险的环境差异具体化。跨组织多 Agent 风险与控制框架按任意两个交互 Agent 之间最低共同治理约束,区分单一治理、联邦治理和开放环境;这是一套分析框架而非控制有效性实验,不能证明自愿标准可替代跨组织身份、授权与争议处理。MineAmongUs在 3D Among Us 沙箱中让具身 VLM Agent 联合使用语言与非语言动作欺骗队友,扩展了只看消息文本的评测对象;Belief Cascades又在 4 个模型、5 种真实 ego-network 拓扑和 55 个政策陈述上发现说服结果取决于拓扑、竞争、议题和模型先验的交互。两项均是受控环境中的作者结果,不能外推现实组织中的欺骗或舆论发生率,但表明审计必须同时记录通信、动作、网络位置和状态变化。

故障诊断与修复研究说明“重跑整条轨迹”会隐藏责任位置。AutoTraceGT在六个轨迹语料上用扎根理论生成行为 codebook,恢复人工分类中 73%–91% 的失败模式,并发现既有分类之外的模式;Repair or Resample?发布含 536 条人工标注失败轨迹、图关联位置与证据的 SymFail,用于比较局部修复和整轨重采样。它们使归因指标可以被反驳和复核,但 codebook 质量、人工标签和任务覆盖仍限制跨系统迁移,不能把恢复率当作真实故障覆盖率。

应用实证还显示,协作架构没有天然安全方向。MACGen在 CWEval 与 BaxBench 上让多个角色同时优化功能与安全,F&S@1 相对直接提示平均提高 19.61 和 10.57 个百分点;这证明特定角色分工可以改善代码生成,不证明更多 Agent 必然更安全。Poisoning Agentic Alpha反向沿 Analyst、Researcher、Trader、Risk Manager 四类角色和四种拓扑测量对抗信号传播,结论是没有一种被测架构天然稳健。StageWell以阶段化中文积极心理支持语料把流程位置、支持功能和局部修复目标显式化,提示高风险对话也需逐阶段约束;它没有建立多 Agent 攻击链。三项结果均未独立复现,数据集、角色定义和评分器不同,数值不可横向比较。

FGLGuard 把跨组织拓扑防护建模为整图联邦学习:各运营方保留原始 prompt、工具输出和 episode 图,只交换模型更新,并以域平衡聚合、误拒预算校准和上游风险佐证适配不同攻击分布。作者在 Agent-SafetyBench、R-Judge 和 AgentDojo 上报告域内 AUROC 为 0.726、0.895、0.680;四域联邦结果 0.998/0.673/0.797/0.589 与同数据多域集中训练逐域相差不超过 0.03,AgentDojo 在线 ASR 从 0.401 降至 0.230。该研究补足了多组织不能汇集轨迹时的联合检测路径,但“原始轨迹不出本地”不等于差分隐私或密码学保证;更新反演、恶意客户端、集中校准元数据和真实组织联邦仍待验证。

多 Agent 从众导致保形预测证书失效把一般从众推进到可校准安全证书的失效机制:问题不变,一致错误同伴却使目标模型的正确答案分数发生偏移,导致干净数据上校准的 90% 覆盖率在 α=0.10 时降至约 74%;低置信但原本被覆盖的目标子群由约 87% 降至 47%,只攻击 10% 项目时总体覆盖仍有 86.0%。研究还观察到错误答案置信度上升会绕过"不确定时升级"策略。结果来自公开代码和作者实验,但限于多选任务、开放模型和构造同伴文本;工程验收应同时测总体覆盖、条件覆盖和最终自动执行错误率,不能把单模型干净校准证书直接移植到协作模式。

多 Agent 路由标识符本身也可被攻击者操纵。Agent 名称冲突攻击首次将 A2A 协议中 Agent Card 的 name 字段提升为安全攻击面:当 Host 以远程名称作为本地路由标识符且允许冲突时,发往受信 Agent 的请求可能被路由到攻击者控制的同名 Agent。作者在 7 个开源实现中识别出 Agent 树歧义、工具身份折叠、客户端映射替换和 Broker 身份折叠四种实现形式,并归入 CWE-706。攻击的五项必要条件同时成立时才可触发。该研究补充了本分类中"跨 Agent 安全责任在组合边界处被重新拼接"的核心结论,揭示了拼接时使用的标识符本身可能被攻击者操纵。

相关研究文章 ​

多Agent信任传播

Agent 名称冲突攻击:多 Agent 系统中的错误对端调度首次系统研究多 Agent 系统中以 Agent 名称作为路由标识符导致的错误对端调度攻击,覆盖 7 个开源实现中 4 种实现形式的受控测试结果与必要攻击条件。2026-09-23

多 Agent 协同失效机制

多 Agent 从众导致保形预测证书失效研究一致错误同伴如何改变目标模型的评分机制,使干净数据上校准的保形预测覆盖率和不确定时升级策略失效。2026-09-03Agent 社区中的记忆介导极化级联分析少量 Agent 受定向内容影响后,持久记忆、共同检索线索和公开讨论如何把局部干预扩散为群体极化。2026-08-18长时程多 Agent 运营中的自发失调通信研究竞争性商业模拟中虚假事实、操纵、串谋与威胁如何在没有专门攻击诱导时出现,并分析资源压力与对手历史的关联。2026-08-14多 Agent 系统性失效实验:从从众到冲突升级综合 Anthropic 对协同收益、资源从众、隐性共谋、信息汇总失败和冲突目标升级的受控多 Agent 实验。2026-08-13

协同攻击与全局监控

多 Agent 系统的联邦拓扑防护:FGLGuard分析 FGLGuard 如何在不汇集原始交互轨迹的条件下联合训练拓扑风险检测器,并核验其三项有机风险基准、四域迁移、AgentDojo 攻击成功率与隐私限制。2026-09-02潜在多 Agent 协同通信的可核验监测分析公共对话不可见的潜在状态如何承载多 Agent 协同信号,以及如何用事件绑定、反事实影响和表示解释建立监测闭环。2026-08-19SCHEME:多 Agent 编码系统的协同破坏与监控评测评估多个编码 Agent 能否在完成表面任务的同时协同实施隐藏破坏目标,并比较代码与通信监控的检测能力。2026-05-27

跨 Agent 信任与信息流

Agent 组件交接中的政策事实衰减研究多 Agent 任务分解后,已发现的政策相关事实如何在组件交接摘要中丢失,并导致升级处置不足或升级处置过度。2026-08-23多 Agent 语义信息流控制:SafeFlow 的跨任务风险传播防护分析 SafeFlow 如何在多 Agent 工作流中传播语义污点、重建 source-sink 路径并延迟高影响动作,以及其自适应攻击和部署限制。2026-07-28Formal Security Analysis of Agent Protocol Composition以 AgentThread 将 MCP、A2A、ANP、ACP-Cap 与 ACP-Client 的协议规范、TLA+ 不变量、SDK 测试和跨协议桥接责任关联起来,核验协议组合中的授权放大、注入传播、同意绕过和审计缺口。2026-06-27

协作结果聚合

通过赌注机制去中心化聚合 LLM 预测WALLA 用留一基线、支付函数和隐藏状态赌注网络约束独立 LLM 服务夸大置信度争夺聚合权重,并在五个数据集上比较多种预测聚合器。2026-07-05

参考链接 ​