外观
Agent 组件交接中的政策事实衰减
摘要
Fiducia-bench 研究任务分解是否削弱 Agent 对政策的遵从。论文固定任务、工具和政策语料,只改变执行架构。结果显示,前序组件已经发现的政策相关事实可能没有进入交接摘要,后续决策组件因而看不到本应触发或阻止动作的依据。作者将这一现象称为事实衰减(fact attenuation)。
在约束距离为 2 的任务中,Qwen2.5-32B-Instruct 的事实衰减率从单循环的 0/16,上升到固定流水线的 9/16 和主管—子 Agent 架构的 22/26。gpt-4.1-mini 的对应结果为 0/27、1/30 和 1/18。较强模型的衰减较低,但论文没有证明该问题已在前沿模型、其他行业或更好的交接协议下普遍成立。
核心创新与差异
原研究贡献。 Fiducia-bench 将“任务是否完成”与“是否按政策完成”分开。它提供机器可检查的政策包(policy pack)、环境侧审计日志和轨迹重放验证器,并定义约束传播损失、事实衰减、违规位置和权限责任扩散等指标。
本站分析。 该研究不是一般的多 Agent 能力比较,也不是某个恶意子 Agent 主动篡改消息。首个失效控制是组件交接没有强制保留影响后续授权判断的政策事实。发现事实的组件和执行违规动作的组件可能不同,逐组件审查容易把责任错归给最后一个执行者。
威胁模型与失效控制
该失效模式不要求外部攻击者。系统把一个受政策约束的任务拆给多个组件;每个组件只能看到自己的工具结果,以及上游交接摘要。风险对象包括需要冻结、升级、补充材料或明确禁止升级的决策。
- 前序组件从工具结果中发现风险信号或免责事实。
- 组件生成自然语言交接摘要,但没有结构化列出该事实、来源和对应政策条款。
- 下游组件只读取摘要,无法访问原始工具结果。
- 风险信号丢失会造成升级处置不足;免责事实丢失则会造成升级处置过度。
最先失效的是政策事实在 Agent 边界上的完整传递,而不是政策语料能否检索,也不是最后一次工具调用的参数校验。
实验设计与实际过程
作者构造 100 个 KYC/AML 任务变体,覆盖 5 个种子场景和约束距离 0、1、2。三种架构分别是单一 ReAct 循环、intake → research → decide 固定流水线,以及带工具范围限制的主管—子 Agent。所有架构共享工具、政策语料和角色提示词,组件只接收上一次交接内容。
实验测试 Qwen2.5-32B-Instruct 和 gpt-4.1-mini,共执行 626 个 episode。环境自动记录工具名、参数、结果摘要和执行组件;验证器按动作发生时的历史状态重放轨迹,不依赖 Agent 自述。主要结果来自完整 policy 位于上下文中的 P0 条件,另以少量种子任务检查按需检索政策的 P1 条件。
关键结果与实际影响
- Qwen2.5-32B-Instruct 在约束距离 2 下,单循环、固定流水线和主管—子 Agent 的事实衰减分别为 0/16、9/16 和 22/26。
- gpt-4.1-mini 的对应分母为 0/27、1/30 和 1/18,说明模型能力会显著影响衰减幅度。
- Qwen2.5-32B-Instruct 的主管架构在 100 个 episode 中发现 27 次触发事实,随后丢失其中 22 次(上文结果表按 22/26 记录衰减率,发现次数与衰减分母的口径差异以论文为准);单循环发现 16 次且没有跨组件交接,所以衰减为 0/16。
- 两个镜像任务显示,同一摘要丢失机制既会漏掉风险信号,也会漏掉免责事实,不能用“全部升级”规避评测。
这些结果说明,多 Agent 架构可能提高信息发现能力,同时削弱信息传递。论文报告的总体治理成功率(governed success)只有 8/596,说明评测基准中大多数运行没有完整满足治理目标;因此不能把衰减比例解释为生产合规失败率。
后续研究把“事实是否被写入摘要”细化为三种可分别检验的交接失败。Facts Without Rules发现摘要可能保留事实值,却丢掉用途、受众等使用边界元数据,因而仍会造成隐私披露;Structured State Reconciliation则以来源追踪、冲突检测和错误信息抑制表明,交接对象需要保存证据之间的关系,而不只是压缩后的结论。两项结果均来自单篇作者实验、尚无独立复现,不能据此估计生产泄漏率,但它们使本页结论更精确:必须把事实、约束、来源和冲突状态作为一个不可拆分的结构传递。
有限核验预算还会让“已经传递的约束”在消费阶段失效。When Stale Constraints Go Unchecked报告三组基线的 stale-consistent 结果分别为 77.3%、74.7% 和 74.7%,并通过把同一预算强制分配给关键路径核验改善结果;When “Must” Becomes “Maybe”在 1,296 个 episode 中观察 binding role 被压缩为非约束性 caveat,并用“主体、约束、来源、有效期”四字段保存与下游复核对照,区分信息被保存与约束真正得到执行。这些数字仅适用于论文的任务、预算和摘要器;它们不证明结构化字段天然可信,来源过期、伪造或策略版本变化时仍须重新核验。
防护措施与验证方法
- 使用结构化交接对象,强制列出政策相关事实、来源、置信状态、适用规则和仍待核验事项。
- 让下游决策器按需读取原始工具证据,而不是只接收自由文本摘要。
- 由环境记录执行主体和状态,避免依赖 Agent 自报审计信息。
- 同时测试风险事实和免责事实,分别测量升级处置不足、升级处置过度与正常完成率。
- 按委派深度报告事实发现率、条件衰减率和最终合规率,不能只给出任务成功率。
部署验证还应加入交接字段缺失、摘要改写、重复委派和模型升级回归测试。关键政策事实如果没有可核验来源,应触发 fail-closed 或人工复核。
局限与待验证问题
- 任务只覆盖合成 KYC/AML 场景,尚未验证医疗、软件变更或云资源审批。
- 论文只测试两个主要模型;gpt-4.1-mini 的衰减事件分母很小,跨模型差异不能归因于单一能力因素。
- 组件隔离和交接提示词属于实验设计的一部分,更完善的结构化摘要可能降低衰减。
- 字符串触发器会同时测到措辞差异和治理差异;虽然轨迹验证不使用 LLM Judge,仍需人工检查语义等价情况。
- 论文公开评测基准(benchmark)与验证 Harness,但本站没有独立复现实验。
- 新增四项研究同样只有作者实验;其任务、预算、模型与交接 Schema 不同,比例不能横向相加或当作现实组织的失败率。