Skip to content

相关失败条件下的多 Agent 组合可靠性证书 ​

摘要 ​

多 Agent 系统常把各组件成功率相乘,隐含假设它们相互独立。该研究用 18,000 次预注册双 Agent 实验检验这一假设,发现同模型组件会在相同难例上相关失败,使乘积估计系统性高估组合可靠性。

作者进一步提出不要求预先知道依赖结构的有限样本线性规划证书和 anytime-valid 证书。证书约束的是已测试分布下的组合失败概率,不是任意部署环境的形式安全保证。

方法的独特价值 ​

方法直接估计联合失败,而不是从单组件平均值外推。它把“行为契约”从接口约束推进到可统计验证的组合可靠性下界。

适用范围 ​

适用于使用同类模型、共享提示或共享数据的 Agent 流水线。任务分布变化、组件在线学习和对抗性协同仍需额外建模。

方法与实施流程 ​

  1. 预注册任务、组件角色和组合成功条件。
  2. 同时记录单组件与组合结果。
  3. 检验失败相关性及独立性乘积偏差。
  4. 用有限样本约束求解最坏情形联合失败率。
  5. 持续采样时使用 anytime-valid 区间避免反复查看造成显著性膨胀。

三项后续研究把依赖从结果相关性推进到证据来源和生成过程。Epistemic Fault Domains 用相对于显式根故障集合的结构认知割 κ_E 衡量授权联盟至少需暴露给多少个根故障;作者证明任意大的 quorum 仍可能保持 κ_E=1,并以分析、模拟和冻结的 120 任务外部套件检验 DAQC 运行时准入机制。该下界依赖封闭因果记账、保守暴露和授权对齐,不能在根故障遗漏时解释为真实安全保证。

Epistemic Sybil Resistance 在超过 20,000 次受控报告与抽取调用中把 Agent 数量和独立证据数分离:固定一个证据根、把报告数从 1 增至 32 时,朴素后验覆盖率从 0.940 降至 0.263;固定报告数、把证据根从 1 增至 16 后差距闭合,k=16 时聚合器无统计显著差异。复本抽取误差的样本外相关估计为 γ_cal=0.719;仅改变表述相似性使报告空间去重器推断的平均簇数改变 1.425(95% CI [1.363, 1.485]),而真实祖先数量四倍变化只改变 0.040([-0.045, 0.120])。这些结果来自合成证据文档,不能直接代表现实情报源。

生成过程多样性研究比较 38 个语言模型和 10 个互不重叠的 benchmark 家族,以相对置换对照残差化的归一化压缩距离估计生成过程差异;控制语义相似性和模型对能力后,它与机会校正的成对相关失败呈跨 benchmark 偏秩相关 -0.216(95% 区间 [-0.309, -0.122]),十个 benchmark 的方向均为负。该结果是关联而非因果,压缩距离也是生成过程的代理量;模型选型仍应以目标任务上的联合失败矩阵和来源独立性验证为准。

质量控制 ​

报告必须包含联合结果矩阵、样本量、停止规则和任务分层。更换组件模型或任务分布后应重新认证。

局限与待验证问题 ​

实验集中在双 Agent 和预设任务。更大拓扑、长期记忆和自适应攻击者可能产生更复杂依赖。证据来自单篇作者研究,等级为 moderate。

参考链接 ​