Skip to content

多 Agent 从众导致保形预测证书失效 ​

摘要 ​

保形预测可以在校准分布与测试分布可交换时给出覆盖保证。该研究发现,多 Agent 系统会从内部破坏这一前提:问题本身不变,但一致给出错误答案的同伴上下文会改变目标模型对正确答案的评分。作者将其称为评分机制偏移(score-mechanism shift)。

在标准 α=0.10 设置下,作者将干净数据校准的 90% 覆盖率测得降至约 74%;对攻击者选择的低置信但原本仍被覆盖子群,覆盖率由约 87% 降至 47%。仅攻击 10% 项目时,总体覆盖率从 90.1% 降至 86.0%,较健康的总体指标会掩盖目标子群失效。证据来自公开论文、代码和数据,但尚无独立复现。

核心创新与差异 ​

原研究贡献。 论文把多 Agent 从众从一般准确率问题推进到证书失效:攻击者不修改问题分布,而是控制同伴通道,使同一问题的评分函数发生变化;普通协变量偏移修正因此瞄准了错误对象。

本站分析。 现有多 Agent 系统性失效研究已经覆盖一般从众与少数信息丢失。本文的独立增量是给出保形覆盖、条件覆盖和“执行或升级”决策之间的完整失效链,并证明攻击者可针对总体指标不敏感的低置信子群。

威胁模型与攻击链 ​

攻击者能够控制或伪造目标 Agent 可见的同伴回答,但不修改原问题和已冻结的干净校准集。目标资产是预测集合覆盖保证以及基于不确定性的执行/升级策略。

  1. 防守方在单模型、无同伴压力的数据上校准阈值。
  2. 部署时,多个同伴一致声称同一个错误答案。
  3. 目标模型把概率质量从正确答案移向错误答案,正确答案越过既定阈值。
  4. 预测集合漏掉正确答案;部分系统还会因错误答案置信度升高而执行,而不是升级人工处理。

攻击方法与复现材料 ​

以下为本站依据作者公开实验结构重构的去武器化离线夹具,只使用虚构四选一题和静态 logits,不调用在线模型:

text
question = "fixture-Q1"
solo_scores = {A: 0.55, B: 0.20, C: 0.15, D: 0.10}  # A 为正确项
peer_transcript = six_mock_peers(answer="B", label="UNTRUSTED_TEST")
pressured_scores = replay_fixture(question, peer_transcript)
assert conformal_set(solo_scores, clean_threshold).contains("A")
assert monitor_reports_shift(solo_scores, pressured_scores)
assert policy(pressured_scores) != "AUTO_ACT"

该夹具对应“干净校准—同伴压力—评分偏移—动作门”四步。预期检测信号是正确项分数变化、同伴答案一致性、条件覆盖率下降和自动执行率上升。省略可用于针对真实服务选择问题或生成欺骗性同伴内容的自动化代码。

实验设计与实际过程 ​

核心实验使用 Qwen2.5-7B、Llama-3.1-8B、Mistral-7B-v0.3 和 Gemma-2-9B,在 ARC-Challenge 与 TruthfulQA 上记录单独回答及六种同伴压力条件;扩展实验再加入模型和五类任务。作者用 2,000 次分层 50/50 校准—测试拆分,主要采用 LAC 非一致性分数,并比较总体覆盖、目标带覆盖和执行/升级结果。本站核对论文 HTML 与公开仓库说明,未独立运行代码。

关键结果与实际影响 ​

  • α=0.10 时,三次种子的无权威提示一致错误条件覆盖率为 73.5%、74.1% 和 74.2%,干净基线约 90%。
  • 四模型池化预测器的目标带覆盖率从 87.3% 降至 47.4%;攻击者只需识别模型低置信区间,不需要答案密钥。
  • 论文报告执行/升级层在翻转样本中仍会执行攻击者答案:池化预测器为 12%,最大单模型 Qwen2.5-32B 为 71%。

这些数字只证明已测开放权重模型和多选任务中的证书失效,不是现实多 Agent 产品错误率。真正风险取决于同伴身份、消息来源、校准流程和动作门是否绑定独立证据。

防护措施与验证方法 ​

  • 将同伴拓扑、身份和消息条件纳入校准与压力测试,不能把单模型干净校准证书直接移植到协作模式。
  • 同时报告总体覆盖、按置信度/群体划分的条件覆盖和最终自动执行错误率。
  • 在执行点要求独立证据或可信工具结果;同伴一致只能作为信息输入,不能自行解除升级要求。
  • 上线前用一致错误、混合意见、正确一致和不同压力剂量做回归,并检查模型规模变化是否真正改善稳健性。

局限与待验证问题 ​

论文以多选题、公开模型和构造的六轮同伴文本为主,未覆盖开放式任务、真实异构 Agent、长期记忆和工具反馈。保形预测的有限样本覆盖本来主要是边际保证,本文揭示的是部署条件改变后的额外失效,不能据此否定所有保形方法。代码公开提高可核验性,但仍需独立复现和真实编排测试。

参考链接 ​