外观
Search-Time Contamination:Deep Research Agent 的基准检索污染
摘要
Deep Research Agent 在评测时可以主动搜索网页,因此公开基准的元数据、题干上下文甚至答案可能在推理阶段泄露。本文将其称为 Search-Time Contamination(STC),区分元数据、题干和显式答案三类污染,并在六个公开基准上测量最高约 4% 的性能膨胀。
核心创新与差异
已有评测完整性文章主要讨论训练污染和静态测试集;本文把检索轨迹纳入信任边界,说明“未见训练数据”不等于“未在评测时取得答案”。
威胁模型与攻击链
Agent 拥有开放搜索工具,基准问题或索引页面可被第三方公开。搜索器检索到题面或答案后,模型将外部证据当作正常研究来源,评测者却把结果归因于推理能力。首个失效控制是评测环境与搜索数据边界缺少隔离。
实验设计与实际过程
作者对六个公开基准构造检测算法,记录搜索结果、命中类型和性能变化;建议使用隔离沙箱、透明搜索轨迹和受控访问。研究是作者实验,尚无独立复现。
关键结果与实际影响
STC 最高带来约 4% 的性能膨胀;幅度取决于基准公开程度和 Agent 搜索策略。评测报告必须单独给出允许搜索的范围、结果页面、缓存与人工污染审计。
局限与待验证问题
检测依赖可见搜索轨迹,改写、缓存和间接来源可能漏检;污染比例和 Agent 集合有限,不能外推所有网络研究系统。