Skip to content

RAG 反事实证据干预审计 ​

摘要 ​

Pair-ID 不只观察 RAG 的正确率,而是对同一问题成对增加或删除关键证据,判断失败是否会随证据变化而修复或出现。研究从 19,981 个查询中筛出 11,105 个 Qwen 失败样本,再按哈希抽样 1,200 个,其中 1,190 个有效。

增加支持证据修复了 197/600 个联合失败样本(32.8%),删除证据触发 162/1,190 个失败(13.6%);语义相近的假干预也出现 22.3% 和 10.1% 的变化,提示配对对照本身必须控制措辞与上下文扰动。

评测方法 ​

方法记录原始证据、干预证据、回答与裁决,并用多名阅读者核对干预有效性。失败预测器的宏 AUROC 为 0.678、Brier 分数 0.152;精确向量预测低于多数基线,说明解释性预测仍弱。

实施建议 ​

RAG 评测应加入最小证据干预、语义假干预和人工一致性复核,分别报告“证据不足”“模型未使用证据”和“裁决漂移”。Pair-ID 更适合离线诊断,不能直接充当运行时阻断策略。

局限与待验证问题 ​

结论依赖单一主模型、采样流程和人工标注。成对变化揭示相关的因果敏感性,但不能单独确定内部推理路径。

参考链接 ​