Skip to content

Divide and Doubt (DnD):RAG 的多样化分散投毒攻击 ​

摘要 ​

检索增强生成(Retrieval-Augmented Generation, RAG)系统的多文档语料投毒攻击通常将同一目标声明重复在相似文档中,产生相关的词法和语义模式,使相似性感知和冲突感知防御能够联合抑制。Tianhao Chen 等人提出 DnD(Divide and Doubt)针对性投毒攻击,基于两个原则:一是通过风格多样化的文档分散对目标答案的支持表示,使投毒段落在嵌入空间中的表示分散化;二是在投毒语料中加入一段质疑参考答案证据的文档,强化目标答案在多篇投毒文档同时被检索时的采纳率。作者在两个开放域 QA 数据集、三个 LLM 和九种 RAG 配置上评估 DnD,覆盖对检索器的黑盒和白盒访问。在多数配置中 DnD 匹配或超过先前的投毒攻击,对聚类和冲突感知防御的攻击成功率提升 27-41%。

核心创新与差异 ​

原研究贡献是在 RAG 投毒攻击中引入两个新原则:表示分散化(通过风格多样化文档使投毒特征不被聚类防御联合抑制)和质疑强化(通过质疑参考答案的段落强化目标答案权重)。此前的研究中,投毒文档通常使用相似措辞重复同一声明,使防御可通过嵌入聚类或语义相似性联合过滤;DnD 通过风格分散和证据质疑绕过这两类防御。

本站分析:DnD 在 RAG 投毒方向的研究链条中补上了"自适应绕过聚类和冲突感知防御"的实证。它的首位失效控制在检索和聚合阶段:检索器的语义相似性无法将风格多样化的投毒段落聚合为一个可被联合过滤的簇,而冲突感知防御中的质疑段落仍为目标答案提供了有效证据权重。该研究与 AdversarialCoT 等单文档投毒形成互补:单文档投毒关注如何构造单个高影响力投毒文档,DnD 关注如何在多文档、多防御条件下分散投毒表示。

威胁模型与攻击链 ​

攻击者能够向 RAG 系统的知识语料中注入多篇投毒文档。攻击者可以选择性地了解检索器(黑盒)或完全了解检索器和生成器(白盒)。攻击目标是引导 RAG 系统在检索到投毒文档后,对特定查询输出攻击者预设的答案。

攻击链为:

  1. 文档构造:攻击者为同一目标答案创作多篇风格多样化的文档(如技术报告、新闻稿、博客文章、FAQ 等),每篇以不同措辞支持目标答案。
  2. 质疑注入:在投毒语料中加入一篇质疑参考答案核心证据的文档,削弱正确答案的可信度。
  3. 投毒投递:通过语料注入、知识库编辑或外部来源污染将投毒文档引入 RAG 系统的检索索引。
  4. 检索分散:当用户查询触发检索时,风格多样化的投毒文档因表示分散而不被聚类防御联合抑制,各文档独立返回。
  5. 聚合攻击:多篇投毒文档与质疑文档共同进入生成上下文,目标答案获得累积证据权重,正确答案因质疑而被弱化。

最先失效的安全控制在检索层(聚类防御无法将表示分散的投毒文档归为同一威胁簇)和聚合层(冲突感知防御中的质疑信号本身构成对正确答案的攻击)。

实验设计与实际过程 ​

作者在两个开放域 QA 数据集(NQ 和 TriviaQA)上评估 DnD,使用三个 LLM(GPT-3.5、Llama-2-7B、Llama-2-13B)和九种 RAG 配置(三种检索器 × 三种防御策略:无防御、聚类防御、冲突感知防御)。访问条件覆盖黑盒(仅能查询检索器)和白盒(完全了解检索器参数)两种设定。

所有实验属于作者原始实验,本站未独立复现。

关键结果与实际影响 ​

  • DnD 在多数配置中匹配或超过先前的投毒攻击(如 PoisonedRAG、AdversarialCoT)。
  • 对聚类和冲突感知防御的攻击成功率提升 27-41%,这是 DnD 最大的性能增量。
  • 风格多样化文档的表示分散化有效绕过了基于嵌入相似性的联合检测。
  • 质疑段落对目标答案采纳率的强化效果在多个投毒文档同时被检索时最为显著。

结果仅限论文测试的数据集、LLM 和 RAG 配置。攻击成功率的绝对值与投毒文档数量、检索 top-k、防御配置和目标查询有关,不应直接外推为任意 RAG 系统的通用投毒率。

防护措施与验证方法 ​

DnD 的提出也暴露了当前 RAG 防御的两个盲区:

  • 表示分散化检测:现有聚类防御依赖投毒文档在嵌入空间中形成密集簇,应在嵌入层检测"风格多样化但主题一致"的分散投毒模式,如通过主题模型或跨文档共指分析。
  • 质疑信号的语义分析:冲突感知防御不应仅检测表面冲突,还应分析质疑段落的语义角色——是揭示合理不确定性还是系统性地攻击参考答案。
  • 多文档联合分析:在检索结果中检测多篇文档是否在不同词法包装下推动同一目标声明,不依赖单文档的措辞相似性。

验证指标:在有/无防御的 RAG 配置上测量 DnD 的攻击成功率,对比单文档投毒基线,并分析防御绕过机制(聚类失效 vs 冲突感知失效)的占比。

局限与待验证问题 ​

  • 实验覆盖两个 QA 数据集和三个 LLM,未在其他类型的 RAG 任务(如代码 RAG、多模态 RAG)或商业 RAG 服务上验证。
  • 风格多样化的生成策略(需要多少种风格、每种风格的投毒文档数量)尚未被系统优化。
  • 质疑文档的质量和措辞对攻击成功率的影响未被消融分析。
  • 论文代码和实验日志的公开状态尚未确认。本站未独立复现。

参考链接 ​