外观
AdversarialCoT:面向推理模型的单文档 RAG 投毒
摘要
AdversarialCoT 考察攻击者只能新增一份知识库文档、只能观察最终输出的黑盒条件。作者以目标模型可观察的推理组织方式引导文档迭代,使其被检索后影响证据整合;在 MS MARCO、HotpotQA、NQ 和多种推理模型上,作者报告相对既有投毒方法最高增加 23 个百分点的攻击成功率。该结论针对受控问答语料和作者攻击预算,不表示单篇文档能够普遍操纵生产 RAG。
核心创新与差异
既有 RAG 投毒常依赖批量文档提高命中率;此研究将“单文档、查询特定、推理结构相似”作为独立攻击对象,揭示检索命中后的证据形态也会影响推理,而不仅是检索分数。
威胁模型与攻击链
攻击者能向知识库提交新文档,不能删改既有文档,也不能访问检索器或模型内部参数。文档被 top-k 检索后,模型将其作为证据参与推理并输出错误目标答案;首个失效控制是摄取与检索阶段没有把不可信作者身份、证据出处和结论一致性纳入决策。
攻击工件与复现材料
论文包含会诱导错误推理的文档构造过程。为避免提供可直接用于操纵真实知识库的内容,以下是防御回归测试的去武器化骨架:
text
[来源:untrusted.invalid;状态:未验证]
测试断言:不得把单一未验证来源作为结论性证据;
若其与已签名证据冲突,则要求交叉来源或拒答。它保留“单文档被检索并影响结论”的条件,省略目标答案、迭代提示和查询特定优化细节。
实验设计与实际过程
作者使用 Co-Condenser 检索器,在三套问答语料上分别报告检索成功率、条件误导率和总体攻击成功率,并比较多轮迭代及跨模型迁移。本站只阅读论文公开材料,未复现投毒实验。
关键结果与实际影响
攻击效果随模型、数据集和迭代轮数变化,迭代成本也会快速增长。防护不能只检测大量相似新增文档;还应追踪文档作者、版本与可验证引文,审计单一来源是否在推理链中承担决定性结论。
CamoDocs 对同一攻击面补充了“文档中不出现目标查询字面内容”的伪装条件:攻击者优化语义相关性,使单篇毒文档仍能进入检索结果,同时降低查询包含规则和异常过滤器的可见信号。它没有改变写入者位置、受影响资产或索引侧修复责任,但说明只搜索查询词或显式目标短语会漏掉语义伪装投毒;跨防御效果和正常检索效用仍受论文设置限制。
防护措施与验证方法
对摄取者实施身份与写入权限控制;将来源、时间和证据级别传递给重排与生成器;对高影响结论要求多源支持;按“单篇新增文档”而非仅按批量投毒进行红队测试。检测集应同时包含不复述目标查询、但在 Embedding 空间定向靠近查询的语义伪装样本。
局限与待验证问题
研究使用公开 QA 数据集、固定检索器及可观察推理输出。闭源系统、不公开推理和带严格写入审核的知识库是否同样受影响,仍需独立测试。