Skip to content

RAG、知识库与索引安全研究综述 ​

摘要 ​

RAG 把可更新知识从模型权重移到检索系统,也把写入、索引和访问控制变成安全边界。攻击者可通过少量优化文档提高恶意内容的检索概率,也可能利用向量接口恢复文本或跨租户枚举知识。需要把“存储侧是否可信”与“检索结果进入 Prompt 后是否被当成指令”分开评估。

分类介绍 ​

本领域覆盖采集连接器、文档清洗、分块、Embedding、向量数据库、重排器和索引快照。第三方文档被检索后劫持 Agent 指令归 A5.1;这里研究其如何进入知识库、被检索、被越权读取或从向量恢复。

主要安全风险 ​

  • 攻击文档可同时优化语义相似度和生成器影响,绕过只看内容的审查。
  • Metadata filter、命名空间和租户 ID 错配会造成跨用户检索。
  • 混合 RAG 若只在向量检索前校验租户,Graph 扩展可能借共享实体从已授权 Seed 跳到未授权邻域。
  • Embedding 与相似度接口可能支持文本反演、成员推断或敏感主题枚举。
  • 索引重建、增量更新和删除不同步会保留已撤回内容。

防护措施与验证方法 ​

对来源、写入身份和文档版本做可追溯记录;将租户隔离落实到数据库查询而非 Prompt;对新增文档做异常和影响评估;为索引生成可验证快照并测试删除传播。红队应分别测量检索命中率、生成影响和跨租户泄露,避免用最终回答掩盖检索层根因。

局限与待验证问题 ​

  • 不同检索器、分块与重排策略如何改变投毒成本?
  • 向量数据库的权限模型能否在复杂过滤条件下保持租户隔离?
  • 如何证明文档删除已传播到缓存、索引和派生 Embedding?
  • 多篇协调毒文档能否规避基于单文档 leave-one-out 的影响检测?
  • Graph 扩展、重排和上下文合并的每一跳能否保持同一主体与资源授权?
  • 如何在高吞吐 RAG 中选择性触发 ZKIP,而不让攻击者利用检测路径制造成本型拒绝服务?

历史研究成果 ​

本分类的独立研究覆盖检索污染、抽取检测和向量制品完整性。研究对象包括跨域检索结果、摄取后写入前的 Embedding、单篇查询特定证据、多文档协调写入和跨查询恢复;Certified Domain Consistency(C3R)以独立校准集控制逐域污染风险并在超预算时 abstain,Embedding Store 隐写外传与向量完整性证明检验写入者篡改浮点向量而检索表面保持正常的条件,AdversarialCoT显示单份查询特定文档即可在受控语料中改变推理,协调向量投毒对准入期防护的包含性限制则证明多份单独可准入的文档能共同占满目标查询 top-k,且只看写入文档与参考查询的准入期防护无法可靠区分攻击簇和合法小众上传;CanaryRAG以运行时金丝雀发现连续抽取。研究成果共同要求把检索质量、作者/授权、向量字节完整性、查询需求和跨查询外泄分别验证:异常分布检测只能辅助发现部分篡改,准入覆盖也不等于协调攻击已被包含。内容—模型—向量签名、来源传递、关键结论多源核验、检索期需求监测和抽取响应闭环需要按威胁模型组合使用。各结果仅在各自语料、访问权限、检索架构和检测器设置下成立。

新增的RAGSieve 自参照式 RAG 投毒检测利用检索内容与模型自身知识的一致性信号筛查知识库投毒,并同时记录误报、领域迁移和模型知识过时等限制。

代码检索中的标识符对抗操纵把索引完整性问题扩展到代码语料:攻击者只改写不影响程序功能的标识符,即可在小型替代模型上优化并跨模型抬高无关代码的查询相似度。与文档投毒一样,首个失效控制位于摄取与排序;但其关键不变量是功能语义而非自然语言事实一致性,防守方需加入语义等价重命名测试。

同一分类的合并证据还补充了两条边界。CamoDocs 表明查询特定单文档投毒不必复述目标查询,词面包含规则会漏掉语义伪装;知识型工具抽取 把跨查询恢复从 RAG 扩展到文件、数据库和搜索索引,并引入工具选择与参数约束。两者均未改变写入侧或跨查询访问控制的主要责任,但要求审计跨文档表示和跨工具会话,而非只看单次响应。

近期可靠性研究把 RAG 的端到端分数拆成可证伪的阶段条件。PAGE-RAG 在同一最终预算下加入来源、噪声与充分性筛选,三个多跳问答基准的加权平均 support F1 与 answer F1 分别提高 10.4 和 3.3 个百分点;KGQA 查询侧攻击 则发现,在已测设置中超过 99% 的端到端崩溃来自子图构造,而非 GNN 推理,即使 74% 的检索子图含正确答案仍会失败。Graph Evidence Is Not Enough 进一步说明证据写入 Prompt 不等于解码器真正使用它。三者要求分别测量召回、证据充分性、解码利用和答案正确性,但数字只适用于各自数据集与实现。

弃答和评测方法也改变了“可靠”的定义。Knowing Before Answering 用内部信号区分证据充分、不足和冲突状态;Knowledge-Gap Canaries 以“知识库中可验证缺失”的问题和错答惩罚区分参数记忆与检索支撑;The RAT 在 27 个配置上联合建模检索成功、弃答和答案正确,显示边际指标相近的系统可能有不同失效路径;CVE-SAI 则用独立族级校准在作者设定的 5% unsafe-admission 预算下选择视觉属性索引策略。这些均是作者报告,不能把代理分数或有限样本界当作部署保证。

写入与排序侧的增量显示,污染不一定表现为单篇恶意文档。CHASE 模拟创作者反复迎合 LLM 排名后出现内容同质化与质量错位;RAGSentinel 以去主题方向后的表示几何多数共识过滤投毒,但其精确恢复依赖诚实多数假设。历史 SQL 作为隐式业务规则的 BIRD-History 含 11 个数据库、1,393 个任务,说明日志也应按知识来源审计。与本分类相邻但不等价的 Driving on Memory、RAGDiffusion++ 和 Agentic Skills 系统综述 分别暴露评测记忆捷径、奖励模型盲点和技能生命周期风险;它们只用于提醒“检索/记忆得分”不能替代当前证据、奖励与制品完整性验证,不构成 RAG 投毒率。

近期工作把写入投毒、排序操纵与使用审计连接成更完整的 RAG 治理链。攻击研究中,CodePoisonRAG以 85 份覆盖 10 类 CWE 的任务匹配代码制品说明,约 0.7% 的总体投毒比例也可能在 3 个生成模型上形成定向弱点传播;它与 AdversarialCoT 的共同点是单份查询特定制品即可产生高影响,差异在于目标从错误答案变为可执行代码的数据流弱点。GEO Defender则研究事实保持不变、只迎合引用偏好的网页改写,联合重排残差与生成端经验库后把 7 类攻击、5 个模型上的平均 ASR 从 50.32% 降至 6.20%,同时保留 94.12% 正常证据使用。两项结果共同说明,事实一致性和低投毒比例都不能替代来源认证、排序完整性和生成后验证。

审计研究中,Rent-a-RAG把提供方侧语义水印写入文档 embedding,在看不到检索日志、答案会释义且混合多提供方内容的条件下累积黑盒证据。作者在主要 benchmark 的每轮审计中最多用 23 个回答达到报告阈值,并迁移到临床、网络威胁情报和法律三个真实领域。该方法补充的是文档复用归因,不是投毒检测或所有权证明;其统计信号仍需与合同、日志、负对照和预注册阈值联合解释。上述三项均为作者报告,关键比例只适用于各自语料、模型、攻击集合与阈值。

检索器稳健性不能只用一次投毒攻击或平均排名衡量。LLM 稠密检索器系统研究在四个基准、30 个数据集上同时评估泛化与稳定性,覆盖改写、拼写错误、语义扰动和语料投毒。作者发现已测 LLM 检索器相对编码器基线更能抵抗拼写错误和语料投毒,却仍容易受同义改写等语义扰动影响;复杂推理特化还可能带来跨域泛化代价。该结论来自开放模型、作者攻击实现和特定数据集,不能外推到闭源 Embedding、混合检索、重排器或多租户过滤;验收应按扰动类型分别报告召回、排名稳定性和正常查询效用。

投毒攻击的分散表示绕过为聚类和冲突感知防御带来了新挑战。Divide and Doubt (DnD)通过风格多样化文档分散投毒表示并加入质疑参考答案的段落,在两个开放域 QA 数据集、三个 LLM 和九种 RAG 配置上匹配或超过先前的投毒攻击,对聚类和冲突感知防御的攻击成功率提升 27-41%。该研究补充了本分类中单文档投毒和协调多文档投毒的局限性:当投毒文档在嵌入空间中分散分布且包含质疑信号时,检索期的聚类和冲突感知联合过滤可能同时失效。

相关研究文章 ​

RAG 投毒攻击

Divide and Doubt (DnD):RAG 的多样化分散投毒攻击提出 DnD(Divide and Doubt)针对性投毒攻击,通过风格多样化文档分散投毒表示并加入质疑参考答案的段落,绕过聚类和冲突感知防御,在 9 种 RAG 配置中攻击成功率提升 27-41%。2026-09-22

RAG 来源审计与统计溯源

Rent-a-RAG:用 Embedding 空间水印审计第三方语料复用研究数据提供方如何在不控制第三方 RAG 的条件下,以语义水印和黑盒统计检验审计文档级复用。2026-09-03

RAG 写入投毒与推理操纵

CodePoisonRAG:面向代码 RAG 的定向知识投毒分析黑盒攻击者如何以单份任务匹配代码制品诱导检索增强代码生成系统复现指定 CWE,并给出来源治理与端到端验证方法。2026-09-02协调向量投毒对准入期防护遏制能力的限制研究多份单独看似正常的文档如何协同占据目标查询的检索结果,并证明只观察写入文档的准入期防护无法可靠区分攻击与合法小众语料。2026-08-23AdversarialCoT:面向推理模型的单文档 RAG 投毒研究仅写入一份检索文档时,如何通过与推理结构相似的误导性证据改变 RAG 推理结果。2026-04-14

RAG 检索防护与生成约束

GEO Defender:生成式搜索操纵的分阶段防护分析恶意生成式引擎优化如何利用证据选择偏好,并评估重排残差与免训练生成控制的联合防护。2026-09-02

检索表示对抗操纵

代码检索中的标识符对抗操纵分析攻击者如何在不改变程序功能的条件下替换标识符,使无关代码跨模型迁移并挤入目标查询结果。2026-08-26

RAG 投毒检测

RAGSieve:基于自参局部对比的 RAG 投毒检测分析无需可信参考语料的查询层与知识图层局部对比方法,以及其对六类 RAG 投毒的检测效果。2026-08-13

技术研究

Certified Domain Consistency for Multi-Domain Retrieval: Label-Free Per-Domain Contamination Control with Conformal Risk Guarantees介绍 C3R 如何在多域检索中用无查询标签的域后验、双校准集和 conformal risk guarantees 控制逐域证据污染,并在预算不足时主动弃答;论文在四个开放测试床上比较证书稳定性、召回率和错误权威 grounding。2026-07-14

Embedding 完整性与索引制品

Embedding Store 隐写外传与向量完整性证明研究分析具备写入和备份访问的内部攻击者如何在尽量保留检索行为的条件下篡改 Embedding,并提出签名绑定的向量来源证明。2026-05-13

RAG 外泄检测与运行时保护

CanaryRAG:用双路径运行时完整性游戏检测 RAG 外泄CanaryRAG 在检索上下文中加入可验证金丝雀,并以双路径一致性与恢复阈值检测知识库抽取。2026-04-12

参考链接 ​