外观
RAGSieve:基于自参局部对比的 RAG 投毒检测
摘要
RAGSieve 在没有可信干净语料作为参照的情况下检测 RAG 知识库投毒。方法分别在查询局部邻域和语料关系图中寻找不一致,用系统自身的局部结构建立对照。
作者针对六类投毒报告攻击成功率、恶意文档移除率和正常问答效用。结果支持自参检测的可行性,但检测效果依赖知识库局部一致性,不能视为通用投毒证明。
核心创新与差异
传统检测常依赖已知干净样本或固定攻击特征。RAGSieve 的差异是把查询邻域与文档图共同作为参照,并通过联合判断降低单侧信号不足。
威胁模型与攻击链
攻击者可以向索引加入或修改少量文档,目标是让特定查询检索到误导内容。防御者可以读取 embedding、检索关系和文档内容,但没有完整可信副本。
攻击方法与复现材料
本站依据公开机制给出去武器化测试流程:
text
index = build_index(clean_fixture + harmless_conflicting_documents)
query_score = local_query_contrast(index, test_queries)
graph_score = document_graph_contrast(index)
quarantine(where combine(query_score, graph_score) > threshold)测试语料只使用虚构实体,不注入生产知识库。预期信号是局部语义与图连接同时异常。
实验设计与实际过程
作者比较查询侧、图侧、联合方法和多种基线,覆盖六类投毒,并做组件消融。指标同时包含攻击抑制和正常效用,避免只追求移除率。
关键结果与实际影响
联合局部对比在多个投毒设置中降低攻击成功率,同时保留较高正常效用。实际部署仍需考虑小型知识库、快速变化语料和合法少数观点被误判的问题。
防护措施与验证方法
应把 RAGSieve 作为隔离与复核信号,而不是自动删除器;结合来源签名、写入授权、版本回滚和人工复核。验证需报告误报、漏报、索引更新成本和攻击者适应后的结果。
局限与待验证问题
作者实验尚无独立复现。知识库本身高度异质或攻击者能操纵大范围邻域时,自参假设可能失效。