Skip to content
A2 / 核心攻击面

数据、知识与隐私安全

训练数据、知识存储、RAG 索引、Memory 与数据权利。

归档边界:由数据内容、存储、索引或访问控制责任方修复。

6 个二级分类 · 6 篇研究综述 · 38 篇独立研究
A2.1

训练、反馈与标注数据安全

1 篇综述 · 3 篇独立研究

研究预训练、微调、RLHF/RLAIF、用户反馈和标注数据的内容完整性与授权。

归档边界数据内容和写入路径归本类;训练算法或奖励机制失效归 A1.2。

  • 数据投毒
  • 标注与反馈污染
  • 来源、授权和数据隔离
分类综述研究综述更新 2026-09-10

训练、反馈与标注数据安全研究综述

从数据进入训练前的来源、授权、完整性与隔离出发,建立投毒和反馈污染的研究边界。

7 min
技术研究更新 2026-08-23

持续学习阻断攻击:从当前投毒到未来可塑性破坏

分析攻击者如何用整轮标签或张量替换破坏持续学习系统的后续可塑性,并区分当前准确率下降、历史遗忘与未来任务阻断。

6 min
技术研究更新 2026-08-19

BVBench:垂直联邦学习后门的现实威胁重评

分析既有垂直联邦学习后门为何依赖不现实先验,并用实践约束重新评估攻击和防御结论。

2 min
攻击方法研究更新 2026-09-20

机器遗忘延迟激活的训练数据投毒:可删除伪装与休眠后门

分析 clean-label 训练数据投毒如何借可删除伪装样本隐藏后门,并在机器遗忘执行后解除抑制、延迟激活。

6 min
A2.2

RAG、知识库与索引安全

1 篇综述 · 11 篇独立研究

研究检索语料、Embedding、向量数据库和索引的存储侧安全。

归档边界索引写入、访问控制和数据恢复归本类;检索内容进入上下文后成为指令归 A5.1。

  • 知识库投毒
  • Embedding 反演
  • 向量库访问控制与多租户隔离
分类综述研究综述更新 2026-09-10

RAG、知识库与索引安全研究综述

聚焦检索语料、Embedding、向量索引和多租户存储的投毒、泄露与完整性风险。

10 min
技术研究更新 2026-09-28

Divide and Doubt (DnD):RAG 的多样化分散投毒攻击

提出 DnD(Divide and Doubt)针对性投毒攻击,通过风格多样化文档分散投毒表示并加入质疑参考答案的段落,绕过聚类和冲突感知防御,在 9 种 RAG 配置中攻击成功率提升 27-41%。

5 min
技术研究更新 2026-09-06

Rent-a-RAG:用 Embedding 空间水印审计第三方语料复用

研究数据提供方如何在不控制第三方 RAG 的条件下,以语义水印和黑盒统计检验审计文档级复用。

5 min
技术研究更新 2026-09-06

CodePoisonRAG:面向代码 RAG 的定向知识投毒

分析黑盒攻击者如何以单份任务匹配代码制品诱导检索增强代码生成系统复现指定 CWE,并给出来源治理与端到端验证方法。

5 min
技术研究更新 2026-09-10

GEO Defender:生成式搜索操纵的分阶段防护

分析恶意生成式引擎优化如何利用证据选择偏好,并评估重排残差与免训练生成控制的联合防护。

6 min
技术研究更新 2026-09-01

代码检索中的标识符对抗操纵

分析攻击者如何在不改变程序功能的条件下替换标识符,使无关代码跨模型迁移并挤入目标查询结果。

3 min
技术研究更新 2026-08-23

协调向量投毒对准入期防护遏制能力的限制

研究多份单独看似正常的文档如何协同占据目标查询的检索结果,并证明只观察写入文档的准入期防护无法可靠区分攻击与合法小众语料。

5 min
技术研究更新 2026-08-19

RAGSieve:基于自参局部对比的 RAG 投毒检测

分析无需可信参考语料的查询层与知识图层局部对比方法,以及其对六类 RAG 投毒的检测效果。

2 min
技术研究更新 2026-08-06

Certified Domain Consistency for Multi-Domain Retrieval: Label-Free Per-Domain Contamination Control with Conformal Risk Guarantees

介绍 C3R 如何在多域检索中用无查询标签的域后验、双校准集和 conformal risk guarantees 控制逐域证据污染,并在预算不足时主动弃答;论文在四个开放测试床上比较证书稳定性、召回率和错误权威 grounding。

5 min
技术研究更新 2026-08-09

Embedding Store 隐写外传与向量完整性证明研究

分析具备写入和备份访问的内部攻击者如何在尽量保留检索行为的条件下篡改 Embedding,并提出签名绑定的向量来源证明。

4 min
技术研究更新 2026-09-01

AdversarialCoT:面向推理模型的单文档 RAG 投毒

研究仅写入一份检索文档时,如何通过与推理结构相似的误导性证据改变 RAG 推理结果。

3 min
技术研究更新 2026-09-01

CanaryRAG:用双路径运行时完整性游戏检测 RAG 外泄

CanaryRAG 在检索上下文中加入可验证金丝雀,并以双路径一致性与恢复阈值检测知识库抽取。

3 min
A2.3

Memory 与 Context Store 安全

1 篇综述 · 3 篇独立研究

研究长期记忆、会话存储和上下文数据层的写入、隔离、生命周期与完整性。

归档边界存储侧污染和越权读取归本类;应用读取后的优先级和跨会话行为影响归 A5.2。

  • 长期记忆污染
  • 跨用户存储隔离
  • 记忆生命周期与删除
分类综述研究综述更新 2026-09-10

Memory 与 Context Store 安全研究综述

分析 Agent 长期记忆和会话存储的写入授权、租户隔离、生命周期与残留风险。

6 min
技术研究更新 2026-09-10

Agent Memory 撤销标记的检索时执行缺口

实测五种 Agent 记忆系统是否在默认检索时执行撤销状态,并分析已失效合法策略仍被排序和执行的风险。

5 min
技术研究更新 2026-09-01

LLM Agent 的跨会话休眠记忆投毒研究

分析外部内容如何被写成伪造用户记忆、在后续会话被检索并影响 Agent 行为,以及写入到使用的生命周期控制。

4 min
技术研究更新 2026-08-09

MemEvoBench:长期记忆渐进污染的 Agent 安全评测

通过多轮误导记忆、噪声工具结果与偏置反馈评测 Agent 记忆渐进失真,显示静态提示难以稳定抑制跨轮风险。

3 min
A2.4

数据隐私、推断与泄露

1 篇综述 · 17 篇独立研究

研究从数据处理、训练信号或知识存储中恢复敏感属性和原始信息的攻击。

归档边界模型资产提取归 A1.3;数据库、梯度和数据记录承载的隐私泄露归本类。

  • 属性与成员推断
  • 梯度泄露
  • 敏感数据暴露与重识别
分类综述研究综述更新 2026-09-10

数据隐私、推断与泄露研究综述

归纳成员推断、属性推断、梯度泄露和重识别攻击的访问条件、指标与隐私防御基线。

18 min
技术研究更新 2026-09-10

LT-Code Peeling:联邦学习中的级联梯度反演

分析攻击者如何递归剥离已恢复样本的梯度贡献,在单轮 FedSGD 中恢复大批量样本及标签,并据此检验梯度共享的隐私风险。

5 min
技术研究更新 2026-09-10

PMA:E2EO 混淆向量流的代理流形对齐恢复

分析攻击者如何把确定性 Embedding 混淆流视为未知分词语言,通过代理语义流形对齐恢复明文。

5 min
技术研究更新 2026-09-06

UMPeek:从个性化 Agent 行为推断隐藏用户模型

研究外部参与者如何从个性化选择而非源记录中推断隐藏用户信息,并评估行为侧隐私控制的有效性与效用代价。

5 min
技术研究更新 2026-09-01

换脸匿名化中的目标身份残留

评估七种换脸工具的目标身份泄露,并以仿射随机模型解释多次换脸后的泄露衰减与残留下限。

3 min
技术研究更新 2026-09-10

面向大规模稠密检索的隐私候选集协议

研究以差分隐私二值候选集、同态加密重排和不经意传输保护查询与最终命中结果的检索协议。

4 min
技术研究更新 2026-08-23

共享锚合谋恢复:协作学习中的几何对齐泄露

分析分析方与参与者如何利用共享锚表示(anchor representation)对齐并恢复其他参与者的私有表示,以及只扰动共享锚的隐私—效用权衡。

6 min
技术研究更新 2026-09-01

DAEI:加噪 Embedding 的去噪感知反转攻击

分析攻击者如何估计 Embedding API 的高斯噪声、用 SURE 训练去噪器并恢复文本,以及查询控制和 DAE-Shield 的适用范围。

6 min
技术研究更新 2026-09-10

Gradient Mirage:分割学习梯度反演与三重不一致防护

分析诚实但好奇的服务端如何从分割学习接口梯度恢复标签文本,以及 Gradient Mirage 如何同时扰乱目标、方向和尺度并保持训练效用。

7 min
技术研究更新 2026-08-23

MemCatalyst:用低影响投毒放大 VLM 成员证据

分析数据持有者如何预先修改自有图文样本,使未来未经授权训练的视觉语言模型更容易暴露成员信号,并限定该证据的技术与法律解释。

6 min
技术研究更新 2026-08-19

文档多模态模型的关系隐私泄漏

分析文档 MLLM 如何在视觉字段缺失时利用关系信息补全身份属性,以及机器遗忘方法的覆盖缺口。

2 min
技术研究更新 2026-08-06

Ball Differential Privacy: How to Mitigate Data Reconstruction with Less Noise

介绍 Ball-DP 如何用嵌入空间中的局部保护半径校准高斯输出扰动,并用 Ball-ReRo 证书评估知情攻击者对训练记录的重建风险;论文在七个嵌入基准上比较局部半径与全局标准 DP 的效用和重建审计结果。

5 min
技术研究更新 2026-08-06

NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization

介绍 NouveauVoice 如何用层级 NVAE 生成伪说话人嵌入,并接入 FACodec 与 CosyVoice2 进行语音匿名化;论文在 LibriTTS 上以声纹验证、可懂度、情感表达和嵌入分布指标评估隐私与效用取舍。

5 min
技术研究更新 2026-08-06

Scalable Differentially Private Data Compression via Diffusion and Stochastic Codes

介绍 DP-DiPP 如何把 step-limited PPR、随机编码和 moment-matched Laplace DiffC 联合为差分隐私图像压缩流程,并在 CIFAR-10 上比较不同隐私预算、压缩码率和分类效用。

5 min
攻击方法研究更新 2026-09-20

联邦 PEFT 隐私后门:恶意 Adapter 如何把聚合梯度变成训练文本

解读 NeuroImprint 如何由恶意参数服务器预置 PEFT 记忆神经元并从聚合更新重建文本,以及 TriShield 防御的实测范围与限制。

8 min
技术研究更新 2026-08-07

ImageAuditor:图像 RAG 的成员推断审计

通过拆分跨模态检索与生成提取阶段,审计目标图像是否进入图像 RAG 数据库。

2 min
技术研究更新 2026-08-08

AURA:面向 Agentic Web Search 重识别的文本匿名化

研究网页检索 Agent 如何将弱上下文线索拼接为重识别证据,并评估掩码—重构匿名化在隐私和语义效用之间的取舍。

4 min
技术研究更新 2026-08-09

Interlocutor Effect:Agent 身份表述如何放大 LLM 个人信息泄露

受控 2×2 实验显示,在合成敏感场景中,把接收方表述为 AI Agent 会改变部分模型的 PII 输出行为;结构化 JSON 输出可降低该差异。

4 min
A2.5

机器遗忘与数据权利验证

1 篇综述 · 3 篇独立研究

研究删除请求、机器遗忘和数据权利在模型及数据层是否真实生效并可审计。

归档边界重点是删除效果和残留恢复;一般隐私泄露归 A2.4。

  • Unlearning 有效性
  • 遗忘后残留恢复
  • 删除请求审计
分类综述研究综述更新 2026-09-10

机器遗忘与数据权利验证研究综述

说明机器遗忘的目标、验证对手、残留恢复风险及其与数据删除和重新训练的差异。

10 min
技术研究更新 2026-09-10

联邦遗忘广播中的删除统计探测与恢复

分析恶意客户端如何以已知增量探测岭回归充分统计量,并从删除前后广播恢复和重放被删除贡献。

5 min
技术研究更新 2026-09-06

TAS:从定向遗忘模型中发现并重构被遗忘 Prompt

研究拒答式机器遗忘如何暴露被遗忘目标,并以黑盒主动搜索评估实体发现、Prompt 重构和查询成本。

5 min
技术研究更新 2026-08-10

Llama 2 的近似机器遗忘实验

研究如何以强化对照、替代标签和微调抑制特定作品知识,并分析输出遗忘与真正删除之间的验证差距。

3 min
A2.6

评测数据与基准完整性

1 篇综述 · 1 篇独立研究

研究测试集、基准数据和评分样本在采集、保管和使用过程中的完整性。

归档边界基准数据污染与泄露归本类;评测器、Judge 或 Harness 被操纵归 C3。

  • 基准污染
  • 测试集泄露
  • 训练集与评测集交叉污染
分类综述研究综述更新 2026-09-10

评测数据与基准完整性研究综述

分析测试集泄露、训练污染、样本重复与基准版本漂移对安全评测结论的影响。

3 min
技术研究更新 2026-08-10

Min-K% Prob 预训练数据检测与基准污染审计

研究以低概率 token 子集在黑盒条件下判断文本是否进入大模型预训练数据,并评估基准污染检测的准确性与限制。

3 min