外观
训练数据、知识存储、RAG 索引、Memory 与数据权利。
归档边界:由数据内容、存储、索引或访问控制责任方修复。
研究预训练、微调、RLHF/RLAIF、用户反馈和标注数据的内容完整性与授权。
归档边界数据内容和写入路径归本类;训练算法或奖励机制失效归 A1.2。
从数据进入训练前的来源、授权、完整性与隔离出发,建立投毒和反馈污染的研究边界。
分析攻击者如何用整轮标签或张量替换破坏持续学习系统的后续可塑性,并区分当前准确率下降、历史遗忘与未来任务阻断。
分析既有垂直联邦学习后门为何依赖不现实先验,并用实践约束重新评估攻击和防御结论。
分析 clean-label 训练数据投毒如何借可删除伪装样本隐藏后门,并在机器遗忘执行后解除抑制、延迟激活。
研究检索语料、Embedding、向量数据库和索引的存储侧安全。
归档边界索引写入、访问控制和数据恢复归本类;检索内容进入上下文后成为指令归 A5.1。
聚焦检索语料、Embedding、向量索引和多租户存储的投毒、泄露与完整性风险。
提出 DnD(Divide and Doubt)针对性投毒攻击,通过风格多样化文档分散投毒表示并加入质疑参考答案的段落,绕过聚类和冲突感知防御,在 9 种 RAG 配置中攻击成功率提升 27-41%。
研究数据提供方如何在不控制第三方 RAG 的条件下,以语义水印和黑盒统计检验审计文档级复用。
分析黑盒攻击者如何以单份任务匹配代码制品诱导检索增强代码生成系统复现指定 CWE,并给出来源治理与端到端验证方法。
分析恶意生成式引擎优化如何利用证据选择偏好,并评估重排残差与免训练生成控制的联合防护。
分析攻击者如何在不改变程序功能的条件下替换标识符,使无关代码跨模型迁移并挤入目标查询结果。
研究多份单独看似正常的文档如何协同占据目标查询的检索结果,并证明只观察写入文档的准入期防护无法可靠区分攻击与合法小众语料。
分析无需可信参考语料的查询层与知识图层局部对比方法,以及其对六类 RAG 投毒的检测效果。
介绍 C3R 如何在多域检索中用无查询标签的域后验、双校准集和 conformal risk guarantees 控制逐域证据污染,并在预算不足时主动弃答;论文在四个开放测试床上比较证书稳定性、召回率和错误权威 grounding。
分析具备写入和备份访问的内部攻击者如何在尽量保留检索行为的条件下篡改 Embedding,并提出签名绑定的向量来源证明。
研究仅写入一份检索文档时,如何通过与推理结构相似的误导性证据改变 RAG 推理结果。
CanaryRAG 在检索上下文中加入可验证金丝雀,并以双路径一致性与恢复阈值检测知识库抽取。
研究长期记忆、会话存储和上下文数据层的写入、隔离、生命周期与完整性。
归档边界存储侧污染和越权读取归本类;应用读取后的优先级和跨会话行为影响归 A5.2。
分析 Agent 长期记忆和会话存储的写入授权、租户隔离、生命周期与残留风险。
实测五种 Agent 记忆系统是否在默认检索时执行撤销状态,并分析已失效合法策略仍被排序和执行的风险。
分析外部内容如何被写成伪造用户记忆、在后续会话被检索并影响 Agent 行为,以及写入到使用的生命周期控制。
通过多轮误导记忆、噪声工具结果与偏置反馈评测 Agent 记忆渐进失真,显示静态提示难以稳定抑制跨轮风险。
研究从数据处理、训练信号或知识存储中恢复敏感属性和原始信息的攻击。
归档边界模型资产提取归 A1.3;数据库、梯度和数据记录承载的隐私泄露归本类。
归纳成员推断、属性推断、梯度泄露和重识别攻击的访问条件、指标与隐私防御基线。
分析攻击者如何递归剥离已恢复样本的梯度贡献,在单轮 FedSGD 中恢复大批量样本及标签,并据此检验梯度共享的隐私风险。
分析攻击者如何把确定性 Embedding 混淆流视为未知分词语言,通过代理语义流形对齐恢复明文。
研究外部参与者如何从个性化选择而非源记录中推断隐藏用户信息,并评估行为侧隐私控制的有效性与效用代价。
评估七种换脸工具的目标身份泄露,并以仿射随机模型解释多次换脸后的泄露衰减与残留下限。
研究以差分隐私二值候选集、同态加密重排和不经意传输保护查询与最终命中结果的检索协议。
分析分析方与参与者如何利用共享锚表示(anchor representation)对齐并恢复其他参与者的私有表示,以及只扰动共享锚的隐私—效用权衡。
分析攻击者如何估计 Embedding API 的高斯噪声、用 SURE 训练去噪器并恢复文本,以及查询控制和 DAE-Shield 的适用范围。
分析诚实但好奇的服务端如何从分割学习接口梯度恢复标签文本,以及 Gradient Mirage 如何同时扰乱目标、方向和尺度并保持训练效用。
分析数据持有者如何预先修改自有图文样本,使未来未经授权训练的视觉语言模型更容易暴露成员信号,并限定该证据的技术与法律解释。
分析文档 MLLM 如何在视觉字段缺失时利用关系信息补全身份属性,以及机器遗忘方法的覆盖缺口。
介绍 Ball-DP 如何用嵌入空间中的局部保护半径校准高斯输出扰动,并用 Ball-ReRo 证书评估知情攻击者对训练记录的重建风险;论文在七个嵌入基准上比较局部半径与全局标准 DP 的效用和重建审计结果。
介绍 NouveauVoice 如何用层级 NVAE 生成伪说话人嵌入,并接入 FACodec 与 CosyVoice2 进行语音匿名化;论文在 LibriTTS 上以声纹验证、可懂度、情感表达和嵌入分布指标评估隐私与效用取舍。
介绍 DP-DiPP 如何把 step-limited PPR、随机编码和 moment-matched Laplace DiffC 联合为差分隐私图像压缩流程,并在 CIFAR-10 上比较不同隐私预算、压缩码率和分类效用。
解读 NeuroImprint 如何由恶意参数服务器预置 PEFT 记忆神经元并从聚合更新重建文本,以及 TriShield 防御的实测范围与限制。
通过拆分跨模态检索与生成提取阶段,审计目标图像是否进入图像 RAG 数据库。
研究网页检索 Agent 如何将弱上下文线索拼接为重识别证据,并评估掩码—重构匿名化在隐私和语义效用之间的取舍。
受控 2×2 实验显示,在合成敏感场景中,把接收方表述为 AI Agent 会改变部分模型的 PII 输出行为;结构化 JSON 输出可降低该差异。
研究删除请求、机器遗忘和数据权利在模型及数据层是否真实生效并可审计。
归档边界重点是删除效果和残留恢复;一般隐私泄露归 A2.4。
说明机器遗忘的目标、验证对手、残留恢复风险及其与数据删除和重新训练的差异。
分析恶意客户端如何以已知增量探测岭回归充分统计量,并从删除前后广播恢复和重放被删除贡献。
研究拒答式机器遗忘如何暴露被遗忘目标,并以黑盒主动搜索评估实体发现、Prompt 重构和查询成本。
研究如何以强化对照、替代标签和微调抑制特定作品知识,并分析输出遗忘与真正删除之间的验证差距。
研究测试集、基准数据和评分样本在采集、保管和使用过程中的完整性。
归档边界基准数据污染与泄露归本类;评测器、Judge 或 Harness 被操纵归 C3。