Skip to content

训练、反馈与标注数据安全研究综述 ​

摘要 ​

训练数据是模型行为的上游控制面。攻击者不必控制大量样本;当数据采集、去重、标注、反馈回流或租户隔离存在缺口时,定向样本可能植入后门、偏置特定实体或削弱安全策略。研究需要同时回答数据从哪里来、谁能写入、如何被转换、是否进入了哪一版模型。

分类介绍 ​

本领域覆盖预训练语料、监督微调集、RLHF/RLAIF 偏好、用户反馈、合成数据和标注平台。训练优化机制的失效归 A1.2;数据集作为分发制品的签名和仓库信任归 A3.1;数据内容、写入路径与租户隔离归本类。

主要安全风险 ​

  • 开放网络采集允许攻击者预先布置可被爬取的投毒内容。
  • 用户反馈直接回流会把终端对手变成训练数据贡献者。
  • 标注账号、供应商和自动标签模型被攻陷后可产生规模化污染。
  • 合成数据循环与去重不足会放大原始错误,并削弱来源可追溯性。
  • 攻击者可同时提交后门样本和 clean-label 伪装样本,让后门在训练后保持休眠,再借机器遗忘移除伪装、延迟激活;详见机器遗忘延迟激活的训练数据投毒。

防护措施与验证方法 ​

建立数据来源清单、授权记录、内容哈希和转换谱系;对高影响数据源实施权限分离、异常聚类、影响分析和隔离训练;保留可回滚的数据快照及模型关联。检测应关注定向概念、触发器和贡献者集中度,而不只做全局分布统计。

局限与待验证问题 ​

  • 如何量化单一来源或贡献者对特定模型行为的边际影响?
  • 合成数据和自动标注链中的污染如何跨代累积?
  • 在隐私约束下,怎样保留足够的训练可追溯证据?

历史研究成果 ​

该分类下的独立研究把训练数据完整性从“当前模型是否已出现异常”扩展到模型生命周期中的延迟状态变化与未来学习能力。机器遗忘延迟激活的训练数据投毒同时提交建立 trigger-target 关联的后门样本与压制该关联的 clean-label 伪装样本,使模型上线时保持低 ASR;攻击者随后删除自己提交的伪装样本,遗忘操作移除抑制后才激活后门。该研究说明,数据写入与删除各自符合局部权限规则,组合后仍可能改变模型安全状态。

持续学习阻断攻击进一步把受保护资产扩展为模型的未来可塑性。研究用标签交换、完整张量替换和表示吸引/排斥攻击 iCaRL、DER、ER-ACE,不只测受攻击轮的 Top-1 accuracy,还追踪后续任务学习与 experience forgetting。两项研究共同说明,训练数据验收不能停留在当前快照:防守方需要保存 experience/样本来源和模型版本,在隔离分支同时验证当前效用、历史保持、未来 probe task 与删除后的行为变化。现有数字均来自视觉基准和作者实验,不能外推为生产持续学习或大模型更新的普遍攻击成功率。

新增的现实条件下 VFL 后门威胁重评 BVBench在垂直联邦学习中重新约束攻击者知识、参与方能力和数据对齐假设,区分理论可行性与现实配置下的成功率。

领域化实证进一步说明,污染检测必须覆盖自然上下文触发器和模型族差异。STAIN-FL 在联邦视频异常检测中把低光、室内与人群密度作为上下文触发器,并用低更新坐标掩蔽维持干净精度;工业控制异常检测污染研究 在 SWaT 上比较 11 类检测器面对随机、相似度定向和特征噪声污染时的不同退化。二者都把首个失效控制指向训练数据或更新完整性,但只覆盖单一领域数据和作者实验,不能外推为联邦学习或工业控制系统的总体攻击成功率。

本轮联邦与持续学习证据把数据完整性验收从中心聚合扩展到拓扑、个性化与多模态触发。R-DPFL以邻域方向估计和历史趋势约束分散式个性化更新;细粒度分布式后门通过分拆触发器与特征对比学习,在 CIFAR-10 目标 ASR 为 70%–90% 的区间相对 DBA 减少 37.4%–48.4% 投毒比例;CACTUS用语义掩码构造 clean-label 触发,在 30% 恶意节点时于 Speech Commands 九规则平均 ASR 为 51.2%,且成功率随网络拓扑和恶意节点比例变化。Robust Dynamic Expansion则以双原型净化识别持续学习中的可疑样本。它们共同说明验收必须跨客户端拓扑、攻击者比例、触发粒度和后续任务,而不能只看一次聚合后的平均准确率。

数据影响与多目标控制也需要分开验证。Influence-Guided Response Rewriting表明影响函数定位到的样本未必能靠重加权产生预期干预,改写响应才暴露其更广的行为杠杆;联邦入侵检测权衡研究在 UNSW-NB15 上观察到 DP-SGD 与坐标中位数的组合可能不成比例地降低稀有攻击检测。神经形态时序嵌入与混合 SNN-XGBoost在两个电网数据集报告高分类指标,但其所谓“遗忘攻击”与模型、数据和领域设置绑定,不能作为一般防投毒保证。三者要求发布方逐类报告安全、隐私、公平和效用,而不是用总体分数掩盖尾部失效。

代码模型投毒还可利用开发者风格而非显式触发词。Poison with Style先收集代码风格,再以两阶段训练把风格变成隐蔽触发器;在作者的 Python 代码补全实验中,触发风格下 CWE-20 脆弱代码生成率为 95%,HumanEval 与 MBPP 的 pass@1 降幅低于 5%。这种机制要求数据准入同时审计功能语义和风格聚类,不能只搜索固定字符串。该数字仅对应作者选定漏洞、模型、投毒配方和触发风格,论文虽公开代码与数据并获 ICML 2026 接收,仍缺少独立复现,不能外推为所有代码模型或真实仓库的投毒成功率。

相关研究文章 ​

参考链接 ​