Skip to content

机器遗忘延迟激活的训练数据投毒:可删除伪装与休眠后门 ​

摘要 ​

这首先是一种训练数据投毒攻击。攻击者同时提交建立 trigger-target 关联的后门样本和压制该关联的 clean-label 伪装样本,使模型上线时保持较低攻击成功率;随后请求删除自己提交的伪装样本,机器遗忘移除压制作用,后门才转为激活状态。

该攻击利用的是训练数据写入控制,因此主归 A2.1。机器遗忘并不凭空制造后门,而是被攻击者利用为延迟激活机制:常规上线前行为测试只看到休眠状态,删除权限检查又会认为攻击者只能删除自己的数据,两项看似正常的控制组合后仍可能破坏模型完整性。

核心创新与差异 ​

原研究贡献是构造两组相互制约的干净标签样本:一组建立触发器与目标类别的关联,另一组在模型上线前压制该关联,并且只有攻击者自己的伪装样本进入待删除集合。这比假设攻击者能够任意指定他人数据的早期机器遗忘攻击更接近真实删除流程。

本站分析认为,机器遗忘是后门的状态转换条件,而不是最初的攻击入口。最先失效的控制仍是训练数据完整性,因此本文归入训练与反馈数据安全;删除流程同时需要承担发布前后的模型行为复核责任。

威胁模型与攻击链 ​

攻击者能够向训练集贡献少量 clean-label 样本,并在之后对其中一部分发起可被系统接受的删除请求。攻击者不需要请求删除其他人的数据;论文强调 forget set 中的 camouflage 样本确实由攻击者提交并参与过训练,这比使用任意“干净替代样本”的早期假设更接近真实数据删除流程。

攻击目标是在删除前隐藏后门行为,在删除后让带触发器的非目标输入被分类到指定目标类。

攻击由两个相互配合的生成器形成:

  • 后门生成器学习在模型中建立持久的 trigger-target 关联。
  • 伪装生成器产生带正确标签的 removable camouflage,使训练后模型暂时抑制该关联。

双层优化同时模拟训练后的潜在模型和执行遗忘后的模型,因此目标不是单纯最大化后门 ASR,而是联合优化“删除前低 ASR、删除后高 ASR-U”。这使攻击能绕过只在部署前检查异常行为的检测流程。

攻击生命周期为:投毒样本与伪装样本进入训练集,模型上线时表现正常,攻击者发起真实删除请求,系统按设计执行 Unlearning,后门失去抑制并进入激活状态。删除请求在这里不是外部 Payload,而是改变模型参数状态的合法控制事件。

攻击方法与复现材料 ​

以下为本站依据论文公开机制重构的去武器化生命周期夹具,只使用合成分类数据、占位触发标签和隔离模型副本:

text
train_set = clean_fixture + synthetic_association + removable_camouflage
before = train(train_set)
assert evaluate_trigger(before, token="TEST_MARKER").target_rate <= low_threshold

after = unlearn(copy(before), forget_set=removable_camouflage)
assert evaluate_clean(after).accuracy >= utility_floor
record(delta_trigger = evaluate_trigger(after) - evaluate_trigger(before))

夹具对应训练、上线前检查、合法删除和删除后复验四个阶段。预期安全结果不是复现高攻击成功率,而是发布门禁能够发现 delta_trigger 异常并阻止模型晋升。检测信号包括同一贡献者样本族、删除前后目标类迁移、表示突变和正常准确率变化。夹具省略真实触发器生成、优化参数和可迁移样本。

实验设计与实际过程 ​

以下结果均来自论文作者实验,本站未独立复现。作者在 CIFAR-10 和 ImageNet-10 图像分类任务上,分别使用 SISA、First-Order 和 PUMA 三类机器遗忘算法,比较删除前攻击成功率(ASR)、删除后攻击成功率(ASR-U)和删除后正常准确率(BA-U)。实验还更换遗忘算法与模型架构,以检查攻击在攻击者假设与目标实现不完全匹配时能否迁移。

关键结果与实际影响 ​

论文报告的主结果显示,该方法在不同数据集和遗忘算法下均形成明显的休眠到激活差值:

数据集 / 遗忘算法删除前 ASR删除后 ASR-U增幅删除后正常准确率 BA-U
CIFAR-10 / SISA8.91%89.01%+80.1090.82%
CIFAR-10 / First-Order12.67%87.87%+75.2083.24%
CIFAR-10 / PUMA13.74%86.99%+73.2580.77%
ImageNet-10 / SISA10.67%80.30%+69.6380.08%
ImageNet-10 / First-Order14.35%82.13%+67.7876.50%
ImageNet-10 / PUMA13.80%80.74%+66.9470.08%

论文还测试了不同遗忘算法和模型架构之间的迁移,并发现多数错配设置仍保持删除前低 ASR、删除后高 ASR-U。Fine-pruning 只有在明显损害正常准确率时才有效降低激活后门;STRIP 结果放在论文附录中。上述结果说明风险存在,但也显示部分设置的 BA-U 下降明显,防守方可能通过效用漂移发现异常。

防护措施与验证方法 ​

防御首先要阻止训练投毒,同时在机器遗忘执行前后检查异常行为变化:

  • 对同一贡献者批量提交、分阶段删除和高度相关样本建立关联分析。
  • 在执行遗忘前后运行固定触发探测、类别迁移和表示漂移测试,比较 ASR 风格指标而不只看总体准确率。
  • 对异常删除集合先在隔离副本运行 Unlearning,设置行为变化和效用变化阈值。
  • 保存训练数据来源、样本族关系、删除请求、模型版本和评测结果的可审计谱系。
  • 将删除授权与安全发布解耦:数据仍须按权利要求删除,但异常模型版本可以不直接晋升到生产环境。
  • 对长期运行系统定期重训可信基线,以识别近似遗忘累积造成的状态偏移。

局限与待验证问题 ​

证据等级为中等:论文给出三种遗忘算法、两个数据集和架构迁移实验,但研究对象仍是图像分类基准,属于 arXiv 预印本,尚不能证明对大语言模型或生产删除流水线同样有效。表中数字是作者报告结果,本站未独立复现实验。

  • 在不延迟法定删除义务的前提下,如何隔离和审查高风险 forget set?
  • 文本生成模型、PEFT Adapter 和持续学习系统中能否构造同类“可删除抑制器”?
  • 能否从梯度、表示或影响函数中识别一组样本之间的抑制与释放关系?
  • 多次独立删除请求是否可以逐步激活难以由单次差分发现的后门?

参考链接 ​