Skip to content

持续学习阻断攻击:从当前投毒到未来可塑性破坏 ​

摘要 ​

Catastrophic Learning 研究把持续学习中的受保护资产从“当前任务准确率”扩展到“以后还能否学习”。攻击者在一个训练经验单元(experience)中替换标签或训练张量,不一定追求立即破坏当前输出,而是让模型在后续任务中失去可塑性、遗忘历史能力,或同时发生两种退化。

论文在 MNIST 与 Split-CIFAR10 上测试 iCaRL、DER、ER-ACE,共报告 4,480 次运行。Label-Exchange 最高让准确率下降约 40%,部分 Attraction-Coincident 设置接近零准确率,Full-Tensor-Exchange 可带来约 25% 的遗忘。结果只适用于作者测试的受控视觉任务和整轮替换条件,不能据此认定所有在线学习系统都存在同等风险。

核心创新与差异 ​

原研究贡献是定义六种阻断攻击(blocker attack),并把攻击方向和攻击时序分开:Label-Exchange、Full-Tensor-Exchange,以及 Attraction/Repulsion 的 coincident/preceding 版本。评测不只观察受攻击轮,还追踪后续任务准确率和经验遗忘(experience forgetting),从而区分当前完整性破坏与未来学习能力受损。

本站分析认为,首个失效控制是训练 experience 的来源与内容完整性校验。持续学习算法随后放大了影响,但问题不是一般优化不稳定:攻击者利用了可写入训练数据的权限,并把模型未来的稳定性—可塑性权衡变成攻击目标。这与只植入固定触发器的后门、只追求本轮误分类的常规投毒不同。

威胁模型与攻击链 ​

攻击者能够控制或替换某一训练 experience 的标签、样本张量或其优化方向,但不能直接修改模型代码。目标系统会按顺序吸收新任务,并依赖 replay、知识蒸馏或类增量约束维持旧任务能力。

  1. 攻击者选择一个足以影响后续参数轨迹的训练轮。
  2. Label-Exchange 交换类别标签;Full-Tensor-Exchange 替换完整训练张量;Attraction/Repulsion 则让更新靠近或远离指定表示。
  3. coincident 版本在目标任务到来时施加更新,preceding 版本提前一轮改变参数状态。
  4. 持续学习器正常完成该轮更新,当前指标可能立刻下降,也可能暂时维持。
  5. 后续任务到来后,受污染参数状态表现为新任务难以学习、历史任务遗忘加剧或两者同时发生。

最先失效的是训练数据写入校验和 experience 级异常检测。只在当前轮验收总体准确率,会漏掉延迟出现的可塑性破坏。

攻击方法与复现材料 ​

论文描述基于 Avalanche 与 Adversarial Robustness Toolbox(ART)的实验实现,但未给出可固定提交的公开项目仓库。以下伪代码是本站依据公开机制重构的本地、非破坏性测试脚本,只表达验证顺序,不复刻论文优化器:

python
# 仅用于本地合成数据和自有持续学习模型。
for experience_id, batch in enumerate(local_stream):
    clean = clone(batch)
    if experience_id == TEST_ATTACK_ROUND:
        candidate = exchange_labels(clean)       # 或 replace_tensor(clean)
    else:
        candidate = clean

    learner.fit(candidate)
    audit.record(
        experience_id,
        current_accuracy=eval_current(learner),
        retained_accuracy=eval_previous(learner),
        future_plasticity=eval_probe_task(learner),
    )

验证时应把攻击轮前后的模型制品、训练数据哈希和任务顺序固定,并设置 DRY_RUN 数据源,避免把投毒样本送入生产更新流水线。检测信号包括单轮梯度方向突变、类别条件表示塌缩、历史任务遗忘异常和未来探针任务(probe task)学习曲线变平。

实验设计与实际过程 ​

以下均为论文作者实验,本站未独立复现。作者在 MNIST 与 Split-CIFAR10 上比较三类持续学习算法:iCaRL 依赖 exemplar 与蒸馏,DER 使用 replay 与 logits,ER-ACE 调整经验回放的分类损失。模型包括 Reduced ResNet-18 与 IcarlNet。

实验交叉改变攻击类型、攻击时序、攻击方向、目标算法和数据集,共计 4,480 次运行。主指标是 Top-1 准确率与经验遗忘。作者还报告攻击失败或反而改善目标指标的设置,这说明攻击效果不能脱离算法和任务顺序解释。

关键结果与实际影响 ​

  • Label-Exchange 在部分设置中使准确率最高下降约 40%。
  • Attraction-Coincident 对若干算法和任务组合造成接近零的准确率。
  • Full-Tensor-Exchange 在部分实验中带来约 25% 的经验遗忘。
  • 攻击效果随持续学习算法、数据集、时序和方向大幅变化;一些 Repulsion 或 preceding 设置没有达到攻击目标,甚至产生反向改善。

这些结果说明,持续学习系统不能只验证“这轮数据是否让当前指标下降”。攻击者可能把损害推迟到后续任务,使发布时的快照验收给出正常结果。现实影响取决于攻击者能控制多少更新数据、系统是否允许回滚,以及后续任务与受污染表示的关系。

防护措施与验证方法 ​

  • 对每个 experience 保存来源、标签规则、张量摘要、训练代码和模型版本,拒绝无法归因的整轮替换。
  • 在隔离分支上执行候选更新,同时测量当前任务、历史任务和固定未来探针任务;任一维度异常都阻止晋升。
  • 按类别和贡献者检查梯度方向、表示中心和 replay buffer 组成,避免总体均值掩盖定向破坏。
  • 为任务顺序和回放样本设置可重复基线;更换任务顺序后重复攻击测试,避免把算法偶然性误判为防护有效。
  • 保留更新前检查点和数据快照。发现未来可塑性异常后,应回滚模型并隔离对应 experience,而不是仅用更多后续训练覆盖。

验收指标至少包括当前准确率、历史保持率、经验遗忘、未来任务学习曲线、误报率和回滚成本。

局限与待验证问题 ​

证据等级为中等。研究覆盖三种持续学习算法和 4,480 次运行,但只测试 MNIST、CIFAR-10 类视觉任务。整轮标签或张量替换也比生产环境中的小比例、长期隐蔽投毒更容易发现。论文没有提供可固定版本的公开复现仓库,本站未重跑实验。

  • 小比例、跨多轮的隐蔽 blocker 能否产生同类延迟损害?
  • 任务顺序、概念漂移和 replay buffer 大小怎样改变攻击成功条件?
  • 大语言模型的持续微调、在线偏好更新和 Adapter 累积是否出现相同的未来可塑性破坏?
  • 如何设计不泄露未来业务数据、却能稳定衡量可塑性的探针任务?

参考链接 ​