Skip to content

机器遗忘与数据权利验证研究综述 ​

摘要 ​

删除源数据不等于模型已遗忘。机器遗忘要求降低指定训练样本对模型参数和输出的影响,同时尽量保留其余能力。验证困难在于攻击者可能从输出、成员推断、再训练差异或权重分析恢复残留,而且“无法从少量提示复现”不足以作为充分证明。

分类介绍 ​

本领域覆盖删除请求传播、精确或近似 Unlearning、残留恢复和可审计证明。一般隐私攻击归 A2.4;本类重点是删除义务执行后是否仍可检测指定数据影响。威胁模型应说明验证者能否访问原模型、遗忘后模型、权重或训练记录。

主要安全风险 ​

  • 近似遗忘可能只抑制常见提示下的输出,而保留可被特殊提示恢复的表征。
  • 训练投毒者可能把删除请求用作延迟激活事件:攻击者先用可删除伪装样本压制后门,再请求遗忘这些真实提交的样本。该攻击最先利用的是训练数据写入控制,因此主归 A2.1;本类只负责验证遗忘前后的安全行为差分,详见机器遗忘延迟激活的训练数据投毒。
  • 缓存、Adapter、索引、检查点和备份可能未同步删除。
  • 删除集合与保留集合分布重叠时,效用和遗忘目标发生冲突。
  • 服务方无法披露训练数据时,外部审计缺少可验证基线。
  • 输出遗忘不等于表征遗忘:DECAF 显示一些方法显著降低 forget-set 分类准确率后,倒数第二层特征仍按原类别紧密聚集,攻击者不需要标签就能用聚类方法恢复类别结构——"模型不再答对"可能只是输出层抑制,不是内部信息被删除;结果来自单一视觉基准,不足以证明对生成式大模型同样有效。
  • 相近的端点效用不代表使用相同机制完成了删除:Mode Connectivity in Unlearning 发现两个遗忘模型即使位于相连的低损失区域,隐私泄露指标也可能剧烈波动,且逐字复述指标先下降、底层知识记忆稍后才变化("先抑制、后遗忘"),说明损失几何可用于发现脆弱的遗忘解。
  • Reward 设计本身是遗忘效果和成本的安全变量:Beyond Binary Rewards 指出只判断"有没有禁用词"的二元奖励会丢弃违规数量和语义结构,用指数或 PageRank 奖励提供连续信号可显著提高遗忘增益并加快收敛;结果仍需跨模型、跨 benchmark 和对抗提示复验。
  • 最终答案遗忘不等于推理过程遗忘:LEMUR 发现多模态大推理模型即使把敏感事实从最终答案中成功遗忘,仍可能在强化学习后训练引入的思维链(Chain-of-Thought)里复现该事实,且原生推理模型的泄露更明显;说明遗忘验证要同时覆盖最终输出与内部推理轨迹,而不能只看表面答案。

防护措施与验证方法 ​

建立从请求到源数据、派生数据、模型版本和备份的删除谱系;优先设计可删除的数据分区和训练流程;使用成员推断、重学习攻击、潜在表示聚类、行为探测与再训练基线联合验证;记录遗忘方法、reward、阈值、效用变化和无法覆盖的副本。删除前后还应做安全行为差分,以发现原有训练投毒是否因删除操作解除抑制;训练样本准入、贡献者关联分析和投毒检测仍由 A2.1 负责。

局限与待验证问题 ​

  • 黑盒用户如何获得有意义且不泄露他人数据的遗忘证明?
  • 大模型近似遗忘与从头重训之间的可接受差异如何定义?
  • 多模型蒸馏和下游微调链中的删除义务如何传播?
  • 哪些表示空间指标能跨架构证明信息已经不可恢复,而不是从输出层被隐藏?
  • 如何同时验证遗忘效果、后门状态和对重学习攻击的稳健性?

历史研究成果 ​

Llama 2 近似遗忘实验用强化模型与原模型的 logits 差异定位目标相关 token,再以替代标签微调,在单一作品知识上同时评估熟悉度下降和通用能力保留。它建立了生成式模型遗忘的早期行为基线,也明确暴露了核心限制:常见提示下不再复述并不能证明内部表征和对抗查询都无法恢复信息。

后续研究把验证对象从一次删除扩展到恢复、连续请求和关联支撑路径。Private Information Unlearning Recoverability 直接审计私有信息在遗忘后能否恢复,Plasticity Collapse 关注连续遗忘导致的可塑性退化;Graph-Guided Selective Unlearning 不再把显式 forget seeds 当作完整删除范围,在 TOFU 与 PISTOL 上相对匹配的 seed-only 基线最多降低 49.5 个百分点的“效用可接受软泄露”。Distance Is Not Enough 则表明全局权重距离会被随机或破坏性更新误导,forget-retain 选择性更能解释重学习稳健性。以上均缺少独立复现,且“较低泄露”不等于法律或参数意义上的完全删除。

方法侧出现三种互补路径。GRACE 用梯度引导的 coreset 从少量不良行为样例选择 forget/retain 数据;ST²U 在 Llama3.1-8B、Qwen3-14B、SpikingBrain-7B 上以测试时状态边界抑制生成,作者报告 80.6%–87.9% 遗忘、平均 90.7% 非目标能力保留和 13.76%–19.84% 重入率,但它是部署时表达抑制而非参数级删除;Temporal Decoupling via Generation Inequality 定位局部/全局注意头的敏感检索路径,以 Adapter 解耦并用 activation exchange 验证。三者分别依赖样本选择、运行时监测和白盒表征干预,不能互相替代。

图数据实验进一步展示删除粒度与成本权衡。Forget or Fine-tune? 在 CIFAR-10、CIFAR-100 与 Food-101N 的四类噪声下比较五种遗忘方法;CallosumNet 和 IsleNet 分别以虚拟边重构和空间熵分区处理时空图,后者在四个作者基准上达到最高约 94% 全图准确率并将时间最多降低一个数量级。这些效用和速度结果不证明删除完整。与删除概念相邻的 Compression-Aware Abstention 只是在 KV 压缩移除答案证据后训练弃答,RAG Hallucination Repair 比较删除、替换与改写并发现会误编辑干净答案;二者验证的是推理期证据缺失和输出修复,不能作为训练数据遗忘证明。

定向主动搜索(TAS)把遗忘验证从“已知 Prompt 后恢复答案”推进到“不知道遗忘集时发现 Prompt”。研究从保留数据构造实体与模板,以异常拒答更新后验并控制查询预算;在 3 种遗忘方法、3 个数据集和 3 个模型家族中,作者报告实体识别最高达到 100%、Prompt 重构最高 95%,相对穷举最多减少 99.7% 查询。这里三个百分比分属不同指标和最佳条件,不能视为全部 27 个方法—数据集—模型组合的统一结果。它强化了既有“输出抑制不等于删除”结论,并增加了新的验收维度:遗忘操作是否让目标本身变得可发现。该攻击依赖目标实体也出现在保留集且拒答模式可分;精确重训、无共享实体或分布不可区分的系统不在结论范围内。

联邦遗忘广播中的删除统计探测把验证对象扩展到删除协议的控制面:恶意客户端以效果已知的增量探测完整岭回归分类头,在响应差分张成特征空间时识别删除前后充分统计量,并恢复或重放被删除贡献。作者在 MNIST 与 CIFAR-10 的高精度广播条件下,对全部已测单样本删除精确恢复标签;低精度或维度不足时恢复骤降。这与 TAS 的黑盒拒答发现不同:TAS 利用输出行为定位遗忘目标,本研究利用多次协议响应重建服务器状态。共同结论是遗忘接口本身也可能产生新的可观测信号,但新结果只适用于可加统计量、完整分类头广播、安静窗口和缺少所有权或重复检查的协议。

新增证据把遗忘验证拆成鲁棒性、评测状态与精确重放三类问题。FOM-UL按层选择遗忘更新,在 TOFU、KnowUnDo 与 MUSE 风格评测中相对多种基线减少残留记忆,并在 8-bit、4-bit 量化和对抗提示下保持较强抑制;这说明遗忘模型还要经过后处理和自适应恢复测试。BatchNorm Illusion发现归一化统计可让九种方法的遗忘准确率表面反转最高 78 个百分点,攻击者仅用 10 张无标签图像即可恢复大部分被掩盖准确率,而 GroupNorm 对照消除了该伪影。两项工作共同要求固定模型运行状态并区分参数删除、输出抑制与评测伪影。

Delta Attention 精确记录省略给出传输收据达到精确省略的充要条件,并在 48B Kimi Linear 混合模型上观察到 4,096 个后续 Token 后仍残留约状态范数 4.5% 的印记;重算一半后缀仍不能关闭一半差距,且逐 Token 收据在 88 个 Token 后已比完整检查点更昂贵。Private Retroactive Algorithms则对线性统计、聚类和直方图给出隐私与追溯删除无渐近额外成本的构造及不可能性结果。二者说明精确删除能否成立取决于状态转移结构与可重放记录,不能由最终输出相似度代替证明。

生成模型的概念擦除还需要同时验证目标去除与非目标保真。TICoE以连续凸概念流形和分层视觉表征联合使用文本、图像信号,试图减少文本单独擦除不充分与朴素图像引导过度擦除之间的权衡;论文获 CVPR 2026 接收并公开代码,作者在多个基准上报告优于既有方法的概念去除精度与内容保真。该证据没有给出法律意义上的样本删除证明,也不能由图像输出中不再出现目标概念推断训练影响已从权重中移除;结论仅适用于已测文本到图像模型、概念和评价器,仍需成员推断、重学习和对抗提示验证。

相关研究文章 ​

参考链接 ​