Skip to content

Gradient Mirage:分割学习梯度反演与三重不一致防护 ​

摘要 ​

分割学习把模型拆成客户端和服务端两部分,但“不上传原始文本”不等于标签安全。Gradient Mirage 论文研究一种诚实但好奇的服务端:它遵循训练协议,却从正常分割接口梯度(split-interface gradient)反演自回归标签文本。作者把攻击记为 GMA-SL,并提出同时制造目标、方向和尺度不一致的防护。

论文在 Llama2-7B、Llama3-8B、DeepSeek-LLM-7B,以及 CodeAlpaca、PIQA、GSM8K 上以三个随机种子比较多种梯度扰动和自适应攻击。Llama3/CodeAlpaca 条件下,Gradient Mirage 的 ROUGE-L 约为 0.351,Gradient Dropout 为 0.942;同时模型困惑度约为 4.42,对照训练为 4.44。结论只覆盖遵循协议、无法获知客户端随机性的服务端,不适用于主动篡改协议或其他侧信道。

核心创新与差异 ​

原研究贡献有两部分。GMA-SL 把分割接口的正常梯度写成标签恢复逆问题;Gradient Mirage 则组合选择性自回归监督(selective autoregressive supervision)、尺度遮蔽(scale blinding)、von Mises-Fisher(vMF)方向随机化、双轨反向传播(dual-track backprop)和底层梯度恢复(bottom-gradient recovery),使攻击者观察到的梯度与真实训练目标在监督位置、方向和尺度上均不匹配。

本站分析认为,研究对象不是恶意服务器下发后门适配器(Adapter),而是正常分割梯度(split gradient)自身的标签可识别性。首个失效控制是系统把梯度接口视为已脱敏数据,却没有用实际恢复攻击验证泄露。防护有效性必须同时测量文本重建、主任务效用和自适应攻击,不能只报告梯度噪声大小。

威胁模型与攻击链 ​

客户端持有输入与标签,并执行底部网络;服务端运行上部网络,接收中间表示和反向梯度。服务端遵循协议、不会改变模型或消息顺序,但会保存接口梯度、已知的模型结构和公开词表。

  1. 客户端按正常自回归目标计算损失并启动反向传播。
  2. 服务端记录与标签 token 对齐的接口梯度。
  3. 攻击者构造候选标签,使候选产生的梯度与观测梯度在方向、尺度或稀疏结构上接近。
  4. 攻击者迭代更新候选文本,或利用 BiSR(b)、TAG、cosine 等目标恢复标签序列。
  5. 恢复结果可泄露代码、答案或推理文本,即使原始数据从未离开客户端。

Gradient Mirage 在客户端改变攻击者看到的监督信号,同时用独立的恢复轨维持底部网络可训练性。服务端不知道客户端随机性,因此难以把观测梯度重新映射到真实标签。

攻击方法与复现材料 ​

论文链接的 GMA-SL 仓库落地页在审计时可访问,但 git ls-remote ... HEAD 没有返回可固定提交,不能称为已公开复现。以下是面向自有模型和合成标签的非破坏性伪代码:

python
# synthetic_label 只含本地生成的无敏感 token。
observed = local_split_model.interface_gradient(synthetic_label)
candidate = random_token_ids(length=len(synthetic_label))

for _ in range(TEST_STEPS):
    trial = local_split_model.interface_gradient(candidate)
    loss = cosine_distance(trial, observed) + scale_gap(trial, observed)
    candidate = update_discrete_candidate(candidate, loss)

assert no_external_endpoint_used()
audit.compare(candidate, synthetic_label)

实际部署验证应使用 canary 标签、隔离模型和固定查询预算。检测信号包括服务端异常保存逐样本梯度、反复请求同一样本、主动改变切分点或要求额外梯度精度。公开报告不应包含真实训练文本。

实验设计与实际过程 ​

以下均为论文作者实验,本站未独立复现。作者测试 Llama2-7B、Llama3-8B、DeepSeek-LLM-7B,数据集为 CodeAlpaca、PIQA、GSM8K,每项使用三个随机种子。

攻击/防护基线包括 Standard、Top-only、Gradient Pruning、Gradient Dropout、GradSeq-LDP,以及 TAG、BiSR(b) 和 cosine adaptive attack。评测指标覆盖 ROUGE-L/F、ROUGE-1/2、METEOR、token recovery rate(TRR)、困惑度(PPL)、ASNR、Jaccard 与 Recall。消融逐项移除选择性自回归监督(SAS)、尺度遮蔽、双轨反向传播、底层梯度恢复和主干(trunk),并给出 vMF 方向隐私的理论分析。

关键结果与实际影响 ​

Llama3/CodeAlpaca 条件下,作者报告 Gradient Mirage 的 ROUGE-L 约为 0.351,Gradient Dropout 为 0.942,数值越低代表重建越差;同时 Gradient Mirage 的 PPL 约为 4.42,Standard 为 4.44。这组结果说明在该设置下,防护显著降低标签恢复质量,且没有观察到明显困惑度损失。

跨三模型、三任务和多种攻击的结果总体支持“三重不一致”比只裁剪、丢弃或在单一位置加噪更稳定。消融则说明 SAS、尺度随机化和双轨反向传播分别承担不同作用。不过,论文指标众多,单一 ROUGE 或 PPL 数值不能替代逐 token 泄露、任务正确率和训练稳定性的联合判断。

现实影响集中在协作微调、分割式大模型训练和算力外包场景。服务端即使没有主动植入后门,也可能从协议允许的梯度恢复客户端标签。该论文没有证明对主动服务端、缓存/日志泄露或表示侧信道同样有效。

新增侧信道证据 ​

返回梯度使诱饵失效的分割式 LLM 训练研究补充了一个与方向和尺度反演不同的稀疏结构侧信道:若客户端用诱饵行隐藏真实样本,但只有真实行参与损失,返回梯度的零模式即可直接标出真实行。作者在 9 个随机种子中每次识别 4,096/4,096 行,内容恢复仅增加约 0.65–1.50 个百分点,而防护代价约 0.01 nats。该结果说明加入诱饵不等于建立隐私边界;验证必须检查损失掩码、梯度支持集和逐行可区分性。它与 Gradient Mirage 的共同点是都利用协议允许返回的梯度,差异在于前者不必重建方向或尺度即可先定位真实行。

防护措施与验证方法 ​

  • 把接口梯度视为敏感派生数据,限制保留、逐样本访问和调试导出。
  • 用 canary 标签定期运行 TAG、BiSR 和自适应 cosine 恢复,报告 token-F1、ROUGE、精确片段命中率和查询预算。
  • 客户端随机性必须本地生成且不复用;服务端不应获得 vMF 种子、尺度映射或恢复轨状态。
  • 对服务端发起的切分点、梯度精度和批量大小变更实施授权校验。Gradient Mirage 的保证不覆盖主动协议偏离。
  • 同时测量主任务准确率、困惑度、训练收敛、通信量和恢复攻击成功率,避免用效用退化换取表面隐私。
  • 结合安全聚合、差分隐私和可信执行环境时,应分别验证各自控制目标,不能把其中任一项视为梯度不可逆证明。

局限与待验证问题 ​

证据等级为中等。论文包含三模型、三任务、三随机种子、多攻击和组件消融,但仍是作者自评,公开仓库没有可固定的可复现提交。威胁模型要求服务端遵循协议且不知道客户端随机性;结论不覆盖主动模型替换、梯度查询操纵、其他切分点或非自回归模型。

  • 恶意服务端能否用选择性重放或批量操纵估计客户端随机性?
  • 防护与正式差分隐私会计、相关噪声和限流组合后如何解释隐私预算?
  • 更深/更浅切分点、长标签和多轮对话是否保持相同效用—隐私前沿?
  • 公开代码落地后,作者表格能否由固定提交和完整配置重算?

参考链接 ​