外观
Gradient Mirage:分割学习梯度反演与三重不一致防护
摘要
分割学习把模型拆成客户端和服务端两部分,但“不上传原始文本”不等于标签安全。Gradient Mirage 论文研究一种诚实但好奇的服务端:它遵循训练协议,却从正常分割接口梯度(split-interface gradient)反演自回归标签文本。作者把攻击记为 GMA-SL,并提出同时制造目标、方向和尺度不一致的防护。
论文在 Llama2-7B、Llama3-8B、DeepSeek-LLM-7B,以及 CodeAlpaca、PIQA、GSM8K 上以三个随机种子比较多种梯度扰动和自适应攻击。Llama3/CodeAlpaca 条件下,Gradient Mirage 的 ROUGE-L 约为 0.351,Gradient Dropout 为 0.942;同时模型困惑度约为 4.42,对照训练为 4.44。结论只覆盖遵循协议、无法获知客户端随机性的服务端,不适用于主动篡改协议或其他侧信道。
核心创新与差异
原研究贡献有两部分。GMA-SL 把分割接口的正常梯度写成标签恢复逆问题;Gradient Mirage 则组合选择性自回归监督(selective autoregressive supervision)、尺度遮蔽(scale blinding)、von Mises-Fisher(vMF)方向随机化、双轨反向传播(dual-track backprop)和底层梯度恢复(bottom-gradient recovery),使攻击者观察到的梯度与真实训练目标在监督位置、方向和尺度上均不匹配。
本站分析认为,研究对象不是恶意服务器下发后门适配器(Adapter),而是正常分割梯度(split gradient)自身的标签可识别性。首个失效控制是系统把梯度接口视为已脱敏数据,却没有用实际恢复攻击验证泄露。防护有效性必须同时测量文本重建、主任务效用和自适应攻击,不能只报告梯度噪声大小。
威胁模型与攻击链
客户端持有输入与标签,并执行底部网络;服务端运行上部网络,接收中间表示和反向梯度。服务端遵循协议、不会改变模型或消息顺序,但会保存接口梯度、已知的模型结构和公开词表。
- 客户端按正常自回归目标计算损失并启动反向传播。
- 服务端记录与标签 token 对齐的接口梯度。
- 攻击者构造候选标签,使候选产生的梯度与观测梯度在方向、尺度或稀疏结构上接近。
- 攻击者迭代更新候选文本,或利用 BiSR(b)、TAG、cosine 等目标恢复标签序列。
- 恢复结果可泄露代码、答案或推理文本,即使原始数据从未离开客户端。
Gradient Mirage 在客户端改变攻击者看到的监督信号,同时用独立的恢复轨维持底部网络可训练性。服务端不知道客户端随机性,因此难以把观测梯度重新映射到真实标签。
攻击方法与复现材料
论文链接的 GMA-SL 仓库落地页在审计时可访问,但 git ls-remote ... HEAD 没有返回可固定提交,不能称为已公开复现。以下是面向自有模型和合成标签的非破坏性伪代码:
python
# synthetic_label 只含本地生成的无敏感 token。
observed = local_split_model.interface_gradient(synthetic_label)
candidate = random_token_ids(length=len(synthetic_label))
for _ in range(TEST_STEPS):
trial = local_split_model.interface_gradient(candidate)
loss = cosine_distance(trial, observed) + scale_gap(trial, observed)
candidate = update_discrete_candidate(candidate, loss)
assert no_external_endpoint_used()
audit.compare(candidate, synthetic_label)实际部署验证应使用 canary 标签、隔离模型和固定查询预算。检测信号包括服务端异常保存逐样本梯度、反复请求同一样本、主动改变切分点或要求额外梯度精度。公开报告不应包含真实训练文本。
实验设计与实际过程
以下均为论文作者实验,本站未独立复现。作者测试 Llama2-7B、Llama3-8B、DeepSeek-LLM-7B,数据集为 CodeAlpaca、PIQA、GSM8K,每项使用三个随机种子。
攻击/防护基线包括 Standard、Top-only、Gradient Pruning、Gradient Dropout、GradSeq-LDP,以及 TAG、BiSR(b) 和 cosine adaptive attack。评测指标覆盖 ROUGE-L/F、ROUGE-1/2、METEOR、token recovery rate(TRR)、困惑度(PPL)、ASNR、Jaccard 与 Recall。消融逐项移除选择性自回归监督(SAS)、尺度遮蔽、双轨反向传播、底层梯度恢复和主干(trunk),并给出 vMF 方向隐私的理论分析。
关键结果与实际影响
Llama3/CodeAlpaca 条件下,作者报告 Gradient Mirage 的 ROUGE-L 约为 0.351,Gradient Dropout 为 0.942,数值越低代表重建越差;同时 Gradient Mirage 的 PPL 约为 4.42,Standard 为 4.44。这组结果说明在该设置下,防护显著降低标签恢复质量,且没有观察到明显困惑度损失。
跨三模型、三任务和多种攻击的结果总体支持“三重不一致”比只裁剪、丢弃或在单一位置加噪更稳定。消融则说明 SAS、尺度随机化和双轨反向传播分别承担不同作用。不过,论文指标众多,单一 ROUGE 或 PPL 数值不能替代逐 token 泄露、任务正确率和训练稳定性的联合判断。
现实影响集中在协作微调、分割式大模型训练和算力外包场景。服务端即使没有主动植入后门,也可能从协议允许的梯度恢复客户端标签。该论文没有证明对主动服务端、缓存/日志泄露或表示侧信道同样有效。
新增侧信道证据
返回梯度使诱饵失效的分割式 LLM 训练研究补充了一个与方向和尺度反演不同的稀疏结构侧信道:若客户端用诱饵行隐藏真实样本,但只有真实行参与损失,返回梯度的零模式即可直接标出真实行。作者在 9 个随机种子中每次识别 4,096/4,096 行,内容恢复仅增加约 0.65–1.50 个百分点,而防护代价约 0.01 nats。该结果说明加入诱饵不等于建立隐私边界;验证必须检查损失掩码、梯度支持集和逐行可区分性。它与 Gradient Mirage 的共同点是都利用协议允许返回的梯度,差异在于前者不必重建方向或尺度即可先定位真实行。
防护措施与验证方法
- 把接口梯度视为敏感派生数据,限制保留、逐样本访问和调试导出。
- 用 canary 标签定期运行 TAG、BiSR 和自适应 cosine 恢复,报告 token-F1、ROUGE、精确片段命中率和查询预算。
- 客户端随机性必须本地生成且不复用;服务端不应获得 vMF 种子、尺度映射或恢复轨状态。
- 对服务端发起的切分点、梯度精度和批量大小变更实施授权校验。Gradient Mirage 的保证不覆盖主动协议偏离。
- 同时测量主任务准确率、困惑度、训练收敛、通信量和恢复攻击成功率,避免用效用退化换取表面隐私。
- 结合安全聚合、差分隐私和可信执行环境时,应分别验证各自控制目标,不能把其中任一项视为梯度不可逆证明。
局限与待验证问题
证据等级为中等。论文包含三模型、三任务、三随机种子、多攻击和组件消融,但仍是作者自评,公开仓库没有可固定的可复现提交。威胁模型要求服务端遵循协议且不知道客户端随机性;结论不覆盖主动模型替换、梯度查询操纵、其他切分点或非自回归模型。
- 恶意服务端能否用选择性重放或批量操纵估计客户端随机性?
- 防护与正式差分隐私会计、相关噪声和限流组合后如何解释隐私预算?
- 更深/更浅切分点、长标签和多轮对话是否保持相同效用—隐私前沿?
- 公开代码落地后,作者表格能否由固定提交和完整配置重算?