外观
联邦 PEFT 隐私后门:恶意 Adapter 如何把聚合梯度变成训练文本
摘要
仅靠“原始数据不离开客户端”和 Secure Aggregation 并不足以保证联邦微调隐私。NeuroImprint 展示了一种由恶意参数服务器发起的隐私后门:服务器在下发的 PEFT Adapter 中预置专用记忆神经元,使客户端本地训练时把不同样本编码到近似独立的参数槽;服务器再从上传的聚合更新中解析并重建离散文本。
攻击论文在 BERT、GPT-2、Qwen2-1.5B 和 Llama3-3B 上报告约 59% 至 79% 的样本重建率,且 SGD 下语义相似度接近 0.95 至 1.00,AdamW 下重建质量通常下降但仍保留大量语义。创新点在于服务器不是被动反演正常梯度,而是主动把待训练制品变成隐私提取通道。
后续 TriShield 提出客户端三层防御并报告实测攻击重建率降到 0%。但其论文部分 LLaMA 主表数据是依据 NeuroImprint 基线和本地 PAD 检测结果投影,并非全部由完整规模训练测得;因此不能把“跨所有大模型零损失防御”当作已经独立证实的结论。
核心创新与差异
原研究贡献是把梯度反演从“被动分析正常更新”改为“由恶意服务器主动设计可训练制品”:NeuroImprint 先在 Adapter 中设置记忆槽,再利用聚合更新恢复文本。后续 TriShield 的贡献是在客户端组合制品检测、优化器状态纠缠和任务子空间投影,专门约束这类主动隐私通道。
本站分析区分了攻击和防护论文中的实测、估计与投影结果。攻击的主要可验证结果是训练文本泄露,因此归入数据隐私、推断与泄露;恶意 Adapter 的制品完整性问题是攻击入口,不另建重叠分类。
威胁模型与攻击链
联邦系统有 10 个客户端,每个客户端持有本地训练文本;恶意但协议兼容的参数服务器下发基础模型和 PEFT 参数,并只能看到 Secure Aggregation 后的模型更新。攻击目标是其中一个客户端的训练样本。
传统设计信任服务器提供的 Adapter 只是高效微调参数,并把聚合视为足以隐藏单个客户端。NeuroImprint 同时打破两项假设:
- 模型/Adapter 制品本身可以包含面向隐私提取的预置结构。
- 聚合只隐藏“正常更新”的单样本贡献,不能消除由服务器主动设计、槽位彼此隔离的解析信号。
这使 A3.1 的制品完整性问题转化为 A2.4 的训练数据恢复。
- 参数服务器构造被污染的 PEFT Adapter,并设置大量 reconstruction bins。
- 特定激活和归一化设计把不同训练样本分配到不同记忆神经元,尽量让每个槽在每轮只接收一次有效更新。
- 客户端在不修改正常训练接口的情况下执行 SGD 或 AdamW,并上传 Adapter 更新。
- 服务器利用相邻槽位的权重和梯度关系解析表示,再通过最近邻 Token Embedding 恢复文本。
- 即使服务器只获得 Secure Aggregation 结果,预先设计的独立槽位仍可减少不同样本与客户端之间的干扰。
攻击方法与复现材料
本文不提供恢复真实训练文本的 Adapter 参数或优化代码。以下为本站依据公开机制重构的合成泄露检查,只使用随机生成 token 序列与本地聚合器:
text
clients = honest_fixtures + [synthetic_probe_client]
aggregate = local_secure_aggregate(clients, dataset="synthetic-only")
candidate = audit_reconstruction(aggregate, allow_real_text=false)
assert candidate.matches_real_dataset == false
record(leakage_score, probe_influence, clean_utility)夹具对应恶意客户端更新、聚合和恢复评估;检测信号是单个 Adapter 对聚合梯度的异常影响、合成序列重构率升高及正常任务效用漂移。省略真实语料、目标客户端标识和可迁移攻击参数。
实验设计与实际过程
以下均为两篇论文作者报告的实验,本站未独立复现。NeuroImprint 默认构造 2,000 个重建槽,使用 8,000 条训练样本和 10 个客户端,每个客户端 800 条数据;本地训练 16 步,批量大小为 50。作者在 BERT、GPT-2、Qwen2-1.5B 和 Llama3-3B 上使用 AGNews、SQuAD、mSQuAD 和 GSM8K,并分别测试 SGD 与 AdamW。
攻击评测报告重建率和平均语义相似度,不能把“语义接近”解释成逐字恢复。TriShield 评测则组合预训练 Adapter 检测、五种自适应攻击、主任务准确率和计算开销;其中部分 LLaMA 主表数据来自基线与本地检测率投影,不是完整规模训练实测。
关键结果与实际影响
论文在 AGNews、SQuAD、mSQuAD 和 GSM8K 上报告重建率与平均语义相似度。部分代表性结果如下:
| 模型 / 数据 / 优化器 | 重建率 | 语义相似度 |
|---|---|---|
| BERT / AGNews / SGD | 77.4% | 0.994 |
| GPT-2 / SQuAD / SGD | 64.2% | 0.988 |
| Qwen2-1.5B / mSQuAD / SGD | 77.6% | 0.959 |
| Llama3-3B / SQuAD / AdamW | 72.4% | 0.926 |
| Qwen2-1.5B / GSM8K / AdamW | 59.5% | 0.663 |
“重建率”与“逐字精确恢复”不是同一指标。SGD 的解析接近闭式恢复;AdamW 的动量和方差状态会混合更新,因此常得到近似文本。论文还讨论用 LLM 润色恢复文本,但主表报告的是未经 LLM 增强的结果。
三项后续研究扩大了联邦聚合的验收面,但不直接复现 NeuroImprint。CARVY-FL 用客户端反聚类与鲁棒投票约束恶意客户端和后门模型替换,并给出认证条件;pFedMARL 用多 Agent 强化学习动态适配 non-IID 半监督联邦聚合;Transferable Adversarial Attacks in Federated Learning 从迁移性分析攻击样本与联邦系统脆弱性。它们分别处理恶意更新、异构效用和推理期对抗迁移,不能证明恶意服务器预置的 PEFT 记忆槽已被阻断;同时均缺少独立复现,认证保证也只在论文明确的对手比例和聚合假设下成立。
防护措施与验证方法
TriShield 三层防护
TriShield 在客户端接收制品和训练更新之间加入三项控制:
- PAD 检查 Adapter 参数的异常低方差、相关性和跨层模式,并在训练前重置可疑记忆行。
- SVI 使用 Adam/AdamW 的状态纠缠,让单次样本更新不再与一个可解析槽位形成简单对应。
- ZUOP 用 32 至 500 条公开、相邻领域辅助样本估计任务子空间,再用 SVD 把更新投影到该子空间,去除与任务无关的记忆方向。
论文在 GPT-2 和本地 LLaMA-Guard-3-1B 检测实验中报告 PAD 检出所有注入神经元;在 GPT-2 上对五种自适应变体的 token reconstruction 实测中,TriShield 均为 0%。其中两个绕过变体虽逃过 PAD,却分别破坏了攻击自身的样本槽映射,或被 ZUOP 去除。
防护结论的适用范围
TriShield 的结论需要分层看待:
- GPT-2、自适应变体和本地 PAD 检测有明确实测表格,支持其对 NeuroImprint 类逐神经元记忆攻击有效。
- 论文报告领域相邻辅助数据下准确率差异小于 0.3%,但 ZUOP 依赖辅助数据能代表真实任务分布。
- CPU 实测额外开销约 72%;论文估计 A100 上低于 4%,讨论部分称 GPU 低于 5%,结论处又写低于 8%。GPU 数字不是同一条件下的完整基准,应视为估计或上界陈述。
- 论文明确说明 Table 1 的 LLaMA 行和 Table 2 的 LLaMA 准确率由 NeuroImprint 基线与本地检测率投影,完整规模 LLaMA 私有数据微调留作未来工作。
- 理论与实验主要覆盖逐神经元记忆、LoRA 类攻击;跨神经元纠缠编码或非 LoRA Adapter 不在已证实范围。
工程控制与验证
- 客户端必须验证 Adapter 来源、签名、初始化分布、层间相关性和与已知良性模板的差异。
- 不应只审计可训练参数数量;需检查冻结基础模型周围新增的归一化、路由和输出结构。
- 用 canary 文本和隔离训练轮验证服务端能否从聚合更新恢复输入,并在不同优化器、本地步数和 batch size 下重复。
- Secure Aggregation、差分隐私、制品检测和任务子空间投影解决不同问题,应组合评测,不能互相替代。
- 对服务端下发模型、客户端实际加载哈希、优化器状态和上传更新建立可追溯记录。
- 防御评测必须同时报告重建率、Token-F1、语义相似度、主任务效用和客户端计算成本。
局限与待验证问题
证据等级为中等:两篇均为公开 arXiv 预印本,攻击覆盖四种模型与四个数据集,防护研究给出代码级方案和局部实测,但尚无独立复现。本文明确区分实测、估计和投影结果;不把“0%”外推到未测试的攻击族或完整规模 LLaMA 训练。
- 恶意服务器能否用跨神经元纠缠、稀疏路由或非 LoRA PEFT 绕开当前检测特征?
- 多轮参与、客户端抽样和异构本地训练会削弱还是增强隐私通道?
- 不依赖同分布公开辅助数据的客户端投影防御如何设计?
- 能否对服务器下发的训练制品给出可验证的“无额外记忆通道”证明?