Skip to content

Ball Differential Privacy: How to Mitigate Data Reconstruction with Less Noise ​

摘要 ​

该研究关注发布嵌入模型后的训练记录重建风险,提出 Ball-DP:只在嵌入空间中声明的、半径为 r 的同标签替换邻域内提供差分隐私,并据此减少不必要的输出噪声。论文还提出 Ball-ReRo 重建鲁棒性证书,用有限先验下的最优 MAP 攻击审计证书的实际表现。

作者在 AG News、BANKING77、CIFAR-10、Emotion、IMDb、MNIST 和 TREC-6 七个嵌入基准上报告:在主设置 epsilon=2、delta=1e-6、m=10 下,局部半径策略的 q50 准确率较 global-radius standard DP 提高 0.57–36.47 个百分点,q95 也在每个任务上更高。结果只覆盖论文列出的模型、邻接关系、预算和一次性发布实验,不应外推到所有差分隐私训练或所有重建攻击。

核心创新与差异 ​

原研究贡献: Ball-DP 把保护半径 r 作为隐私政策参数,将邻接关系限制为嵌入空间中的 label-preserving 替换;半径覆盖整个可行记录域时,退化为标准 DP。论文为正则化凸学习给出 Gaussian output perturbation 校准,并推导 Ball-ReRo 证书和有限先验 MAP 重建攻击。

本站分析: 与只按全局最坏替换校准噪声的发布模型相比,本文新增的是“声明重建威胁所需局部邻域,再据此校准控制”的适用范围。最先需要重新审查的控制是模型发布时隐私邻接域与实际重建候选集是否匹配;修复责任在隐私机制设计者和发布模型的维护者,而不是由更高的下游分类准确率单独承担。

威胁模型与攻击链 ​

  • 研究对象与资产: 固定嵌入上的凸分类模型及其训练记录;要保护的资产是隐藏训练记录的身份或内容,尤其是记录并非人类可读时仍可能从发布模型中被识别。
  • 攻击者与权限: informed adversary 知道训练算法、超参数、发布规则以及除一个记录外的全部数据,并在有限候选集中识别该隐藏记录。论文还用有限先验 MAP 攻击进行审计。
  • 信任边界与首失效控制: 训练数据经过嵌入和模型发布后,发布模型跨越边界交给具有大量侧信息的攻击者;本站分析认为首失效控制是全局邻接假设没有明确对应实际重建候选邻域。
  • 攻击链: 攻击者取得发布模型及允许的侧信息,枚举有限候选记录,计算各候选在训练与发布机制下的解释力,选择 MAP 候选;Ball-ReRo 则对该重建成功率给出上界并进行经验审计。

实验设计与实际过程 ​

这是作者实验,不是本站复现。七个数据集使用固定嵌入和 ridge-prototype classifier;主实验采用 Gaussian output perturbation、delta=1e-6、m=10,并以 q50、q80、q95 的同标签距离分位数设置保护半径。效用实验以 global-radius standard DP 为基线,使用 10 个独立 Gaussian release seeds。

MAP 审计在每个设置使用 10 个 setup seeds、4 个支持集和每种机制 400 次 trials,比较经验攻击率、oblivious baseline 与 Ball-ReRo 证书。IMDb 另比较 logistic 和 SVM heads;消融考察不同 r 及不同凸学习 head。全文核验未发现公开代码或工件仓库声明。

关键结果与实际影响 ​

  • 在七个基准的效用比较中,q50 局部半径的准确率提升范围为 0.57–36.47 个百分点;q95 在每个任务上仍高于 global-radius standard DP。这里的提升是作者在上述数据、模型、随机种子和隐私参数下报告的结果。
  • Ball-ReRo 将有限先验 MAP 重建攻击纳入可审计对象,使隐私声明的半径与重建候选集之间的关系可被单独检查。全文核验记录没有提供一个可跨数据集汇总的攻击成功率,因此本站不补写统一数值。
  • 实际部署影响是效用与保护邻域范围的共同取舍:缩小 r 可能减少噪声,但同时缩小隐私声明覆盖的替换集合;不能把局部保证当作对未声明候选的全局保证。

防护措施与验证方法 ​

防护路径是先明确重建威胁下的候选邻域和 label-preserving 条件,再按 Ball-DP 校准 Gaussian 输出扰动,并用 Ball-ReRo 对有限先验 MAP 攻击的重建成功率进行证书审计。验证时应同时记录 r、距离度量、epsilon、delta、候选集先验、模型 head、数据集和随机性,并把 q50/q80/q95 等不同半径策略与 global-radius standard DP 放在同一设置比较。

这不是 DP-SGD transcript、非凸表示学习或 label-changing substitutions 的验证方案;论文也没有公开代码或工件供独立复现。原文伦理要求使用获授权数据且不发布原始记录,发布者仍需按自身数据和威胁条件重新确认邻接域是否合理。

局限与待验证问题 ​

证据来自一篇完整论文的作者实验,尚无独立复现。实验集中于一次性 Gaussian release、凸 ERM 和 label-preserving 邻接,不能据此判断 DP-SGD 的训练过程、非凸表示学习或改变标签的替换。待验证问题包括:不同发布机制和非凸模型下局部半径是否仍能提供相同的风险解释;候选集先验与距离度量如何在真实部署中获得;以及当攻击者拥有超出有限候选集的记录或不同侧信息时,Ball-ReRo 的适用范围如何变化。

参考链接 ​