Skip to content

面向大规模稠密检索的隐私候选集协议 ​

摘要 ​

该研究面向服务商持有私有语料、外部用户提交敏感查询的托管检索场景,提出两阶段协议:先发布经方向度量差分隐私随机化的二值码以形成短候选集,再对候选执行同态加密精排,并用主动安全的 (k)-of-(K) 不经意传输隐藏最终选择。

作者在 2.5 万至 540 万文档的五套零样本语料上报告,200–500 个候选可保留完整语料检索 NDCG@10 的 98.84%–100%;在 268 万段 NQ 语料、10 Gbps 网络和 128 Token Qwen3-32B 流水线上,协议增加 0.73 秒、约 10% 的端到端延迟。结果来自作者原型,不构成生产部署的通用隐私或性能保证。

核心创新与差异 ​

原研究把可泄露的粗粒度候选模式与必须保密的精确查询、排序和最终文档选择分开处理,使密码计算从全语料缩小到候选集。其贡献是明确泄漏模型与性能—隐私权衡,而非声称候选模式完全不可观察。

协议定位与核心差异 ​

协议假设语料拥有者诚实但好奇,用户已通过身份和授权检查。数据所有者保留全精度 Embedding 和轻量二值索引;随机化代码只提供方向邻域上的度量差分隐私,随后由 BFV 同态加密完成候选精排。与只保护查询的公开语料检索不同,本协议还限制用户每轮只能取得已授权的少量文档。

架构和消息流程 ​

  1. 用户生成干净查询表示,并发布经方向度量差分隐私处理的二值码。
  2. 服务端在二值索引中执行 Hamming 检索,返回 (K) 个候选的加密评分流程。
  3. 用户本地解密评分并选择最多 (k) 个结果。
  4. 双方通过主动安全的不经意传输只打开被选文档,账户与累计配额限制跨轮抽取。

实验设计与实际过程 ​

作者比较随机响应、高斯、Rényi-DP 校准的 von Mises–Fisher(vMF)和纯 vMF 随机机制,并评估检索质量、Embedding 反演、属性推断、协议延迟和端到端 RAG。系统使用 int8 精排、浅层打包 BFV、仅密钥传输和流水线重叠。本站仅核对论文,未部署密码原型。

关键结果与实际影响 ​

在五套 BEIR 语料和两种编码器上,500 个候选保留接近完整检索的质量;即使加入差分隐私,扩大到最多 3,000 个候选仍可形成可用折中。作者报告发布码降低 Embedding 反演与属性推断泄露,但它仍泄露受隐私参数约束的候选模式。私有检索因此不是“零泄漏”,部署方必须显式选择邻域半径、(\varepsilon)、(\delta)、(K) 与 (k)。

协议对照:Spruce ​

Spruce采用另一种性能—泄露取舍:用学习得到的紧凑二值码与双服务器多方安全计算(MPC)完成候选筛选,再由客户端本地精排或以私有信息检索取得结果。作者在 4 个、规模从 38.3 万到 542 万文档的语料上报告候选集为 382–1,952;全扫描耗时 0.21–2.97 秒并比对照快 4.8–6.7 倍,加入剪枝后快 13.1–22.9 倍且保留 93.9%–97.3% NDCG。与本文“差分隐私候选模式 + 同态加密精排 + 不经意传输”相比,Spruce 把信任分散到不串通服务器并将精排移到客户端;两者都不是零泄露,部署选择应明确服务器串通、候选模式、客户端状态和跨轮查询假设。

防护措施与验证方法 ​

上线前应验证密码实现、授权绑定、累计查询配额和失败关闭行为;对实际查询分布校准方向邻域,而不是照搬论文参数。验收同时报告候选模式泄露、反演/属性攻击、NDCG、延迟、带宽、客户端状态和跨轮文档恢复量。

局限与待验证问题 ​

协议依赖诚实但好奇的语料拥有者、账户身份和不经意传输实现;恶意服务端、侧信道、密钥管理及串通场景需要额外控制。五套公开语料的零样本结果不能直接代表专有医疗、法律或多语言知识库。

参考链接 ​