外观
PMA:E2EO 混淆向量流的代理流形对齐恢复
摘要
Embedding-to-Embedding Obfuscation(E2EO)在客户端把每个明文 Token 的向量确定性映射为混淆向量,再把向量流交给远端模型。PMA 攻击指出,即使混淆彻底破坏原始向量几何,一一映射仍保留符号重复、共现关系和句法顺序。攻击者可把混淆向量流视作一种未知“分词语言”,分别从目标流和公开语料训练代理表示,再按流形结构对齐并恢复明文。
作者报告 PMA 在多种 E2EO 方法、模型和跨数据集条件下取得超过 80 的 ROUGE-L,且不需要模型权重、明密文平行数据或严格同分布辅助数据。证据来自单篇预印本作者实验,无公开专属代码和独立复现;结论只适用于确定性一一映射、攻击者能观察足够混淆流并知道目标 tokenizer 的条件,不等同于攻破加密协议或随机化隐私机制。
核心创新与差异
原研究贡献。 PMA 不在被打乱的原始数值空间里寻找近邻,也不以单 Token 频率匹配明文。它用 Word2Vec 分别学习混淆符号共现空间和公开文本空间,经初始锚点、Gromov-Wasserstein 等结构对齐与全局细化建立符号映射,把反演问题改写为无监督翻译。
本站分析。 既有 DAEI 针对加性噪声,依赖查询校准和可学习去噪;PMA 针对确定性替换,即使攻击者不知道转换机制或原始向量,也能利用序列级语义结构。最先失效的控制是 E2EO 只隐藏向量数值,却把跨请求稳定的可链接符号与共现结构完整交给服务端。
威胁模型与攻击链
攻击者是诚实但好奇的远端推理服务,可以观察用户上传的混淆向量序列,知道目标模型的公开 tokenizer,并能取得公开语料。攻击者不知道秘密映射、原始 embedding、模型权重或任何明密文配对。任务感知条件知道应用域;任务未知条件只使用通用公开语料。
- 对混淆流中的不同向量做稳定符号化,保留出现顺序与共现窗口。
- 在混淆符号语料上训练代理表示;用目标 tokenizer 处理公开文本并训练明文代理表示。
- 依据两个空间的内部距离和邻接结构寻找初始锚点。
- 进行全局流形对齐和迭代细化,得到混淆符号到明文 Token 的候选映射。
- 把目标混淆序列转换为候选明文,并以 ROUGE-L 等语义指标评估恢复。
攻击方法与复现材料
论文未提供专属代码直链。以下是本站依据公开机制重构的去武器化审计伪代码,只使用本地合成语料和人为置换的测试词表;它省略对齐目标、锚点选择、优化超参数和真实 tokenizer 细节,不能直接用于第三方流量恢复。
text
plain = load_public_synthetic_sentences()
mapping = random_bijection(vocabulary(plain), seed=TEST_SEED)
obfuscated = substitute_tokens(plain, mapping)
left = train_proxy_embeddings(obfuscated)
right = train_proxy_embeddings(tokenize(plain))
recovered_map = align_manifolds(left, right, DRY_RUN=True)
assert evaluate_on_owned_fixture(recovered_map).rouge_l <= audit_ceiling
assert no_network_capture() and no_user_content()该工件对应攻击链第 1–4 步。预期检测信号包括同一混淆符号跨请求稳定出现、服务端长期聚合用户向量流、公开语料与目标业务域高度匹配,以及恢复质量随观测语料增长而持续上升。
实验设计与实际过程
以下均为论文作者实验,本站未独立复现。研究覆盖 ObfusLM、SentinelLMs、CodeCipher、STIP 与 AlienLM 等确定性 E2EO 设计,比较 KNN、InvBert、Token Frequency Analysis、KNN+SDA、ERA 与 PMA。评估同时包含任务感知、任务未知、跨数据集、不同模型架构和不同 tokenizer 条件。
主要指标为 ROUGE-L,并辅以文本恢复质量和对齐消融。PMA 不使用目标模型权重、明密文平行数据或严格同分布辅助样本;但仍需要足够规模的混淆向量流、公开 tokenizer 和可形成相似语义结构的公共语料。
关键结果与实际影响
- 作者报告 PMA 在多种 E2EO 与实验设置中取得超过 80 的 ROUGE-L,并整体优于所比较的数值近邻、监督反演和频率匹配基线。
- 跨数据集结果表明,攻击不严格依赖与用户输入同分布的辅助数据;但公开语料与目标任务的语义距离仍影响对齐质量。
- 消融支持初始锚点、结构对齐和迭代细化共同贡献恢复,单纯频率匹配不足以解释结果。
该结果说明,高效确定性混淆可能把“明文 Token”替换为“可长期链接的别名”,而不是消除语义信息。恢复成功会暴露查询主题与文本内容,但并不证明所有样本逐 Token 完全恢复,也不能外推到每次请求随机化、密钥轮换或具备正式安全证明的协议。
防护措施与验证方法
- 不把确定性一一替换当作密码学保护;高敏感推理优先采用经过评审的加密计算、可信执行环境或明确泄漏模型下的协议。
- 若必须使用轻量方案,应引入请求级随机化、不可链接化和受控填充,并验证其对模型效用与跨请求对齐的影响。
- 限制服务端按用户长期聚合原始混淆流,缩短保留期,隔离租户并审计离线训练用途。
- 用任务感知和任务未知两种公共语料运行 PMA 类红队测试,同时报告语料规模、ROUGE-L、精确片段命中率和效用损失。
- 将 tokenizer、序列长度、重复模式和流量元数据纳入泄漏模型;只打乱向量坐标或邻域不足以关闭序列共现通道。
局限与待验证问题
证据等级为 moderate。研究没有公开专属代码,且结果尚未独立复现。攻击依赖固定的一一映射和足够观测规模;短会话、低重复词表、频繁密钥轮换、每次请求随机化或隐藏 tokenizer 可能降低对齐效果。ROUGE-L 超过 80 是跨多种设置的作者概括,不应理解为每个数据集、每种方案或每条输入都达到同一水平。后续需公开逐配置结果、语料量曲线、非英语与专有词表表现,并与正式隐私定义比较。