Skip to content

MoE 路由路径水印与模型所有权证明:PathMark ​

摘要 ​

模型权重水印的目标不是证明输出文本来自某个模型,而是在模型参数或推理行为中保留可验证的所有权信号。PathMark 将 Mixture-of-Experts(MoE)路由路径作为水印载体:模型所有者在指定专家层中编码秘密触发条件下的多位路由模式,之后通过白盒路由读取或黑盒 API 行为验证模型是否保留该信号。

威胁模型与控制边界 ​

攻击者已经获得了带水印 MoE 模型,可以对模型执行微调、量化、剪枝、路由噪声注入、专家覆盖或遗忘训练,但不知道秘密触发条件,也不能从零训练同一模型。首个失效控制是模型制品从发布到所有权验证之间的参数完整性与可归因性。该边界不同于输出统计水印:攻击对象是模型内部参数和专家路由,而不是生成文本。

PathMark 机制 ​

PathMark 在最后约三分之一的 MoE 层中联合使用 distribution alignment loss、wide-path 多专家集合和 contrastive clean-routing loss,把多位信号编码到触发输入对应的专家路径,同时约束干净输入下的路由和模型效用。白盒验证读取路由路径;黑盒验证需要额外的微调或 API 行为判定,因此两种验证的安全假设并不相同。

作者实验结果 ​

作者在 4 个 MoE 模型和 3 类数据上与 LearnMark、IFMark、EaaW、KGW 等基线比较。作者报告白盒水印成功率为 100%,干净 PPL 增加约 5.9%,下游平均准确率约下降 2.4%;4-bit 量化后仍报告 100% 水印成功率,30 个 epoch 微调后约 95%,移除 50% 目标专家后约 90%,10 个 epoch 覆盖训练后原水印仍约为 99%。多水印从 1 增加到 16 个时,交叉干扰上升至约 26%,加入 4 至 12 层水印带来的推理延迟开销为 8.0% 至 19.1%。这些数字均是在论文列出的模型、触发器和攻击预算下的作者实验结果。

消融覆盖路由层数、路径宽度、水印容量、路由噪声、剪枝和遗忘训练,支持“路径宽度与层位置影响容量和耐久性”的工程判断,但不能证明任意 MoE 架构都具有同样性质。

防护与验证建议 ​

  • 将水印验证绑定模型版本、专家路由配置、触发器秘密和权重摘要,避免把 API 黑盒命中率当成独立所有权证明。
  • 发布和验证时同时检查量化、剪枝、专家替换、路由噪声以及多水印冲突;这些转换可能保留或选择性破坏路径信号。
  • 对高风险归属结论结合签名制品、发布记录和访问日志,不能仅凭一次水印命中执行处罚或追责。

证据限制 ​

论文强依赖秘密触发条件、MoE 架构和最后层设置;黑盒验证需要额外微调,真实生产部署、跨供应商模型和独立复现尚未验证。代码和工件公开于 PathMark_in,但公开代码不等于已有独立复现。本文不使用个人数据,伦理说明仅覆盖公开语料和研究用途。

参考链接 ​