Skip to content

Signed-Permutation Coordinate Transport for RMSNorm Transformers ​

摘要 ​

这篇研究分析 RMSNorm Transformer 在坐标重参数化下的模型制品传输问题。论文指出,RMSNorm 的原生离散对称性是 signed-permutation gauge B_d,而只处理 permutation 的 S_d 传输可能遗漏符号变化,使 LoRA、SAE、steering、拒答方向和 AdamW 状态在不同 checkpoint 之间失真。

作者在 Qwen、TinyLlama 和 Llama-2 相关设置中报告,运行中进行坐标传输比只在端点处理更能恢复安全干预和训练状态。但实验主要使用作者构造的精确 gauge 与特定模型轨迹;FFN 长期传输、重复 gain 和探针分布仍限制结论外推。

核心创新与差异 ​

原研究贡献。 论文从 RMSNorm 的对称性出发,证明原生离散 gauge 应包含符号和置换,而不只是 S_d。方法将 checkpoint、适配器、steering 方向和优化器状态在 gauge 变换下同步传输,并以 gauge sweep 检查坐标级结论是否保持。

本站分析。 现有权重完整性和安全干预讨论容易把“参数数值变化”与“模型功能变化”混在一起。该研究补充了一个具体的制品转换控制:即使两个 checkpoint 在模型函数意义上等价,遗漏符号的转换仍可能破坏安全适配器或错误解释坐标方向。因此,模型供应链的校验对象应包括转换规则、适配器和优化器状态,而不是只检查最终权重文件。

威胁模型与攻击链 ​

威胁场景是维护者或模型流水线能够控制 checkpoint、LoRA、SAE、steering 或优化器状态的转换。问题既可能来自恶意或粗略实现,也可能来自把只支持 permutation 的转换器用于 RMSNorm 模型。资产包括拒答行为、安全适配器完整性、坐标级解释和继续训练状态。

攻击或失效过程可以概括为:

  1. 流水线在不同参数化或 checkpoint 之间转换模型制品。
  2. 转换器只处理坐标置换,遗漏 signed-permutation 中的符号,或只在端点做对齐。
  3. LoRA、SAE、steering、拒答方向或 AdamW 状态与主模型坐标不再匹配。
  4. 下游训练、解释或安全干预结果发生变化,且变化可能让人误以为是模型自身安全行为发生了变化。

最先失效的安全控制是模型制品跨参数化传输时的对称性和方向校验,信任边界位于 checkpoint 坐标图及其适配器之间。

实验设计与实际过程 ​

以下结果均为论文作者实验,未进行本站或第三方独立复现。主要设置包括:

  • Qwen2.5-1.5B 同基模型进行 1500 步训练,比较 18 对运行中的传输和只在端点处理的传输。
  • TinyLlama SAE 重构实验,以及 Qwen sentiment steering 和 Qwen SST-2 LoRA 实验。
  • AdamW 长程续训状态传输,以及 Llama-2 拒答方向的 20 题重测。

基线包括 permutation-only 的 S_d 处理、endpoint/through-base、unaligned 设置,并有模块级和探针级消融。日志、超参数和时间戳说明较完整;研究复用了 Arditi 的公开拒答代码,但未见本研究公开代码仓库。

关键结果与实际影响 ​

  • Qwen2.5-1.5B 的运行中 transport 恢复 91.1% 坐标,endpoint 设置为 60.3%。
  • TinyLlama SAE 重构 NMSE 为 0.004,对照为 1.08。
  • Qwen sentiment steering 保留 95.8% 效果,遗漏符号的设置为 17.2%。
  • Qwen SST-2 LoRA 准确率为 0.944,S_d 处理为 0.523。
  • AdamW 长程续训的相对 logit MSE 为 5.3e-10,对照为 3.5e-3。
  • Llama-2 拒答方向重测中,原设置为 20/20,错误传输后为 3/20。

这些结果表明,坐标传输错误可能同时影响模型安全行为、适配器效果和解释结论。作者也指出,正确修复会降低不良 steering 的迁移成本,因此完整性修复本身不等于消除了所有安全风险。

防护措施与验证方法 ​

  • 对 RMSNorm 模型使用包含符号和置换的 B_d canonical transport,并让主模型、适配器、SAE、steering 向量和优化器状态使用同一坐标映射。
  • 不只在转换端点比较权重;在训练或连续转换过程中检查中间状态,避免通过 base 或 endpoint 对齐掩盖传输失真。
  • 对拒答、分类、steering 效果、SAE 重构和继续训练分别做转换前后回归测试,并报告相同数据和任务上的对照结果。
  • 用 gauge sweep、模块级消融和探针级消融检查结论是否依赖某一坐标表示;同时记录 gain、探针分布、模型版本和转换日志。

这些措施是本站根据论文揭示的失效模式提出的验证方法,不能直接视为论文已经证明的生产防护效果。

局限与待验证问题 ​

实验主要使用作者构造的精确 gauge 和 Qwen 轨迹;独立端点没有 canonical transport,重复 gain 和探针分布可能影响匹配,FFN 的长期传输相对不稳定。论文未见本研究公开代码仓库或独立复现,也未见单独伦理审查。后续需要验证更多 RMSNorm 架构、不同适配器和量化/分片流程,并测量恶意转换者能否利用这些坐标传输差异进行隐蔽 steering 或安全行为篡改。

参考链接 ​