Skip to content

人类道德范畴表征对齐与跨攻击安全泛化 ​

摘要 ​

该研究检验语言模型是否像人类一样,以范畴原型和典型性组织道德概念。作者分析 23 个开放权重模型、251,334 条人类标注和 16,135 个动作,发现模型对相反道德范畴的分离及范畴内典型性保留都较弱。基于这一诊断,论文提出表征相似性优化(Representational Similarity Optimization, ReSO),直接调整隐表示之间的关系,而不监督生成答案。

在使用相同标注的匹配实验中,DPO 更快提高显式道德判断,却没有显著重组内部范畴关系,并在作者的对抗评测中提高攻击成功率(Attack Success Rate, ASR);ReSO 的显式判断增益较小,但在不同模型规模、九个基准和多种攻击策略上更稳定地降低 ASR。该结论来自单篇作者实验,不能将人类道德标注等同于完整安全政策,也不能证明表征相似性本身具有因果充分性。

核心创新与差异 ​

原研究贡献。 论文把对齐目标从输出偏好扩展到表示关系,利用原型理论构造十维道德范畴与典型性参考,并以 Bradley–Terry 排序目标优化表示相似性。相同标注、不同训练目标的对照减少了数据差异对结论的干扰。

本站分析。 现有训练完整性研究多关注拒答率、奖励投机或特定安全方向。本文新增了“人类范畴关系是否进入模型表示”这一可测中间变量,并报告该变量与跨攻击安全泛化相关。它归入 A1.2,因为核心结论是训练目标如何影响对齐的持久性与泛化,而不是某一种权重编辑技术。

威胁模型与验证路径 ​

攻击者是能够改写有害意图表达形式的用户,可使用叙事包装、越狱模板或其他分布外措辞,使表面语言偏离训练时的响应模式。保护对象是模型对相同潜在意图的一致安全判断。最先失效的控制是行为级训练只拟合可观察答案,没有确保内部范畴关系支持跨表达泛化。

验证路径包括:从人类标注构造范畴原型与典型性;测量不同层的范畴中心分离、典型性相关和线性可解码性;在同一批标注上分别训练 DPO 与 ReSO;最后比较通用能力、价值判断、过度拒答和多种越狱评测。

实验设计与实际过程 ​

作者从 Social-Chemistry-101 提取 251,334 条原子判断,分解为关爱—伤害、公平—欺骗、忠诚—背叛、权威—颠覆、圣洁—堕落十个方向,并在 16,135 个动作上提取逐层残差表示。诊断覆盖 23 个、参数量 6 亿至 2350 亿的基础、指令和防护模型。

训练对照在四个不同规模与架构的模型上使用相同标注比较 DPO 和 ReSO。评测覆盖九个通用能力、价值、安全与越狱基准,并跟踪 Qwen3-8B 的 20 个训练检查点。所有结果均为作者实验;本站未训练模型或重新标注数据。

关键结果与实际影响 ​

  • 23 个模型的 230 个“模型 × 道德范畴”组合中,逐层峰值典型性 Spearman 相关平均为 0.37,最高不超过 0.55;完整十维向量的线性预测最高 R² 为 0.34。
  • 权威—颠覆原型相似度在 23 个模型中有 21 个为正,关爱—伤害有 18 个为正,说明许多模型没有在表示中稳定分离相反范畴;这只是作者定义下的几何诊断。
  • 在四条训练线与九个基准中,DPO 提高显式判断,但在作者全部越狱评测和模型上提高 ASR;ReSO 的显式收益较小,却在已测条件下持续降低 ASR。
  • Qwen3-8B 的 20 个训练检查点加基线中,表征相似性分析指标解释了 HarmBench ASR 变化的 86%。这是相关与同轨迹证据,不能单独证明因果关系。

防护措施与验证方法 ​

训练验收不应只看标准提示上的合规率。可加入范畴中心分离、典型性保持、跨语言改写和未知越狱模板,并与输出级指标、通用能力和过度拒答共同报告。表示指标应在留出模型、留出攻击和不同标注体系上复核。

ReSO 类目标涉及价值标注,应记录数据来源、文化覆盖、标注一致性和版本。部署前还需比较 DPO、SFT、ReSO 及组合训练,确认安全泛化改善不是由降低响应能力或增加泛化拒答造成。

局限与待验证问题 ​

人类道德范畴来自单一数据源和理论框架,不代表所有安全政策。多数模型诊断是观察性分析,训练实验只覆盖四个模型。攻击基准、语言与标注偏差都可能影响结果,论文也未提供独立复现。

后续需要验证 RSA 指标能否预测未见攻击、非道德类安全政策和多模态模型,并通过干预与消融区分表征重组、训练正则化和数据覆盖各自的贡献。

参考链接 ​