Skip to content

从预训练阶段写入合成人格的安全对齐研究 ​

摘要 ​

Synthetic Persona Pretraining(SPP)把价值人格材料加入预训练,而不是等到监督微调或偏好优化阶段才施加行为约束。作者在最高 3B 参数、500B token 的设置中研究身份绑定、越狱、分布外道德任务和通用能力权衡。

作者报告这种训练路径能产生较稳定的价值行为,但它仍是训练方法实验,不等于人格文本能够提供不可绕过的安全保证。

核心创新与差异 ​

原研究贡献是把对齐干预提前到预训练,并用身份绑定让模型把价值规则与自身行为主体关联。本站关注的安全差分是:控制不再只是输出阶段拒答,而是训练数据和表征形成过程的一部分。

威胁模型与安全目标 ​

研究假设攻击者可使用越狱或分布外任务诱导模型偏离目标人格。保护对象是训练后行为的一致性和通用能力。首要验证点是预训练写入的价值是否在后续上下文压力下保持,而不是是否存在某个具体产品漏洞。

实验设计与实际过程 ​

作者比较 SPP、常规预训练及后训练对齐基线,覆盖不同规模、训练 token、身份绑定消融、越狱和分布外任务。这些结果均属于作者实验,本站未重新训练模型。

关键结果与实际影响 ​

研究显示训练期人格可以改变安全行为的起点,并在部分越狱和迁移任务中保持优势。价值是为训练完整性提供新的控制位置;风险是训练语料定义、人格冲突和后续微调仍可能改变结果。

防护措施与验证方法 ​

部署前应使用未见过的越狱集、相互冲突人格、后续微调和能力保持测试。还应记录人格数据来源、训练占比和身份绑定模板,避免把单一评分视为稳定对齐。

局限与待验证问题 ​

实验规模仍小于前沿生产模型,合成人格的文化与规范选择也会影响结果。缺少独立复现和长期后训练链验证,因此证据等级为 moderate。

参考链接 ​