外观
从预训练阶段写入合成人格的安全对齐研究
摘要
Synthetic Persona Pretraining(SPP)把价值人格材料加入预训练,而不是等到监督微调或偏好优化阶段才施加行为约束。作者在最高 3B 参数、500B token 的设置中研究身份绑定、越狱、分布外道德任务和通用能力权衡。
作者报告这种训练路径能产生较稳定的价值行为,但它仍是训练方法实验,不等于人格文本能够提供不可绕过的安全保证。
核心创新与差异
原研究贡献是把对齐干预提前到预训练,并用身份绑定让模型把价值规则与自身行为主体关联。本站关注的安全差分是:控制不再只是输出阶段拒答,而是训练数据和表征形成过程的一部分。
威胁模型与安全目标
研究假设攻击者可使用越狱或分布外任务诱导模型偏离目标人格。保护对象是训练后行为的一致性和通用能力。首要验证点是预训练写入的价值是否在后续上下文压力下保持,而不是是否存在某个具体产品漏洞。
实验设计与实际过程
作者比较 SPP、常规预训练及后训练对齐基线,覆盖不同规模、训练 token、身份绑定消融、越狱和分布外任务。这些结果均属于作者实验,本站未重新训练模型。
关键结果与实际影响
研究显示训练期人格可以改变安全行为的起点,并在部分越狱和迁移任务中保持优势。价值是为训练完整性提供新的控制位置;风险是训练语料定义、人格冲突和后续微调仍可能改变结果。
防护措施与验证方法
部署前应使用未见过的越狱集、相互冲突人格、后续微调和能力保持测试。还应记录人格数据来源、训练占比和身份绑定模板,避免把单一评分视为稳定对齐。
局限与待验证问题
实验规模仍小于前沿生产模型,合成人格的文化与规范选择也会影响结果。缺少独立复现和长期后训练链验证,因此证据等级为 moderate。