Skip to content

受约束 Best-of-N 推理中的安全投机 ​

摘要 ​

受约束 Best-of-N 先用学习型安全模型过滤候选,再从通过过滤的输出中选取奖励最高者。该研究把失效分为两步:安全代理误接纳造成可行集污染,奖励最大化再偏向污染样本的高分尾部。作者将最终输出通过代理约束却违反真实安全标准定义为“安全投机”。

作者推导的理论结果表明,只要不安全但可行输出具有更重的奖励分布上尾,安全投机概率可随 N 增大趋近 1,即使误接纳概率质量和平均代理误差任意小。该结论由作者的玩具实验和语言模型实验支持,但依赖独立同分布采样等假设。

方法的独特价值 ​

研究指出平均过滤准确率不足以预测推理扩展后的安全性;必须同时测量残余污染和安全/不安全候选的联合奖励尾部。它区别于普通奖励投机,因为优化域本身已经由不完美安全代理错误定义。

适用范围 ​

分析适用于固定提示下从参考策略独立采样并硬过滤、再按学习奖励排序的流水线,也可扩展到开环轨迹。它不直接覆盖束搜索、树搜索或逐步非独立决策。

方法与实施流程 ​

  1. 将代理可行集拆成真实安全集合 A 与误接纳集合 B。
  2. 以二者在学习奖励上的联合上尾质量推导有限 N 上下界。
  3. 构造误差趋近零但 N=Θ(1/ε) 时风险仍被放大的实例。
  4. 用奖励模型与安全过滤器消融区分污染和放大贡献。
  5. 以受限悲观采样限制相对参考分布的卡方散度。

质量控制 ​

作者给出的理论示例中,如果不安全输出在安全输出最高代理奖励以上的联合上尾质量为 0.01,安全投机概率下界在 N=100 时约为 0.63、N=500 时约为 0.99;这些数值是公式实例,不是语言模型实验成功率。覆盖控制可给出与 N 无关的上界,但只能限制集中程度,不能清除过滤器已接纳的不安全输出。

局限与待验证问题 ​

真实安全函数在部署中不可直接获得,尾部估计也需要大量样本。受限悲观采样并非对所有奖励代理都更安全,且会影响效用。后续需验证相关采样、自适应搜索和真实低基率场景。

参考链接 ​