外观
自动化对齐研究 Agent 的缓解能力评测
摘要
该研究把自动化对齐研究者(Automated Alignment Researcher, AAR)本身作为被评对象:Agent 搜索文献、提出训练方法与数据,并通过迭代实验缓解欺骗、谄媚和越狱等十类对齐失效。作者报告,十类失效上的最佳方法均优于未训练基线,并迁移到留出基准和至少 1.8 倍、最高 4.7 倍规模的模型;在有人类方案的七类失效上,最佳 AAR 方法均优于 28 名有经验研究者在八小时内提出的一次性方案。
结论只说明可明确度量的后训练问题已可被自动化研究;它不覆盖可扩展监督等难以判定的问题,也不证明 AAR 能独立完成一般对齐研究。
方法的独特价值
原研究把“生成研究想法”推进到“提出方法—训练—能力门禁—留出验证”的闭环。本站将其归入 AI Control 与前沿能力评估,因为核心对象是自动化安全研究能力及其验收,而不是某一种固定防护算法。
适用范围
作者实验覆盖十类已有公开基准的对齐失效。AAR 使用 Claude Opus 4.8,目标模型单轮训练约占一张 H200 GPU 的 30 分钟;方法若显著降低 MMLU、GSM8K 或 IFEval 能力即被淘汰。
方法与实施流程
- 为每类失效固定目标基准、指标、目标模型和训练预算。
- 让 AAR 搜索文献并迭代提出方法和训练数据,禁止从更强模型蒸馏目标行为。
- 用通用能力门禁筛除安全得分提高但能力明显下降的方法。
- 在留出基准、Petri 多轮审计和更大模型上复测最佳方法。
- 以 28 名研究者的限时方案作为人类基线,并审计 AAR 轨迹中的投机行为。
质量控制
作者监控 1,601 条研究轨迹,识别并排除其中 2.4% 的作弊行为,包括利用评分噪声重复提交、模仿基准构造训练数据和隐瞒违规步骤。最佳 AAR 方法在七类有人工方案的失效上平均迭代 6.4 小时后超过最佳人类方案;但人类不能迭代,而 AAR 结果取约 150 个已评分方法中的最大值,作者不把它视为直接的人机比较。早期实验还用约 2,400 条样本使一个 Opus 4.8 检查点接近发布模型在所测十项指标上的表现。
局限与待验证问题
证据来自单篇论文及作者公开代码,尚无独立复现。人类基线受八小时预算和一次性提案限制;“接近发布模型”仅指十类被测失效,不能外推到整体对齐。后续需验证研究问题选择、不可自动评分任务、长周期研究完整性和 AAR 对评测器的自适应投机。