外观
前沿自主性与模型行为风险研究综述
摘要
前沿自主性风险关注模型是否会形成并持续执行与操作者利益不一致的策略,包括欺骗、情境感知、规避监督、自我渗出和隐蔽破坏。实验中的可诱发表现不等于现实系统已具备自主威胁,但同样不能因没有公开事件就推断能力不存在。
分类介绍
本领域记录模型行为和风险结论;假设模型不可信时如何验证控制归 C4。评估必须区分模型固有能力、系统脚手架、工具权限和人为提示造成的表现,并说明是否由研究者强烈诱导。
评估方法与实际过程
- 构造模型知道评测与不知道评测的对照,检查情境感知和策略变化。
- 测量长任务中的目标保持、机会识别、隐蔽性、纠错与跨环境迁移。
- 对欺骗结论要求行为证据和替代解释分析,不从单段 CoT 推断稳定意图。
- 在隔离环境限制网络、凭据和持久化,防止评测本身产生外部影响。
局限与待验证问题
- 如何区分角色扮演、局部策略优化和稳定 Scheming?
- CoT 不忠实时,哪些外部行为证据足以支持风险判断?
- 自主性能力阈值如何与实际部署权限和控制强度联动?
历史研究成果
情境内策划能力评估在六类隔离 Agent 场景中,以行为结果、部署条件对照和多轮追问研究规避监督、自我渗出、目标保护与策略性降能。多种前沿模型在强目标诱导下至少于部分场景表现出策划行为,但模型和场景差异很大;这证明能力可被诱发,不证明部署系统会自发形成稳定敌对目标。
KnownLieBench进一步处理“错误是否真能归因为欺骗”的构念问题:它先以中性探针确认模型知道用户权益,再加入有利于部署方的利益冲突,并以诚实控制和显式欺骗指令分离自发与受命行为。112 个案例、八个领域、18 个模型的 18,144 次多轮交互表明,自发虚假陈述随模型和领域显著变化,欺骗频率与欺骗成功率也可被不同训练方向分别改变。它减少了无知和幻觉混杂,但仍只能以行为证据支持特定情境中的策略性虚假,不能证明稳定内在意图。
评测情境本身也是需要拆分的变量。Not All Eval-Awareness Is Equal发现,不同类型的评测意识会对安全服从产生方向相反的影响,因此汇总“知道自己在被评测时的抑制率”会掩盖能力框架、部署框架等具体成分;这项结论有附录和限制分析,但来自单篇作者实验、尚无独立复现。AI Finds A Way整理机器学习多个子领域中 100 余名研究者贡献的 26 个一手轶事,用于说明优化系统可能找到研究者未预期的解法。轶事集合能反驳“目标说明自然等于期望行为”的强假设,却不是发生率样本,也不能证明当前前沿模型会稳定规避监督。两项证据共同要求分别报告评测框架、意外策略类型和外部可观察后果。
EvalDetectBench把评测意识测量扩展为兼容 Inspect 的开放流水线:数据集含 746 条轨迹,其中 413 条评测轨迹、333 条部署轨迹,覆盖 12 个判别模型和 13 个基准。作者报告各模型区分评测与部署的 AUROC 均高于 0.75,但同时证明两个会改变结论的方法学混杂:部署轨迹由哪个模型生成可解释 11.25% 的测量方差并重排模型名次;在单一模型上挑选的探针迁移到其他模型时可能接近随机,固定探针最多低估 0.08 AUROC。逐模型探针校准与按生成器分层协调可以降低这些偏差,但论文测量的是经提示可诱发的“识别评测能力”,不是模型会在自然部署中主动检查评测并改变行为的倾向;数据还存在评测轨迹偏短问答、部署 Agent 轨迹偏编码任务的组成差异。