外观
执行前监督的验证单元效应
摘要
执行前监督通常让 LLM 监控器一次审查若干计划动作,但窗口越长是否越安全此前缺少受控证据。Twin-prefix 方法为每条错误轨迹构造只差一个写操作的干净配对,并在 1、2、3、5、8 五种嵌套长度下同时测量捕获率和误拒率。
作者实验中的六个 Judge 在两个领域均于一至两个动作时达到最高区分度。主要 Retail 配置使用 200 条错误轨迹和 31 个干净锚点,Youden informedness 在两动作时为 0.602,八动作时降至 0.035;回放被省略的中间观察后,八动作区分度恢复至 0.490。结果支持长窗口退化主要来自尚未执行动作缺少观察,而不是信息越多越难。
方法的独特价值
该方法把“验证单元长度”从成本参数变成安全参数。只报告捕获率会把全拒绝监控器误判为优秀;成对干净轨迹使 J=捕获率-误拒率 能区分更会判断与只是更拒绝。
适用范围
实验面向固定批次、每步只审查一次的执行前监控。结论不覆盖树搜索、非独立采样、自适应攻击或执行后验证。
方法与实施流程
- 从正确计划中注入一个环境可接受但语义错误的写操作。
- 构造仅该写入不同的干净/错误双轨迹。
- 固定错误类型和位置,改变审查前缀长度。
- 六个 Judge 分别输出二元判决与概率分数。
- 同时报告捕获、误拒、informedness、AUC 和调用成本。
质量控制
语料在评审前冻结并预注册方向无关的结果分支。Retail 实现 200 条错误轨迹并复用 31 个干净锚点,AppWorld 实现 190 条错误轨迹和 200 条干净轨迹;Retail 错误按跨用户写入、错误参数和额外写入分层。所有错误都必须通过环境模式校验,避免用显然无效调用抬高检出。
局限与待验证问题
向后扩展的实验前缀与部署中的向前规划并不完全相同;研究只测试零样本监控器和有限任务。部署应在自己的动作先验和误拒代价下重新校准,不能直接采用“一步最优”作为通用规则。