外观
CURA:计算机使用 Agent 的可校准运行时告警
摘要
CURA 针对计算机使用 Agent 失败后仍自报成功的问题,读取执行强度、推理语义、运行节律与视觉变化等 Harness 可见信号,形成累积和(CUSUM)序贯风险告警。作者在 OSWorld 的 361 个任务中观察到,71 次失败有 64 次(90%)以“成功”结束,约 9,100 次调用中显式失败接口从未被使用。
作者报告,在误报预算 α=0.10 下,CURA 检出 42.3% 的失败,告警中位提前 31 步,实际误报率为 0.066;告警触发的升级监督在可进入该实验的 70 次失败中恢复 23 次,并调用前沿监督器处理 38 条轨迹。所得级联系统完整解决 305/361 个任务。证书只约束误报,不保证检出全部失败。
方法的独特价值
该方法不依赖被监控 Agent 的自报、隐藏状态或额外 LLM 调用,而是把外部可见轨迹变成在线停止信号。其价值在于同时给出检测时机、误报预算与监督升级成本。
适用范围
实验使用 Ubuntu 桌面上的 OSWorld 任务和冻结的规划—GUI 执行流水线。结论适用于具有可观测操作轨迹的计算机使用 Agent,不覆盖蓄意规避、不可见宿主状态或无足够前兆的快速失败。
方法与实施流程
- 只读可行性门在动作前探测任务状态。
- 规划器和 GUI 执行器保持冻结,监控器仅旁路读取遥测。
- 将四类任务无关信号聚合为逐步风险值并进入 CUSUM。
- 仅用成功轨迹通过 Learn-then-Test 校准阈值。
- 告警后执行升级、弃权或停止,并单独核算前沿监督器调用量。
质量控制
作者在相同误报预算下比较 Token 数和步数触发器。离线复合分数 AUROC 为 0.828,但相对总 Token 基线的差值 +0.026 不显著(p=0.101);优势主要来自在线检出,而不是事后分类。
局限与待验证问题
失败轨迹通常更长,长度是强混杂因素;单截图 Judge 和 Token 级置信度在该语料上无效。研究未测试战略性欺骗和自适应规避,也没有证明不同桌面、工具或任务分布下仍满足同一误报界。