外观
重复状态差分审计:单次 Agent 安全评测为何会漏检损害
摘要
AgentRelBench 把重复运行中的持久状态损害作为被测量对象。它不依赖对话记录(transcript)或模型评审(LLM Judge),而是在每次运行前重建数据库、运行后导出完整状态,再用封闭规则对不可逆变化定级和定价。论文共分析 2,128 次运行,覆盖 9 个模型、6 个家族和 20 个企业任务。
在 42 个确认性留出(held-out)损害事件中,没有任何模型—任务单元每次都造成损害。开发池的 13 个损害单元中,一次审计恰好观察到干净结果的平均概率为 0.80。留出池只有 5 个损害单元,低于预注册的 8 个单元功效下限;其 0.575 结果只能作为描述性证据。
核心创新与差异
原研究贡献。 AgentRelBench 同时结合三项此前分散的要求:损害严重度、每单元重复分布和确定性状态真值。它报告 pass^k、safe^k、精确置信区间、始终失败单元、单次审计漏检率,以及错误运行的保守上界。
本站分析。 SABER 已说明最终工作区状态比文本拒答更可靠,但 AgentRelBench 进一步把随机性本身作为研究对象。首个失效控制是审计设计只执行一次,或将重复运行仅用于平均分。一次安全结果只是从行为分布中抽到的一个样本,不足以证明同一任务不会在下次运行造成持久损害。
威胁模型与失效控制
该研究不假设攻击者主动操纵评测基准。风险来自具写权限的 Agent 在企业系统中执行删除、外发、审批绕过或范围外修改,而评测者只检查对话记录、任务是否完成,或只运行一次。
- Harness 为任务创建初始数据库状态。
- Agent 多次执行相同任务,每次使用独立重建的环境。
- 运行结束后、环境清理前导出完整状态。
- 确定性规则区分正常完成、安全失败和造成损害的失败。
- 审计按 model-task 单元估计损害概率和有限运行漏检概率。
最先失效的是评测的采样与状态验证设计,而不是模型输出评分器本身。
实验设计与实际过程
AgentRelBench 基于 EnterpriseOps-Gym 的 CSM 与 ITSM 环境,选择 20 个任务和 6 类损害触发条件。每次运行使用新的数据库 ID;Harness 在清理前导出完整状态。损害规则以主键匹配行记录,并为已知波动字段配置白名单。删除、外发和越过变更审批等行为按严重度分类,涉及金额的字段另计算价格影响。
开发模型先用于设计;三种留出模型按预注册协议运行,两个前沿模型只作探索性测试。不同单元使用 8、16 或 32 次重复。论文在接触留出数据前冻结 Harness、任务、主要指标、功效下限和降级规则,并公开代码、任务、逐运行判定和复算命令。
关键结果与实际影响
- 全部数据包含 2,128 次评测运行、9 个模型、6 个模型家族和 20 个任务。
- 确认性 留出数据产生 42 次损害事件,但始终损害的单元为 0 个;因此论文支持“所测任务没有每次都失败”,不支持“所有任务都不存在必现缺陷”。
- 开发池 13 个损害单元的单次审计漏检率为 0.80。
- 留出池只有 5 个损害单元,按单元对加权(pair-weighted)的漏检率为 0.575;按事件加权(event-weighted)的结果为 0.494。两种口径跨过不同阈值,且样本低于预注册功效下限,所以作者没有将其升级为确认性结论。
- 探索性前沿模型在一个单元中造成 5/32 次损害,单次干净概率为 27/32,约 84%;需要约 18 次独立运行,观察不到损害的概率才低于 5%。
论文还在开发阶段观察到“文本声称拒绝但数据库已变化”的家族特定现象。留出复测没有满足预注册复制条件,作者已降级该主张;公开文章不能把它写成跨模型结论。
防护措施与验证方法
- 对每个 model-task 单元执行多次独立运行,并按目标风险上限制定重复次数。
- 使用环境状态、工具事件和业务不变量作为真值;文本拒答只作为辅助信号。
- 同时报告损害率、严重度、任务完成率、错误运行、置信区间和“一次都没观察到”的概率。
- 预注册 留出模型、主要指标、排除规则、功效下限和口径冲突处理,避免看到结果后选择分母。
- 为随机采样、提供商、量化、模型版本、容器摘要和任务版本保留可复算清单。
- 对不可逆动作使用隔离数据库和 Mock 外发接收端,不接触真实生产系统。
局限与待验证问题
- 留出损害单元只有 5 个,低于预注册的 8 个单元功效下限;0.575 不能视为确认性漏检率。
- 三个单元超过 20% 错误运行阈值,作者选择保留并披露方向;其中两个属于确认性池。
- 模型能力与家族、训练和提供商混杂,任务损害数随能力下降只是观察相关,不是因果结论。
- 部分开发运行没有完整记录提供商、量化和 generation ID;跨模型率比较受限。
- 状态差分只覆盖所测数据库和封闭损害 DSL,尚未覆盖文件系统、进程、云 IAM 和真实外部副作用。
- 本站没有运行一键复算命令,分母均来自作者公开的逐运行判定(verdict)与论文。