Skip to content

AuthBench:编码 Agent 的最小权限边界推断评测 ​

摘要 ​

AuthBench 把“编码 Agent 是否理解最小权限”定义为权限边界推断:模型根据任务说明和终端环境,生成文件级读、写、执行策略。基准包含 120 个带人工复核标签和可执行效用/攻击验证器的终端任务,要求策略既覆盖完成任务必需的访问,又不额外暴露敏感路径。

作者发现前沿模型常在两种失败之间摆动:为保证成功而授予无用或敏感权限,或因过度收紧而漏掉执行链所需权限。增加推理强度不会自动达到最小权限,反而使各模型稳定落入自身的“授权吸引子”;将策略生成拆为充分性与紧致性审计后,作者报告紧致偏置模型的敏感任务成功率最高提高 15.8%,并降低所测攻击成功。范围只覆盖文件级权限,未覆盖网络、云身份、数据库或浏览器会话。

核心创新与差异 ​

ScopeGate/HCP 研究运行时是否会执行未授权动作;AuthBench 的新增问题是策略在运行前能否被模型正确推断。这两者互补:模型生成的权限建议不能替代可信执行器,但若策略本身既不充分也不紧致,运行时再严格也会在不可用与过度暴露之间两难。

威胁模型与攻击链 ​

编码 Agent 需在仓库和终端中完成合法任务,环境含不应访问的敏感文件或路径。攻击者可诱导任务链触及额外资源,或从过宽策略获得读取、写入或执行机会;基准用隔离验证器判断任务效用与攻击暴露,不使用真实凭据。

  1. 模型从任务和环境推断权限清单;
  2. 过宽策略授予与任务无关的敏感访问,或过窄策略阻断必要步骤;
  3. 验证器分别测量任务是否完成和攻击路径是否可达;
  4. 充分性—紧致性分解先覆盖执行链,再逐项审计必要性与敏感性。

实验设计与实际过程 ​

作者在 120 个现实风格终端任务上比较模型、不同推理强度与分解式方法,使用人工复核策略标签及可执行验证器。所有数字均来自论文作者实验;本站未运行 Agent 或修改任何仓库。论文的“攻击成功”是隔离基准中策略暴露的结果,不是生产入侵统计。

关键结果与实际影响 ​

  • 增加推理强度未使被测模型普遍收敛到安全授权窗口,而是强化各自的宽授权或紧授权倾向。
  • Sufficiency-Tightness Decomposition 在紧致偏置模型上最高提升 15.8% 的敏感任务成功率,并在作者条件下降低攻击成功。
  • 证据表明权限策略生成应拆分覆盖与必要性判断;它不证明模型可安全决定任何 API、网络或云权限。

防护措施与验证方法 ​

把模型生成的权限当作待审计建议,使用可信策略执行器实施默认拒绝;分开验证任务充分性、无用授权、敏感路径暴露和策略解释。扩展测试应覆盖符号链接、子进程、网络、密钥、容器挂载及策略变更后的回归,并记录策略版本和验证器版本。

局限与待验证问题 ​

AuthBench 只测文件级 read/write/execute,且研究推理强度的结论依赖暴露相应选项的模型。120 个任务和作者验证器不覆盖企业 IAM、真实用户协作或多 Agent 委派,仍需跨运行时与独立复现。

参考链接 ​