外观
ATOBench:欺骗性目标证据下的渗透测试 Agent 验证
摘要
ATOBench 不只测试 Agent 能否找到漏洞,而是让目标返回看似成功、实际错误的证据,观察 Agent 是否继续验证。作者设计三种观察契约和成对转换,共运行 450 个回合,测量恢复、停止和最终报告的支持链。
研究说明:工具返回成功文本不等于漏洞成立,安全 Agent 必须把主张绑定到可重复的目标状态变化。
方法的独特价值
基准将“目标证据会撒谎”纳入威胁模型,并把任务成功拆成探索、复核、停止和报告。它补充了只按 flag 或 Agent 自报成功评分的现有基准。
适用范围
适用于授权靶场中的漏洞验证 Agent、SOC 自动调查和修复确认。不得把该 harness 用于未授权目标。
方法与实施流程
- 为同一任务准备真实回显和欺骗回显。
- 限定 Agent 可观察的证据契约。
- 记录后续验证动作、停止条件和报告引用。
- 以目标最终状态和独立验证器判断主张是否成立。
- 比较成对任务中 Agent 是否被表面证据改变。
质量控制
评测必须隔离目标、固定镜像并保留完整工具轨迹。评分器应独立于 Agent 文本,区分“发现线索”“验证成功”和“报告有证据”。
局限与待验证问题
450 回合来自受控任务,不能代表所有真实网络。目标欺骗模式、工具集合和模型版本会影响结果;仍需外部靶场复现。