Skip to content

SIR-Bench:安全事件响应 Agent 的调查深度评测 ​

摘要 ​

SIR-Bench 试图避免仅用“是否给出正确告警结论”衡量事件响应 Agent。作者从 129 种匿名化事件模式构造 794 个测试案例,并以真实调查应发现的附加证据衡量调查深度;其 SIR Agent 在论文设置中分类处置真阳性率为 97.1%,但只覆盖了 41.9% 的真阳性案例所需的新发现。它表明结论正确可能掩盖调查过程不足。

方法的独特价值 ​

该基准将反应式事件响应与 CTF 找 flag、通用安全问答分开,并用“是否找到独立的新证据”限制只复述初始告警的高分。它提供了事件响应 Agent 的过程性验收对象。

适用范围 ​

适用于基于日志、端点和网络遥测进行分类处置和调查的安全运营 Agent。原始客户数据不在公开材料中;作者称计划发布基准、标签与工具,当前结论应按论文设置理解。

方法与实施流程 ​

  1. 从匿名化事件模式派生重放案例及带良性凭据的攻击模拟。
  2. 分别评估分类处置结论、调查中的新发现和工具调用覆盖。
  3. 以人工专家调查轨迹校准自动评分器,并提高漏掉真实事件的代价。
  4. 将未找到的关键证据作为需要人工复核或升级的条件。

质量控制 ​

作者将工具覆盖与调查深度分开:前者即使接近 100% 也不代表找到了正确证据。重复运行、专家基线和按攻击类别分解有助于解释分数,但公共工件发布状态仍需在复审时核验。

局限与待验证问题 ​

匿名化模式和脚本化重放无法完全重现生产噪声、跨租户上下文或未知攻击。论文中 Agent 的分数不代表人类分析师替代率,也不证明自动评分器对所有事件可靠。

参考链接 ​