外观
Cyber Defense Benchmark:面向原始遥测的 Agent 威胁狩猎评测
摘要
Cyber Defense Benchmark 把防御性 Agent 的任务从“回答一条告警”改为在没有预置假设的 Windows 原始事件库中主动检索、定位并标记恶意事件。它基于 OTRF Security-Datasets 的 106 个真实攻击过程构造 26 条演练链;每次任务含 7.5 万至 13.5 万条记录,Agent 只能通过 SQL 分步取证并提交时间戳。
作者对五个前沿模型进行 859 次运行,最佳模型的恶意事件覆盖率仅为 3.8%,没有模型在每个 ATT&CK 战术上达到作者定义的 50% 召回通过线。该结果支持“安全知识问答”不能替代开放式证据发现;它不等同于对任意 SOC 产品或模型版本的生产能力认证。
核心创新与差异
原研究贡献是把真实攻击遥测、可交互的 SQL 检索限制、去标识化时间/实体变换和事件级评分组合为一项可复现实验。评分同时记录 Agent 实际查询到的线索与最终提交的告警,因而能区分搜索不可见、已见未归因和未提交三类失败。
本站分析认为其增量在于评估“由原始证据形成假设”的防御能力,而非安全知识、固定告警研判或攻击型 CTF 成功率。它与本站已有的安全 Agent 评测共同说明:工具调用本身不代表有效研判,必须对可观察性和最终处置分别计量。
评测模型与实际过程
作者将每个 episode 放入内存 SQLite 数据库。Agent 每回合可执行 SQL 并最多查看十条结果(同时得知总行数),或提交被认为恶意的时间戳;正常上限为 50 次查询,并设 75 次硬上限。数据由公开原始记录经时间平移、实体混淆和攻击链合成生成,避免模型仅记忆固定 IP、账号或时间字符串。
任务覆盖 86 个 ATT&CK 子技术、12 个战术和 106 个攻击过程。评测报告 Coverage Score、按战术的召回,以及“曾出现在查询结果中”的可观察性上限。作者公开了演练种子、标签、生成/抽取代码、评测 Harness 与 859 条完整轨迹;本站未运行这些实验。
关键结果与实际影响
- 26 条演练链中,五个被测模型均未在所有战术达到 50% 召回;最佳 Claude Opus 4.6 的平均正确标记覆盖率为 3.8%。
- 即使正确事件曾进入查询结果,Agent 仍常未将其归因为恶意或未最终提交,表明瓶颈不只在 SQL 语法或检索。
- 单次 rollout、十行结果截断和 26 条链使结果具可重复的基线价值,但不足以估计真实 SOC 中告警质量、分析师协作和长期上下文的效果。
对部署方而言,开放式狩猎功能应先以候选线索、证据链接和人工复核为输出,而不是直接触发隔离、封禁或账户处置。验证时需保留查询轨迹、未见/已见未判定的失败分解,并测试数据格式和攻击链变化。
局限与待验证问题
该评测由作者以单次或有限次数的 API 调用完成,模型输出存在随机性;模拟链虽然源自真实过程,仍不能覆盖企业日志保留策略、误报背景和实时压力。公开包中部分生成组件属作者专有实现,预构造的演练 JSON 仍可复跑,但独立复现与跨厂商 SOC 验证尚缺。