外观
Elastic Agentic SOC 评测:工具调用可靠性与任务质量必须分开报告
摘要
Elastic 的 Agentic SOC 评测使用 21 个 Prompt、7 类能力和 500 余次完整对话,保留工具调用轨迹并采用盲化匿名评分;没有工具调用的回答最高只能得 6/10。Attack Discovery 场景约含 95 条告警和恰好 8 起入侵,迁移场景包含 52 条 Splunk 规则与 200 个宏。
结果的关键增量不是某个模型总分领先,而是排名会随研判、攻击发现和规则迁移任务翻转,因此应把“能否稳定调用正确工具”的可靠性与完成任务后的质量分开报告。该评测由厂商在自身 Agent Builder、Attack Discovery 和迁移工作流中完成,数据、Judge 与产品接口尚无独立复现,适合作为 SOC Agent 评测设计证据,不应外推为通用模型排行榜或产品安全认证。
方法的独特价值
该评测的独特价值在于强制把“工具调用可靠性”纳入计分体系(没有工具调用的回答封顶 6/10),并用盲化匿名评分避免评审者因为知道模型身份而产生偏见,从而能够暴露“模型总分接近但排名会随任务类型翻转”这一现象,而不是只报一个笼统的 SOC 能力分数。
适用范围
评测在 Elastic 自身的 Agent Builder、Attack Discovery 和规则迁移产品工作流中完成,涉及的告警、入侵和规则样本来自厂商自有数据;结果不能外推为跨厂商、跨 SOC 平台的通用模型排行榜,也不构成产品安全认证。
方法与实施流程
评测设计 21 个 Prompt,覆盖 7 类能力,产生 500 余次完整对话;每次对话保留完整工具调用轨迹供评分参考。评分采用盲化匿名方式,评审者不知道回答来自哪个模型。三类具体任务场景:Attack Discovery(约 95 条告警、恰好 8 起真实入侵,测试模型能否从告警噪声中定位真实入侵)、研判(triage)任务、以及迁移场景(52 条 Splunk 规则、200 个宏,测试模型能否正确迁移检测逻辑)。
质量控制
计分规则明确要求区分工具调用可靠性与任务完成质量:没有实际调用工具、仅凭已有知识作答的回答最高只能获得 6/10(无法获得满分),倒逼模型必须实际使用平台提供的检索/查询工具而非凭训练记忆猜测。排名对比在三类任务(研判、攻击发现、规则迁移)之间独立进行,用于观察同一模型在不同任务类型上的排名是否一致。
Elastic 后续披露的自纠正 Agentic SOC 实践把静态 benchmark 扩展到历史反馈循环:三个 Agent 读取检测规则调查指南和过去 30 天案例的关闭理由,厂商报告告警研判准确率从 60% 提升到 92%。这个增量可用时间切分的历史案例、规则级留出集和人工复核复测,但公开材料没有给出完整样本、错误分布和外部基线;同一厂商同时提供平台、Agent 和评价数据,因此 32 个百分点只能视为其内部工作流结果,不能外推到其他 SOC、规则集或真实攻击基率。
局限与待验证问题
- 证据等级为中等:评测方法设计公开且具体(21 Prompt、7 类能力、500+ 对话、盲化评分标准),但数据集、Judge 实现细节和产品接口均未开源,无法独立复现评分结果。
- 评测在厂商自有产品工作流中进行,模型与 Elastic 自身工具集成的紧密程度可能影响结果,不能反映模型在其他 SOC 平台或自建工具链中的表现。
- 8 起真实入侵的样本量较小,攻击发现任务的排名结论对样本选择可能较敏感。
- 未说明评审者数量、评审者背景一致性和评分者间一致性(inter-rater agreement)等评分质量控制细节。
参考链接
- Elastic Security Labs, Benchmarking the Agentic SOC, 2026-08-04