外观
CTI-REALM:从威胁情报到检测规则的端到端生成评测
摘要
CTI-REALM 从 37 份公开威胁情报(Cyber Threat Intelligence, CTI)报告构造 Linux、AKS 和 Azure 云环境,要求 Agent 选择报告、映射 MITRE ATT&CK、识别数据源、迭代 KQL,并生成 Sigma 与 KQL 检测规则。最新公开结果使用 50 个任务:Claude 系列总分为 0.624 至 0.685;不同平台平均表现从 Linux 的 0.585、AKS 的 0.517 降至 Cloud 的 0.282。移除 CTI 专用工具使所有模型最多下降 0.150 分,人工编写的流程提示可弥补小模型与大模型约三分之一的差距。
该基准的增量在于对中间步骤和最终规则分别用 Ground Truth 计分,而不是只测安全知识问答。它已经开源并进入 Inspect Evals,但模型比较结果来自 Microsoft 团队,尚无独立复现;37 份报告和 50 个任务也不能代表生产遥测、组织 Schema 与误报成本。
方法的独特价值
CTI-REALM 的独特价值在于把"检测规则生成"这一端到端任务拆成可分别计分的中间步骤(报告选择、ATT&CK 映射、数据源识别、KQL 迭代)和最终产出(Sigma/KQL 规则),使评测能够定位 Agent 在流水线的哪个环节表现最弱,而不是只给出一个笼统的"能否生成能用的检测规则"分数。
适用范围
结果覆盖 37 份公开 CTI 报告在 Linux、AKS、Azure 三类环境下生成的检测规则任务,不代表生产环境的真实遥测数据规模、组织特有的日志 Schema 或实际部署后的误报/漏报成本。
方法与实施流程
流程要求 Agent 依次完成:从候选报告中选择相关报告、将报告内容映射到 MITRE ATT&CK 战术技术、识别检测所需的数据源、迭代编写和验证 KQL 查询,最终生成 Sigma 与 KQL 格式的检测规则。评测覆盖 Linux、AKS(Azure Kubernetes Service)和 Azure 云平台三类环境,每个中间步骤和最终规则均对照人工构建的 Ground Truth 计分。
质量控制
评测使用 50 个任务的最新公开结果集,比较多个 Claude 系列模型(总分 0.624–0.685)。消融实验测试移除 CTI 专用工具(报告检索、ATT&CK 映射辅助等)后的表现下降(最多 0.150 分),以及人工编写的流程提示(prompt scaffolding)能否弥补小模型与大模型之间的能力差距(约弥补三分之一)。基准已开源并进入 Inspect Evals 评测框架。
局限与待验证问题
- 证据等级为中等:基准设计和评分方法公开、已进入 Inspect Evals 便于第三方使用,但当前公开的模型比较结果来自 Microsoft 团队自身实验,尚无独立复现验证。
- 不同云平台间的显著能力落差(Linux 0.585 vs. Cloud 0.282)原因未充分拆解——是训练数据分布差异、平台特定 API 复杂度,还是评分标准对不同平台的宽严不一致,需要进一步分析。
- 37 份公开 CTI 报告和 50 个任务的样本规模较小,且报告均为公开可得材料,不能代表企业内部处理的机密/定制威胁情报的复杂度。
- 未验证生成的检测规则在真实生产环境部署后的实际误报率和运维负担,基准计分的是与 Ground Truth 的匹配程度而非部署效果。
参考链接
- Microsoft, CTI-REALM: A new benchmark for end-to-end detection rule generation with AI agents, 2026-03-20
- CTI-REALM paper, 2026-03-13