外观
Fully Automated End-to-End Adversary Emulation from MITRE ATT&CK Based Cyber Threat Intelligence Using LLMs
摘要
本文研究如何让 LLM 从 MITRE ATT&CK 对齐的网络威胁情报(Cyber Threat Intelligence, CTI)生成 Caldera Playbook,并在授权的预置 Windows 环境中执行和修复失败步骤。系统将 Ability 生成、执行和按失败类型恢复放入同一流程。
在 11 份 KISA CTI、4 个商业模型、每个报告和模型 5 次运行的作者实验中,Claude Sonnet 4.5 的平均 Playbook 包含 27.3 个 Ability,执行成功率从初始 69.63% 提高到恢复后的 84.22%,CTI F1 为 60.50%。这些结果只描述预置拓扑和实验预算下的攻击仿真能力,不代表对真实生产系统的可用攻击能力。
核心创新与差异
原研究贡献
研究将 CTI 到 ATT&CK Ability、Caldera Playbook 生成、实际执行和失败恢复串成闭环。系统针对语法、环境、依赖和超时错误进行分类,最多重试 3 次,并根据失败类型修订失败 Ability。论文还在 AURORA 数据集的 10 份 CTI 上比较最终执行结果。
本站分析
安全意义不只在文本到技术编号的映射,而在生成的步骤会进入执行环境。信任边界从 CTI 文本扩展到 Playbook、执行器和 Windows 主机;首要控制是实验环境的授权、执行门禁和失败恢复是否能限制自动攻击链。恢复机制提高的是受控仿真完成度,不能被解释为绕过生产授权或证明 Agent 可以自主完成真实入侵。
威胁模型与攻击链
研究在授权实验环境中模拟由 CTI 驱动的攻击者行为。输入是描述攻击活动的 CTI,目标是生成与 ATT&CK 对齐的可执行攻击步骤;执行目标是预先配置的 3 台 Windows 主机。论文没有把第三方生产主机作为测试对象。
攻击链为:CTI 文本提取 ATT&CK 技术和参数,LLM 生成 Caldera Ability 与 Playbook,Caldera 在主机上执行;若步骤因语法、环境、依赖或超时失败,系统识别失败类型、修订 Ability 并重新执行,最多重试 3 次。最先失效的控制是自动生成内容进入执行环境前后的授权和恢复门禁。
实验设计与实际过程
这是作者实验,不是本站复现。实验使用 11 份 KISA CTI、Claude Sonnet 4.5、GPT-4o、Gemini 2.5 Pro 和 Grok 4 Fast;每份报告与每个模型运行 5 次,在预置的 3 台 Windows 主机上执行,每份报告生成一条 Playbook。
评估指标包括每个 Playbook 的 Ability 数量、Ability 执行成功率以及 CTI Precision、Recall、F1。系统同时记录恢复前后结果和失败类型。与 AURORA 的对照使用其数据集中的 10 份 CTI;恢复前后比较和失败类型比较能显示恢复带来的增益,但不是对每个组件的完整因果消融。
关键结果与实际影响
- Claude Sonnet 4.5 平均每个 Playbook 生成 27.3 个 Ability;其初始执行成功率为 69.63%,修订后的最终成功率为 84.22%,CTI F1 为 60.50%。
- 恢复机制在所有评估模型上使执行成功率提高 14.59--17.23 个百分点。
- 在 AURORA 数据集的 10 份 CTI 上,本文系统最终执行成功率为 65.17%,AURORA 为 60.72%;CTI F1 分别为 30.57% 和 26.07%。AURORA 的初始成功率为 32.90%,因此差异主要来自恢复过程,不能只归因于 Playbook 初始生成。
实际影响是,CTI 驱动的安全 Agent 评测必须同时测量生成质量、执行成功率和失败恢复,而不能把 ATT&CK 映射准确当作攻击链可执行性的替代指标。执行成功率仍受主机拓扑、依赖和权限配置约束。
防护措施与验证方法
实验运营方应将 CTI 解析、Playbook 生成、主机执行和恢复分段记录,在进入执行器前设置授权实验范围和人工或策略门禁。恢复逻辑应限制失败类型、重试次数和可访问主机,保留原始步骤、修订步骤、执行日志及失败原因,便于审计和回滚。
验证时应分别报告初始和最终成功率,并按语法、环境、依赖、超时等失败类型统计恢复收益;还应使用不同拓扑和未参与生成的数据检验迁移性。上述是针对论文暴露的自动执行风险提出的验证方法,论文本身只在单一预置 Windows 拓扑上完成测试。
局限与待验证问题
- 实验只有 11 份长 CTI,且每份只生成一条 Playbook,不能代表不同来源、长度和质量的威胁情报。
- 只有一个预置 Windows 拓扑,环境构建仍由人工完成;结果不能外推到 Linux、云环境或生产网络。
- 恢复前后比较不是完整的组件消融,AURORA 对照的增益也主要来自恢复过程。
- 论文未提供配套代码,也没有独立复现或独立伦理说明。后续需要验证更大规模 CTI、跨平台环境、权限最小化和自适应失败条件下的恢复安全性。