Skip to content

ThreatForest:多 Agent 攻击树生成与 TTP 映射的覆盖—归因权衡 ​

摘要 ​

ThreatForest 把源码架构分析、威胁生成、攻击树扩展、缓解措施和 ATT&CK 映射拆给多个 Agent 分工完成。在 7 个应用域的实验中,每个应用平均生成 12 个威胁和 240 个攻击步骤,5/7 域达到完整 ATT&CK tactic 覆盖,威胁、攻击步骤和缓解质量得分约 0.63 至 0.68。

这个结果支持多 Agent 分解可以扩大威胁建模的搜索覆盖,但同时暴露一个容易被总量掩盖的失败:纯 Embedding TTP 映射的可辩护准确率只有 0.29,而同模型单次调用基线达到 0.63。瓶颈主要在映射编码器,不是生成 Agent 数量;覆盖更多节点不等于这些节点已正确归因到框架技术。

方法的独特价值 ​

ThreatForest 的独特价值在于把威胁建模流水线拆分为可独立评测的阶段(架构分析、威胁生成、攻击树扩展、缓解生成、ATT&CK 映射),使评测能够分别衡量“搜索覆盖有多广”和“归因有多准”,而不是只报告一个笼统的威胁建模质量分数。

适用范围 ​

结果基于 7 个应用域的实验,覆盖对象是源码可获取、具备典型攻击面的应用系统;结论不代表所有软件架构或所有 ATT&CK 战术类别都能获得同等覆盖率,也不代表其他威胁建模工具链使用同样的多 Agent 分工会得到相同结果。

方法与实施流程 ​

流水线按阶段拆分给不同 Agent:源码架构分析 Agent 提取组件与数据流,威胁生成 Agent 基于架构产出候选威胁,攻击树扩展 Agent 把威胁细化为攻击步骤序列,缓解措施 Agent 为每个威胁提出对应控制,ATT&CK 映射阶段将威胁/攻击步骤关联到 MITRE ATT&CK 战术与技术编号。映射阶段比较了纯 Embedding 检索式映射与同模型单次调用式映射两种实现。

质量控制 ​

评测在 7 个应用域上进行,衡量指标包括:每应用平均生成的威胁数(12)和攻击步骤数(240)、达到完整 ATT&CK tactic 覆盖的域数(5/7)、威胁质量、攻击步骤质量和缓解质量得分(约 0.63–0.68),以及 TTP 映射的可辩护准确率(纯 Embedding 映射 0.29 对比同模型单次调用基线 0.63)。质量得分和映射准确率均依赖人工或模型评分器判定,论文未说明是否有独立第三方复核评分一致性。

局限与待验证问题 ​

  • 证据等级为中等:论文提供完整流水线设计和 7 域实验,但映射准确率评分方法、应用域选择标准和评分器一致性未充分披露。
  • 纯 Embedding TTP 映射准确率低(0.29)是否是该论文特定 Embedding 模型的问题,还是所有基于向量检索的 ATT&CK 映射方法的共性瓶颈,需要更多实现的对照。
  • 覆盖率指标(tactic 覆盖域数、平均威胁/攻击步骤数)容易被误读为“建模完整性”,但论文本身显示搜索覆盖与归因正确性是两个独立维度,后续评测应继续拆开报告。
  • 结论未验证多 Agent 分工在更大规模代码库或微服务架构下是否仍保持同等质量得分。

参考链接 ​