Skip to content

Trail of Bits 安全 Agent 能力外部实证:Buttercup 竞赛结果与内部落地报告 ​

摘要 ​

Trail of Bits 的 Buttercup 系统在 DARPA AIxCC 决赛中提供了一组比产品宣传更具体、但仍需限定场景的安全 Agent 能力证据:决赛包含 23 个开源仓库的 48 项 challenge,Buttercup 报告发现 28 个漏洞、成功提交 19 个补丁,PoV 覆盖 20 类 CWE,整体提交准确率超过 90%,最终获得第二名。系统结合 libFuzzer/Jazzer、LLM 生成测试、tree-sitter/代码查询和多 Agent 补丁分工。

Trail of Bits 2026 年的内部落地报告提供了另一类组织样本:其内部和公开仓库合计 94 个 plugin、201 个 skill、84 个 specialized agent;在"代码库和范围适合的特定客户"上,自述每周发现量从约 15 增至 200,约 20% 最终报告漏洞最初以某种形式由 AI 发现,且每一项都由审计员验证。

核心特点与评估范围 ​

两份材料的评估对象不同但互补:Buttercup 是竞赛条件下的自动化漏洞发现与修复能力(无人工复核的端到端评测),内部落地报告是生产条件下“AI 发现 + 人工验证”混合工作流的组织级效能样本。评估范围均限于 Trail of Bits 自身系统与客户群体,不是跨厂商比较。

评估方法与实际过程 ​

Buttercup 的评测方法是 DARPA AIxCC 决赛的官方计分:23 个开源仓库、48 项 challenge,按发现漏洞数、成功提交补丁数、PoV 覆盖的 CWE 类别和提交准确率计分排名。系统架构结合 libFuzzer/Jazzer 模糊测试、LLM 生成测试用例、tree-sitter/代码查询定位,以及多 Agent 分工完成补丁生成。

内部落地报告的方法是组织自述的运营数据:统计 94 个 plugin、201 个 skill、84 个 specialized agent 的规模,以及“代码库和范围适合的特定客户”这一子集上的每周发现量趋势和 AI 首次发现占比;原文说明所有 AI 报告的漏洞均经过审计员人工验证后才计入“最终报告”。

关键结果与风险解释 ​

  • Buttercup(AIxCC 决赛):发现 28 个漏洞、成功提交 19 个补丁,PoV 覆盖 20 类 CWE,整体提交准确率超过 90%,最终获得第二名。这里的“90%+”是特定竞赛计分与提交结果,不能写成对任意代码库稳定达到 90% 漏洞检出率;公开页面也说明当时完整竞赛 telemetry 尚未发布。
  • 内部落地报告:合计 94 个 plugin、201 个 skill、84 个 specialized agent;在适配客户子集上,自述每周发现量从约 15 增至 200,约 20% 最终报告漏洞最初以某种形式由 AI 发现。原文明确每一项都由审计员验证,因此这些数字支持“专业技能封装 + 并行 Agent + 人工验证”工作流有效,不支持无人复核的全自动审计结论。
  • 该组织公开的控制包括统一工具链和 AI Handbook、受控插件市场、buddy review、devcontainer/macOS/Dropkit 沙箱、MDM 强化默认值和 package cooldown。原文仍把 client code prompt injection、私有推理和服务器端统一策略执行列为未解决问题。

这两份材料都是单一安全咨询公司的自我披露样本,适合用于构造待验证假设,不构成跨组织生产率基准或独立安全审计结论。

局限与待验证问题 ​

  • Buttercup 的 90%+ 提交准确率是决赛计分口径下的结果,完整竞赛 telemetry 未公开,无法独立复现或验证泛化到其他代码库的表现。
  • 内部落地报告的"每周发现量"和"20% AI 首次发现"均为组织自述数据,缺少与非 AI 基线的对照实验,也没有说明该子集客户在全部客户中的占比或选择标准。
  • 两份材料均来自 Trail of Bits 自身,不构成独立第三方验证;结论不能外推为其他安全咨询机构或内部安全团队采用同类工作流会获得相同效果。

参考链接 ​