Skip to content

CyberFactory:可验证网络安全轨迹的规模化训练 ​

摘要 ​

截至 2026-09-02,论文全文可获取,但论文给出的 GitHub 仓库为空,Hugging Face 项目链接返回 404,公开工件尚不足以独立复现。论文描述的 CyberFactory 将漏洞实例构造、Agent 轨迹合成和模型训练接成一条流水线,覆盖漏洞触发输入生成、补丁生成和网络安全问答;它从 ARVO、OSS-Fuzz 与现实 CVE 构建可执行环境,并用“修补前触发、修补后不触发”的差分预言机验证结果。

作者报告,基于这些轨迹训练的 OpenAegis 在一小时 CyberGym 预算下达到 58.1% Pass@1,比同一 Qwen 3.5 基础模型的 29.6% 高 28.5 个百分点,并高于相同脚手架下的 GLM 5.2(43.3%)和 Kimi K2.7(51.7%)。

方法的独特价值 ​

论文的目标不是只发布模型权重,而是公开从真实漏洞证据到可验证监督的生成过程。可复用漏洞分析 Skill 指导教师模型检查源码、调用工具、验证证据并在失败后修订;训练后模型推理时不再加载该 Skill。由于论文所列代码与模型页面在本站核验时尚未提供可用工件,这一开放性主张目前只能依据论文描述,不能视为已完成的外部复现条件。

适用范围 ​

方法面向隔离、授权的开源软件漏洞任务。其能力分数不能外推为针对生产目标的攻击成功率;公开使用必须保留访问控制、环境隔离和结果审查。

方法与实施流程 ​

  1. 从公开漏洞记录定位修复提交并构造修补前/后镜像。
  2. 丢弃无法形成稳定差分预言机或过于容易的实例。
  3. 由教师 Agent 在漏洞分析 Skill 指导下生成工具交互轨迹。
  4. 仅保留通过任务特定验证器的最终输出。
  5. 用多任务轨迹监督微调 OpenAegis,并在统一脚手架和预算下评测。

安全披露与去武器化边界 ​

原研究在隔离环境中生成能触发公开漏洞的 PoC。本文不转载具体触发输入、利用命令、目标定位信息或完整工具轨迹,只保留不含漏洞细节的差分验证逻辑:DRY_RUN(pre_patch, fixture) == TRIGGERED 且 DRY_RUN(post_patch, fixture) == NOT_TRIGGERED。该伪代码属于本站对作者验证流程的去武器化概括,仅用于检查训练样本是否绑定目标漏洞;真实工件应限制在自有、开源或明确授权的隔离环境中。

质量控制 ​

教师 GLM 5.2 加载 Skill 后,Pass@1 从 43.3% 升至 46.5%,单次预算从 60 分钟降至 15 分钟。90% 上下文占用时压缩将总体 Pass@1 提高到 58.1%,上下文耗尽率降至 7.0%;完整历史策略对应 52.1% 和 18.7%。

局限与待验证问题 ​

证据来自作者训练与 CyberGym,缺少独立复现;模型训练使用 256 张 GPU,复现实物成本较高。论文所列 GitHub 仓库截至 2026-09-02 仍为空,Hugging Face 项目链接返回 404,因此无法核验训练数据、Skill、模型权重和复现命令是否与论文描述一致。公开实例还可能进入后续训练集,需维护时间切分和污染审计;差分崩溃预言机也只覆盖可执行的特定漏洞类型。

参考链接 ​