外观
漏洞挖掘LLM/Agent复现与审计
摘要
一项预注册研究审计了 LLM/Agent 驱动的漏洞验证论文及其复现材料。104 篇共识语料中有 59 篇提供可访问的代码或运行材料;18 篇执行样本只有 10 篇能在零修改环境完成声明流程,环境兼容修复后为 11 篇。对一个 102 案例锚点基准的检查还发现,58 个脚本内部的 CVE 标识与目录声明不一致。
更重要的结果来自对判定规则的反事实检查:30 个能产生信号的案例中,20 个在修补版本上仍产生同样信号;19 个配对正常输入中有 7 个仍触发。作者计算的判定规则灵敏度为 60%、特异度为 45%。这说明“脚本运行成功并出现崩溃、状态码或标记”不能单独证明特定 CVE 已复现,必须同时验证漏洞语义、正常输入和修补版本。
核心创新与差异
既有安全 Agent 基准通常把环境启动、脚本退出码或测试框架标记当作成功。该研究把证据拆为可访问、可运行、产生信号和语义确认四层,并提出 R0/R1 修复阶梯、G1–G3 证据条件以及正常输入和修补版本双反事实。
本站分析认为,首个失效控制是判定程序没有证明观测信号由目标漏洞而非通用崩溃、脚本设计或环境差异造成。这与 Terminal Wrench 的可劫持任务验证器相邻,但本研究直接检验 CVE 复现材料的因果特异性。
威胁模型与攻击链
本研究不是对生产目标的攻击。被审计对象是论文仓库、PoC、漏洞环境和判定脚本;风险来自研究或评测流程把非特异信号误报为漏洞复现。
- 复现材料声明目标 CVE,并在“漏洞版本”上执行 PoC。
- 测试框架观察崩溃、文本标记、退出码或状态变化并判为成功。
- 若没有正常输入和修补版本,无法排除信号与输入或版本无关。
- 错误 Oracle 进入基准、训练数据或论文统计,使 Agent 能力和修复有效性被高估。
复现材料与安全验证方法
安全复现只应在自有、隔离、已授权环境中进行。对每个案例固定提交摘要和依赖,准备漏洞版本、官方修补版本与不触发漏洞的正常输入;先运行 R0,不修改攻击、Oracle 或后置条件;仅允许在 R1 修复环境兼容问题。不得把真实公网服务、生产凭据或第三方资产作为验证对象。
建议最小证据记录为:G1 候选信号、G2 CVE 特定后置条件、G3a 正常输入不触发、G3b 修补版本不触发。只有四项同时满足时,才把结果表述为严格语义确认。
实验设计与实际过程
作者以双人筛选形成 2023–2026 年 104 篇论文的共识语料,冻结仓库提交和预注册协议。论文级执行样本为 18 篇;案例级检查覆盖锚点基准全部 102 个案例,并对其中 30 个信号案例执行修补版本反事实、对 19 个案例执行配对正常输入。环境兼容修改与攻击/Oracle 语义修改被明确分开。
关键结果与实际影响
- 可访问的代码或运行材料:59/104(56.7%)。
- R0 完成声明流程:10/18(55.6%);R1 后:11/18(61.1%)。
- 脚本内部 CVE 与目录声明不一致:58/102(56.9%)。
- 修补版本仍触发:20/30;正常输入仍触发:7/19。
- 判定规则灵敏度 60%,特异度 45%。
这些结果会直接影响安全 Agent 排行、自动 PoC 生成和补丁验证:如果评分器只要求产生信号,Agent 可能得到高分而没有证明目标漏洞或修复差异。
两项后续工作从真实案例标注和受控缺陷生成两端补强了反事实审计。VEX-Bench收集 Python、Java 与 Go 生态中 75 个由安全专家标注的真实供应链漏洞案例,把“组件含漏洞”与“在给定依赖和调用路径中可利用”分开;LLM 自动注入 Solidity 漏洞从 OpenSCV 的 49 类弱点出发生成近 1,000 个 SmartBugs 变体,经去重和验证后仅保留 32 个、覆盖 25 类弱点,存活率为 16.58%。前者要求 Oracle 证明部署上下文中的可达性和影响,后者说明生成器产出的候选绝大多数不能直接充当真值。因而漏洞评测应把版本、调用路径、漏洞特定后置条件、去重和验证存活率共同纳入,并分别使用无漏洞版本、正常输入与已知可利用案例校准;两项结果都不能直接外推为其他语言或生产依赖的漏洞率。
防护措施与验证方法
- 把漏洞特定后置条件、正常输入和修补版本设为强制门禁,而非可选人工复核。
- 分开报告复现材料可访问率、运行率、信号率和严格语义确认率。
- 判定代码与攻击生成器独立维护;记录版本、提交、环境差异和每次允许的修复。
- 对基准目录、脚本常量、镜像标签和声明 CVE 做机器校验,发现不一致即阻断统计。
- 发布样本级混淆矩阵与失败原因,避免只报告聚合成功率。
局限与待验证问题
论文级执行只有 18 篇,案例级反事实主要来自一个 102 案例锚点基准;30 个修补反事实和 19 个正常对照也不是全部案例。作者把结果定位为预注册但仍具探索性的复现研究,没有证明相同比例适用于全部漏洞类别或 Agent 基准。后续需要独立团队对更多语言、漏洞语义和真实修复评测重复该协议。