Skip to content

SRE-Bench:无污染的 Agent 逆向工程能力评测 ​

摘要 ​

SRE-Bench 使用私有源码从零构建二进制,降低训练数据污染和答案记忆。基准包含 19 个程序、262 个二进制、1,572 个任务和 44 类反分析原语,用于测量 Agent 的真实逆向工程能力。

该基准提供的是受控能力证据,不等于模型已能对任意生产软件完成漏洞利用,也不应公开保存可直接攻击第三方目标的步骤。

核心特点与评估范围 ​

研究把污染控制、构建可追溯性和反分析机制放入同一基准。主要结论是不同 Agent 在结构恢复、行为理解和对抗反分析上的能力边界。

评估方法与实际过程 ​

每个程序由未公开源码生成多个二进制和任务,任务覆盖函数识别、数据流、算法语义及反分析处理。作者固定工具、时间与执行预算,并以可验证答案评分。

关键结果与风险解释 ​

1,572 个任务揭示能力具有明显的程序和反分析依赖。高分说明模型能在给定工具和预算下完成特定逆向任务,不代表具备完整入侵链。对防守方而言,它提供了评估未来自动化漏洞研究能力的更干净基线。

局限与待验证问题 ​

程序规模、架构、编译器和工具链仍有限,私有源码也降低外部复现便利。需要可信第三方复跑、更多真实软件和严格防泄漏流程。

参考链接 ​