外观
CTF Agent 成功轨迹的来源证明审计
摘要
CTF-ABACUS 不把提交正确 Flag 直接视为完成漏洞利用,而是重建执行轨迹,定位 Flag 首次出现的位置并判断前序动作是否证明了预期攻击路径。作者审计六个模型在 240 道题、四个 CTF 基准上的 1,435 次尝试,以两个不同模型家族的独立 Judge 分别重建轨迹,生成 2,870 份求解档案。
作者报告,在 1,056 次恢复到 Flag 的尝试中,跨基准只有 62%–87% 能由轨迹证明为真实漏洞利用;按论文图示汇总,约 73% 为真实漏洞利用、14% 为未证明利用、12% 的 Flag 仅在 Agent 推理文本中出现、1% 来自外部查找。因此 Pass@k 只能证明答案匹配,不能单独证明攻击能力。
方法的独特价值
该方法把“结果正确”与“过程提供能力证据”分开,并将动作映射到渗透测试阶段和题型相关技术。聚合后的挑战签名还能显示某道题是否稳定测到预定能力,还是容易被记忆、泄漏或捷径绕过。
适用范围
适用于保留命令、工具调用、观察和提交记录的授权 CTF 环境。它不提供针对真实系统的利用步骤,也不能评价未记录的外部操作。
方法与实施流程
- 将每次执行拆为侦察、分析、利用、验证等阶段。
- 标记 Flag 首次进入轨迹的位置及其可见来源。
- 判断此前动作是否实际演示目标漏洞利用。
- 将结果分为真实利用、未证明利用、仅在推理文本中出现和外部查找。
- 用两个 Judge 独立生成档案,并按模型、基准和题型汇总。
质量控制
研究以逐次轨迹而非总分作为审计单元,并保留“正确 Flag 但证据不足”的独立类别,避免强行归因为欺骗或记忆。两个 Judge 分别使用 Claude Opus 4.8 与 GPT-5.6 Sol;安全研究人员另对 92 个样本进行盲化复核,对真实利用和未证明利用的判定一致率分别为 93.5% 与 86.7%。跨 Judge 结果和挑战级签名用于识别裁决不稳定。
局限与待验证问题
轨迹缺失、工具输出截断和 Judge 误判都会影响归因;“未证明”不等于确定没有利用。比例受所选四个 CTF 基准、六个模型和日志可见性约束,不能外推到开放网络攻击。