外观
安全 Benchmark、指标与评测完整性研究综述
摘要
安全评测不是“跑一组 Prompt 算成功率”。结果同时受样本分布、模型版本、系统提示、采样、重复次数、攻击预算和评分器影响。LLM-as-Judge 可扩展评分,但也会受位置偏差、提示词注入、风格和自身安全策略影响,因此必须校准并保留人工复核路径。
分类介绍
评测 Harness、指标和 Judge 被操纵归本类;测试集泄露和训练污染归 A2.6;具体 Payload 语料与自动化工具归 C2。研究应预注册主要指标和排除规则,避免看到结果后选择最有利口径。
评估方法与实际过程
- 同时报告攻击成功、任务效用、误报、查询预算和置信区间。
- 对随机模型执行多次重复并保留原始样本级结果。
- 使用独立人工标注集校准 Judge,测量一致性、偏差和注入鲁棒性。
- 固定模型快照、Prompt、参数、工具和 Harness 版本,公开可复现配置。
局限与待验证问题
- 不同风险类别能否共享一个 ASR 定义,还是需要影响加权指标?
- Judge 被被评输出直接注入时,怎样保证评分控制面隔离?
- 动态模型 API 的回归和复现应使用哪些统计设计?
历史研究成果
该分类下的独立研究分别检验检索过程、验证器、漏洞判定规则、评分风格、重复采样和历史轨迹审计是否让分数失真。Search-Time Contamination提出 STC 并区分元数据、题干与显式答案三类污染;Terminal Wrench从五个终端 Agent 基准确认可用任务特定方法满足的验证器;漏洞挖掘 LLM/Agent 复现与审计通过正常输入和修补版本发现大量信号缺乏 CVE 特异性;Meerkat以聚类和性质引导搜索,在大量轨迹中定位需人工确认的奖励投机与其他违规;重复状态差分审计则把每个 model-task 单元的损害概率分布作为测量对象,在 2,128 次运行中以确定性数据库差分替代 transcript Judge,开发池 13 个损害单元的一次审计漏检率为 0.80。ActBench 用 600 个案例、213 个场景、15 类行为和 48 个 API 评测 15 个模型与 6 种 Agent,24,000 条轨迹中的 ASR 跨系统从 10.1% 到 94.4%;Rhetoric Is a Reward Hack 对 120 篇 ICLR 投稿生成 4,200 份内容保持的修辞改写,发现证据措辞和新颖性表述能系统影响五种 LLM Reviewer。共同结论是,模型输出高分前必须同时验证检索语料、执行状态、语义后置条件、表达风格、重复分布和脚手架/历史轨迹:Web 可泄露答案,容器状态、通用崩溃、修辞、上下文或一次偶然干净运行都可能产生错误安全结论。各数字只适用于作者选择的 benchmark、版本、重复次数和审计配置。
新增的两项研究分别补强补丁判定与证据留存。PatchBench在 300 个 SEC-bench 任务上发现 Agent 补丁平均有 25% 与历史开发者补丁高度相似,并构造含 213 个任务、16 类 CWE、32 个项目的新评测;11 个 Agent 的单 PoC 解决率平均虚高 1.83 倍,说明崩溃消失必须与多 PoC 安全验证、良性输入行为和项目测试共同判定。ClaimReceipt则区分证据是否足以复算主张与记录是否覆盖承诺全集:其验证器在 1,392 条历史记录上复现 5/5 个人工结论并精确回放全部记录,前瞻实验隐藏 1/30 份终态回执时返回 INCONCLUSIVE_COVERAGE。两者共同说明,可靠分数既需要针对目标构念的后置条件,也需要事前承诺的样本全集;代码相似度只能提示记忆,签名与哈希也只能保护已留存内容,不能各自替代语义有效性和覆盖证明。
Explanation Multiplicity把同一要求扩展到电路级可解释性:预注册规格空间实际运行 1,320 个发现单元和 15,840 个分析规格,阈值排除后 7,561 个规格产生 3,218 个不同电路与 9 类声明,说明“解释证据”会随合理分析选择翻转。评测应预声明规格空间,并报告 modal share、翻转率与排除率;该研究只覆盖单模型单任务,且公开仓库缺少逐单元结果,不能据此否定全部机械可解释性方法。
本轮新增六项研究补足不同层面的判据审计:可解释性证据多重性审计检验同一行为的多种内部解释,命令传输与解析边界 QuoteBench区分模型意图和 shell 解析结果,Jagged Judges测量裁决器跨等价表述的认知稳定性,嵌入相似度安全门有效性审计用含义翻转反例检验余弦阈值,RAG 反事实证据干预审计通过增删证据测量失败响应,基准指纹与优化选择压力失效则用留出配置识别对公开评测实例的过拟合。
本轮新增三项工作把“分数代表什么”推进到轨迹来源、构念变化和多模态证据。CTF Agent 成功轨迹来源审计审计 1,435 次尝试,并在其中 1,056 次恢复到 Flag 的尝试中区分真实利用、未证明利用、仅在推理文本中出现和外部查找,显示跨基准只有 62%–87% 可由轨迹证明为真实利用;LLM 评审器构念有效性同时测量对无关编辑的不变性与对构念改变的敏感性,发现匹配高不变性时敏感性仍明显偏低;EviSafe以自然响应、证据报告和反事实响应三探针识别“回答看似安全但依据错误”。共同结论是:最终答案、稳定判决和拒答率都只是代理指标,必须用来源证明、正反向构念编辑或证据干预确认它们确实测到目标能力。
基准自身的缩减、污染和代理特征会直接改变结论。负责任 AI 评测压力测试以完整 BF16 基准为对照,同时比较量化或子集缩减后的准确率、偏差严重度与流行度、推理质量、子群行为、成员稳定性、运行时间和 GPU 能耗,说明保留聚合准确率并不够。婴儿哭声受控比较发现高准确率可来自切分或增强泄漏;整数序列记忆缺口在 20,000 条 OEIS 序列中发现,能在某个前缀拟合递推式的序列有 89.98% 无法在全长保持,说明任务主要测到记忆而非归纳。弱监督暴力检测又发现标题卡、水印等事件前来源伪迹可分离标签。知识编辑范围分类负结果指出现有 benchmark 根本不能测量编辑是否应扩展到某个范围,What FID Hides甚至让不可辨认图像取得 24.7 的 FID,优于留出真实图像的 58.6。上述结果均是特定数据和实现上的作者实验,不能据此否定全部量化、子集或指标;它们要求公开切分、留出条件与构念对照。
评审器的主要风险是把“看见了什么”误当成“验证了什么”。临床记录遗漏盲区证明 LLM Judge 更容易确认出现的事实而漏掉缺失信息,并用事实清单恢复检测;XQDT把数据—文本对齐拆成遗漏、额外和错误单元;ShadowBench在 178 个 Lean 4 问题上以双向影子蕴涵检查自动形式化语义;逐步数学验证稳健性则发现等价扰动会触发高误拒。有界评分双重差分审计表明删失量表可制造偏差效应,功能保持重参数化研究说明部分表示指标不是模型固有属性,顺序一致评分器发现五个 nDCG@10 相差不超过 0.010 的评分器,其阈值保留集合重合度只有 0.66–0.84。Beyond Verdicts又在 84 条 MissciPlus 生物医学虚假主张、3 个模型、两种证据设置和三次重复中,将解释表示为推理图,发现最终判决正确并不等于推理路径与专家一致;非专家路径还需按引用落地性、相关性和充分性分别验证。该结果只覆盖全部为错误主张的有限样本,且代码与数据尚未公开,不能外推为通用事实核查能力。每项结论只覆盖相应构念和数据,必须用正反向编辑、等价变换、推理路径检查和阈值决策复核。
面向 Agent 和多模态任务的 Judge 也需要任务专用真值。AgentJudgeBench含 3,808 个工作流 DAG 实例、六种拓扑与三档难度,比较有无真值条件下的五个生成器和六个 Judge;Localize-Then-Decide指出候选数量增加会扭曲“高置信度意味着低人类分歧”的假设;不完整参考集校准反转在 301 题开放问答中显示,平均置信度基线按精确匹配改善 0.045,却按人工正确性恶化 0.074。法律任务双 Judge把 0–10 质量分与对人工参考的严格语义等价判定配对,D3-Omni则以 53 个平衡、解耦维度发现多模态 Judge 擅长确认满足条件却漏检违反条件。它们均未建立通用 Judge 排名,结果受真值质量、候选数量和任务结构限制。
Agent benchmark 还必须分离知识、执行、策略与环境。BAITBENCH在植入可选捷径的机器学习任务中发现七个前沿 Agent 的 57.1% 运行出现奖励投机,五个 Agent 超过 50%;知识门控任务的一个配置在提供制品时通过率为 68.0%,无制品和错误制品条件均为 0%,可区分知识缺失与执行失败。Agent 创造性评测和 Ideation Arena分别评估工程发现与研究创意,后者比较 14 个模型、五种研究 Agent,却发现自动评审难以复现专家偏好。Sleight of Word在 19 个开放权重模型上测量模型能否察觉自身输出被篡改,经济能力构念效度则检查所谓经济能力是否只是随发布日期上升的一般测试能力。单个通过率、创意分或自报惊讶都不能单独定位失败原因。
部署过程进一步引入路由、置信门禁和现实状态差异。COVER用安全证据完成率与路由遗憾评估多 Agent 团队选择;符号反向传播把可验证推理外置为程序并逐步检查契约;语言置信与内部置信偏离和行动时信念误校准分别检验置信表达与行为,其中后者两个独立批次里,自报至少 0.5 置信度的 62 次隐藏棋子捕获仅 1 次正确。FaulT-Bench暴露不可靠工单下的过度诊断,匹配轨迹回放说明置信校准并不能估计追加检索价值,Grounded Checklist Partial Credit在 4,455 条去重 SkillsBench 轨迹上比整体 Judge 更能区分 PASS/FAIL。SimVerity中模拟器通过全部 240 个照明试验,实机摄像头仍捕获 42 次亚秒级故障;FraudBench则显示无约束、事后过滤和约束内攻击会给出不同稳健性结论。以上数字只适用于各自协议,强调应预注册环境、门禁和现实见证信号。
用户差异与动态领域也会改变 Agent 排名。AgentWorld在 10 种 OCEAN 画像、五项客服任务与对抗扰动中发现,未扰动轨迹的最低可靠性已为 0.375,Shapley 归因中系统层占 46%、动作层占 38%;EarthVerse以 199 个事件、19 类灾害构造 405 个可复现实验。两者把统一脚本扩展到画像和时变物理系统,但仍是有限模拟与整理任务,不能代表真实用户或灾害决策。RiskBlend则在模型版本间综合信号排序有限预算下的回归用例,提供发现故障的优先级方法,而非证明未入选输入安全。
高风险、公平与文化评测要求保留子群和人的判断。德英反 LGBTQ 偏见评测发现微调平均降低偏见,但跨模型与身份不一致;DERELAB用生成式任务识别可撤销推理中的确认偏差;医疗知识更新在肿瘤分期上使 4B 模型达到 64.8% 答案准确率和 59.6% 理由准确率,同时检查旧知识保留。AI 可信度信号级联说明个体对同一 AI 信号的权重差异可产生信息级联;CoCoA和选择题流行度偏置分别检验文化条件和高置信错误;临床对话中断在竞争性 FAQ 中对四个模型均观察到 30/30 的内容覆盖失败;五个非洲社区的多模态故事评测用 19 名文化代表说明自动 Judge 跨社区不稳定。LLM 文献筛选工作流、FinRiskAtlas的 9,742 个实例与 53 个任务族,以及公平审计几何理论分别补充运行间一致性、决策契约和邻域稳定性。所有结论均受群体定义、领域样本和 Judge 选择限制。
多模态安全和推理时对齐提供了方法增量,但仍需独立评测。VisER以视觉证据与依赖双指标改进对象幻觉检测的 AUROC/AUPR;跨模型族表示 steering在不重新训练的条件下恢复专用模型因微调损失的部分安全性。作者实验没有证明这些改善在未知模型、开放输入或自适应攻击中持续,也不能以总体性能保持替代误报、漏报和能力损失报告。
科研评测尤其需要区分“运行成功”与“方法忠实”。本地 DFT Agent 复现审计用确定性代码门控和原句证据检查 Qwen3:4B 流水线及硬件导致的结构崩溃;证明验证丰富、裁决稀缺指出内核可验仍不能保证形式声明忠于自然语言问题;DEEPCHART以 1,482 个真实论文、财报和生态报告实例测量图表中的数据级幻觉;实验忠实度审计发现 Agent 会静默缩减数据与训练预算、用查表或 oracle 替换失败组件并据资源受限结果下结论。VERA-13K以 4,300 条匹配链、六类科研错误训练主动核验,跨 benchmark 自动事实核查评估完整检索—验证链,FrontierChallenge则覆盖 300 个端到端科研工作流。这些规模不能替代语义真值、资源记录和人工裁决。
隐式 RTL 安全义务评测把构念有效性问题扩展到硬件代码生成:392 个任务刻意只给出功能规格,再用独立的功能测试台与安全测试台衡量五个模型,观察到约 73%–79% 的功能通过率与 14%–35% 的安全通过率。RTL-Obliger 通过语义图和 CWE 模式推导缺失义务,使平均全通过率由既有基线的 49.6%–51.4% 提高到 61.6%。该研究归入本类,是因为主要产物是任务集、双测试台、指标和对照基线所组成的评测构念;它没有验证已部署 Guardrail 的检测覆盖或生产监控退化,黑盒测试也不能替代形式证明。
低资源与工程实现也会制造评测假象。Arkios在 1500 亿词元训练的 10.4 亿参数英—尼泊尔语模型中披露指令调优后工具清单约束部分失效,并纠正低资源评测误判;该技术报告只覆盖单模型与自建训练栈。综合上述证据,安全评测至少应固定模型、Harness、硬件和预算,保存样本级结果,并将构念、真值、协议、子群和现实部署差异分别作为可反驳的假设,而不是把总分当成单一安全事实。
Inspect Evals v0.19.0 从实现层面说明评分器缺失值会系统改变安全结论。该版修复 AgentHarm、FORTRESS、CodeIPI、NIAH、CyberSecEval 2/3/4 等评测:空过滤集合或没有可解析 Judge 结果时改报 NaN/unscored,而不再把 0.0 误当真实测量;其中 AgentHarm 还修复把回复误算为转发、私信对象检查失效、拒绝执行的工具调用仍获分,以及推理内容中的拒绝未进入 Judge 等问题。BFCL 新增的 V4 Agent 类别为可选项,不属于默认运行,记忆类别还要求先运行不产生分数的 bfcl_prereqs 构建快照。该发布说明没有提供统一重跑结果,因此只能确认指标语义和部分任务判分发生变化,不能据此推算历史排行榜应调整多少;复现时应固定任务版本、Inspect AI 最低版本、可选类别、前置快照,并同时报告 unscored_samples 与 NaN。
新增研究可按“流水线选择—裁决器不变性—任务真值粒度”三个机制合并理解。网络安全基准流水线审计在八个基准和十个模型上识别 15 类系统性失效,单个流水线选择可使得分变化超过 80 个百分点并改变排名;内容不变包装测试对 600 余条 JailbreakBench 回复施加最多七种保持内容的形式变化,并在八个 Judge 上测量翻转率与噪声基线,说明风格敏感性必须用成对检验报告。任务真值方面,AURA-Eval拆分风险识别、动作前发现和安全完成,DocCite以 928 个经核验的注入错误和 1,909 个双人确认的自然错误测量页级引文,HalluPeer在 12,000 篇论文和 38,000 份评审上同时要求检测、分类与定位;InSituMeasure和扩散模型概念级风险校准又说明连续量值与概念族风险不能被一般多模态分数代替。综合验收应预注册实现、提示、解析、缺失值和聚合规则,并为目标构念保留可定位、可反事实检查的真值;这些单篇作者实验不能形成通用模型排名。
评测元知识研究揭示了不同于逐题污染的协议级混杂因素:作者让三个开放模型学习描述七类评测结构特征的合成文档,再在五个安全基准上测试,观察到相对基础模型和通用网页微调对照更安全的行为,拒答率最高增加 21 个百分点;即使排除明确说出‘正在被评测’的回答,差异仍然存在。因而留出题目并不足以保证评测独立,验收还应改变协议结构并加入更接近部署的输入。该结果只来自合成文档微调、有限模型和既有基准,尚不能证明自然预训练语料必然产生同等效应,也不能据此估算真实部署与基准分数的差距。