外观
评测数据与基准完整性研究综述
摘要
安全基准要具备解释力,前提是测试样本独立、版本明确且评分过程可追溯。公开题目进入预训练语料、厂商针对基准微调、样本变体重复或测试集被提前访问,都会把记忆和优化伪装成泛化能力。基准完整性是数据保管问题,评分器操纵则属于 C3。
分类介绍
本领域覆盖评测样本采集、去重、访问控制、版本、泄露和训练交叉污染。攻击者可能是参评模型开发者、评测维护者、数据供应方或能读取私有题库的内部人员。应区分无意污染、已知题微调和主动窃取测试集。
主要安全风险
- 公开仓库、论文附录和在线排行榜会把测试样本带入后续训练语料。
- 近重复、翻译和格式变体使精确哈希无法识别污染。
- 动态模型和滚动 API 更新让同名模型在不同日期不可比。
- 只公布总分会掩盖样本级异常、拒答策略和失败模式。
防护措施与验证方法
保留私有或滚动测试集,执行语义去重和污染探测;对数据访问、样本生成和版本发布做审计;记录模型快照、系统提示、采样参数和运行日期;用新生成的保留集与可复现实验交叉验证公开基准结论。
局限与待验证问题
- 面对不可见训练语料,污染概率如何估计并反映到置信区间?
- 动态生成题能否在不牺牲难度一致性的情况下降低记忆效应?
- 安全能力与安全策略拒答应如何在基准中分离?
历史研究成果
Min-K% Prob 研究以训练截止日前后的 Wikipedia 文本建立 WIKIMIA 真值集,只使用最低概率 token 子集判断文本是否被模型见过,并在被测模型上超过多个成员推断基线。该方法支持版权文本和基准污染审计,但输出是受文本长度、难度和模型校准影响的统计证据,不能替代训练数据披露或样本级归属证明。
CGMIA把同类审计推进到代码生成基准:作者在八个基准上将候选代码的成员关系建模为可校准的行为差异,并在多数设置中超过八种成员推断基线,还识别出 StarCoder-7B 训练数据中已知泄露的 APPS 样本。该结果说明代码题的语法、模板和难度差异会影响污染判断,验收应同时保留非成员对照、语义近重复检查和已知泄露阳性对照;单一模型上的成员分数仍不是训练归属证明。