外观
Min-K% Prob 预训练数据检测与基准污染审计
摘要
Shi 等人提出 WIKIMIA 动态基准和 Min-K% Prob 方法:只观察文本中最低概率的一部分 token,估计该文本是否被模型见过。该方法无需知道训练语料,也无需训练参考模型;在被测开放模型上平均 AUC 为 0.72,并用于版权文本和下游基准污染审计。它提供的是统计证据,不能把单个样本分数当作训练数据归属证明。
核心创新与差异
原研究利用“未见文本更可能含有少量异常低概率 token”的假设,避免传统成员推断依赖相似参考语料。本站关注其对基准完整性的价值:模型分数异常可能来自训练污染,也可能来自文本难度、时间、领域或重复模式,必须保留对照。
核心特点与评估范围
WIKIMIA 使用模型训练截止日前后创建的 Wikipedia 文本形成可知真值,覆盖 32、64、128、256 token 和原文/改写条件。目标模型包括 Pythia、GPT-NeoX、LLaMA 和 OPT。
评估方法与实际过程
作者与困惑度、邻域、压缩率、小模型参考等基线比较,使用 AUC 与 5% 假阳性率下真阳性率。k 在保留验证集上选择为 20%,随后固定用于其他模型。本站未对闭源 API 重跑检测。
关键结果与实际影响
Min-K% Prob 在十个模型/文本条件组合中平均 AUC 0.72,最佳基线平均 0.67;模型越大、文本越长通常越易检测。在 100 本 Books3 书籍、每本 100 个 512 词片段的案例中,验证集 AUC 为 0.88,作者估计近 90% 书籍有超过一半片段被判定为污染。闭源训练集未知,后一个结果仍是模型推断而非供应商确认。
防护措施与验证方法
评测维护者应保留时间滚动的私有题、发布不可变版本并执行语义去重;污染检测需报告基准率、阈值、假阳性和文本长度分层,并用训练截止时间或供应商披露交叉验证。排行榜不应把污染检测分数直接折算为能力扣分。
局限与待验证问题
方法受模型校准、文本难度和访问 log-probability 的能力影响;WIKIMIA 的时间切分也不等同于所有真实训练流程。无法获得 token 概率的 API 需要其他探测方法。