研究:基准测试数据污染会虚高得分,但很少改变大模型排行榜名次

斯坦福大学和澳门城市大学的研究人员提出一种校准的污染检测方法,在188个模型-基准组合中仅发现3例能影响排名的差异化污染。

AI解读:基准测试污染——测试题混入训练数据——常被视为大模型排行榜不可信的根源。这篇论文把问题拆成两个:污染是否抬高绝对分数,以及是否改变模型间的相对名次。作者用原题与语义等价的改写题做对照,在47个公开发布模型和74个人为注入已知剂量污染的微调模型上验证了检测方法,发现污染会普遍抬高分数(测试集泄漏使准确率平均提高0.187个百分点),但各模型受影响程度大致相同,因此排行榜名次几乎没有变动。标准排行榜与排除改写后排行榜的秩相关系数高达0.997。对榜单用户来说,短期不必担心排行榜因污染而失真;但研究提醒,当某个模型出现与其他模型不同的差异化污染时,名次仍可能被扭曲,因此榜单发布方应同时公布改写对照后的排名和置信区间。

一项针对188个模型-基准组合的分析显示,基准测试数据污染(测试题混入训练数据)会普遍抬高模型的绝对得分,但很少改变排行榜上的相对名次。论文由斯坦福大学的Xingyao Xiao和澳门城市大学的Yihong Cheng撰写,以预印本形式发布在arXiv(编号2609.02899),尚未经同行评审。

方法与数据

作者将污染重新定义为对锚定项目不变性的违反,并通过比较原始题目与语义等价的改写题之间的表现差异来衡量污染效应。这种题内对照在保持被测技能不变的同时,将记忆(memorization)与能力(capability)分离。

数据来源包括47个公开发布模型的逐实例响应,以及74个注入已知剂量污染进行微调的模型,覆盖ARC、GSM8K、HellaSwag和MMLU四个基准测试。

校准结果

该测量方法在对照地面真值进行校准时能够剂量响应式地恢复注入的污染:测试集泄漏的校正效应为+0.187个准确率百分点。对于仅使用合法训练集划分训练的阴性对照模型,该测量从未误报,效应为-0.012。

对排行榜的影响

标准排行榜与排除改写后(paraphrase-controlled)排行榜之间的秩相关系数为0.997。敏感性分析表明,观察到的差异化污染远低于改变名次所需的水平。在188个模型-基准组合中,仅有3例在两个参考数据中得到证实的差异化污染。

该论文据此认为,这些公开模型中的污染总体上是均匀的——它抬高绝对分数但不改变排行榜名次,只有当罕见的差异化污染出现时才会导致排名失真。作者提供了校准的不变性审计工具(以参考实现形式发布),并建议排行榜发布方在展示置信区间的同时,报告排除改写后的排名。

信息来源