斯坦福大学的Xingyao Xiao与澳门城市大学的Yihong Cheng在一篇2026年7月5日提交至arXiv的预印本论文中,重新考察了基准污染对大语言模型(LLM)排行榜的影响。基准污染指测试题泄漏进训练数据,通常被视为威胁LLM评测可信度的重要问题。论文指出,现有讨论常把两个不同的问题混在一起:污染是否抬高绝对得分,以及污染是否改变模型之间的名次。
为分离这两种效应,作者将污染重新定义为对“锚定题目不变性”的违背。测量思路是比较原始题目与语义等价的改写题目在模型上的作答差异。因为两类题目测量的是同一项技能,模型若在原始题上表现显著优于改写题,就说明它可能记住了训练阶段见过的原题,而非真正掌握能力。这样可以把记忆成分从能力评估中剥离出来。
研究使用了ARC、GSM8K、HellaSwag和MMLU四个基准,覆盖47个公开模型的逐实例作答,并额外构造了74个接受已知剂量污染微调的模型用于校准。校准结果显示,测量能够随注入污染剂量呈剂量-反应关系;测试集泄漏带来的校正效应为+0.187个准确率百分点。作为阴性对照,仅使用合法训练划分训练的模型测量值只有−0.012,说明该方法不会把正常训练误判为污染。
在排行榜影响方面,标准排行榜与经过释义对照调整后的排行榜之间的秩相关达到0.997。敏感性分析也显示,当前观测到的差异污染水平远低于足以改变榜单排序的程度。在188个模型×基准组合中,只有3个组合在两种参考条件下都表现出可重复的差异污染。所谓差异污染,是指某些模型比其他模型更严重地接触测试数据;只有在这种情况下,污染才会实质性扭曲排名。
因此,作者认为公开模型中的污染大体上是均匀的:它普遍推高绝对分数,但很少改变模型间的相对顺序。论文提供了一套经过校准的不变性审计工具作为参考实现,同时建议主流排行榜在标准排名之外,也公布附带置信区间的释义对照排名,使用户能够区分“背题”效应与真实能力差异。