跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

数据污染抬高分数,但很少改变大语言模型排行榜名次

文章摘要

一项新的arXiv研究通过将基准测试原始题目与语义等价的改写题目进行对照,把数据污染对LLM评测的影响拆分为“绝对分数虚高”和“排名重排”两个问题。基于47个公开模型和74个已知污染强度的微调模型,在ARC、GSM8K、HellaSwag与MMLU上的结果表明,标准排行榜与释义对照排行榜的秩相关达0.997;污染在公开模型中近乎均匀,会推高绝对分数,却很少改变相对名次。作者建议排行榜同时公布带置信区间的释义对照排名。

来源arXiv Computational Linguistics作者: Xingyao Xiao (Stanford University), Yihong Cheng (City University of Macau)
数据污染抬高分数,但很少改变大语言模型排行榜名次
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

斯坦福大学的Xingyao Xiao与澳门城市大学的Yihong Cheng在一篇2026年7月5日提交至arXiv的预印本论文中,重新考察了基准污染对大语言模型(LLM)排行榜的影响。基准污染指测试题泄漏进训练数据,通常被视为威胁LLM评测可信度的重要问题。论文指出,现有讨论常把两个不同的问题混在一起:污染是否抬高绝对得分,以及污染是否改变模型之间的名次。

为分离这两种效应,作者将污染重新定义为对“锚定题目不变性”的违背。测量思路是比较原始题目与语义等价的改写题目在模型上的作答差异。因为两类题目测量的是同一项技能,模型若在原始题上表现显著优于改写题,就说明它可能记住了训练阶段见过的原题,而非真正掌握能力。这样可以把记忆成分从能力评估中剥离出来。

研究使用了ARC、GSM8K、HellaSwag和MMLU四个基准,覆盖47个公开模型的逐实例作答,并额外构造了74个接受已知剂量污染微调的模型用于校准。校准结果显示,测量能够随注入污染剂量呈剂量-反应关系;测试集泄漏带来的校正效应为+0.187个准确率百分点。作为阴性对照,仅使用合法训练划分训练的模型测量值只有−0.012,说明该方法不会把正常训练误判为污染。

在排行榜影响方面,标准排行榜与经过释义对照调整后的排行榜之间的秩相关达到0.997。敏感性分析也显示,当前观测到的差异污染水平远低于足以改变榜单排序的程度。在188个模型×基准组合中,只有3个组合在两种参考条件下都表现出可重复的差异污染。所谓差异污染,是指某些模型比其他模型更严重地接触测试数据;只有在这种情况下,污染才会实质性扭曲排名。

因此,作者认为公开模型中的污染大体上是均匀的:它普遍推高绝对分数,但很少改变模型间的相对顺序。论文提供了一套经过校准的不变性审计工具作为参考实现,同时建议主流排行榜在标准排名之外,也公布附带置信区间的释义对照排名,使用户能够区分“背题”效应与真实能力差异。

展开要点与分析

文章情报

工程师进阶

要点

  • 研究将“污染是否抬高绝对分数”和“污染是否重排榜单顺序”作为两个独立问题处理。
  • 使用原题与语义等价改写题的差异来分离记忆与能力,且测量值可随注入污染剂量上升。
  • 对47个公开模型、4个基准的188个模型-基准组合,仅3个案例显示出两种参照一致支持的差异污染。
  • 标准排行榜与释义控制排行榜的秩相关为0.997,显示公开模型的污染对排名影响很小。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。