跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

數據污染抬高分數,但很少改變大語言模型排行榜名次

文章摘要

一項新的arXiv研究通過將基準測試原始題目與語義等價的改寫題目進行對照,把數據污染對LLM評測的影響拆分為“絕對分數虛高”和“排名重排”兩個問題。基於47個公開模型和74個已知污染強度的微調模型,在ARC、GSM8K、HellaSwag與MMLU上的結果表明,標準排行榜與釋義對照排行榜的秩相關達0.997;污染在公開模型中近乎均勻,會推高絕對分數,卻很少改變相對名次。作者建議排行榜同時公佈帶置信區間的釋義對照排名。

來源arXiv Computational Linguistics作者: Xingyao Xiao (Stanford University), Yihong Cheng (City University of Macau)
數據污染抬高分數,但很少改變大語言模型排行榜名次
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

斯坦福大學的Xingyao Xiao與澳門城市大學的Yihong Cheng在一篇2026年7月5日提交至arXiv的預印本論文中,重新考察了基準污染對大語言模型(LLM)排行榜的影響。基準污染指測試題泄漏進訓練數據,通常被視為威脅LLM評測可信度的重要問題。論文指出,現有討論常把兩個不同的問題混在一起:污染是否抬高絕對得分,以及污染是否改變模型之間的名次。

為分離這兩種效應,作者將污染重新定義為對“錨定題目不變性”的違背。測量思路是比較原始題目與語義等價的改寫題目在模型上的作答差異。因為兩類題目測量的是同一項技能,模型若在原始題上表現顯著優於改寫題,就説明它可能記住了訓練階段見過的原題,而非真正掌握能力。這樣可以把記憶成分從能力評估中剝離出來。

研究使用了ARC、GSM8K、HellaSwag和MMLU四個基準,覆蓋47個公開模型的逐實例作答,並額外構造了74個接受已知劑量污染微調的模型用於校準。校準結果顯示,測量能夠隨注入污染劑量呈劑量-反應關係;測試集泄漏帶來的校正效應為+0.187個準確率百分點。作為陰性對照,僅使用合法訓練劃分訓練的模型測量值只有−0.012,説明該方法不會把正常訓練誤判為污染。

在排行榜影響方面,標準排行榜與經過釋義對照調整後的排行榜之間的秩相關達到0.997。敏感性分析也顯示,當前觀測到的差異污染水平遠低於足以改變榜單排序的程度。在188個模型×基準組合中,只有3個組合在兩種參考條件下都表現出可重複的差異污染。所謂差異污染,是指某些模型比其他模型更嚴重地接觸測試數據;只有在這種情況下,污染才會實質性扭曲排名。

因此,作者認為公開模型中的污染大體上是均勻的:它普遍推高絕對分數,但很少改變模型間的相對順序。論文提供了一套經過校準的不變性審計工具作為參考實現,同時建議主流排行榜在標準排名之外,也公佈附帶置信區間的釋義對照排名,使用户能夠區分“背題”效應與真實能力差異。

展開要點與分析

文章情報

工程師進階

要點

  • 研究將“污染是否抬高絕對分數”和“污染是否重排榜單順序”作為兩個獨立問題處理。
  • 使用原題與語義等價改寫題的差異來分離記憶與能力,且測量值可隨注入污染劑量上升。
  • 對47個公開模型、4個基準的188個模型-基準組合,僅3個案例顯示出兩種參照一致支持的差異污染。
  • 標準排行榜與釋義控制排行榜的秩相關為0.997,顯示公開模型的污染對排名影響很小。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。