斯坦福大學的Xingyao Xiao與澳門城市大學的Yihong Cheng在一篇2026年7月5日提交至arXiv的預印本論文中,重新考察了基準污染對大語言模型(LLM)排行榜的影響。基準污染指測試題泄漏進訓練數據,通常被視為威脅LLM評測可信度的重要問題。論文指出,現有討論常把兩個不同的問題混在一起:污染是否抬高絕對得分,以及污染是否改變模型之間的名次。
為分離這兩種效應,作者將污染重新定義為對“錨定題目不變性”的違背。測量思路是比較原始題目與語義等價的改寫題目在模型上的作答差異。因為兩類題目測量的是同一項技能,模型若在原始題上表現顯著優於改寫題,就説明它可能記住了訓練階段見過的原題,而非真正掌握能力。這樣可以把記憶成分從能力評估中剝離出來。
研究使用了ARC、GSM8K、HellaSwag和MMLU四個基準,覆蓋47個公開模型的逐實例作答,並額外構造了74個接受已知劑量污染微調的模型用於校準。校準結果顯示,測量能夠隨注入污染劑量呈劑量-反應關係;測試集泄漏帶來的校正效應為+0.187個準確率百分點。作為陰性對照,僅使用合法訓練劃分訓練的模型測量值只有−0.012,説明該方法不會把正常訓練誤判為污染。
在排行榜影響方面,標準排行榜與經過釋義對照調整後的排行榜之間的秩相關達到0.997。敏感性分析也顯示,當前觀測到的差異污染水平遠低於足以改變榜單排序的程度。在188個模型×基準組合中,只有3個組合在兩種參考條件下都表現出可重複的差異污染。所謂差異污染,是指某些模型比其他模型更嚴重地接觸測試數據;只有在這種情況下,污染才會實質性扭曲排名。
因此,作者認為公開模型中的污染大體上是均勻的:它普遍推高絕對分數,但很少改變模型間的相對順序。論文提供了一套經過校準的不變性審計工具作為參考實現,同時建議主流排行榜在標準排名之外,也公佈附帶置信區間的釋義對照排名,使用户能夠區分“背題”效應與真實能力差異。