在一篇新發布的可復現研究中,作者 Yuvraj Verma 對機器學習界廣泛使用的 ISOT/Kaggle「Fake and Real News」假新聞語料庫提出了一個直接的問題:在這類資料集上動輒出現的 0.98 以上準確率與 F1 分數,究竟測的是什麼?論文以一套透明的 TF-IDF 加線性分類器流程作為「測量儀器」,從三條洩漏通道和兩種分佈偏移協議對語料庫進行系統審計,並公開了全部程式碼與推匯出的數值。
審計的第一項發現指出,這個基準在某種程度上是退化的。研究者把文章正文完全丟棄,只把 subject 後設資料欄位餵給分類器,結果 F1 達到 1.000。原因是兩個類別對應的 subject 彼此不相交,模型只要記住主題標籤即可完美分類,與判斷新聞真假毫無關係。這意味著在這一設定下,高分首先反映的是資料劃分方式。
隨後,作者逐一移除三條洩漏通道:subject 後設資料;出現在 99.2% 真實文章中的通訊社來源標籤;以及 6,251 篇重複文件——它們汙染了樸素測試集的 19.4%。令人意外的是,全部清理之後 F1 僅下降 1.21 個點,從 0.9935 降到 0.9814。作者進一步檢驗殘餘訊號的來源,發現它並非集中在少數「洩露答案」的詞元上,而是彌散在整個文本的編輯風格之中:即使刪掉權重最高的 1,000 個一元詞元,F1 仍高達 0.926。換句話說,模型學到的是寫作習慣,而不是事實核查能力。
第三項發現說明這種風格訊號無法遷移。在主題不重疊的協議下,平均精度從 0.9995 跌至 0.9475,實際部署口徑的 F1 從 0.9905 降到 0.8067;經過先驗匹配分析後,仍確認存在 5.2 個點的真實判別力損失。相比之下,時間維度的遷移幾乎不造成損失,說明脆弱之處主要來自話題分佈的變化,而非時間漂移。
模型容量也不是解藥。微調後的 DistilBERT 在分佈內表現更強,F1 達 0.9993,但在主題偏移下退化得更嚴重,平均精度損失 12.9 個點,約為線性模型 5.2 個點的兩倍多。當三個模型被遷移到獨立的 LIAR 基準時,它們的排序能力都跌至接近隨機水平,ROC-AUC 僅在 0.54 至 0.57 之間,沒有任何一個能超過多數類基線。
作者據此得出結論:在該語料庫內部取得的分數,量化的是來源與主題的可分性,而不是新聞的真實性;增加模型容量只會更好地利用這一捷徑,而非繞開它。論文建議未來的研究把僅使用後設資料的基線、小樣本基線和主題不重疊基線作為低成本的常規診斷手段。該論文共 17 頁,含 11 張圖和 11 張表,實驗指令碼與機器可讀結果均已隨程式碼一併釋出;論文於 2026 年 7 月 26 日提交至 arXiv,編號 arXiv:2609.25006,歸類於計算與語言(cs.CL)及機器學習(cs.LG)。