AI News HubLIVE
站內改寫1 分鐘閱讀

汙染資料上最小二乘插值的雙重下降:一項模擬研究

一項模擬研究探討了在汙染資料下過度引數化線性迴歸中的雙重下降現象,發現最小二乘插值法在泛化效能上優於穩健估計器。

來源arXiv Machine Learning作者: Tino Werner

在機器學習研究中,一個令人困惑的現象是,高度過度引數化的模型——即引數數量遠超訓練樣本數量的模型——儘管傳統統計學理論預測它們極易過擬合,卻往往表現出優異的泛化效能。這一悖論催生了“雙重下降”(double descent)現象的發現:隨著模型複雜度的增加,泛化誤差先上升至一個峰值,隨後在模型複雜度超過某個閾值後反而下降,甚至達到比簡單模型更低的水平。

最近,一項發表於arXiv的新研究(arXiv:2605.21494)將雙重下降現象擴充套件到了汙染資料場景。汙染資料是指由於實際資料分佈與假設的理想分佈不一致而出現的異常值,這些異常值可能嚴重扭曲經典估計結果。傳統的穩健統計學專門設計來應對這類問題,通常使用如M估計、 LMS等替代方法。然而,該研究的作者Tino Werner透過模擬實驗發現,在汙染資料下,高度非穩健的最小二乘插值估計器竟然表現出雙重下降行為,並且在模型高度過度引數化時,其泛化效能超過了專門設計的穩健替代方法。

研究採用線性迴歸設定,人為向訓練資料中新增異常值以模擬汙染。實驗系統地比較了最小二乘插值器與多種穩健估計器(如Huber估計、LTS等)在不同汙染程度下的表現。結果表明,當模型引數數量遠大於樣本數量時,最小二乘插值器的測試誤差先隨過引數化程度增加而上升,但隨後在高度過引數化時急劇下降,最終顯著優於穩健方法。這一發現挑戰了傳統觀念,即在高維或汙染資料中簡單插值必然導致糟糕的泛化,反而表明適度的過度引數化可以帶來魯棒性。

該研究的意義在於,它提示我們在實踐應用中,面對髒資料時,使用高度引數化的最小二乘模型可能比設計專門的穩健方法更為簡單有效。這為深層神經網路在噪聲資料上表現良好提供了一種可能的理論解釋。未來工作可進一步探索非線性模型及其他型別的汙染對雙重下降現象的影響。