正交梯度約束塑造噪聲標籤記憶動態
一項新研究介紹了OrthoGrad,一種對梯度更新進行幾何干預的方法,它移除權重梯度的徑向分量。在噪聲標籤影像分類實驗中,OrthoGrad在小資料場景下提高了測試準確率,但並不能阻止最終對噪聲標籤的記憶。該方法可作為研究學習動態的有用診斷工具。
來自2026年ICML HiLD研討會的研究人員Richard Mai等人提出了一種名為OrthoGrad的新方法,用於研究神經網路在噪聲標籤下的記憶動態。現代神經網路能夠擬合被汙染的標籤,這使得噪聲標籤學習成為研究記憶驅動過擬合的理想場景。大多數現有正則化方法透過修改目標函式、網路架構或資料分佈來緩解過擬合,而OrthoGrad開創性地從最佳化器更新角度入手,施加一種幾何干預。具體而言,它在每個訓練步驟中計算權重梯度,然後移除該梯度中與當前權重向量平行的部分(即徑向分量),僅保留正交分量。這種正交投影操作旨在防止模型過度依賴噪聲標籤中的虛假相關性,從而延緩或減輕記憶效應。
為了驗證OrthoGrad的有效性,研究團隊在噪聲標籤影像分類任務上進行了實驗。在MNIST資料集上,當訓練資料量有限時(例如僅使用少量樣本),使用正交梯度更新的卷積神經網路(CNN)相比標準SGD顯著提升了測試準確率,並且對噪聲標籤的擬合程度較低。透過分析權重範數和梯度-權重餘弦相似度等診斷指標,他們發現該投影機制在原始梯度包含較大徑向分量時效果最為顯著;當資料量增大,梯度本身已經接近正交於權重向量時,OrthoGrad的效果會減弱。這表明其正則化能力與梯度幾何特性密切相關,並且只在特定條件下有效。具體來說,當原始梯度與權重向量的夾角較小時,徑向分量較大,此時正交投影對更新的影響顯著;反之,當夾角接近90度時,投影幾乎不影響更新。
進一步在CIFAR-10資料集上使用ResNet-18進行的實驗顯示,OrthoGrad雖然能夠改變模型的記憶軌跡,例如延遲過擬合的開始時間,但最終仍然無法阻止模型完全記住噪聲標籤。經過充足訓練後,採用OrthoGrad的模型與普通訓練的模型在噪聲標籤上的表現趨於一致,說明該方法並非一種通用的正則化手段。
作者強調,正交更新約束更適合作為一種診斷工具,幫助研究者觀察學習過程中梯度方向的變化及其對記憶的影響。該研究已被2026年ICML HiLD研討會接收,論文共7頁。這一工作揭示了梯度幾何與記憶中相互作用的新視角,併為未來設計更精細的更新約束提供了基礎。例如,未來可以探索將OrthoGrad與其他正則化方法結合,或者透過自適應調整投影強度來提升其在不同場景下的有效性。總體而言,OrthoGrad為研究噪聲標籤學習動態提供了有價值的分析工具,儘管其在防止過擬合方面的能力有限。