直交勾配制約がノイズラベル記憶ダイナミクスを形成する
新しい研究では、重み勾配の動径成分を取り除く幾何学的介入手法OrthoGradが紹介されています。ノイズラベル画像分類実験では、OrthoGradは小データ領域でテスト精度を向上させるものの、最終的なノイズラベルの記憶を防ぐことはできません。この手法は学習ダイナミクスを研究するための有用な診断ツールとして機能します。
2026年のICML HiLDワークショップにおいて、研究者のRichard Maiらは、ノイズラベル下でのニューラルネットワークの記憶ダイナミクスを研究するための新しい手法「OrthoGrad」を提案しました。現代のニューラルネットワークは破損したラベルを記憶できるため、ノイズラベル学習は記憶駆動型過適合を研究する有用な設定です。多くの正則化手法は目的関数、アーキテクチャ、データ分布を変更しますが、OrthoGradは最適化器の更新自体に幾何学的介入を施します。具体的には、各重み勾配から現在の重みベクトルに平行な成分(動径成分)を取り除き、直交成分のみを保持します。この直交投影は、モデルがノイズラベルの誤った相関に過度に依存するのを防ぐことを目的としています。
有効性を検証するため、ノイズラベル画像分類実験を行いました。MNISTデータセットにおいて、訓練データが限られている場合(例えば少数サンプルのみ)、直交勾配更新を用いた畳み込みニューラルネットワーク(CNN)は標準SGDと比較してテスト精度が顕著に向上し、ノイズラベルへの適合も低減しました。重みノルムと勾配-重みコサイン類似度に基づくメカニズム診断により、この投影は生の勾配に大きな動径成分が含まれる場合に最も効果的であり、データ量が多く勾配がすでに重みにほぼ直交している場合には効果が弱まることが示されました。つまり、正則化能力は勾配の幾何学的特性に依存し、特定の条件下でのみ有効です。
さらに、CIFAR-10データセットでResNet-18を用いた実験を行ったところ、OrthoGradは記憶の軌跡を変更し、過適合の開始を遅らせることができましたが、最終的にはモデルがノイズラベルを完全に記憶するのを防ぐことはできませんでした。十分な訓練後、OrthoGradを使用したモデルと通常の訓練を行ったモデルのノイズラベル性能は同程度になり、この手法が普遍的な正則化手段ではないことが示されました。
著者らは、直交更新制約は学習ダイナミクスにおける勾配方向の変化とその記憶への影響を観察する診断ツールとしてより適していると強調しています。この研究は2026年のICML HiLDワークショップに採択され、全7ページです。この研究は、勾配の幾何学と記憶の相互作用に関する新たな視点を提供し、将来のより洗練された更新制約設計の基礎となります。例えば、OrthoGradを他の正則化手法と組み合わせたり、投影強度を適応的に調整することで、さまざまなシナリオでの有効性を高める可能性があります。全体として、OrthoGradはノイズラベル学習ダイナミクスの分析に有用なツールを提供しますが、過適合防止能力には限界があります。