AI News HubLIVE
站內改寫2 分鐘閱讀

Learn-by-Wire訓練控制治理:有界自主訓練在壓力下的穩定性和效率

本文提出Learn-by-Wire Guard(LBW-Guard),一種在AdamW之上執行的有界自主訓練控制治理層,透過觀察訓練遙測、解釋不穩定敏感區域並施加有界控制,在不替換最佳化器的情況下提升大型語言模型訓練的穩定性和效率。在Qwen2.5系列模型上的實驗表明,LBW-Guard可將7B模型的最終困惑度從13.21降至10.74(改善18.7%),同時端到端訓練時間減少約10%。在強學習率壓力下,AdamW完全退化,而LBW-Guard仍能保持可訓練性,困惑度維持在11.57和10.33。

來源arXiv AI作者: Anis Radianis

大型語言模型(LLM)的訓練正日益面臨不穩定性、執行退化和計算浪費的挑戰,尤其是在激進的學習率、規模擴充套件和執行時壓力條件下。針對這一問題,最新研究論文《Learn-by-Wire Training Control Governance: Bounded Autonomous Training Under Stress for Stability and Efficiency》提出了一種新穎的解決方案——Learn-by-Wire Guard(LBW-Guard)。該工作由Anis Radianis完成,並發表於arXiv(編號2605.19008)。

LBW-Guard是一個有界的自主訓練控制治理層,執行在常用最佳化器AdamW之上。與直接替換最佳化器更新規則不同,LBW-Guard透過觀察訓練遙測資料,即時解釋不穩定敏感的訓練區間,並對最佳化器的執行施加有界控制,同時保持固定的訓練目標。這種方法類似於航空領域的“線控飛行”概念,旨在透過一個外部的監控和干預層來確保訓練的穩定性。

研究團隊在基於Qwen2.5系列模型的壓力與魯棒性測試套件中評估了LBW-Guard,使用WikiText-103資料集。實驗以Qwen2.5-7B為主要錨點,並與Qwen2.5-3B和Qwen2.5-14B進行模型規模比較,同時進行了學習率壓力測試、梯度裁剪基線對比,以及無LoRA的TinyLlama-1B全引數完整性檢查。

在7B參考設定下,LBW-Guard展現了顯著效果:最終困惑度從13.21降至10.74,提升了18.7%;同時端到端訓練時間從392.54秒減少到357.02秒,實現了1.10倍的加速。更令人印象深刻的是,在面對更強的學習率壓力時(學習率3e-3和1e-3),標準AdamW最佳化器的困惑度分別急劇退化至1885.24和659.76,而LBW-Guard仍然保持可訓練狀態,其困惑度僅為11.57和10.33。此外,梯度裁剪基線無法複製這一效果,表明LBW-Guard的優勢並非來自簡單的梯度處理。

這些結果支援一個範圍化的系統結論:對穩定性敏感的LLM訓練可以從最佳化器之上的治理平面中受益。LBW-Guard提供了有力的證據,表明有界執行時控制能夠在壓力下保持高效的計算利用,並且這種方法與替換最佳化器或區域性梯度抑制截然不同。該研究為未來大型語言模型的穩定高效訓練開闢了新的方向。