AI News HubLIVE
站內改寫1 分鐘閱讀

始終學習,始終混合:高效且簡單的資料混合新方法

OP-Mix是一種統一的資料混合演算法,適用於整個語言模型訓練生命週期,能以極低的計算量實現接近最優的混合策略。它利用低秩介面卡模擬候選混合,無需單獨的代理模型。

來源arXiv Computational Linguistics作者: Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho, Tal Linzen, Pratyusha Sharma

資料混合是語言模型訓練中一個至關重要的環節。在預訓練階段,資料組成直接影響模型質量;在持續學習和適應過程中,混合策略決定了模型保留哪些知識、獲取哪些新知識。然而,現有的資料混合方法大多隻針對單一訓練階段設計:有的依賴與特定階段繫結的小型代理模型,有的假設領域集合固定不變,而持續學習領域甚至缺乏系統的理論指導。這種碎片化的方法無法應對語言模型訓練整個生命週期中反覆出現的資料混合問題。

針對這一瓶頸,來自紐約大學的研究團隊提出了一種名為OP-Mix(On-Policy Mix)的統一資料混合演算法。該演算法的核心創新在於,無需單獨訓練代理模型,而是透過在當前正在訓練的模型上並行訓練多個低秩介面卡(LoRA),然後插值這些介面卡的引數來低成本模擬不同資料混合方案的效果。這樣,資料混合的搜尋始終基於模型當前的即時學習動態,從而避免了代理模型與目標模型之間的失配問題。

OP-Mix在預訓練、持續中訓練和持續指令微調三個典型場景中均進行了實驗驗證。在預訓練階段,與完全不進行資料混合相比,OP-Mix使平均困惑度降低了6.3%,接近理論最優混合策略。在持續學習任務中,OP-Mix的表現與完全重訓練以及基於策略的蒸餾方法相當,但計算量分別減少了66%和95%。這證明了OP-Mix在保持高效能的同時,大幅降低了計算開銷。

更重要的是,OP-Mix挑戰了語言模型訓練的傳統觀念:訓練不再是一系列截然分立的階段,而是一個從資料中不斷學習的連續過程。這一視角的轉變可能對未來語言模型的訓練正規化產生深遠影響。該研究由Michael Y. Hu、Apurva Gandhi、Kyunghyun Cho、Tal Linzen和Pratyusha Sharma共同完成,論文於2026年5月13日提交至arXiv。