AI News HubLIVE
站內改寫2 分鐘閱讀

DomainPilot:基於領域級損失引導的兩階段資料混合最佳化,實現高效語言模型微調

DomainPilot 提出一種兩階段資料混合最佳化框架,透過領域級損失監控和定標定律引導,在不增加資料量或訓練成本的情況下提升 LLM 微調效能。

來源arXiv Machine Learning作者: He Zhang

大型語言模型(LLM)的訓練效果從根本上受限於訓練資料的質量與組成。現有的動態資料排程方法在工業規模的預訓練和監督微調(SFT)中面臨關鍵瓶頸:資料選擇在TB級語料上產生昂貴的O(N)開銷;混合最佳化方案引入嚴重的I/O瓶頸或需要訓練輔助參考模型;樣本級重加權策略依賴於混合了噪聲、難度和新穎性的損失訊號。

針對這些問題,研究者提出了DomainPilot,一個領域級損失引導的兩階段資料混合最佳化框架。DomainPilot引入了令牌級領域損失監控,能夠在不中斷資料流水線的情況下捕獲訓練過程中每個領域的學習動態。基於這些訊號,首先透過Scaling Law引導的粗最佳化階段擬合領域特定的收斂曲線,得出混合調整的原則性先驗;隨後進入Mixing Law引導的細最佳化階段,透過受控掃描實驗建模跨領域互動效應,進一步最佳化混合比例。整個機制透過基於補丁的架構實現,僅需約30行框架特定的介面卡程式碼即可注入到現有訓練框架(如MindSpeed/Megatron-LM)中。

研究者以Qwen3-1.7B模型在SFT階段驗證了DomainPilot的有效性。與原始資料混合相比,最佳化後的混合在MMLU-Redux上提升+2%,在AIME24上提升+1.8%,在LiveCodeBench v5上提升+3.8%,在BFCL v3上提升+3.6%,且未增加總資料量或訓練成本。這些結果表明,領域級訓練訊號為混合最佳化提供了一種高效、輕量的替代方案,避免了昂貴的資料選擇或輔助模型訓練。DomainPilot的程式碼已基於arXiv:2607.22769釋出。

該框架的關鍵創新在於其兩階段最佳化策略:第一階段利用Scaling Law預測各領域隨資料量增加的學習收斂行為,從而確定一個合理的初始混合比例;第二階段則透過Mixing Law捕捉領域間的相互影響,例如數學程式碼領域的資料可能對推理能力產生協同效應。這種分而治之的方法使得最佳化過程既有效率又有理論依據。實驗結果表明,即使在1.7B引數的模型中,領域級訊號也能帶來顯著收益,暗示在更大模型上可能獲得更大幅度的提升。