在預訓練之後,語言模型需要經過一系列中期和後訓練階段才能變得實用——學習遵循指令、推理問題、可靠地呼叫工具等。然而,在這些階段之後更新或擴充套件模型往往具有挑戰性。最可靠的選擇是從頭開始重新訓練,但成本高昂且需要完全訪問原始訓練設定。進一步訓練新資料更便宜,但可能導致模型丟失已有能力。而且,由於後訓練通常涉及多個階段(每個階段有自己的資料和目標),新增新技能意味著需要重新執行或調整每個階段以避免破壞已有成果。
為了解決這些問題,艾倫人工智慧研究所(Ai2)的研究團隊提出了BAR(Branch-Adapt-Route,分支-適配-路由)方法,一種模組化後訓練的方案。與一次訓練一個處理所有資料的單一模型不同,BAR獨立訓練領域專家——每個專家透過自己的完整訓練流程——並透過混合專家(MoE)架構將它們組合成一個統一模型。每個專家都可以獨立開發、升級或替換,而無需影響其他專家。該團隊釋出了配方、技術報告以及用於驗證該方法的模型檢查點。
BAR的動機源於之前的FlexOlmo工作。FlexOlmo表明,基於MoE的模組化訓練在預訓練階段效果良好:可以從共享基礎分支,訓練特定領域的FFN專家同時凍結所有共享層,然後合併回。然而,研究人員發現這種方案不適用於後訓練。原因在於:預訓練主要更新知識表示,這些知識主要存在於FFN層;而後訓練則引入行為變化(如新的輸出格式、推理模式和安全約束),這些變化需要改變共享引數(如注意力層、嵌入層和語言模型頭)。例如,當研究人員在強化學習與驗證獎勵(RLVR)中直接使用FlexOlmo方法時,獎勵曲線完全平坦;模型在所有共享引數凍結的情況下根本學不會。這促使他們專門為後訓練開發了新的配方。
BAR包含三個階段。階段一:獨立專家訓練。每個領域專家例項化為包含兩個專家的MoE:一個凍結的“錨定”專家(保留基礎模型的FFN權重)和一個可訓練的專家。專家根據領域需求經歷相應的訓練階段。在實驗中,數學和程式碼專家經歷中期訓練、有監督微調(SFT)和RLVR;工具使用和安全專家僅使用SFT。關鍵的技術貢獻是跨階段的漸進式解凍計劃:中期訓練時所有共享層凍結;SFT時解凍嵌入層和語言模型頭,這對於引入新特殊令牌(如工具使用的函式呼叫格式)是必要的;RLVR時解凍所有共享引數,包括注意力層。此外,每個專家還訓練混合了領域特定和通用SFT資料的資料集,因為僅領域SFT會嚴重損害通用能力。
階段二:專家合併。訓練後,所有專家合併為一個單一的MoE模型。跨專家執行中分化的共享引數(由於在SFT或RLVR期間解凍)被簡單地平均。研究發現,與任何單個專家相比,這種平均化在領域特定評估中幾乎沒有引入可測量的效能損失。階段三:路由器訓練。最後,在MoE內部訓練路由器,同時凍結所有其他專家和共享權重。研究人員發現,僅用SFT資料的分層5%樣本就足以實現有效路由,使得這一階段快速且廉價。
實驗表明,BAR模型在19個基準測試中超越了所有不需要從零重新訓練中期訓練的基線方法。平均而言,BAR優於僅進行後訓練重訓練的模型(49.1 vs 47.8),尤其在數學(+7.8)和程式碼(+4.7)方面提升顯著。這歸因於模組化訓練的結構性優勢:在單一流水線中,後期對數學和程式碼的RL可能會削弱早期SFT階段學到的安全能力,而模組化訓練完全避免了這一點。值得注意的是,中期訓練後的稠密模型合併效果極差(整體6.5),而BAR在無需中期訓練的情況下仍然大幅領先。
BAR最實用的特性之一是專家可以獨立升級。研究展示了兩種升級方式:用更高質量資料和RL訓練的程式碼專家替換原有專家,使程式碼效能提升16.5點,而其他領域幾乎不變;在已有數學專家基礎上新增RL訓練,使數學效能提升13點。在這兩種情況下,只有受影響的專家和輕量級路由器需要重新訓練,而傳統單一流水線則需要重新訓練整個模型。這使得BAR的領域更新成本呈線性增長,而單一模型更新成本則幾乎是二次方增長。
研究還得出一些實用經驗:後訓練需要比預訓練更大的靈活性,漸進式解凍至關重要;僅使用領域SFT資料是不夠的,必須混合通用SFT資料;解凍後的權重平均效果出奇地好;並非所有專家都需要在推理時啟用,啟用4/5專家即可達到幾乎相同的效能。未來工作包括從原生稀疏架構開始,而非將稠密模型轉換為稀疏模型,這可能提高模組化方法的效率和可擴充套件性。