基於廣義瑞利商最佳化的基礎模型保持適應方法
本文提出FoLoRA,一種遺忘感知最佳化框架,透過廣義瑞利商權衡任務效用與遺忘懲罰,並利用預訓練模型取樣構建代理資料,在數學、程式碼和指令跟隨任務上實現了最佳的效能保持平衡。
近年來,大型基礎模型在眾多自然語言處理和程式碼生成任務中展現出卓越能力。然而,當這些模型被微調以適應特定下游任務時,它們往往會丟失在預訓練階段獲得的泛化能力,這種現象被稱為“災難性遺忘”。現有的遺忘感知方法通常透過特殊的初始化或固定的約束來尋找更安全的更新方向,但無法在訓練過程中動態調節適應與保持之間的權衡。針對這一挑戰,來自韓國科學技術院(KAIST)等機構的研究團隊提出了一種名為FoLoRA(Foundation Preserving LoRA)的新型遺忘感知最佳化框架。
FoLoRA的核心創新在於利用廣義瑞利商來評估每個更新方向的任務效用與遺忘懲罰之比。具體而言,該框架首先基於一階保持條件定義了遺忘懲罰和任務效用:遺忘懲罰透過預訓練代理啟用來計算,而任務效用則透過下游任務啟用來衡量。然後,它透過廣義瑞利商計算每個更新方向的任務效用與遺忘懲罰的比率,從而得到一個譜座標系。在這個座標系中,FoLoRA引入了方向門控機制,在Adam最佳化器中衰減那些低效用-懲罰比的更新方向,從而動態調節適應與保持的平衡。
與以往依賴固定代理資料集的方法不同,FoLoRA透過從預訓練模型本身取樣來構建代理校準資料。這種方法不僅避免了單一資料集可能帶來的偏差,還能更準確地估計遺忘懲罰,從而提高了方法的泛化性。研究團隊在數學推理、程式碼生成和指令跟隨等下游任務上進行了廣泛實驗。結果表明,FoLoRA在目標任務效能上超越了現有基線,同時在保持非目標能力方面取得了最佳的整體平衡。例如,在數學推理任務中,FoLoRA在保持模型原有程式碼生成能力的同時,顯著提升了數學問題解決的準確率。
這項工作的意義在於,它為遺忘感知的微調提供了新的視角和實用工具。透過動態調節適應與保持的權衡,FoLoRA使得基礎模型在適應新任務時能夠更好地保留其預訓練中獲得的廣泛能力。該方法的程式碼和詳細論文已在arXiv上公開(arXiv:2606.00132),為後續研究提供了堅實的基礎。