AI News HubLIVE
站內改寫2 分鐘閱讀

基於廣義瑞利商優化的基礎模型保持適應方法

本文提出FoLoRA,一種遺忘感知優化框架,通過廣義瑞利商權衡任務效用與遺忘懲罰,並利用預訓練模型採樣構建代理數據,在數學、代碼和指令跟隨任務上實現了最佳的性能保持平衡。

來源arXiv Machine Learning作者: Dongjun Kim, Adrian de Wynter, Huancheng Chen, Heasung Kim, Haris Vikalo

近年來,大型基礎模型在眾多自然語言處理和代碼生成任務中展現出卓越能力。然而,當這些模型被微調以適應特定下游任務時,它們往往會丟失在預訓練階段獲得的泛化能力,這種現象被稱為“災難性遺忘”。現有的遺忘感知方法通常通過特殊的初始化或固定的約束來尋找更安全的更新方向,但無法在訓練過程中動態調節適應與保持之間的權衡。針對這一挑戰,來自韓國科學技術院(KAIST)等機構的研究團隊提出了一種名為FoLoRA(Foundation Preserving LoRA)的新型遺忘感知優化框架。

FoLoRA的核心創新在於利用廣義瑞利商來評估每個更新方向的任務效用與遺忘懲罰之比。具體而言,該框架首先基於一階保持條件定義了遺忘懲罰和任務效用:遺忘懲罰通過預訓練代理激活來計算,而任務效用則通過下游任務激活來衡量。然後,它通過廣義瑞利商計算每個更新方向的任務效用與遺忘懲罰的比率,從而得到一個譜座標系。在這個座標系中,FoLoRA引入了方向門控機制,在Adam優化器中衰減那些低效用-懲罰比的更新方向,從而動態調節適應與保持的平衡。

與以往依賴固定代理數據集的方法不同,FoLoRA通過從預訓練模型本身採樣來構建代理校準數據。這種方法不僅避免了單一數據集可能帶來的偏差,還能更準確地估計遺忘懲罰,從而提高了方法的泛化性。研究團隊在數學推理、代碼生成和指令跟隨等下游任務上進行了廣泛實驗。結果表明,FoLoRA在目標任務性能上超越了現有基線,同時在保持非目標能力方面取得了最佳的整體平衡。例如,在數學推理任務中,FoLoRA在保持模型原有代碼生成能力的同時,顯著提升了數學問題解決的準確率。

這項工作的意義在於,它為遺忘感知的微調提供了新的視角和實用工具。通過動態調節適應與保持的權衡,FoLoRA使得基礎模型在適應新任務時能夠更好地保留其預訓練中獲得的廣泛能力。該方法的代碼和詳細論文已在arXiv上公開(arXiv:2606.00132),為後續研究提供了堅實的基礎。