梯度與自然梯度之間:LoRA初始化的連續統一體
該研究提出ULoRA,一種統一的LoRA初始化方法,將現有方法統一為雙參數連續族,並發現最優初始化點因任務而異。調優後的ULoRA在GLUE任務上媲美甚至超越全微調,而自動變體ULoRA-Auto無需搜索即可接近最優性能。
低秩適配(LoRA)是一種高效的微調方法,但其性能嚴重依賴於適配器的初始化方式。近期研究提出了多種基於下游損失梯度的初始化方案:有的將原始梯度投影到其主方向,有的則先用估計的損失曲率進行白化。來自arXiv的新論文《Between Gradient and Natural Gradient: A Continuum of LoRA Initializations》表明,這些看似不同的方法其實屬於同一個連續統一體——一種名為ULoRA(Unified LoRA)的雙參數預條件梯度初始化族。該族由譜白化指數和類似Adam的對角指數共同控制。
通過對這一族進行完整學習率掃描,研究人員發現,並不存在單一固定的預條件強度始終最優;最佳工作點因任務而異,且通常位於族內部,遠離已發表的端點。以該族的上界作為基準,經過調優的ULoRA配置在RoBERTa-base模型上的所有五個GLUE任務中均達到或超過全微調性能,並在LLaMA-2-7B的GSM8K任務上與最強基線競爭。此外,論文還提出了一種可直接部署且無需搜索的變體ULoRA-Auto,它根據測得的譜統計量為每層選擇指數,無需額外搜索即可接近上界性能,在可部署的LoRA方法中名列前茅。
這些結果揭示了一個重要的設計原則:LoRA初始化與曲率預條件的設計空間應被視為一個可調節的維度,而非固定不變的決策。該研究為LoRA的初始化提供了更全面的理論框架,並展示了自適應初始化在實際應用中的巨大潛力。同時,ULoRA-Auto的提出使得方法更加實用,無需手動調參即可獲得接近最優的性能,這對於實際部署具有重要意義。