梯度与自然梯度之间:LoRA初始化的连续统一体
该研究提出ULoRA,一种统一的LoRA初始化方法,将现有方法统一为双参数连续族,并发现最优初始化点因任务而异。调优后的ULoRA在GLUE任务上媲美甚至超越全微调,而自动变体ULoRA-Auto无需搜索即可接近最优性能。
低秩适配(LoRA)是一种高效的微调方法,但其性能严重依赖于适配器的初始化方式。近期研究提出了多种基于下游损失梯度的初始化方案:有的将原始梯度投影到其主方向,有的则先用估计的损失曲率进行白化。来自arXiv的新论文《Between Gradient and Natural Gradient: A Continuum of LoRA Initializations》表明,这些看似不同的方法其实属于同一个连续统一体——一种名为ULoRA(Unified LoRA)的双参数预条件梯度初始化族。该族由谱白化指数和类似Adam的对角指数共同控制。
通过对这一族进行完整学习率扫描,研究人员发现,并不存在单一固定的预条件强度始终最优;最佳工作点因任务而异,且通常位于族内部,远离已发表的端点。以该族的上界作为基准,经过调优的ULoRA配置在RoBERTa-base模型上的所有五个GLUE任务中均达到或超过全微调性能,并在LLaMA-2-7B的GSM8K任务上与最强基线竞争。此外,论文还提出了一种可直接部署且无需搜索的变体ULoRA-Auto,它根据测得的谱统计量为每层选择指数,无需额外搜索即可接近上界性能,在可部署的LoRA方法中名列前茅。
这些结果揭示了一个重要的设计原则:LoRA初始化与曲率预条件的设计空间应被视为一个可调节的维度,而非固定不变的决策。该研究为LoRA的初始化提供了更全面的理论框架,并展示了自适应初始化在实际应用中的巨大潜力。同时,ULoRA-Auto的提出使得方法更加实用,无需手动调参即可获得接近最优的性能,这对于实际部署具有重要意义。