StrLoRA:面向多模态大语言模型的流式连续视觉指令微调
本研究提出StrLoRA,一种正则化两阶段专家路由框架,用于解决流式连续视觉指令微调(StrCVIT)中模型需同时学习新能力、巩固已有能力并缓解遗忘的问题。StrLoRA通过任务感知专家选择和令牌级加权,显著优于现有方法。
近年来,多模态大语言模型(MLLMs)在视觉理解、对话等任务中展现出强大能力。然而,如何使模型在持续数据流中不断学习新知识、巩固旧知识并避免灾难性遗忘,仍是关键挑战。现有连续视觉指令微调(CVIT)方法大多假设任务分阶段出现,每个阶段单一固定任务,不符合现实世界中数据动态交错到达的场景。
为了弥合这一差距,研究团队引入了流式连续视觉指令微调(Streaming CVIT, StrCVIT)设置。在该设置下,模型需要从包含动态混合任务的数据块流中学习,同时实现三个目标:获取新能力、强化循环出现的能力、以及缓解遗忘。实验表明,现有CVIT方法在StrCVIT中效果不佳,因为它们无法可靠区分或适应每个数据块中的异构任务样本。
为此,研究者提出了StrLoRA——一种正则化的两阶段专家路由框架。在第一阶段,模型通过文本指令进行任务感知的专家选择,激活一组稀疏的相关专家,从而减少跨任务干扰。第二阶段,在该子集内应用令牌级专家加权,其中贡献权重通过局部视觉令牌与全局指令表示的跨模态注意力计算得到。为了在非平稳流中保持稳定性,引入路由稳定性正则化,将当前路由分布与历史指数移动平均参考对齐。
在新建的StrCVIT基准上的大量实验表明,StrLoRA显著优于现有方法,有效增强了模型从持续演化的数据流中提升能力的效果。这一工作为实际应用中的实时学习提供了重要思路。
具体来说,StrLoRA通过任务感知的专家选择机制,能够根据指令内容动态激活最相关的专家模块,从而在处理混合任务时有效隔离不同任务之间的干扰。例如,当模型处理一个涉及图像描述的任务时,文本指令会引导模型选择与视觉语义相关的专家,而忽略与数学推理相关的专家。在第二阶段,令牌级加权机制进一步细化了每个专家对最终输出的贡献,通过局部视觉令牌与全局指令表示的跨模态注意力,模型能够更精准地聚焦于与当前指令相关的视觉区域。路由稳定性正则化则通过约束当前路由分布与历史分布的偏差,防止模型在连续数据流中发生剧烈的参数波动,从而维持学习的稳定性。
在实验部分,研究团队构建了一个包含多个视觉任务(如目标检测、图像分类、视觉问答等)的StrCVIT基准,并模拟了数据流中任务动态混合的场景。与多种基线方法(包括EWC、LwF、MAS等经典连续学习方法以及最新基于LoRA的变体)相比,StrLoRA在多个指标上取得了显著提升,特别是在长序列学习任务中,展现了卓越的抗遗忘能力。此外,消融实验验证了每个组件的有效性,表明任务感知选择和令牌级加权是性能提升的关键因素。
总之,StrLoRA为多模态大语言模型在动态数据流下的持续学习提供了一种高效且鲁棒的解决方案,有望推动智能系统在现实场景中不断进化。