AI News HubLIVE
站內改寫2 分鐘閱讀

StrLoRA:面向多模態大語言模型的流式連續視覺指令微調

本研究提出StrLoRA,一種正則化兩階段專家路由框架,用於解決流式連續視覺指令微調(StrCVIT)中模型需同時學習新能力、鞏固已有能力並緩解遺忘的問題。StrLoRA通過任務感知專家選擇和令牌級加權,顯著優於現有方法。

來源arXiv Computer Vision作者: Chang Che, Ziqi Wang, Hui Ma, Cheems Wang, Zenglin Shi

近年來,多模態大語言模型(MLLMs)在視覺理解、對話等任務中展現出強大能力。然而,如何使模型在持續數據流中不斷學習新知識、鞏固舊知識並避免災難性遺忘,仍是關鍵挑戰。現有連續視覺指令微調(CVIT)方法大多假設任務分階段出現,每個階段單一固定任務,不符合現實世界中數據動態交錯到達的場景。

為了彌合這一差距,研究團隊引入了流式連續視覺指令微調(Streaming CVIT, StrCVIT)設置。在該設置下,模型需要從包含動態混合任務的數據塊流中學習,同時實現三個目標:獲取新能力、強化循環出現的能力、以及緩解遺忘。實驗表明,現有CVIT方法在StrCVIT中效果不佳,因為它們無法可靠區分或適應每個數據塊中的異構任務樣本。

為此,研究者提出了StrLoRA——一種正則化的兩階段專家路由框架。在第一階段,模型通過文本指令進行任務感知的專家選擇,激活一組稀疏的相關專家,從而減少跨任務干擾。第二階段,在該子集內應用令牌級專家加權,其中貢獻權重通過局部視覺令牌與全局指令表示的跨模態注意力計算得到。為了在非平穩流中保持穩定性,引入路由穩定性正則化,將當前路由分佈與歷史指數移動平均參考對齊。

在新建的StrCVIT基準上的大量實驗表明,StrLoRA顯著優於現有方法,有效增強了模型從持續演化的數據流中提升能力的效果。這一工作為實際應用中的實時學習提供了重要思路。

具體來説,StrLoRA通過任務感知的專家選擇機制,能夠根據指令內容動態激活最相關的專家模塊,從而在處理混合任務時有效隔離不同任務之間的干擾。例如,當模型處理一個涉及圖像描述的任務時,文本指令會引導模型選擇與視覺語義相關的專家,而忽略與數學推理相關的專家。在第二階段,令牌級加權機制進一步細化了每個專家對最終輸出的貢獻,通過局部視覺令牌與全局指令表示的跨模態注意力,模型能夠更精準地聚焦於與當前指令相關的視覺區域。路由穩定性正則化則通過約束當前路由分佈與歷史分佈的偏差,防止模型在連續數據流中發生劇烈的參數波動,從而維持學習的穩定性。

在實驗部分,研究團隊構建了一個包含多個視覺任務(如目標檢測、圖像分類、視覺問答等)的StrCVIT基準,並模擬了數據流中任務動態混合的場景。與多種基線方法(包括EWC、LwF、MAS等經典連續學習方法以及最新基於LoRA的變體)相比,StrLoRA在多個指標上取得了顯著提升,特別是在長序列學習任務中,展現了卓越的抗遺忘能力。此外,消融實驗驗證了每個組件的有效性,表明任務感知選擇和令牌級加權是性能提升的關鍵因素。

總之,StrLoRA為多模態大語言模型在動態數據流下的持續學習提供了一種高效且魯棒的解決方案,有望推動智能系統在現實場景中不斷進化。