AI News HubLIVE
站內改寫2 分鐘閱讀

StrLoRA:面向多模態大語言模型的流式連續視覺指令微調

本研究提出StrLoRA,一種正則化兩階段專家路由框架,用於解決流式連續視覺指令微調(StrCVIT)中模型需同時學習新能力、鞏固已有能力並緩解遺忘的問題。StrLoRA透過任務感知專家選擇和令牌級加權,顯著優於現有方法。

來源arXiv Computer Vision作者: Chang Che, Ziqi Wang, Hui Ma, Cheems Wang, Zenglin Shi

近年來,多模態大語言模型(MLLMs)在視覺理解、對話等任務中展現出強大能力。然而,如何使模型在持續資料流中不斷學習新知識、鞏固舊知識並避免災難性遺忘,仍是關鍵挑戰。現有連續視覺指令微調(CVIT)方法大多假設任務分階段出現,每個階段單一固定任務,不符合現實世界中資料動態交錯到達的場景。

為了彌合這一差距,研究團隊引入了流式連續視覺指令微調(Streaming CVIT, StrCVIT)設定。在該設定下,模型需要從包含動態混合任務的資料塊流中學習,同時實現三個目標:獲取新能力、強化迴圈出現的能力、以及緩解遺忘。實驗表明,現有CVIT方法在StrCVIT中效果不佳,因為它們無法可靠區分或適應每個資料塊中的異構任務樣本。

為此,研究者提出了StrLoRA——一種正則化的兩階段專家路由框架。在第一階段,模型透過文本指令進行任務感知的專家選擇,啟用一組稀疏的相關專家,從而減少跨任務干擾。第二階段,在該子集內應用令牌級專家加權,其中貢獻權重透過區域性視覺令牌與全域性指令表示的跨模態注意力計算得到。為了在非平穩流中保持穩定性,引入路由穩定性正則化,將當前路由分佈與歷史指數移動平均參考對齊。

在新建的StrCVIT基準上的大量實驗表明,StrLoRA顯著優於現有方法,有效增強了模型從持續演化的資料流中提升能力的效果。這一工作為實際應用中的即時學習提供了重要思路。

具體來說,StrLoRA透過任務感知的專家選擇機制,能夠根據指令內容動態啟用最相關的專家模組,從而在處理混合任務時有效隔離不同任務之間的干擾。例如,當模型處理一個涉及影像描述的任務時,文本指令會引導模型選擇與視覺語義相關的專家,而忽略與數學推理相關的專家。在第二階段,令牌級加權機制進一步細化了每個專家對最終輸出的貢獻,透過區域性視覺令牌與全域性指令表示的跨模態注意力,模型能夠更精準地聚焦於與當前指令相關的視覺區域。路由穩定性正則化則透過約束當前路由分佈與歷史分佈的偏差,防止模型在連續資料流中發生劇烈的引數波動,從而維持學習的穩定性。

在實驗部分,研究團隊構建了一個包含多個視覺任務(如目標檢測、影像分類、視覺問答等)的StrCVIT基準,並模擬了資料流中任務動態混合的場景。與多種基線方法(包括EWC、LwF、MAS等經典連續學習方法以及最新基於LoRA的變體)相比,StrLoRA在多個指標上取得了顯著提升,特別是在長序列學習任務中,展現了卓越的抗遺忘能力。此外,消融實驗驗證了每個元件的有效性,表明任務感知選擇和令牌級加權是效能提升的關鍵因素。

總之,StrLoRA為多模態大語言模型在動態資料流下的持續學習提供了一種高效且魯棒的解決方案,有望推動智慧系統在現實場景中不斷進化。