Mage-VL:一種高效的編解碼器原生流式多模態基礎模型
Mage-VL是一種新型流式多模態基礎模型,通過自定義Mage-ViT分詞器(利用運動向量和殘差能量選擇性編碼動態區域)減少75%以上視覺令牌消耗,並採用雙系統架構實現實時感知。在多項任務上匹配或超越更大模型,推理速度提升3.5倍。
標準視覺語言模型(VLM)面臨一個被稱為莫拉維克悖論的困境:它們擅長處理複雜的離線視覺推理任務,例如圖像描述或視覺問答,但在面對簡單的流式感知任務(如實時視頻分析)時卻表現不佳,且處理效率低下。這種矛盾源於傳統VLM對均勻幀採樣的依賴,導致其在處理視頻流時產生大量冗餘的視覺令牌,增加了計算負擔。為了解決這一問題,研究團隊提出了Mage-VL,一種高效的編解碼器原生流式基礎模型,專為實時多模態理解和交互設計。
Mage-VL的核心創新在於其自定義的分詞器Mage-ViT。與傳統的均勻幀採樣不同,Mage-ViT通過利用運動向量和殘差能量,在稀疏的錨點幀(I幀)和預測幀(P幀)之間選擇性地編碼動態、熵豐富的區域。這種操作在16×16的區塊級別上進行,能夠在保留時空上下文的同時,將視覺令牌消耗減少超過75%。Mage-ViT從零開始訓練,使用了大約5.6億張無標籤圖像和1億個無標籤視頻幀,其性能與在數十億圖像-文本對上訓練的旗艦編碼器相當甚至更優。
除了分詞器,Mage-VL還引入了一種受生物啓發的雙系統架構。該架構包含一個輕量級的System 1事件門(用於快速檢測流式輸入中的重要事件)和一個因果的System 2解碼器(用於深度推理和生成響應)。這種設計使Mage-VL能夠實現主動流式感知,即在處理實時數據時能夠主動識別關鍵事件並進行高效推理。
在訓練方面,研究團隊建立了AI4AI數據流水線,其中包括提示-代碼聯合優化用於多模態字幕生成,以及AI驅動的性能診斷來指導訓練策略。這些創新使得Mage-VL在訓練效率和模型性能上均取得了顯著提升。
廣泛的評估結果表明,Mage-VL-4B在靜態任務上與Qwen3-VL-4B匹敵,同時視頻理解和2D/3D空間推理能力大幅提升,推理速度(牆鍾時間)最高提升3.5倍,並全面超越了15B參數的Phi-4-reasoning-vision基線。除此之外,該研究還貢獻了七項關鍵實證發現,涵蓋預訓練數據效率、可變分辨率縮放、編解碼器系統加速、VideoQA SFT冗餘、運動-空間協同、AI4AI數據流水線以及多模態強化學習的零視覺SFT。這些發現為未來多模態模型的設計和優化提供了重要指導。