AI News HubLIVE
站內改寫2 分鐘閱讀

Mage-VL:一種高效的編解碼器原生流式多模態基礎模型

Mage-VL是一種新型流式多模態基礎模型,透過自定義Mage-ViT分詞器(利用運動向量和殘差能量選擇性編碼動態區域)減少75%以上視覺令牌消耗,並採用雙系統架構實現即時感知。在多項任務上匹配或超越更大模型,推理速度提升3.5倍。

來源arXiv Computer Vision作者: Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

標準視覺語言模型(VLM)面臨一個被稱為莫拉維克悖論的困境:它們擅長處理複雜的離線視覺推理任務,例如影像描述或視覺問答,但在面對簡單的流式感知任務(如即時影片分析)時卻表現不佳,且處理效率低下。這種矛盾源於傳統VLM對均勻幀取樣的依賴,導致其在處理影片流時產生大量冗餘的視覺令牌,增加了計算負擔。為了解決這一問題,研究團隊提出了Mage-VL,一種高效的編解碼器原生流式基礎模型,專為即時多模態理解和互動設計。

Mage-VL的核心創新在於其自定義的分詞器Mage-ViT。與傳統的均勻幀取樣不同,Mage-ViT透過利用運動向量和殘差能量,在稀疏的錨點幀(I幀)和預測幀(P幀)之間選擇性地編碼動態、熵豐富的區域。這種操作在16×16的區塊級別上進行,能夠在保留時空上下文的同時,將視覺令牌消耗減少超過75%。Mage-ViT從零開始訓練,使用了大約5.6億張無標籤影像和1億個無標籤影片幀,其效能與在數十億影像-文本對上訓練的旗艦編碼器相當甚至更優。

除了分詞器,Mage-VL還引入了一種受生物啟發的雙系統架構。該架構包含一個輕量級的System 1事件門(用於快速檢測流式輸入中的重要事件)和一個因果的System 2解碼器(用於深度推理和生成響應)。這種設計使Mage-VL能夠實現主動流式感知,即在處理即時資料時能夠主動識別關鍵事件並進行高效推理。

在訓練方面,研究團隊建立了AI4AI資料流水線,其中包括提示-程式碼聯合最佳化用於多模態字幕生成,以及AI驅動的效能診斷來指導訓練策略。這些創新使得Mage-VL在訓練效率和模型效能上均取得了顯著提升。

廣泛的評估結果表明,Mage-VL-4B在靜態任務上與Qwen3-VL-4B匹敵,同時影片理解和2D/3D空間推理能力大幅提升,推理速度(牆鍾時間)最高提升3.5倍,並全面超越了15B引數的Phi-4-reasoning-vision基線。除此之外,該研究還貢獻了七項關鍵實證發現,涵蓋預訓練資料效率、可變解析度縮放、編解碼器系統加速、VideoQA SFT冗餘、運動-空間協同、AI4AI資料流水線以及多模態強化學習的零視覺SFT。這些發現為未來多模態模型的設計和最佳化提供了重要指導。