AI News HubLIVE
站内改写2 分钟阅读

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Mage-VL是一种新型流式多模态基础模型,通过自定义Mage-ViT分词器(利用运动向量和残差能量选择性编码动态区域)减少75%以上视觉令牌消耗,并采用双系统架构实现实时感知。在多项任务上匹配或超越更大模型,推理速度提升3.5倍。

来源arXiv Computer Vision作者: Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

标准视觉语言模型(VLM)面临一个被称为莫拉维克悖论的困境:它们擅长处理复杂的离线视觉推理任务,例如图像描述或视觉问答,但在面对简单的流式感知任务(如实时视频分析)时却表现不佳,且处理效率低下。这种矛盾源于传统VLM对均匀帧采样的依赖,导致其在处理视频流时产生大量冗余的视觉令牌,增加了计算负担。为了解决这一问题,研究团队提出了Mage-VL,一种高效的编解码器原生流式基础模型,专为实时多模态理解和交互设计。

Mage-VL的核心创新在于其自定义的分词器Mage-ViT。与传统的均匀帧采样不同,Mage-ViT通过利用运动向量和残差能量,在稀疏的锚点帧(I帧)和预测帧(P帧)之间选择性地编码动态、熵丰富的区域。这种操作在16×16的区块级别上进行,能够在保留时空上下文的同时,将视觉令牌消耗减少超过75%。Mage-ViT从零开始训练,使用了大约5.6亿张无标签图像和1亿个无标签视频帧,其性能与在数十亿图像-文本对上训练的旗舰编码器相当甚至更优。

除了分词器,Mage-VL还引入了一种受生物启发的双系统架构。该架构包含一个轻量级的System 1事件门(用于快速检测流式输入中的重要事件)和一个因果的System 2解码器(用于深度推理和生成响应)。这种设计使Mage-VL能够实现主动流式感知,即在处理实时数据时能够主动识别关键事件并进行高效推理。

在训练方面,研究团队建立了AI4AI数据流水线,其中包括提示-代码联合优化用于多模态字幕生成,以及AI驱动的性能诊断来指导训练策略。这些创新使得Mage-VL在训练效率和模型性能上均取得了显著提升。

广泛的评估结果表明,Mage-VL-4B在静态任务上与Qwen3-VL-4B匹敌,同时视频理解和2D/3D空间推理能力大幅提升,推理速度(墙钟时间)最高提升3.5倍,并全面超越了15B参数的Phi-4-reasoning-vision基线。除此之外,该研究还贡献了七项关键实证发现,涵盖预训练数据效率、可变分辨率缩放、编解码器系统加速、VideoQA SFT冗余、运动-空间协同、AI4AI数据流水线以及多模态强化学习的零视觉SFT。这些发现为未来多模态模型的设计和优化提供了重要指导。