Mage-VL:一种高效的编解码器原生流式多模态基础模型
Mage-VL是一种新型流式多模态基础模型,通过自定义Mage-ViT分词器(利用运动向量和残差能量选择性编码动态区域)减少75%以上视觉令牌消耗,并采用双系统架构实现实时感知。在多项任务上匹配或超越更大模型,推理速度提升3.5倍。
标准视觉语言模型(VLM)面临一个被称为莫拉维克悖论的困境:它们擅长处理复杂的离线视觉推理任务,例如图像描述或视觉问答,但在面对简单的流式感知任务(如实时视频分析)时却表现不佳,且处理效率低下。这种矛盾源于传统VLM对均匀帧采样的依赖,导致其在处理视频流时产生大量冗余的视觉令牌,增加了计算负担。为了解决这一问题,研究团队提出了Mage-VL,一种高效的编解码器原生流式基础模型,专为实时多模态理解和交互设计。
Mage-VL的核心创新在于其自定义的分词器Mage-ViT。与传统的均匀帧采样不同,Mage-ViT通过利用运动向量和残差能量,在稀疏的锚点帧(I帧)和预测帧(P帧)之间选择性地编码动态、熵丰富的区域。这种操作在16×16的区块级别上进行,能够在保留时空上下文的同时,将视觉令牌消耗减少超过75%。Mage-ViT从零开始训练,使用了大约5.6亿张无标签图像和1亿个无标签视频帧,其性能与在数十亿图像-文本对上训练的旗舰编码器相当甚至更优。
除了分词器,Mage-VL还引入了一种受生物启发的双系统架构。该架构包含一个轻量级的System 1事件门(用于快速检测流式输入中的重要事件)和一个因果的System 2解码器(用于深度推理和生成响应)。这种设计使Mage-VL能够实现主动流式感知,即在处理实时数据时能够主动识别关键事件并进行高效推理。
在训练方面,研究团队建立了AI4AI数据流水线,其中包括提示-代码联合优化用于多模态字幕生成,以及AI驱动的性能诊断来指导训练策略。这些创新使得Mage-VL在训练效率和模型性能上均取得了显著提升。
广泛的评估结果表明,Mage-VL-4B在静态任务上与Qwen3-VL-4B匹敌,同时视频理解和2D/3D空间推理能力大幅提升,推理速度(墙钟时间)最高提升3.5倍,并全面超越了15B参数的Phi-4-reasoning-vision基线。除此之外,该研究还贡献了七项关键实证发现,涵盖预训练数据效率、可变分辨率缩放、编解码器系统加速、VideoQA SFT冗余、运动-空间协同、AI4AI数据流水线以及多模态强化学习的零视觉SFT。这些发现为未来多模态模型的设计和优化提供了重要指导。