AI News HubLIVE
站内改写2 分钟阅读

GLM 5.2 具备视觉能力

研究人员通过训练一个仅5000万参数的MLP投影器,成功为开源语言模型GLM 5.2添加了视觉功能,使其在MMMU-Pro上达到与Claude 4.5 Haiku相当的性能(55%)。该过程使用Kimi K2.6的视觉塔,仅训练投影器,并在SFT和RL阶段观察到“顿悟”现象,模型甚至能识别训练数据中未出现的人物(如史蒂芬·霍金)。

AI模型领域迎来一项令人瞩目的突破:Baseten团队成功为开源语言模型GLM 5.2添加了视觉能力,且未对其原有的纯文本性能造成任何影响。这一成果的关键在于一个极其轻量的两层MLP投影器,仅含5000万参数,被训练用于将Kimi K2.6视觉塔提取的图像特征映射到GLM的嵌入空间中。整个过程只训练了投影器,其余所有参数(包括GLM骨干网络和Kimi视觉编码器)均保持冻结状态。

GLM 5.2原本是顶级开源语言模型之一,但与Qwen、Kimi和Minimax等旗舰模型不同,它原生不支持图像输入。这一限制激发了研究团队的挑战热情:能否在不损害文本能力的前提下,为GLM后训练视觉功能?答案不仅是肯定的,而且实现方式出人意料地简洁高效。

视觉语言模型通常依赖一个名为“视觉塔”的模块处理图像。典型的视觉塔包含预处理(如卷积层将像素分块处理成token序列)、Transformer编码器(采用全注意力机制,无因果掩码)和投影器(将编码器输出映射到主语言模型的嵌入空间)。Kimi K2.6的视觉塔仅有4.66亿参数,不到主模型的0.04%。团队选择它正是看中其出色的基准性能和广泛的框架支持(Megatron、vLLM、SGLang等)。

训练分为两个阶段:监督微调(SFT)和强化学习(RL)。在SFT阶段,团队使用66k张公开图像及其对应的简单问答对,以64的批量大小和5e-4的学习率运行了两个epoch。令人惊讶的是,大约在第900步(一个epoch含1035步)时,损失函数出现急剧下降,表明投影器突然“顿悟”,成功学会了图像特征与语言空间的精确对齐。这种顿悟现象在模型训练中极为罕见。

完成SFT后,团队测试了模型的泛化能力:即使训练数据中从未出现“霍金”这个名字,模型在识别史蒂芬·霍金时正确率仍达26%,其他常见回答包括爱因斯坦、理查德·费曼和奥本海默。这充分证明了投影器学到的特征具有极强的泛化性。

不过,SFT阶段的简单问答对使模型缺乏推理能力。为恢复推理,团队启动了RL阶段,仅训练投影器。初始时模型几乎不产生任何推理痕迹——前4批共512个样本中推理次数为零。但在第5批样本中,模型生成了第一个推理轨迹。这个单一的更新足以推动模型更频繁地生成推理,奖励曲线迅速攀升至0.8附近。GLM在图像语境下快速重新获得了推理能力。

最终,具备视觉能力的GLM 5.2在MMMU-Pro基准上达到55%的准确率,与Claude 4.5 Haiku旗鼓相当。团队已开放接口供用户试用。这一成果证明,通过极小的附加模块和针对性训练,可以高效地为强语言模型赋予视觉能力,同时保留其原有优势,这为未来多模态模型的开发提供了新思路。