AI News HubLIVE
站內改寫2 分鐘閱讀

GLM 5.2 具備視覺能力

研究人員通過訓練一個僅5000萬參數的MLP投影器,成功為開源語言模型GLM 5.2添加了視覺功能,使其在MMMU-Pro上達到與Claude 4.5 Haiku相當的性能(55%)。該過程使用Kimi K2.6的視覺塔,僅訓練投影器,並在SFT和RL階段觀察到“頓悟”現象,模型甚至能識別訓練數據中未出現的人物(如史蒂芬·霍金)。

AI模型領域迎來一項令人矚目的突破:Baseten團隊成功為開源語言模型GLM 5.2添加了視覺能力,且未對其原有的純文本性能造成任何影響。這一成果的關鍵在於一個極其輕量的兩層MLP投影器,僅含5000萬參數,被訓練用於將Kimi K2.6視覺塔提取的圖像特徵映射到GLM的嵌入空間中。整個過程只訓練了投影器,其餘所有參數(包括GLM骨幹網絡和Kimi視覺編碼器)均保持凍結狀態。

GLM 5.2原本是頂級開源語言模型之一,但與Qwen、Kimi和Minimax等旗艦模型不同,它原生不支持圖像輸入。這一限制激發了研究團隊的挑戰熱情:能否在不損害文本能力的前提下,為GLM後訓練視覺功能?答案不僅是肯定的,而且實現方式出人意料地簡潔高效。

視覺語言模型通常依賴一個名為“視覺塔”的模塊處理圖像。典型的視覺塔包含預處理(如卷積層將像素分塊處理成token序列)、Transformer編碼器(採用全注意力機制,無因果掩碼)和投影器(將編碼器輸出映射到主語言模型的嵌入空間)。Kimi K2.6的視覺塔僅有4.66億參數,不到主模型的0.04%。團隊選擇它正是看中其出色的基準性能和廣泛的框架支持(Megatron、vLLM、SGLang等)。

訓練分為兩個階段:監督微調(SFT)和強化學習(RL)。在SFT階段,團隊使用66k張公開圖像及其對應的簡單問答對,以64的批量大小和5e-4的學習率運行了兩個epoch。令人驚訝的是,大約在第900步(一個epoch含1035步)時,損失函數出現急劇下降,表明投影器突然“頓悟”,成功學會了圖像特徵與語言空間的精確對齊。這種頓悟現象在模型訓練中極為罕見。

完成SFT後,團隊測試了模型的泛化能力:即使訓練數據中從未出現“霍金”這個名字,模型在識別史蒂芬·霍金時正確率仍達26%,其他常見回答包括愛因斯坦、理查德·費曼和奧本海默。這充分證明了投影器學到的特徵具有極強的泛化性。

不過,SFT階段的簡單問答對使模型缺乏推理能力。為恢復推理,團隊啓動了RL階段,僅訓練投影器。初始時模型幾乎不產生任何推理痕跡——前4批共512個樣本中推理次數為零。但在第5批樣本中,模型生成了第一個推理軌跡。這個單一的更新足以推動模型更頻繁地生成推理,獎勵曲線迅速攀升至0.8附近。GLM在圖像語境下快速重新獲得了推理能力。

最終,具備視覺能力的GLM 5.2在MMMU-Pro基準上達到55%的準確率,與Claude 4.5 Haiku旗鼓相當。團隊已開放接口供用户試用。這一成果證明,通過極小的附加模塊和針對性訓練,可以高效地為強語言模型賦予視覺能力,同時保留其原有優勢,這為未來多模態模型的開發提供了新思路。