AI News HubLIVE
站內改寫2 分鐘閱讀

GLM 5.2 具備視覺能力

研究人員透過訓練一個僅5000萬引數的MLP投影器,成功為開源語言模型GLM 5.2新增了視覺功能,使其在MMMU-Pro上達到與Claude 4.5 Haiku相當的效能(55%)。該過程使用Kimi K2.6的視覺塔,僅訓練投影器,並在SFT和RL階段觀察到“頓悟”現象,模型甚至能識別訓練資料中未出現的人物(如史蒂芬·霍金)。

AI模型領域迎來一項令人矚目的突破:Baseten團隊成功為開源語言模型GLM 5.2新增了視覺能力,且未對其原有的純文本效能造成任何影響。這一成果的關鍵在於一個極其輕量的兩層MLP投影器,僅含5000萬引數,被訓練用於將Kimi K2.6視覺塔提取的影像特徵對映到GLM的嵌入空間中。整個過程只訓練了投影器,其餘所有引數(包括GLM骨幹網路和Kimi視覺編碼器)均保持凍結狀態。

GLM 5.2原本是頂級開源語言模型之一,但與Qwen、Kimi和Minimax等旗艦模型不同,它原生不支援影像輸入。這一限制激發了研究團隊的挑戰熱情:能否在不損害文本能力的前提下,為GLM後訓練視覺功能?答案不僅是肯定的,而且實現方式出人意料地簡潔高效。

視覺語言模型通常依賴一個名為“視覺塔”的模組處理影像。典型的視覺塔包含預處理(如卷積層將畫素分塊處理成token序列)、Transformer編碼器(採用全注意力機制,無因果掩碼)和投影器(將編碼器輸出對映到主語言模型的嵌入空間)。Kimi K2.6的視覺塔僅有4.66億引數,不到主模型的0.04%。團隊選擇它正是看中其出色的基準效能和廣泛的框架支援(Megatron、vLLM、SGLang等)。

訓練分為兩個階段:監督微調(SFT)和強化學習(RL)。在SFT階段,團隊使用66k張公開影像及其對應的簡單問答對,以64的批次大小和5e-4的學習率執行了兩個epoch。令人驚訝的是,大約在第900步(一個epoch含1035步)時,損失函式出現急劇下降,表明投影器突然“頓悟”,成功學會了影像特徵與語言空間的精確對齊。這種頓悟現象在模型訓練中極為罕見。

完成SFT後,團隊測試了模型的泛化能力:即使訓練資料中從未出現“霍金”這個名字,模型在識別史蒂芬·霍金時正確率仍達26%,其他常見回答包括愛因斯坦、理查德·費曼和奧本海默。這充分證明了投影器學到的特徵具有極強的泛化性。

不過,SFT階段的簡單問答對使模型缺乏推理能力。為恢復推理,團隊啟動了RL階段,僅訓練投影器。初始時模型幾乎不產生任何推理痕跡——前4批共512個樣本中推理次數為零。但在第5批樣本中,模型生成了第一個推理軌跡。這個單一的更新足以推動模型更頻繁地生成推理,獎勵曲線迅速攀升至0.8附近。GLM在影像語境下快速重新獲得了推理能力。

最終,具備視覺能力的GLM 5.2在MMMU-Pro基準上達到55%的準確率,與Claude 4.5 Haiku旗鼓相當。團隊已開放介面供使用者試用。這一成果證明,透過極小的附加模組和針對性訓練,可以高效地為強語言模型賦予視覺能力,同時保留其原有優勢,這為未來多模態模型的開發提供了新思路。