統一像素令牌和詞令牌的生成語言模型
研究人員提出了一種新的生成語言模型,將像素令牌和詞令牌統一起來,解決了當前視覺Transformer在細節理解上的侷限性,如難以識別圖像中的小文字或數字。該模型具有每個像素獨立令牌嵌入、顏色摺疊、全局條件注意力近似和無監督預訓練等特點,即使在小型模型和有限數據下也表現出良好性能,並符合縮放定律。
研究人員Haun Leung和ZiNan Wang近日在arXiv上提交了一篇論文,提出了一種名為“Unified Pix Token And Word Token Generative Language Model”的新架構,旨在解決當前視覺Transformer(ViT)在細節理解上的不足。自ViT問世以來,它被廣泛應用於生成語言模型和生成視覺模型中,特別是在當前最先進的開源多模態模型中,通過CLIP或SigLIP方法獲得的ViT常作為視覺編碼器骨幹網絡,幫助模型獲取視覺理解能力。然而,這種方法在細節理解上存在侷限性,例如難以準確識別圖像中的小文字或數字。為了克服這些挑戰,新模型將圖像中的每一個像素視為獨立的令牌,併為每個像素分配單獨的嵌入向量,同時引入顏色摺疊(color folding)和全局條件注意力近似(global conditional attention approximation)機制,從而更精細地捕捉視覺信息。此外,模型還採用圖像無監督預訓練方法,無需人工標註即可學習視覺表示。研究團隊使用新模型進行了圖像無監督預訓練實驗,以探索其潛力。實驗結果表明,即使在參數規模較小和訓練數據有限的情況下,該模型也能取得良好效果。這表明模型具有高效的特徵學習能力,能夠從有限的數據中提取有價值的視覺特徵。研究團隊相信,該模型符合縮放定律(scaling law),隨着模型參數和訓練數據的增加,其性能將持續提升。這一發現對於推動多模態人工智能的發展具有重要意義,特別是在圖像理解、文檔分析和自動駕駛等需要精細視覺感知的領域。論文還包括13頁正文和6幅圖表,提交於2026年5月13日,目前可在arXiv上獲取全文。