AI News HubLIVE
站內改寫1 分鐘閱讀

統一畫素令牌和詞令牌的生成語言模型

研究人員提出了一種新的生成語言模型,將畫素令牌和詞令牌統一起來,解決了當前視覺Transformer在細節理解上的侷限性,如難以識別影像中的小文字或數字。該模型具有每個畫素獨立令牌嵌入、顏色摺疊、全域性條件注意力近似和無監督預訓練等特點,即使在小型模型和有限資料下也表現出良好效能,並符合縮放定律。

來源arXiv Computer Vision作者: Haun Leung, ZiNan Wang

研究人員Haun Leung和ZiNan Wang近日在arXiv上提交了一篇論文,提出了一種名為“Unified Pix Token And Word Token Generative Language Model”的新架構,旨在解決當前視覺Transformer(ViT)在細節理解上的不足。自ViT問世以來,它被廣泛應用於生成語言模型和生成視覺模型中,特別是在當前最先進的開源多模態模型中,透過CLIP或SigLIP方法獲得的ViT常作為視覺編碼器骨幹網路,幫助模型獲取視覺理解能力。然而,這種方法在細節理解上存在侷限性,例如難以準確識別影像中的小文字或數字。為了克服這些挑戰,新模型將影像中的每一個畫素視為獨立的令牌,併為每個畫素分配單獨的嵌入向量,同時引入顏色摺疊(color folding)和全域性條件注意力近似(global conditional attention approximation)機制,從而更精細地捕捉視覺資訊。此外,模型還採用影像無監督預訓練方法,無需人工標註即可學習視覺表示。研究團隊使用新模型進行了影像無監督預訓練實驗,以探索其潛力。實驗結果表明,即使在引數規模較小和訓練資料有限的情況下,該模型也能取得良好效果。這表明模型具有高效的特徵學習能力,能夠從有限的資料中提取有價值的視覺特徵。研究團隊相信,該模型符合縮放定律(scaling law),隨著模型引數和訓練資料的增加,其效能將持續提升。這一發現對於推動多模態人工智慧的發展具有重要意義,特別是在影像理解、文件分析和自動駕駛等需要精細視覺感知的領域。論文還包括13頁正文和6幅圖表,提交於2026年5月13日,目前可在arXiv上獲取全文。