统一像素令牌和词令牌的生成语言模型
研究人员提出了一种新的生成语言模型,将像素令牌和词令牌统一起来,解决了当前视觉Transformer在细节理解上的局限性,如难以识别图像中的小文字或数字。该模型具有每个像素独立令牌嵌入、颜色折叠、全局条件注意力近似和无监督预训练等特点,即使在小型模型和有限数据下也表现出良好性能,并符合缩放定律。
研究人员Haun Leung和ZiNan Wang近日在arXiv上提交了一篇论文,提出了一种名为“Unified Pix Token And Word Token Generative Language Model”的新架构,旨在解决当前视觉Transformer(ViT)在细节理解上的不足。自ViT问世以来,它被广泛应用于生成语言模型和生成视觉模型中,特别是在当前最先进的开源多模态模型中,通过CLIP或SigLIP方法获得的ViT常作为视觉编码器骨干网络,帮助模型获取视觉理解能力。然而,这种方法在细节理解上存在局限性,例如难以准确识别图像中的小文字或数字。为了克服这些挑战,新模型将图像中的每一个像素视为独立的令牌,并为每个像素分配单独的嵌入向量,同时引入颜色折叠(color folding)和全局条件注意力近似(global conditional attention approximation)机制,从而更精细地捕捉视觉信息。此外,模型还采用图像无监督预训练方法,无需人工标注即可学习视觉表示。研究团队使用新模型进行了图像无监督预训练实验,以探索其潜力。实验结果表明,即使在参数规模较小和训练数据有限的情况下,该模型也能取得良好效果。这表明模型具有高效的特征学习能力,能够从有限的数据中提取有价值的视觉特征。研究团队相信,该模型符合缩放定律(scaling law),随着模型参数和训练数据的增加,其性能将持续提升。这一发现对于推动多模态人工智能的发展具有重要意义,特别是在图像理解、文档分析和自动驾驶等需要精细视觉感知的领域。论文还包括13页正文和6幅图表,提交于2026年5月13日,目前可在arXiv上获取全文。