AI News HubLIVE
サイト内リライト1 分で読了

ピクセルトークンとワードトークンを統合した生成言語モデル

研究者らは、現在のVision Transformerが持つ画像内の小さな文字や数字の認識困難などの詳細理解の限界を克服するため、ピクセルトークンとワードトークンを統合した新しい生成言語モデルを提案した。このモデルは、ピクセルごとのトークン埋め込み、カラーフォールディング、グローバル条件付き注意近似、教師なし事前学習などの特徴を持つ。小規模モデルや限られたデータでも良好な性能を示し、スケーリング則に従うことが実験で確認された。

ソースarXiv Computer Vision著者: Haun Leung, ZiNan Wang

研究者のHaun Leung氏とZiNan Wang氏は、arXivにて「Unified Pix Token And Word Token Generative Language Model」と題する論文を発表し、現在のVision Transformer(ViT)が抱える画像の詳細理解の限界を克服する新しい生成言語モデルを提案した。ViTは、CLIPやSigLIPなどの手法でマルチモーダルモデルの視覚エンコーダとして広く利用されており、画像認識能力を向上させてきた。しかし、これらの手法では画像内の小さな文字や数字を正確に認識することが難しく、詳細な視覚理解に限界があった。新モデルでは、画像の各ピクセルを独立したトークンとして扱い、それぞれに個別の埋め込みベクトルを割り当てる。さらに、カラーフォールディング(color folding)やグローバル条件付き注意近似(global conditional attention approximation)の機構を導入し、より細かい視覚情報を捉えることを可能にした。また、教師なし事前学習手法を採用し、人間によるラベル付けなしで視覚表現を学習する。研究チームは、新しいモデルを用いて画像の教師なし事前学習実験を行い、その可能性を探った。実験結果は、パラメータ数が小さく、トレーニングデータが限られている状況でも良好な性能を示した。これは、モデルが限られたデータから効率的に特徴を学習できることを示している。研究チームは、このモデルがスケーリング則に従い、パラメータとデータの増加に伴って性能が向上し続けると確信している。この発見は、画像理解、文書解析、自動運転など、細かい視覚認識が必要な分野でのマルチモーダルAIの発展に重要な意味を持つ。論文は13ページ、6図から構成され、2026年5月13日に提出され、現在arXivで全文を閲覧できる。