WorldVQAは、Kimiチームによって開発された新しいベンチマークであり、マルチモーダル大規模言語モデル(MLLM)が視覚的世界知識に関して事実的に正しいかどうかを体系的に測定することを目的としています。最近のモデルは視覚的推論と記述において印象的な能力を示していますが、具体的なエンティティを認識する信頼性は依然として課題です。WorldVQAの核心的な問いは、モデルが実際に見た対象を認識しているのか、それとも視覚パターンに基づいて幻覚を起こしているのかという点です。
データセットは3,500の高品質な画像-質問ペアで構成され、モデルの百科事典的な知識の広さをテストします。設計は3つの基本原則に従っています:第一に、事実性と曖昧さの排除——各質問には検証可能な単一の正解があり、主観的または曖昧なシナリオは除外されます。第二に、豊富な分類法——自然、地理、文化、物体、交通、エンターテイメント、ブランド、スポーツ、有名人の9カテゴリをカバーし、世界知識の広範な網羅を確保します。第三に、ヘッドとテールの分布——一般的な知識(ヘッド)と希少な長尾知識(テール)を明確に分離し、知識が曖昧になるにつれてモデルのパフォーマンスがどのように低下するかを測定します。すべての画像と質問応答ペアは、ノイズと曖昧さを取り除くために厳格な多段階の人間による検証を受けています。
実験結果は憂慮すべき現状を明らかにしています:WorldVQAは最先端モデルにとって大きな課題であり、長尾視覚知識では最も優れたモデルでも精度が50%を下回ることがよくあります。例えば、Kimi K2.5の全体精度は46.3%、Gemini-3-proは47.4%であり、GPT-5.2やClaude-opus-4.5などの他のモデルはさらに低い結果でした。9つのカテゴリでは、スポーツ、ブランド、有名人で比較的高い精度を示す一方、自然、文化、エンターテイメントでは低い精度でした。
精度に加えて、研究ではモデルのキャリブレーション(主観的自信と実際の精度の一致)も測定しました。評価されたすべてのモデルは普遍的な過信傾向を示し、Kimi K2.5がキャリブレーション指標で最良の結果(ECE 37.9%、Slope 0.550)を記録しましたが、理想的な状態には依然として大きなギャップがあります。このことは、マルチモーダルモデルの自己認識境界を強化することが将来の重要な研究方向であることを示しています。
WorldVQAはシンプルでありながら挑戦的なベンチマークであり、そのパフォーマンス向上は次世代AIエージェントにとって必要不可欠なステップです。研究チームは、コミュニティが視覚知識ギャップに対処するのを支援するために、WorldVQAデータセットと評価スクリプトをオープンソース化しています。論文とコードはそれぞれarXivとGitHubで入手可能です。