本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

WorldVQA:マルチモーダル大規模言語モデルにおける原子世界知識の測定

記事の要約

WorldVQAは、マルチモーダル大規模言語モデルの視覚的世界知識に関する事実的正確性を評価する新しいベンチマークです。3,500の高品質な画像-質問ペアから構成され、9カテゴリをカバーし、ヘッドとテールの知識分布に焦点を当てています。最先端モデルでも50%未満の精度にとどまり、過信と視覚知識のギャップが明らかになりました。

ソースKimi Blog
WorldVQA:マルチモーダル大規模言語モデルにおける原子世界知識の測定
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

WorldVQAは、Kimiチームによって開発された新しいベンチマークであり、マルチモーダル大規模言語モデル(MLLM)が視覚的世界知識に関して事実的に正しいかどうかを体系的に測定することを目的としています。最近のモデルは視覚的推論と記述において印象的な能力を示していますが、具体的なエンティティを認識する信頼性は依然として課題です。WorldVQAの核心的な問いは、モデルが実際に見た対象を認識しているのか、それとも視覚パターンに基づいて幻覚を起こしているのかという点です。

データセットは3,500の高品質な画像-質問ペアで構成され、モデルの百科事典的な知識の広さをテストします。設計は3つの基本原則に従っています:第一に、事実性と曖昧さの排除——各質問には検証可能な単一の正解があり、主観的または曖昧なシナリオは除外されます。第二に、豊富な分類法——自然、地理、文化、物体、交通、エンターテイメント、ブランド、スポーツ、有名人の9カテゴリをカバーし、世界知識の広範な網羅を確保します。第三に、ヘッドとテールの分布——一般的な知識(ヘッド)と希少な長尾知識(テール)を明確に分離し、知識が曖昧になるにつれてモデルのパフォーマンスがどのように低下するかを測定します。すべての画像と質問応答ペアは、ノイズと曖昧さを取り除くために厳格な多段階の人間による検証を受けています。

実験結果は憂慮すべき現状を明らかにしています:WorldVQAは最先端モデルにとって大きな課題であり、長尾視覚知識では最も優れたモデルでも精度が50%を下回ることがよくあります。例えば、Kimi K2.5の全体精度は46.3%、Gemini-3-proは47.4%であり、GPT-5.2やClaude-opus-4.5などの他のモデルはさらに低い結果でした。9つのカテゴリでは、スポーツ、ブランド、有名人で比較的高い精度を示す一方、自然、文化、エンターテイメントでは低い精度でした。

精度に加えて、研究ではモデルのキャリブレーション(主観的自信と実際の精度の一致)も測定しました。評価されたすべてのモデルは普遍的な過信傾向を示し、Kimi K2.5がキャリブレーション指標で最良の結果(ECE 37.9%、Slope 0.550)を記録しましたが、理想的な状態には依然として大きなギャップがあります。このことは、マルチモーダルモデルの自己認識境界を強化することが将来の重要な研究方向であることを示しています。

WorldVQAはシンプルでありながら挑戦的なベンチマークであり、そのパフォーマンス向上は次世代AIエージェントにとって必要不可欠なステップです。研究チームは、コミュニティが視覚知識ギャップに対処するのを支援するために、WorldVQAデータセットと評価スクリプトをオープンソース化しています。論文とコードはそれぞれarXivとGitHubで入手可能です。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • WorldVQAベンチマークは、3,500の高品質な画像-質問ペアを使用して、マルチモーダルLLMの原子的視覚世界知識をテストします。
  • モデルは著しく苦戦し、トップモデルでも50%未満の精度であり、特に長尾知識でパフォーマンスが低下します。
  • データセットは、事実性、豊富な分類法、ヘッド・テール分布を重視し、知識ギャップを測定します。
  • 評価により、モデルは普遍的に過信する傾向があり、Kimi K2.5が最良の結果を示すものの、理想からは程遠いことが明らかになりました。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。