WorldVQA是由Kimi團隊開發的全新基準測試,旨在系統地衡量多模態大語言模型(MLLM)對視覺世界知識的事實正確性。儘管當前模型在視覺推理和描述方面取得了顯著進展,但它們在識別具體實體方面的可靠性仍是一個關鍵問題。WorldVQA的核心問題在於:模型是真的識別出它看到的特定物件,還是僅僅基於視覺模式進行幻覺?
資料集由3500個高質量的影像-問題對組成,旨在測試模型的百科全書式知識廣度。設計遵循三條核心原則:首先,事實性與無歧義性——每個問題只有一個可驗證的正確答案,排除了主觀或模糊的場景;其次,豐富的分類法——覆蓋自然、地理、文化、物體、交通、娛樂、品牌、體育和人物等9個類別,確保世界知識的廣泛覆蓋;最後,頭部與尾部分佈——明確區分常見知識和罕見的長尾知識,從而衡量模型效能隨知識難度下降的程度。所有影像和問答對都經過了嚴格的多階段人工驗證,以消除噪音和歧義。
實驗結果揭示了令人警醒的現狀:WorldVQA對前沿模型構成了重大挑戰。即使是最先進的模型,在長尾視覺知識上的準確率也經常低於50%。例如,Kimi K2.5的整體準確率為46.3%,Gemini-3-pro為47.4%,而其他模型如GPT-5.2、Claude-opus-4.5等則更低。在九個類別中,模型在體育、品牌和人物類別上表現較好,但在自然、文化和娛樂類別上準確率較低。
除了準確性,研究還測量了模型的校準能力,即主觀置信度與實際準確率的對齊程度。所有評估模型都顯示出普遍的過度自信趨勢。Kimi K2.5在校準指標上表現最佳,預期校準誤差(ECE)為37.9%,加權平均斜率(Slope)為0.550,但距離理想狀態仍存在顯著差距。這表明增強多模態模型的自我認知邊界是未來研究的關鍵方向。
WorldVQA是一個簡單但有挑戰性的基準,提升其表現是下一代AI代理的必要步驟。研究團隊已開源WorldVQA資料集和評估指令碼,以幫助社群解決視覺知識差距。論文和程式碼分別可在arXiv和GitHub上獲取。