跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

WorldVQA:衡量多模態大語言模型中的原子世界知識

文章摘要

WorldVQA是一個新基準,用於評估多模態大語言模型在視覺世界知識上的事實準確性。它包含3500個高質量的圖像-問題對,涵蓋9個類別,重點關注頭部與尾部知識分佈。前沿模型準確率低於50%,暴露出過度自信和視覺知識差距。

來源Kimi Blog
WorldVQA:衡量多模態大語言模型中的原子世界知識
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

WorldVQA是由Kimi團隊開發的全新基準測試,旨在系統地衡量多模態大語言模型(MLLM)對視覺世界知識的事實正確性。儘管當前模型在視覺推理和描述方面取得了顯著進展,但它們在識別具體實體方面的可靠性仍是一個關鍵問題。WorldVQA的核心問題在於:模型是真的識別出它看到的特定對象,還是僅僅基於視覺模式進行幻覺?

數據集由3500個高質量的圖像-問題對組成,旨在測試模型的百科全書式知識廣度。設計遵循三條核心原則:首先,事實性與無歧義性——每個問題只有一個可驗證的正確答案,排除了主觀或模糊的場景;其次,豐富的分類法——覆蓋自然、地理、文化、物體、交通、娛樂、品牌、體育和人物等9個類別,確保世界知識的廣泛覆蓋;最後,頭部與尾部分佈——明確區分常見知識和罕見的長尾知識,從而衡量模型性能隨知識難度下降的程度。所有圖像和問答對都經過了嚴格的多階段人工驗證,以消除噪音和歧義。

實驗結果揭示了令人警醒的現狀:WorldVQA對前沿模型構成了重大挑戰。即使是最先進的模型,在長尾視覺知識上的準確率也經常低於50%。例如,Kimi K2.5的整體準確率為46.3%,Gemini-3-pro為47.4%,而其他模型如GPT-5.2、Claude-opus-4.5等則更低。在九個類別中,模型在體育、品牌和人物類別上表現較好,但在自然、文化和娛樂類別上準確率較低。

除了準確性,研究還測量了模型的校準能力,即主觀置信度與實際準確率的對齊程度。所有評估模型都顯示出普遍的過度自信趨勢。Kimi K2.5在校準指標上表現最佳,預期校準誤差(ECE)為37.9%,加權平均斜率(Slope)為0.550,但距離理想狀態仍存在顯著差距。這表明增強多模態模型的自我認知邊界是未來研究的關鍵方向。

WorldVQA是一個簡單但有挑戰性的基準,提升其表現是下一代AI代理的必要步驟。研究團隊已開源WorldVQA數據集和評估腳本,以幫助社區解決視覺知識差距。論文和代碼分別可在arXiv和GitHub上獲取。

展開要點與分析

文章情報

工程師進階

要點

  • WorldVQA基準測試多模態大語言模型的原子視覺世界知識,使用3500個高質量的圖像-問題對。
  • 模型表現顯著掙扎,頂級模型準確率低於50%,尤其在長尾知識上表現更差。
  • 數據集強調事實性、豐富分類法和頭尾分佈,以測量知識差距。
  • 評估顯示模型普遍過度自信,Kimi K2.5表現最佳但仍遠未達到理想狀態。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。