PerceptionBench:評估多模態大語言模型的原子視覺感知能力
PerceptionBench 是一個全新基準測試,專注於隔離和評估多模態大語言模型的原子視覺感知能力。該基準從 42 個現有基準中的模型失敗模式中歸納出 10 種原子感知能力,並構建了 3000 個經人工驗證的問題。測試顯示,頂尖模型均未達到 60% 的準確率,且感知相關的幻覺是平均最弱的能力。PerceptionBench 旨在精確診斷視覺感知的薄弱環節,推動多模態 AI 實現可靠且一致的視覺理解。
Kimi 團隊近日釋出了 PerceptionBench,這是一個旨在精準評估多模態大語言模型(MLLMs)原子視覺感知能力的新基準。與以往側重整體效能的基準不同,PerceptionBench 致力於將視覺感知分解為一系列基礎能力,並逐一進行嚴格測試。
該基準的獨特之處在於其分類體系並非預先定義,而是從模型的實際失敗中歸納而來。研究團隊分析了 42 個現有基準中前沿模型的所有錯誤,追溯至最早的失誤步驟,最終總結出 10 種原子感知能力:視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR 和幻覺。基於這一分類,團隊構建了一個包含 3000 個經人工驗證問題的測試集,其中 60% 的問題源自對模型失敗案例的分解,40% 為全新編寫。每個問題都嚴格設計為僅依賴視覺感知即可作答,無需任何推理或外部知識。
PerceptionBench 的評估結果令人深思。在 16 個前沿多模態大語言模型中,沒有任何模型達到 60% 的準確率。平均而言,與感知相關的幻覺是最弱的能力。值得注意的是,整體得分幾乎相同的模型,其實際感知能力可能存在顯著差異。這表明,僅依賴綜合得分無法全面反映模型在視覺感知方面的真實缺陷。
基準中包含了多種型別的問題示例。例如,在視覺定位任務中,模型需要根據鐘錶上 Gemini 符號的位置回答具體時刻;在深度與 3D 任務中,模型需判斷場景中物體前後的遠近關係;在幻覺任務中,模型則需準確回答影像中實際不存在的物體數量。這些問題看似簡單,卻對模型的視覺感知能力構成了嚴峻挑戰。
PerceptionBench 的開發團隊強調,單一基準或少數幾個基準只能捕捉感知錯誤的狹小片段,且這些片段之間重疊有限(平均成對加權 Jaccard 係數僅為 0.20)。因此,一個以能力為中心的、能聚合並平衡這些碎片化視角的基準至關重要。透過提供一個標準化的測評框架,PerceptionBench 有望推動多模態 AI 在視覺感知領域取得實質性進步。
目前,PerceptionBench 的資料集和評估程式碼已在 GitHub 上開源,供全球研究人員使用。團隊希望這一基準能夠幫助社群更好地理解和解決視覺感知的瓶頸問題,最終實現更可靠、更一致的多模態視覺理解。