AI News HubLIVE
站內改寫1 分鐘閱讀

CurveBench:嵌套喬丹曲線精確拓撲推理基準

CurveBench是一個用於評估AI視覺拓撲推理能力的新基準。它包含756張嵌套喬丹曲線圖像,要求模型重建包含關係樹。最強模型Gemini 3.1 Pro在簡單集上準確率為71.1%,在困難集上僅為19.1%。通過RLVR微調,Qwen3-VL-8B在簡單集上從2.8%提升至33.3%,超過了GPT-5.4和Claude Opus 4.5。然而,該任務仍未完全解決。

來源arXiv Computer Vision作者: Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian, Naser Talebizadeh Saradari

近日,研究人員發佈了一項名為“CurveBench”的新基準測試,專門用於評估人工智能模型在視覺層次拓撲推理方面的能力。該基準由756張成對不相交的喬丹曲線圖像組成,涵蓋了五種不同的配置:簡單、多邊形、地形、迷宮和密集計數。每一張圖像都附帶了一棵根樹註釋,用於編碼平面區域之間的包含關係。任務被定義為結構預測:給定一張圖像,模型必須恢復由曲線誘導的完整根包含樹結構。

儘管這個任務在視覺上看似簡單,但目前的頂尖模型表現卻並不理想。評估中表現最好的模型——Gemini 3.1 Pro——在CurveBench的簡單子集(Easy)上僅達到71.1%的樹生成準確率,而在困難子集(Hard)上更是低至19.1%。這一結果凸顯了當前視覺語言模型在處理精確拓撲關係方面的根本性侷限。

為了進一步探索該基準的實用性,研究人員採用了強化學習與視覺推理(RLVR)風格的微調方法,對開放權重的視覺語言模型進行訓練。經過微調的Qwen3-VL-8B模型在CurveBench-Easy上的準確率從2.8%躍升至33.3%,甚至超過了GPT-5.4和Claude Opus 4.5。然而,在CurveBench-Hard上,模型的表現仍然遠不理想,這表明精確的拓撲感知視覺推理仍然是一個尚未解決的重要問題。值得注意的是,CurveBench-Hard包含更復雜的曲線配置,例如密集計數和迷宮形狀,這些配置要求模型具備更高的層次化視覺理解能力。

CurveBench的提出為AI視覺拓撲推理提供了一個標準化的評估平台,揭示了現有模型在層次化空間關係理解方面的明顯不足。未來,這一基準有望推動新的拓撲推理算法的發展,從而提升AI對複雜視覺場景的精細理解能力。同時,該基準也為強化學習與視覺推理的結合提供了新的實驗場,推動更高效、更魯棒的視覺推理模型的出現。