AI News HubLIVE
站內改寫1 分鐘閱讀

GeoSym127K:面向多模態幾何推理的可擴充套件符號可驗證合成

研究人員提出GeoSym引擎,這是一種神經符號框架,可自動生成高質量的幾何推理資料。由此產生的GeoSym127K資料集將多模態模型在依賴圖表的任務上的效能提升了超過20%。

來源arXiv Computer Vision作者: Jinhao Jing, Zheng Ma, Jinwei Liang, Qiannian Zhao, Shawn Chen, Jing Yang, Por Lip Yee, Prayag Tiwari, Jingjing Bai, Benyou Wang, Lewei Lu, Zhan Su

大型多模態模型(LMM)在幾何推理任務中常面臨視覺幻覺和缺乏精確數學思維鏈(CoT)資料的挑戰。為突破這一瓶頸,研究團隊提出了GeoSym引擎——一個自動化、可擴充套件的神經符號框架。該引擎透過型別條件語法和解析型SymGT求解器,推匯出精確的符號化真實標註,並與穩健的渲染管線無縫整合,生成高精度的幾何圖形。這種設計避免了傳統資料生成中的噪聲和模糊性,確保了標註的數學嚴密性。

基於該引擎,團隊構建了GeoSym127K資料集,包含5.1萬張高解析度影像、12.7萬個帶有符號化真實標註的問題以及5.5萬個經答案驗證的思維鏈問答對,並按難度分層(基礎、中級、高階)。同時,他們還推出了GeoSym-Bench——一個由專家精選的511個複雜樣本評測集,用於嚴格評估模型在依賴圖表和多步推理任務上的能力。該基準旨在填補現有幾何推理評測中缺乏高難度樣本的空白。

透過大規模監督微調(SFT),實驗證明GeoSym能夠顯著提升模型在依賴圖形和多步幾何任務上的表現。Qwen3-VL-8B模型在MathVerse純視覺子集上實現了22.21個百分點的絕對提升,在WeMath上達到61.52%(提升6.19%),有效緩解了長程邏輯碎片化問題,並超越了Doubao-1.8等先進閉源模型。值得注意的是,這些改進主要集中在需要視覺理解和逐步推理的任務上,而在純文本幾何問題上的提升較小,證實了GeoSym資料對圖表依賴任務的有效性。

此外,透過GRPO實現基於可驗證獎勵的強化學習(RLVR)表明,從結構化的SFT檢查點初始化要比零樣本RL顯著提高效能天花板。在確定性精確匹配訊號的驅動下,這展示了驗證推理合成的強大擴充套件潛力。研究人員還分析了不同難度層級的資料對模型效能的影響,發現高階別資料對提升複雜推理能力尤為關鍵。資料集和程式碼已在Hugging Face和GitHub公開發布,可供社群進一步研究和應用。