AI News HubLIVE
サイト内リライト2 分で読了

GeoSym127K: マルチモーダル幾何推論のためのスケーラブルな記号検証可能合成

研究者らは、高品質な幾何推論データを自動生成する神経記号フレームワークGeoSym Engineを提案。生成されたGeoSym127Kデータセットにより、図に依存するタスクにおけるLMMの性能が20%以上向上しました。

ソースarXiv Computer Vision著者: Jinhao Jing, Zheng Ma, Jinwei Liang, Qiannian Zhao, Shawn Chen, Jing Yang, Por Lip Yee, Prayag Tiwari, Jingjing Bai, Benyou Wang, Lewei Lu, Zhan Su

大規模マルチモーダルモデル(LMM)は幾何推論において、視覚的幻覚や数学的に正確な思考連鎖(CoT)データの欠如にしばしば直面します。この課題に対処するため、研究チームはGeoSym Engineを提案しました。これは自動化されたスケーラブルな神経記号フレームワークです。型条件付き文法と解析的SymGTソルバーを活用し、正確な記号グラウンドトゥルースを導出し、堅牢なレンダリングパイプラインと統合して高精度の幾何図形を生成します。この設計により、従来のデータ生成におけるノイズや曖昧さを排除し、数学的に厳密なアノテーションを実現します。

このエンジンを用いて、GeoSym127Kデータセットが構築されました。51Kの高解像度画像、127Kの記号グラウンドトゥルース付き質問、55Kの回答検証済みCoT QAペアを含み、難易度別(基礎、中級、上級)に階層化されています。また、厳格な評価のための専門家厳選の511サンプルセット、GeoSym-Benchも導入されました。このベンチマークは、図依存および多段階推論タスクにおけるモデルの能力を厳密に評価するために設計されており、既存の幾何推論ベンチマークでは不足していた高難易度サンプルを補完します。

広範な教師ありファインチューニング(SFT)実験により、GeoSymが特に図依存および多段階幾何タスクにおいて集中した改善をもたらすことが実証されました。Qwen3-VL-8BモデルはMathVerse Vision-Onlyサブセットで絶対値+22.21%の向上を達成し、WeMathで61.52%(+6.19%改善)に達し、長距離論理断片化を軽減し、Doubao-1.8などの高度なクローズドソースモデルを上回りました。これらの改善は主に視覚的理解と段階的推論を必要とするタスクで見られ、テキストのみの幾何問題での向上は小さく、GeoSymデータが図依存タスクに有効であることを確認しました。

さらに、GRPOによる検証可能報酬を用いた強化学習(RLVR)では、構造化SFTチェックポイントからの初期化がゼロショットRLよりも性能上限を大幅に引き上げることが明らかになりました。決定論的な完全一致信号に駆動され、検証可能な推論合成の堅牢なスケーリングポテンシャルを示しています。研究者らはまた、難易度別データがモデル性能に与える影響を分析し、上級データが複雑な推論能力の向上に特に重要であることを発見しました。データセットとコードはHugging FaceとGitHubで公開されており、コミュニティによるさらなる研究と応用が可能です。