CurveBench:入れ子になったジョルダン曲線に対する正確なトポロジカル推論のベンチマーク
CurveBenchは、AIの視覚的トポロジカル推論を評価するための新しいベンチマークです。756枚の入れ子ジョルダン曲線画像から構成され、モデルは包含関係の木を再構築する必要があります。最強モデルGemini 3.1 Proでも、Easyで71.1%、Hardで19.1%の精度にとどまります。RLVRファインチューニングによりQwen3-VL-8BはEasyで2.8%から33.3%に向上し、GPT-5.4やClaude Opus 4.5を上回りました。しかし、この課題は依然として解決にはほど遠いです。
研究者らは、視覚入力からの階層的トポロジカル推論を評価する新しいベンチマーク「CurveBench」を発表しました。CurveBenchは、ペアごとに交差しない756枚のジョルダン曲線画像で構成され、簡単、多角形、地形風、迷路、密集カウントの5つの構成をカバーしています。各画像には、平面領域間の包含関係を符号化した根付き木が注釈として付与されています。タスクは構造予測として定式化されており、モデルは画像から曲線によって誘導される完全な根付き包含木を復元する必要があります。
このタスクは視覚的には単純に見えますが、現在の最先端モデルでも十分な性能を示せていません。評価された中で最強のモデルであるGemini 3.1 Proは、CurveBench-Easyで71.1%、CurveBench-Hardで19.1%の木生成精度しか達成できませんでした。これは、現在の視覚言語モデルが正確なトポロジカル関係を処理する際に根本的な限界があることを示しています。
さらに研究者らは、RLVR(強化学習と視覚推論)スタイルのファインチューニングをオープンウェイトの視覚言語モデルに適用し、ベンチマークの有用性を実証しました。ファインチューニングされたQwen3-VL-8Bモデルは、CurveBench-Easyで2.8%から33.3%に精度が向上し、GPT-5.4やClaude Opus 4.5を上回る結果を示しました。しかし、CurveBench-Hardでは依然として大きなギャップが残っており、正確なトポロジー認識型視覚推論はまだ解決にはほど遠いことが明らかになりました。
CurveBenchは、AIの視覚的トポロジカル推論を評価するための標準化されたプラットフォームを提供し、階層的な空間関係を扱う既存モデルの限界を浮き彫りにしています。このベンチマークは今後、トポロジカル推論アルゴリズムのさらなる発展を促し、複雑な視覚シーンの理解を向上させることが期待されます。また、RLVRファインチューニングの実証により、強化学習と視覚推論の融合が有効であることも示されました。