AI News HubLIVE
站内改写1 分钟阅读

CurveBench:嵌套乔丹曲线精确拓扑推理基准

CurveBench是一个用于评估AI视觉拓扑推理能力的新基准。它包含756张嵌套乔丹曲线图像,要求模型重建包含关系树。最强模型Gemini 3.1 Pro在简单集上准确率为71.1%,在困难集上仅为19.1%。通过RLVR微调,Qwen3-VL-8B在简单集上从2.8%提升至33.3%,超过了GPT-5.4和Claude Opus 4.5。然而,该任务仍未完全解决。

来源arXiv Computer Vision作者: Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian, Naser Talebizadeh Saradari

近日,研究人员发布了一项名为“CurveBench”的新基准测试,专门用于评估人工智能模型在视觉层次拓扑推理方面的能力。该基准由756张成对不相交的乔丹曲线图像组成,涵盖了五种不同的配置:简单、多边形、地形、迷宫和密集计数。每一张图像都附带了一棵根树注释,用于编码平面区域之间的包含关系。任务被定义为结构预测:给定一张图像,模型必须恢复由曲线诱导的完整根包含树结构。

尽管这个任务在视觉上看似简单,但目前的顶尖模型表现却并不理想。评估中表现最好的模型——Gemini 3.1 Pro——在CurveBench的简单子集(Easy)上仅达到71.1%的树生成准确率,而在困难子集(Hard)上更是低至19.1%。这一结果凸显了当前视觉语言模型在处理精确拓扑关系方面的根本性局限。

为了进一步探索该基准的实用性,研究人员采用了强化学习与视觉推理(RLVR)风格的微调方法,对开放权重的视觉语言模型进行训练。经过微调的Qwen3-VL-8B模型在CurveBench-Easy上的准确率从2.8%跃升至33.3%,甚至超过了GPT-5.4和Claude Opus 4.5。然而,在CurveBench-Hard上,模型的表现仍然远不理想,这表明精确的拓扑感知视觉推理仍然是一个尚未解决的重要问题。值得注意的是,CurveBench-Hard包含更复杂的曲线配置,例如密集计数和迷宫形状,这些配置要求模型具备更高的层次化视觉理解能力。

CurveBench的提出为AI视觉拓扑推理提供了一个标准化的评估平台,揭示了现有模型在层次化空间关系理解方面的明显不足。未来,这一基准有望推动新的拓扑推理算法的发展,从而提升AI对复杂视觉场景的精细理解能力。同时,该基准也为强化学习与视觉推理的结合提供了新的实验场,推动更高效、更鲁棒的视觉推理模型的出现。