GeoSym127K:面向多模态几何推理的可扩展符号可验证合成
研究人员提出GeoSym引擎,这是一种神经符号框架,可自动生成高质量的几何推理数据。由此产生的GeoSym127K数据集将多模态模型在依赖图表的任务上的性能提升了超过20%。
大型多模态模型(LMM)在几何推理任务中常面临视觉幻觉和缺乏精确数学思维链(CoT)数据的挑战。为突破这一瓶颈,研究团队提出了GeoSym引擎——一个自动化、可扩展的神经符号框架。该引擎通过类型条件语法和解析型SymGT求解器,推导出精确的符号化真实标注,并与稳健的渲染管线无缝集成,生成高精度的几何图形。这种设计避免了传统数据生成中的噪声和模糊性,确保了标注的数学严密性。
基于该引擎,团队构建了GeoSym127K数据集,包含5.1万张高分辨率图像、12.7万个带有符号化真实标注的问题以及5.5万个经答案验证的思维链问答对,并按难度分层(基础、中级、高级)。同时,他们还推出了GeoSym-Bench——一个由专家精选的511个复杂样本评测集,用于严格评估模型在依赖图表和多步推理任务上的能力。该基准旨在填补现有几何推理评测中缺乏高难度样本的空白。
通过大规模监督微调(SFT),实验证明GeoSym能够显著提升模型在依赖图形和多步几何任务上的表现。Qwen3-VL-8B模型在MathVerse纯视觉子集上实现了22.21个百分点的绝对提升,在WeMath上达到61.52%(提升6.19%),有效缓解了长程逻辑碎片化问题,并超越了Doubao-1.8等先进闭源模型。值得注意的是,这些改进主要集中在需要视觉理解和逐步推理的任务上,而在纯文本几何问题上的提升较小,证实了GeoSym数据对图表依赖任务的有效性。
此外,通过GRPO实现基于可验证奖励的强化学习(RLVR)表明,从结构化的SFT检查点初始化要比零样本RL显著提高性能天花板。在确定性精确匹配信号的驱动下,这展示了验证推理合成的强大扩展潜力。研究人员还分析了不同难度层级的数据对模型性能的影响,发现高级别数据对提升复杂推理能力尤为关键。数据集和代码已在Hugging Face和GitHub公开发布,可供社区进一步研究和应用。