AI News HubLIVE
站内改写1 分钟阅读

Physics-R1:经过审计的奥林匹克物理语料库及视觉物理推理配方

本研究对多模态物理评估流程进行了全面审计,发现了三种未被察觉的构建偏差:训练-测试污染、翻译漂移和多项选择题(MCQ)饱和。研究团队发布了四个新数据集和一个基于Qwen3-VL-8B-Thinking的参考模型Physics-R1,在多个基准测试上取得了显著提升。

来源arXiv Computational Linguistics作者: Shan Yang

近年来,多模态大语言模型在视觉物理推理领域取得了显著进展,但评估流程中存在的潜在偏差可能扭曲了真实能力。来自研究团队的最新工作对多模态物理评估流程进行了端到端的审计,首次系统性地揭示了三种未被注意到的构建缺陷:训练-测试数据污染、翻译漂移以及多项选择题(MCQ)的饱和效应。

研究团队首先对UGPhysics-Train、SciInstruct和MMK12等公共训练池进行了一阶段5-gram Jaccard审计,结果显示在所有六个公开物理评估数据集上均无重叠。然而,采用三阶段审计(Jaccard→mxbai-embed-large余弦相似度→Haiku-4.5 LLM判断)后,仅在SciInstruct中就发现了134个近似重复样本和4846个释义候选,表明传统单阶段方法无法有效检测数据污染。

翻译漂移问题通过一组59对爱沙尼亚-英语双语奥林匹克问题得到了量化。使用Sonnet 4.5模型测试发现,英语版本正确率为30.5%,而爱沙尼亚语版本仅为13.6%,性能差距高达17个百分点(统计检验显著)。这表明语言转换会导致显著的性能损失。

此外,研究还发现同一模型在多项选择题(PhyX上的MCQ准确率79.7%)与开放式奥林匹克问题(PhysOlym-A上的33.4%)之间存在46个百分点的巨大差距,说明MCQ格式可能高估了模型的真实推理能力。

为解决这些问题,研究团队发布了四个关键资源:PhysCorp-A(经三阶段审计的6432条多模态语料)、PhysR1Corp(2268条封闭形式强化学习池)、PhysOlym-A(500道全新开放式奥林匹克问题,含难度标签及爱沙尼亚-英语双语子集)以及Physics-R1模型。该模型基于Qwen3-VL-8B-Thinking,采用GSPO+DAPO训练策略,在三个随机种子下取得了显著效果:在PhysOlym-A上比8B基础模型提升18.3个百分点(从8.0%到26.3%),仅落后Sonnet 4.5约7个百分点;在PhysReason上提升15.7个百分点(23.9%到39.6%),超越Qwen3-VL-32B和Gemini 2.5 Pro;在OlympiadBench-Physics上达到46.2%,在PhyX MCQ上达到77.8%。该工作为视觉物理推理提供了更可靠的评估基准和高效模型方案。