AI News HubLIVE
站內改寫1 分鐘閱讀

Physics-R1:經過審計的奧林匹克物理語料庫及視覺物理推理配方

本研究對多模態物理評估流程進行了全面審計,發現了三種未被察覺的構建偏差:訓練-測試汙染、翻譯漂移和多項選擇題(MCQ)飽和。研究團隊釋出了四個新資料集和一個基於Qwen3-VL-8B-Thinking的參考模型Physics-R1,在多個基準測試上取得了顯著提升。

來源arXiv Computational Linguistics作者: Shan Yang

近年來,多模態大語言模型在視覺物理推理領域取得了顯著進展,但評估流程中存在的潛在偏差可能扭曲了真實能力。來自研究團隊的最新工作對多模態物理評估流程進行了端到端的審計,首次系統性地揭示了三種未被注意到的構建缺陷:訓練-測試資料汙染、翻譯漂移以及多項選擇題(MCQ)的飽和效應。

研究團隊首先對UGPhysics-Train、SciInstruct和MMK12等公共訓練池進行了一階段5-gram Jaccard審計,結果顯示在所有六個公開物理評估資料集上均無重疊。然而,採用三階段審計(Jaccard→mxbai-embed-large餘弦相似度→Haiku-4.5 LLM判斷)後,僅在SciInstruct中就發現了134個近似重複樣本和4846個釋義候選,表明傳統單階段方法無法有效檢測資料汙染。

翻譯漂移問題透過一組59對愛沙尼亞-英語雙語奧林匹克問題得到了量化。使用Sonnet 4.5模型測試發現,英語版本正確率為30.5%,而愛沙尼亞語版本僅為13.6%,效能差距高達17個百分點(統計檢驗顯著)。這表明語言轉換會導致顯著的效能損失。

此外,研究還發現同一模型在多項選擇題(PhyX上的MCQ準確率79.7%)與開放式奧林匹克問題(PhysOlym-A上的33.4%)之間存在46個百分點的巨大差距,說明MCQ格式可能高估了模型的真實推理能力。

為解決這些問題,研究團隊釋出了四個關鍵資源:PhysCorp-A(經三階段審計的6432條多模態語料)、PhysR1Corp(2268條封閉形式強化學習池)、PhysOlym-A(500道全新開放式奧林匹克問題,含難度標籤及愛沙尼亞-英語雙語子集)以及Physics-R1模型。該模型基於Qwen3-VL-8B-Thinking,採用GSPO+DAPO訓練策略,在三個隨機種子下取得了顯著效果:在PhysOlym-A上比8B基礎模型提升18.3個百分點(從8.0%到26.3%),僅落後Sonnet 4.5約7個百分點;在PhysReason上提升15.7個百分點(23.9%到39.6%),超越Qwen3-VL-32B和Gemini 2.5 Pro;在OlympiadBench-Physics上達到46.2%,在PhyX MCQ上達到77.8%。該工作為視覺物理推理提供了更可靠的評估基準和高效模型方案。