物理AI的前沿模型評估:GPT-5.6 vs Claude Fable 5
JuliaHub對最新前沿模型(GPT-5.6系列與Claude Fable 5)在物理AI領域的表現進行了評估。測試涵蓋五個難度遞增的密封問題,結果顯示Claude Fable 5在得分上領先,但成本最高;GPT-5.6 Sol在性價比上表現最佳。
物理AI的正確性取決於模型所編碼的物理定律是否準確。一個飛機、分離塔或帶電粒子的模型可以順利編譯和運行,但其物理本質可能是錯誤的。AI智能體通過測試反饋來引導自身,而測試往往由同一智能體編寫,這使得錯誤模式更加嚴重。在物理工程領域,真正的問題是“這個模型是否符合現實世界?”——智能體可能通過所有自編寫的測試,但這些測試建立在簡化假設之上,這些假設在實際使用的工況下可能不成立。
現有基準測試存在信任問題。模型提供商自報的基準測試結果往往不被採信,因為他們有動機進行針對性優化。JuliaHub的激勵方向相反:他們提供多種後端代理,目標是讓用户獲得最佳的Dyad體驗,無論哪個實驗室的模型實現這一點。因此,他們進行了這項研究,以客觀評估哪個前沿模型在物理建模中表現最佳。
為了衡量哪個模型能最好地完成物理建模任務,JuliaHub保持所有其他變量不變。Dyad AI代理框架(專為建模與仿真工作流設計)在所有試驗中固定,問題集、推理努力(xhigh)、上下文窗口(1M)和令牌預算(128k)也固定。唯一的變量是模型:OpenAI的GPT 5.6系列(terra、sol、luna)與Anthropic的Claude Fable 5。每個模型在每個問題上進行三次試驗(第五個問題進行一次長期試驗),共計52次評分運行。
評估問題與方法
研究使用了五個密封問題,難度遞增,選自日常建模與仿真工作。這些問題的共同點是:存在一些解法可以編譯運行通過但物理上錯誤。因此,評分忽略代碼,直接比較完整模擬軌跡與密封真實值。最難的問題是NASA的HL-20飛行器。
評分結果
評分使用難度加權平均。結果如下:
- Claude Fable 5: 0.889分,每次試驗成本9.60美元,平均耗時16.1分鐘。
- GPT-5.6 Sol: 0.814分,成本1.74美元,耗時13.4分鐘。
- GPT-5.6 Terra: 0.786分,成本1.25美元,耗時12.6分鐘。
- GPT-5.6 Luna: 0.727分,成本3.26美元,耗時25.0分鐘。
在較容易的問題上,所有模型幾乎都能拿到滿分;但在最難的問題上,得分普遍下降,其中Claude Fable 5得分0.690,GPT-5.6 Sol得分0.660,Terra得分0.590,Luna僅0.383。
工作風格分析
通過分析試驗記錄,每種模型的工作風格不同。按工具調用次數:Luna最忙碌(平均59次調用),Fable最精簡(28次)。按時間分佈,推導和測試物理模型佔據了所有模型的大部分時間。Fable傾向於一次性編寫模型,而Terra則更多時間用於編輯,Luna則花費時間“尋找”代碼片段。
總體而言,Claude Fable 5在物理AI任務上表現最佳,但成本最高;GPT-5.6 Sol提供了最佳性價比;而GPT-5.6 Luna在各方面均落後。