AI News HubLIVE
站內改寫2 分鐘閱讀

物理AI的前沿模型評估:GPT-5.6 vs Claude Fable 5

JuliaHub對最新前沿模型(GPT-5.6系列與Claude Fable 5)在物理AI領域的表現進行了評估。測試涵蓋五個難度遞增的密封問題,結果顯示Claude Fable 5在得分上領先,但成本最高;GPT-5.6 Sol在價效比上表現最佳。

來源Hacker News AI作者: ViralBShah

物理AI的正確性取決於模型所編碼的物理定律是否準確。一個飛機、分離塔或帶電粒子的模型可以順利編譯和執行,但其物理本質可能是錯誤的。AI智慧體透過測試反饋來引導自身,而測試往往由同一智慧體編寫,這使得錯誤模式更加嚴重。在物理工程領域,真正的問題是“這個模型是否符合現實世界?”——智慧體可能透過所有自編寫的測試,但這些測試建立在簡化假設之上,這些假設在實際使用的工況下可能不成立。

現有基準測試存在信任問題。模型提供商自報的基準測試結果往往不被採信,因為他們有動機進行針對性最佳化。JuliaHub的激勵方向相反:他們提供多種後端代理,目標是讓使用者獲得最佳的Dyad體驗,無論哪個實驗室的模型實現這一點。因此,他們進行了這項研究,以客觀評估哪個前沿模型在物理建模中表現最佳。

為了衡量哪個模型能最好地完成物理建模任務,JuliaHub保持所有其他變數不變。Dyad AI代理框架(專為建模與模擬工作流設計)在所有試驗中固定,問題集、推理努力(xhigh)、上下文視窗(1M)和令牌預算(128k)也固定。唯一的變數是模型:OpenAI的GPT 5.6系列(terra、sol、luna)與Anthropic的Claude Fable 5。每個模型在每個問題上進行三次試驗(第五個問題進行一次長期試驗),共計52次評分執行。

評估問題與方法

研究使用了五個密封問題,難度遞增,選自日常建模與模擬工作。這些問題的共同點是:存在一些解法可以編譯執行透過但物理上錯誤。因此,評分忽略程式碼,直接比較完整模擬軌跡與密封真實值。最難的問題是NASA的HL-20飛行器。

評分結果

評分使用難度加權平均。結果如下:

  • Claude Fable 5: 0.889分,每次試驗成本9.60美元,平均耗時16.1分鐘。
  • GPT-5.6 Sol: 0.814分,成本1.74美元,耗時13.4分鐘。
  • GPT-5.6 Terra: 0.786分,成本1.25美元,耗時12.6分鐘。
  • GPT-5.6 Luna: 0.727分,成本3.26美元,耗時25.0分鐘。

在較容易的問題上,所有模型幾乎都能拿到滿分;但在最難的問題上,得分普遍下降,其中Claude Fable 5得分0.690,GPT-5.6 Sol得分0.660,Terra得分0.590,Luna僅0.383。

工作風格分析

透過分析試驗記錄,每種模型的工作風格不同。按工具呼叫次數:Luna最忙碌(平均59次呼叫),Fable最精簡(28次)。按時間分佈,推導和測試物理模型佔據了所有模型的大部分時間。Fable傾向於一次性編寫模型,而Terra則更多時間用於編輯,Luna則花費時間“尋找”程式碼片段。

總體而言,Claude Fable 5在物理AI任務上表現最佳,但成本最高;GPT-5.6 Sol提供了最佳價效比;而GPT-5.6 Luna在各方面均落後。