AI News HubLIVE
站内改写2 分钟阅读

物理AI的前沿模型评估:GPT-5.6 vs Claude Fable 5

JuliaHub对最新前沿模型(GPT-5.6系列与Claude Fable 5)在物理AI领域的表现进行了评估。测试涵盖五个难度递增的密封问题,结果显示Claude Fable 5在得分上领先,但成本最高;GPT-5.6 Sol在性价比上表现最佳。

来源Hacker News AI作者: ViralBShah

物理AI的正确性取决于模型所编码的物理定律是否准确。一个飞机、分离塔或带电粒子的模型可以顺利编译和运行,但其物理本质可能是错误的。AI智能体通过测试反馈来引导自身,而测试往往由同一智能体编写,这使得错误模式更加严重。在物理工程领域,真正的问题是“这个模型是否符合现实世界?”——智能体可能通过所有自编写的测试,但这些测试建立在简化假设之上,这些假设在实际使用的工况下可能不成立。

现有基准测试存在信任问题。模型提供商自报的基准测试结果往往不被采信,因为他们有动机进行针对性优化。JuliaHub的激励方向相反:他们提供多种后端代理,目标是让用户获得最佳的Dyad体验,无论哪个实验室的模型实现这一点。因此,他们进行了这项研究,以客观评估哪个前沿模型在物理建模中表现最佳。

为了衡量哪个模型能最好地完成物理建模任务,JuliaHub保持所有其他变量不变。Dyad AI代理框架(专为建模与仿真工作流设计)在所有试验中固定,问题集、推理努力(xhigh)、上下文窗口(1M)和令牌预算(128k)也固定。唯一的变量是模型:OpenAI的GPT 5.6系列(terra、sol、luna)与Anthropic的Claude Fable 5。每个模型在每个问题上进行三次试验(第五个问题进行一次长期试验),共计52次评分运行。

评估问题与方法

研究使用了五个密封问题,难度递增,选自日常建模与仿真工作。这些问题的共同点是:存在一些解法可以编译运行通过但物理上错误。因此,评分忽略代码,直接比较完整模拟轨迹与密封真实值。最难的问题是NASA的HL-20飞行器。

评分结果

评分使用难度加权平均。结果如下:

  • Claude Fable 5: 0.889分,每次试验成本9.60美元,平均耗时16.1分钟。
  • GPT-5.6 Sol: 0.814分,成本1.74美元,耗时13.4分钟。
  • GPT-5.6 Terra: 0.786分,成本1.25美元,耗时12.6分钟。
  • GPT-5.6 Luna: 0.727分,成本3.26美元,耗时25.0分钟。

在较容易的问题上,所有模型几乎都能拿到满分;但在最难的问题上,得分普遍下降,其中Claude Fable 5得分0.690,GPT-5.6 Sol得分0.660,Terra得分0.590,Luna仅0.383。

工作风格分析

通过分析试验记录,每种模型的工作风格不同。按工具调用次数:Luna最忙碌(平均59次调用),Fable最精简(28次)。按时间分布,推导和测试物理模型占据了所有模型的大部分时间。Fable倾向于一次性编写模型,而Terra则更多时间用于编辑,Luna则花费时间“寻找”代码片段。

总体而言,Claude Fable 5在物理AI任务上表现最佳,但成本最高;GPT-5.6 Sol提供了最佳性价比;而GPT-5.6 Luna在各方面均落后。