AI News HubLIVE
サイト内リライト2 分で読了

物理AIのための最先端モデル評価:GPT-5.6 vs Claude Fable 5

JuliaHubが物理AIタスクにおける最新フロンティアモデル(GPT-5.6シリーズとClaude Fable 5)の性能評価を実施。難易度が異なる5つの封印問題を用いた結果、Claude Fable 5が最高スコア(0.889)を達成したが、コストも最高(1回9.60ドル)。GPT-5.6 Solがコストパフォーマンスで優れる(0.814、1.74ドル)。

ソースHacker News AI著者: ViralBShah

物理AIの成否は、モデル化された物理法則が正しいかどうかにかかっています。航空機、分離塔、荷電粒子のモデルはコンパイルと実行が正常でも、その物理が非現実的である可能性があります。エージェント型AIでは、エージェントがテストからのフィードバックで自己修正するため、この問題がさらに悪化します。テストは多くの場合、同じエージェントが作成するため、正しい動作が閉じていてチェック可能なWeb開発やコンパイラの領域ではうまく機能しますが、工学では「現実世界と一致するか?」という問いが重要であり、テストが単純化に基づいている場合、エージェントはそれらのテストを通過しても、実際の使用条件ではモデルが無効になる可能性があります。

既存のベンチマークには信頼性の問題もあります。モデルプロバイダーが自己報告するベンチマークは、調整の動機があるため、そのまま信用する人はいません。JuliaHubのインセンティブは逆です。彼らは複数のベンダーのエージェントバックエンドを提供しており、ユーザーが最良のDyad体験を得られることを目指しています。したがって、どのラボのモデルが物理モデリングに優れているかを客観的に評価するためにこの研究を実施しました。

物理モデリングのタスクを最も効果的に処理するモデルを測定するため、すべての変数を固定しました。Dyad AIエージェントフレームワーク(モデリング&シミュレーションワークフロー専用)はすべての試行で固定され、問題、推論努力(xhigh)、コンテキストウィンドウ(1M)、トークン予算(128k)も固定されました。唯一の変数はモデル:OpenAIのGPT 5.6ファミリー(terra、sol、luna)とAnthropicのclaude-fable-5です。各モデルについて、最初の4つの問題で3回、5番目の問題で1回の長期試行を実施し、合計52回の採点済み実行を行いました。

評価問題と方法

研究では、日常のモデリング&シミュレーションから抽出された5つの封印問題を使用し、難易度順に並べました。これらの問題は、正しい解が通過しなければならない段階、致命的な小さな見落とし、近道、モデリング以外のエンジニアリング作業で定義される難易度を持ちます。共通の特性として、コンパイルと実行は通るが物理的に誤った解が存在することが挙げられます。そのため、採点はコードを無視し、完全なシミュレーション軌跡を封印された正解と比較します。最も難しい問題はNASAのHL-20飛行機です。

スコアボード

スコアは難易度加重平均で計算されます。結果は以下の通り:

  • Claude Fable 5: 加重スコア0.889、試行あたりコスト9.60ドル、平均所要時間16.1分。
  • GPT-5.6 Sol: 0.814、1.74ドル、13.4分。
  • GPT-5.6 Terra: 0.786、1.25ドル、12.6分。
  • GPT-5.6 Luna: 0.727、3.26ドル、25.0分。

簡単な問題では全モデルがほぼ満点を獲得しましたが、最も難しい問題(P5)ではスコアが大幅に低下し、Fableが0.690、Solが0.660、Terraが0.590、Lunaが0.383でした。

作業スタイルの分析

各試行のトランスクリプトを分析し、ツール呼び出しをカテゴリに分類しました。ツール呼び出し数では、Lunaが最も忙しく(平均59回)、Fableが最も少ない(28回)。時間配分では、物理の導出とテストが全モデルで支配的でした。Fableは一度の記述で済ませる傾向があり、Terraは編集に時間をかけ、Lunaはコピー元の探索に時間を費やしました。

総合すると、Claude Fable 5は物理AIタスクで最高の性能を示しましたが、コストは最も高くなります。GPT-5.6 Solはコストパフォーマンスに優れ、GPT-5.6 Lunaはすべての軸で劣っていました。