AI News HubLIVE
サイト内リライト3 分で読了

パラメトリックCADベンチマーク:編集可能なCAD設計におけるAIエージェントの評価

パラメトリックCADベンチマークは、AIエージェントが自然言語から編集可能なFreeCADモデルを作成する能力を測定する新しい評価基準です。マルチステップのエージェントループと「編集可能性ゲート」(調和平均スコアリング)を使用して、機能的なエンジニアリングレシピを生成することを保証します。初期結果では、GPT-5.5 via Codexが0.832でリードし、ハーネス効果が顕著に見られます。1セルあたりのコストは3ドルから170ドルの範囲で、コストと品質のフロンティアは広いです。

ソースHacker News AI著者: handcrafted

パラメトリックCADベンチマークは、AIエージェントが自然言語の説明から編集可能なCADモデルを作成する能力を測定するために設計された新しい評価基準です。従来のCAD関連ベンチマークとは異なり、このベンチマークはマルチステップのエージェントループと「編集可能性ゲート」(調和平均スコアリング)を採用し、モデルが単なる静的な3D形状ではなく、機能的なエンジニアリングレシピを生成することを保証します。

このベンチマークはgNucleus-AIチームによって開発され、タスクスイートは「Harbor」、結果データセットはHugging Faceで公開されています。エージェントは、自然言語による部品の説明(例:「4つのボルト穴を持つ円形取り付けフランジ、ボルト穴のピッチ円直径87.3 mm、中央ボア49.2 mm」)と主要な寸法の表を受け取り、FreeCADで実行可能なスクリプトを生成し、最終的に.FCDstdファイルを出力する必要があります。評価は2つのサブスコアで行われます:幾何学的類似性(形状が参照設計と一致するか)とCAD仕様の一貫性(生成されたCADが提供された仕様と一致するか)で、これらは調和平均によって結合されます。これにより、形状が正しいだけでなく、編集可能なパラメータを持つモデルのみが高得点を獲得できます。

FreeCADが選ばれた理由:FreeCADはオープンソースで、Pythonから完全にスクリプト制御可能であり、ネイティブ形式の.FCDstdは機能の履歴を完全に保持します。また、オフラインで動作するため、自動評価のためにサンドボックス化されたコンテナに簡単に組み込むことができます。FreeCADには2つのソリッドモデリングスタイルがあります:パーツワークベンチ(CSG:プリミティブに対するブール演算)とパーツデザインワークベンチ(フィーチャーベース:スケッチとパラメトリックフィーチャーツリー)。このベンチマークではパーツデザインワークベンチを使用します。これは、プロフェッショナルなCAD(Catia、NX、Creo、SolidWorks、Onshape)の実際の動作を反映しており、より豊富な評価信号を提供します。

既存のベンチマークとの違い:最近、2つのCAD-AIベンチマーク(CadBenchとBenchCAD)が登場していますが、これらは主に単一ショットのプロンプト(テキスト、画像、または3Dメッシュ)によるCADプログラムの生成能力を測定しています。一方、パラメトリックCADベンチマークは以下の点で異なります:

  • エージェントはツールを持っている:シェルを実行し、FreeCADスクリプトを作成・実行し、エラーを検査して修正するというループを実行できます。
  • 出力は編集可能でなければならない:正しい形状だけでなく、内部構造(スケッチ→パッド→ポケット→パターン、名前付き駆動寸法)がCADエンジニアの設計方法を反映している必要があります。
  • ハーネスは第一級の変数:10のリーダーボードセルは4つのエージェントフレームワーク(claude-code、codex、gemini-cli、mini-swe-agent)と主要なフロンティアモデルをクロスしており、モデルを固定してドライバーを変えることで、ハーネスとモデルのどちらが作業を行っているかを明らかにします。

初期結果(v1):10のセルを平均複合スコアでソートすると:

  1. codex-gpt5.5:0.832、1試験あたり$170.00
  2. mini-swe-gemini-pro:0.790、$70.82
  3. mini-swe-gpt5.5:0.744、$42.35
  4. mini-swe-claude-opus:0.734、$29.84
  5. gemini-cli-pro:0.729、$51.28
  6. claude-code-opus:0.655、$73.25
  7. claude-code-sonnet:0.518、$96.34
  8. claude-code-haiku:0.284、$24.67
  9. mini-swe-gemini-flash:0.241、$3.00
  10. gemini-cli-flash:0.119、$7.63

主な発見:

  • GPT-5.5 via Codexが0.832でトップ。同じモデルを汎用ハーネス(mini-swe-gpt5.5)で実行すると0.744と、0.088の差があり、ハーネス効果が明確に現れています。
  • ハーネス効果は双方向に働く:Codexは専用CLIが汎用ハーネスを上回った唯一のケース。他のモデルファミリーでは、汎用のmini-swe-agentドライバーが勝利。
  • Anthropicの3層モデル(Opus/Sonnet/Haiku)は0.655/0.518/0.284と単調減少。Sonnetの22の例外のうち14は出力トークン制限(32K)によるもので、スクリプトが途中で切れました。
  • 信頼性はmini-swe-agentに傾く:400試験で例外0。ベンダーCLIは600試験で31の例外、特にclaude-code-sonnetに集中。
  • コストの透明性:1試験あたりのコストは3ドルから170ドルまで幅広く、高コストが常に高スコアを意味するわけではありません。

パラメトリックCADベンチマークは、AIエージェントの実用的なエンジニアリング設計能力を評価するための重要な一歩であり、特に編集可能性と反復プロセスを重視しています。将来のAI支援設計ツールの開発に貴重な洞察を提供するでしょう。