AI News HubLIVE
站內改寫2 分鐘閱讀

參數化CAD基準測試:衡量AI代理設計可編輯CAD的能力

參數化CAD基準測試是一項新的AI代理評估,衡量其從自然語言生成可編輯FreeCAD模型的能力。該基準採用多步代理循環和“可編輯性門控”(調和平均評分)以確保模型生成功能性工程方案,而非靜態3D形狀。初步結果顯示,GPT-5.5通過Codex以0.832的得分領先,且存在明顯的框架效應:固定模型而切換驅動程序時,分數變化約10%。每個任務成本從3美元到170美元不等,成本和質量的跨度很大。

來源Hacker News AI作者: handcrafted

參數化CAD基準測試是一項新推出的評估標準,旨在衡量AI代理從自然語言描述設計可編輯CAD模型的能力。與以往僅關注靜態形狀生成的基準不同,本測試要求代理在FreeCAD中生成包含完整特徵樹和參數化尺寸的可編輯文檔,而非僅輸出3D網格或腳本。

該基準測試由gNucleus-AI團隊開發,任務套件名為“Harbor”,結果數據集託管在Hugging Face上。代理需要接收自然語言描述(如“一個圓形安裝法蘭,帶有4個螺栓孔,螺栓孔分佈圓直徑87.3毫米,中心孔徑49.2毫米”)和關鍵尺寸表格,然後生成可執行的FreeCAD腳本,最終輸出.FCDstd文件。評分分為兩個子指標:幾何相似性(形狀與參考設計匹配程度)和CAD規範一致性(文件名參數與實際參數的一致性),兩者取調和平均作為最終得分。這種設計確保只有既形狀正確又具有可編輯性的模型才能獲得高分——如果模型生成了正確的形狀但沒有命名參數,則得分為0。

為什麼選擇FreeCAD?FreeCAD是開源軟件,完全可通過Python腳本控制,且其原生格式.FCDstd能夠完整保留特徵歷史。它支持兩種建模風格:零件工作台(基於布爾運算的CSG)和零件設計工作台(基於草圖與特徵樹)。本基準採用零件設計工作台,因為它更符合專業CAD軟件(如Catia、NX、SolidWorks)的設計意圖,能夠提供更豐富的評估信號。

與現有基準的差異:目前存在兩個CAD-AI基準(CadBench和BenchCAD),它們主要評估單次提示(文本或圖像)生成CAD程序的能力,樣本量約18,000個。而本基準的獨特之處在於:

  • 代理擁有工具:支持多步迭代循環,代理可運行shell、編寫腳本、執行、檢查錯誤並修正,類似於真實的CAD設計流程。
  • 輸出必須可編輯:不僅要求形狀正確,還要求文檔內部結構(如草圖→拉伸→切除→陣列,帶有命名驅動尺寸)符合工程實踐。
  • 框架被視為首要變量:10個測試單元交叉了4種代理框架(claude-code、codex、gemini-cli、mini-swe-agent)和多個前沿模型,便於分離框架和模型對結果的影響。

初步結果(v1):所有10個單元按平均綜合得分排序如下:

  1. codex-gpt5.5: 0.832分,每任務成本$170.00
  2. mini-swe-gemini-pro: 0.790分,$70.82
  3. mini-swe-gpt5.5: 0.744分,$42.35
  4. mini-swe-claude-opus: 0.734分,$29.84
  5. gemini-cli-pro: 0.729分,$51.28
  6. claude-code-opus: 0.655分,$73.25
  7. claude-code-sonnet: 0.518分,$96.34
  8. claude-code-haiku: 0.284分,$24.67
  9. mini-swe-gemini-flash: 0.241分,$3.00
  10. gemini-cli-flash: 0.119分,$7.63

主要發現:

  • GPT-5.5通過Codex以0.832分領先,但同一模型在通用框架(mini-swe-gpt5.5)上得分為0.744,差距0.088,顯示了框架效應。
  • 框架效應方向不一致:Codex是唯一一個專用框架優於通用框架的案例;對於其他模型,通用框架mini-swe-agent表現更好。
  • Anthropic的三層模型(Opus/Sonnet/Haiku)得分分別為0.655/0.518/0.284,呈單調遞減。Sonnet的22個異常中,14個是由於輸出token限制(32K)導致腳本截斷。
  • 可靠性方面,mini-swe-agent更為穩健:其400次試驗中0次異常,而供應商CLI在600次試驗中出現31次異常,主要集中在claude-code-sonnet。
  • 成本透明度:每任務成本從$3到$170不等,這表明高成本不一定帶來高回報,用户需根據自身需求權衡。

總之,參數化CAD基準測試為評估AI在工程設計領域的實用能力提供了新視角,強調可編輯性和多步迭代的重要性,結果對開發更高效的AI輔助設計工具具有指導意義。