AI模型與智能體在CAD任務上的基準測試
Parametric CAD Bench是一個專為CAD設計與3D建模任務設計的AI基準測試集合,由gNucleus AI團隊發起,旨在構建最優質的開源參數化CAD數據集。榜單顯示GPT-5.5結合Codex以0.832的綜合得分領先,但成本高達170美元。評估涵蓋幾何精度、約束正確性、參數一致性等多個維度。
Parametric CAD Bench是一個全面的基準測試集合,專門用於評估AI模型和智能體在CAD設計和3D建模任務上的表現。該項目由gNucleus AI團隊發起,是一個社區驅動的開源倡議,旨在打造最優秀的開源參數化CAD數據集。該基準測試涵蓋了多個任務類型,包括從自然語言提示和參考輸入生成可編輯的參數化3D CAD零件、生成帶配合約束和組件層次的多零件裝配體,以及執行多步CAD工作流——即通過迭代編輯和驗證設計,直到模型滿足目標規格。
在最新的排行榜中,GPT-5.5通過Codex智能體以0.832的綜合得分位居第一,但其運行成本高達170美元;而性價比更高的選擇包括gemini-3.1-pro-preview搭配mini-swe-agent(得分0.790,成本70.82美元)和GPT-5.5搭配mini-swe-agent(得分0.744,成本42.35美元)。排名靠後的模型如gemini-3.1-flash-lite-preview雖然成本極低(3.00美元),但得分僅為0.241。
評估方法不僅關注視覺相似性,還通過沙盒CAD環境自動檢查生成CAD的有效性、準確性、可重建性和設計規格一致性。每個任務都基於幾何精度、約束與裝配正確性、參數正確性、拓撲結構、智能體工作流成功率和效率等多個維度進行評分,評分結果具有確定性。
最新更新方面,2026年5月13日發佈了Parametric CAD Bench報告,報告比較了10種智能體-模型組合在FreeCAD中的表現。5月10日,團隊在GitHub上開源了freecad-validator工具,用於程序化評估AI生成的參數化FreeCAD零件。5月8日,cad-gen-freecad數據集在Hugging Face上發佈,包含原生FreeCAD零件及其參數化特徵歷史、設計規格和渲染圖,旨在支持從文本提示生成準確的參數化CAD模型。