AI模型与智能体在CAD任务上的基准测试
Parametric CAD Bench是一个专为CAD设计与3D建模任务设计的AI基准测试集合,由gNucleus AI团队发起,旨在构建最优质的开源参数化CAD数据集。榜单显示GPT-5.5结合Codex以0.832的综合得分领先,但成本高达170美元。评估涵盖几何精度、约束正确性、参数一致性等多个维度。
Parametric CAD Bench是一个全面的基准测试集合,专门用于评估AI模型和智能体在CAD设计和3D建模任务上的表现。该项目由gNucleus AI团队发起,是一个社区驱动的开源倡议,旨在打造最优秀的开源参数化CAD数据集。该基准测试涵盖了多个任务类型,包括从自然语言提示和参考输入生成可编辑的参数化3D CAD零件、生成带配合约束和组件层次的多零件装配体,以及执行多步CAD工作流——即通过迭代编辑和验证设计,直到模型满足目标规格。
在最新的排行榜中,GPT-5.5通过Codex智能体以0.832的综合得分位居第一,但其运行成本高达170美元;而性价比更高的选择包括gemini-3.1-pro-preview搭配mini-swe-agent(得分0.790,成本70.82美元)和GPT-5.5搭配mini-swe-agent(得分0.744,成本42.35美元)。排名靠后的模型如gemini-3.1-flash-lite-preview虽然成本极低(3.00美元),但得分仅为0.241。
评估方法不仅关注视觉相似性,还通过沙盒CAD环境自动检查生成CAD的有效性、准确性、可重建性和设计规格一致性。每个任务都基于几何精度、约束与装配正确性、参数正确性、拓扑结构、智能体工作流成功率和效率等多个维度进行评分,评分结果具有确定性。
最新更新方面,2026年5月13日发布了Parametric CAD Bench报告,报告比较了10种智能体-模型组合在FreeCAD中的表现。5月10日,团队在GitHub上开源了freecad-validator工具,用于程序化评估AI生成的参数化FreeCAD零件。5月8日,cad-gen-freecad数据集在Hugging Face上发布,包含原生FreeCAD零件及其参数化特征历史、设计规格和渲染图,旨在支持从文本提示生成准确的参数化CAD模型。