参数化CAD基准测试:衡量AI代理设计可编辑CAD的能力
参数化CAD基准测试是一项新的AI代理评估,衡量其从自然语言生成可编辑FreeCAD模型的能力。该基准采用多步代理循环和“可编辑性门控”(调和平均评分)以确保模型生成功能性工程方案,而非静态3D形状。初步结果显示,GPT-5.5通过Codex以0.832的得分领先,且存在明显的框架效应:固定模型而切换驱动程序时,分数变化约10%。每个任务成本从3美元到170美元不等,成本和质量的跨度很大。
参数化CAD基准测试是一项新推出的评估标准,旨在衡量AI代理从自然语言描述设计可编辑CAD模型的能力。与以往仅关注静态形状生成的基准不同,本测试要求代理在FreeCAD中生成包含完整特征树和参数化尺寸的可编辑文档,而非仅输出3D网格或脚本。
该基准测试由gNucleus-AI团队开发,任务套件名为“Harbor”,结果数据集托管在Hugging Face上。代理需要接收自然语言描述(如“一个圆形安装法兰,带有4个螺栓孔,螺栓孔分布圆直径87.3毫米,中心孔径49.2毫米”)和关键尺寸表格,然后生成可执行的FreeCAD脚本,最终输出.FCDstd文件。评分分为两个子指标:几何相似性(形状与参考设计匹配程度)和CAD规范一致性(文件名参数与实际参数的一致性),两者取调和平均作为最终得分。这种设计确保只有既形状正确又具有可编辑性的模型才能获得高分——如果模型生成了正确的形状但没有命名参数,则得分为0。
为什么选择FreeCAD?FreeCAD是开源软件,完全可通过Python脚本控制,且其原生格式.FCDstd能够完整保留特征历史。它支持两种建模风格:零件工作台(基于布尔运算的CSG)和零件设计工作台(基于草图与特征树)。本基准采用零件设计工作台,因为它更符合专业CAD软件(如Catia、NX、SolidWorks)的设计意图,能够提供更丰富的评估信号。
与现有基准的差异:目前存在两个CAD-AI基准(CadBench和BenchCAD),它们主要评估单次提示(文本或图像)生成CAD程序的能力,样本量约18,000个。而本基准的独特之处在于:
- 代理拥有工具:支持多步迭代循环,代理可运行shell、编写脚本、执行、检查错误并修正,类似于真实的CAD设计流程。
- 输出必须可编辑:不仅要求形状正确,还要求文档内部结构(如草图→拉伸→切除→阵列,带有命名驱动尺寸)符合工程实践。
- 框架被视为首要变量:10个测试单元交叉了4种代理框架(claude-code、codex、gemini-cli、mini-swe-agent)和多个前沿模型,便于分离框架和模型对结果的影响。
初步结果(v1):所有10个单元按平均综合得分排序如下:
- codex-gpt5.5: 0.832分,每任务成本$170.00
- mini-swe-gemini-pro: 0.790分,$70.82
- mini-swe-gpt5.5: 0.744分,$42.35
- mini-swe-claude-opus: 0.734分,$29.84
- gemini-cli-pro: 0.729分,$51.28
- claude-code-opus: 0.655分,$73.25
- claude-code-sonnet: 0.518分,$96.34
- claude-code-haiku: 0.284分,$24.67
- mini-swe-gemini-flash: 0.241分,$3.00
- gemini-cli-flash: 0.119分,$7.63
主要发现:
- GPT-5.5通过Codex以0.832分领先,但同一模型在通用框架(mini-swe-gpt5.5)上得分为0.744,差距0.088,显示了框架效应。
- 框架效应方向不一致:Codex是唯一一个专用框架优于通用框架的案例;对于其他模型,通用框架mini-swe-agent表现更好。
- Anthropic的三层模型(Opus/Sonnet/Haiku)得分分别为0.655/0.518/0.284,呈单调递减。Sonnet的22个异常中,14个是由于输出token限制(32K)导致脚本截断。
- 可靠性方面,mini-swe-agent更为稳健:其400次试验中0次异常,而供应商CLI在600次试验中出现31次异常,主要集中在claude-code-sonnet。
- 成本透明度:每任务成本从$3到$170不等,这表明高成本不一定带来高回报,用户需根据自身需求权衡。
总之,参数化CAD基准测试为评估AI在工程设计领域的实用能力提供了新视角,强调可编辑性和多步迭代的重要性,结果对开发更高效的AI辅助设计工具具有指导意义。