DrawingVQA:面向施工图纸的多深度视觉文本推理真实世界基准
DrawingVQA 是首个专为评估多模态大语言模型(MLLM)在真实施工图纸上表现而设计的基准。它包含33张“签发施工”图纸和92个专家策划的问答对,涵盖感知理解、上下文解释和领域专家推理三个深度。通过双分类框架,该基准首次将工程工作流映射到AI推理能力,评估显示最先进的MLLM与专家性能之间仍存在显著差距,尤其是在高推理深度上。
研究人员近日发布了 DrawingVQA,这是首个专门用于评估多模态大语言模型(MLLM)在真实施工图纸上理解与推理能力的基准测试。施工图纸是建筑、土木工程等领域核心的视觉文本媒介,融合了抽象几何、符号标记、表格数据、注释及领域特定文本,其复杂程度远超自然图像或示意图。与传统的平面图或自然图像不同,施工图纸包含大量专业符号、尺寸标注、材料说明以及跨图纸的引用关系,对模型的视觉理解和领域知识提出了极高要求。
DrawingVQA 基准包含33张“签发施工”图纸和92个由专家精心设计的问答对,这些问答对按推理深度分为三个层次:感知理解(例如识别门窗、管道等基本元素)、上下文解释(例如理解符号与标注的含义,推断构件的功能)以及领域专家推理(例如综合多张图纸和建筑规范进行安全分析或设计决策)。此外,研究团队提出了一个双分类框架,同时从七个施工工程维度(如结构、机电、暖通等)和四个MLLM能力维度(如视觉感知、文本理解、逻辑推理、知识整合)分析模型表现,首次将工程工作流明确映射到AI推理能力上。这一框架不仅用于评估现有模型,也为未来模型的设计和改进提供了方向。
对当前最先进的MLLM(如 GPT-4V、Gemini等)进行的评估显示,模型在感知理解任务上表现尚可,准确率接近专家水平的70%,但随着推理深度增加,与专家水平的差距显著扩大。在领域专家推理层面,模型准确率不足30%,而专家可达90%以上。例如,在需要综合多张图纸和领域知识的任务中,模型往往忽略关键细节或错误解读符号,导致决策失误。这一结果表明,尽管MLLM在通用视觉任务上取得了长足进步,但在专业工程领域仍需进一步提升,尤其是在深层推理和跨知识整合方面。
DrawingVQA 团队表示,该基准为领域专用的多模态推理奠定了坚实基础,有望推动AI在真实工程工作流中的集成。相关论文已被 CVPR 2026 接收,并可在 arXiv 上获取(ID: 2607.15418)。未来工作将扩展图纸类型(如结构、电气、给排水)和问题多样性,并探索结合专业知识训练的模型架构,例如引入图神经网络或领域特定预训练。DrawingVQA 的发布标志着AI从通用视觉向专业工程应用迈出了重要一步,为建筑行业的智能化转型提供了新的可能性。