DrawingVQA:面向施工圖紙的多深度視覺文本推理真實世界基準
DrawingVQA 是首個專為評估多模態大語言模型(MLLM)在真實施工圖紙上表現而設計的基準。它包含33張“簽發施工”圖紙和92個專家策劃的問答對,涵蓋感知理解、上下文解釋和領域專家推理三個深度。透過雙分類框架,該基準首次將工程工作流對映到AI推理能力,評估顯示最先進的MLLM與專家效能之間仍存在顯著差距,尤其是在高推理深度上。
研究人員近日釋出了 DrawingVQA,這是首個專門用於評估多模態大語言模型(MLLM)在真實施工圖紙上理解與推理能力的基準測試。施工圖紙是建築、土木工程等領域核心的視覺文本媒介,融合了抽象幾何、符號標記、表格資料、註釋及領域特定文本,其複雜程度遠超自然影像或示意圖。與傳統的平面圖或自然影像不同,施工圖紙包含大量專業符號、尺寸標註、材料說明以及跨圖紙的引用關係,對模型的視覺理解和領域知識提出了極高要求。
DrawingVQA 基準包含33張“簽發施工”圖紙和92個由專家精心設計的問答對,這些問答對按推理深度分為三個層次:感知理解(例如識別門窗、管道等基本元素)、上下文解釋(例如理解符號與標註的含義,推斷構件的功能)以及領域專家推理(例如綜合多張圖紙和建築規範進行安全分析或設計決策)。此外,研究團隊提出了一個雙分類框架,同時從七個施工工程維度(如結構、機電、暖通等)和四個MLLM能力維度(如視覺感知、文本理解、邏輯推理、知識整合)分析模型表現,首次將工程工作流明確對映到AI推理能力上。這一框架不僅用於評估現有模型,也為未來模型的設計和改進提供了方向。
對當前最先進的MLLM(如 GPT-4V、Gemini等)進行的評估顯示,模型在感知理解任務上表現尚可,準確率接近專家水平的70%,但隨著推理深度增加,與專家水平的差距顯著擴大。在領域專家推理層面,模型準確率不足30%,而專家可達90%以上。例如,在需要綜合多張圖紙和領域知識的任務中,模型往往忽略關鍵細節或錯誤解讀符號,導致決策失誤。這一結果表明,儘管MLLM在通用視覺任務上取得了長足進步,但在專業工程領域仍需進一步提升,尤其是在深層推理和跨知識整合方面。
DrawingVQA 團隊表示,該基準為領域專用的多模態推理奠定了堅實基礎,有望推動AI在真實工程工作流中的整合。相關論文已被 CVPR 2026 接收,並可在 arXiv 上獲取(ID: 2607.15418)。未來工作將擴充套件圖紙型別(如結構、電氣、給排水)和問題多樣性,並探索結合專業知識訓練的模型架構,例如引入圖神經網路或領域特定預訓練。DrawingVQA 的釋出標誌著AI從通用視覺向專業工程應用邁出了重要一步,為建築行業的智慧化轉型提供了新的可能性。