DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

📄 arXiv: 2607.15418 📥 PDF

作者: Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

分类: cs.AI, cs.CV

发布日期: 2026-07-20


💡 一句话要点

提出DrawingVQA以评估多模态大语言模型在施工图上的推理能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 施工图推理 视觉-文本融合 工程工作流程 基准评估

📋 核心要点

  1. 现有方法在处理复杂施工图时,无法有效融合视觉与文本信息,导致推理能力不足。
  2. 论文提出DrawingVQA基准,通过多模态大语言模型评估施工图的推理能力,涵盖多层次的推理深度。
  3. 实验结果显示,当前最先进的MLLM在高深度推理任务中与专家表现存在显著差距,表明该基准的重要性。

📝 摘要(中文)

我们介绍了DrawingVQA,这是第一个旨在评估多模态大语言模型(MLLMs)在真实施工图上的基准。这些施工图在建筑、土木工程及其他工程实践中是核心媒介。与自然图像或示意平面图不同,施工图融合了抽象几何、符号标记、表格数据、注释和领域特定文本,形成了一个独特复杂的视觉-文本领域。DrawingVQA通过33幅“施工发放”图纸和92对专家策划的问题-答案对,涵盖了三种推理深度:感知理解、上下文解释和领域专家推理。我们提出了一个双重分类框架,以共同分析在七个施工工程和四个MLLM能力维度上的性能,首次明确将工程工作流程映射到AI推理能力上。对最先进的MLLMs的评估显示,模型与专家性能之间存在显著差距,尤其是在更高的推理深度上。该基准为领域专业化的多模态推理奠定了基础,促进了AI驱动理解与真实工程工作流程的整合。

🔬 方法详解

问题定义:本论文旨在解决多模态大语言模型在真实施工图上的推理能力不足的问题。现有方法在处理复杂的视觉-文本信息时,常常无法有效整合,从而影响推理的准确性和深度。

核心思路:DrawingVQA基准通过提供真实施工图和专家策划的问题-答案对,旨在评估和提升多模态大语言模型在不同推理深度上的表现。该设计考虑了施工图的复杂性,强调了视觉和文本信息的融合。

技术框架:该方法包含三个主要模块:施工图数据集的构建、问题-答案对的策划,以及双重分类框架的设计。数据集包括33幅施工图和92个问题-答案对,分类框架则用于分析模型在不同推理深度上的表现。

关键创新:本研究的关键创新在于首次将工程工作流程与AI推理能力进行明确映射,提出了一个系统化的评估框架,填补了现有研究的空白。

关键设计:在模型评估中,采用了多层次的推理深度,分别为感知理解、上下文解释和领域专家推理。通过对比分析,揭示了模型在高深度推理任务中的不足之处。实验中使用了标准的评估指标,以确保结果的可靠性和可比性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,当前最先进的多模态大语言模型在高深度推理任务中的表现与专家之间存在显著差距,尤其是在复杂的施工图分析中,模型的准确率低于专家水平,强调了该基准的重要性和未来改进的方向。

🎯 应用场景

该研究的潜在应用领域包括建筑设计、施工管理和工程教育等。通过提升多模态大语言模型在施工图推理上的能力,可以有效支持工程师在实际工作中的决策,促进AI与工程实践的深度融合,未来可能推动智能建筑和自动化施工的发展。

📄 摘要(原文)

We introduce DrawingVQA, the first benchmark designed to evaluate multimodal large language models (MLLMs) on real-world construction drawings -- a core media in architecture, civil, and many other engineering practices. Unlike natural images or schematic floor plans, construction drawings fuse abstract geometry, symbolic notation, tabular data, annotations, and domain-specific text, forming a uniquely complex visual-textual domain core to engineering workflows. DrawingVQA bridges this gap with 33 "Issued for Construction" drawings and 92 expertly curated question-answer pairs, spanning three reasoning depths: perceptual understanding, contextual interpretation, and domain-expert reasoning. To evaluate model capabilities, we present a dual categorization framework to jointly analyze performance across seven construction-engineering and four MLLM capability dimensions -- the first to explicitly map engineering workflows to AI reasoning competencies. Evaluations of state-of-the-art MLLMs reveal a substantial gap between model and expert performance, particularly at higher reasoning depths. This benchmark lays a foundation for domain-specialized multimodal reasoning to allow for advancement on integration of AI-driven understanding and real-world engineering workflows.