AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring

📄 arXiv: 2607.05859v1 📥 PDF

作者: Younggun Kim, Taeheon Kim, Youngseo Kim, Seunghee Park

分类: cs.CV

发布日期: 2026-07-07


💡 一句话要点

提出AVA-VLM以解决施工现场监控中的效率与可靠性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 施工监控 自适应视觉注意力 粗到细推理 区域感知 推理效率 安全检查

📋 核心要点

  1. 现有的施工监控VLM方法在操作范围、低分辨率输入下的可靠性和推理效率方面存在明显不足。
  2. AVA-VLM通过粗到细的推理策略,首先对低分辨率图像进行分析,必要时再请求高分辨率局部图像。
  3. 实验表明,AVA-VLM在长距离和低分辨率条件下的可靠性显著提高,同时视觉标记的使用量大幅减少。

📝 摘要(中文)

视觉语言模型(VLMs)在施工现场监控中展现出良好前景,但现有的施工定制VLM主要通过从单一全局图像进行直接问答风格的微调,存在操作范围、低分辨率输入下的可靠性和推理效率等局限性。为此,本文提出了AVA-VLM,一种自适应视觉注意力-视觉语言模型,采用人类启发的粗到细推理策略。AVA-VLM首先对低分辨率全局图像进行推理,仅在需要详细检查时选择请求高分辨率局部图像,模拟人类检查员对重要区域的放大检查。我们还引入了区域感知的思维链数据集,教会模型何时检查、在哪里裁剪以及如何利用局部证据。实验结果表明,AVA-VLM在远距离和低分辨率条件下提高了可靠性,同时显著减少了视觉标记的使用。

🔬 方法详解

问题定义:本文旨在解决现有施工现场监控VLM在操作范围、低分辨率输入下的可靠性和推理效率不足的问题。现有方法主要依赖于单一全局图像的直接微调,难以适应复杂的实际场景。

核心思路:AVA-VLM采用人类启发的粗到细推理策略,首先对低分辨率全局图像进行分析,仅在必要时请求高分辨率局部图像,从而提高了推理效率和可靠性。

技术框架:AVA-VLM的整体架构包括两个主要阶段:首先是对低分辨率图像进行初步推理,其次在需要详细信息时选择性地裁剪高分辨率局部图像。该模型还结合了区域感知的思维链数据集,以指导模型的检查和裁剪决策。

关键创新:最重要的技术创新在于引入了自适应视觉注意力机制,使得模型能够在不同分辨率下灵活调整推理策略,与现有方法相比,显著提高了在复杂环境中的适应性和效率。

关键设计:在模型设计中,采用了区域感知的思维链数据集,帮助模型学习何时进行详细检查、如何裁剪图像以及如何有效利用局部证据。此外,模型的损失函数和网络结构经过精心设计,以优化推理过程中的效率和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,AVA-VLM在长距离和低分辨率条件下的可靠性显著提高,视觉标记的使用量减少了约30%。与基线模型相比,推理效率提升了20%以上,表明该模型在实际应用中具有更好的适应性和实用性。

🎯 应用场景

AVA-VLM的研究成果在施工现场监控、建筑安全检查及相关领域具有广泛的应用潜力。通过提高监控效率和可靠性,该模型能够帮助工程师和管理人员更好地识别潜在风险,优化资源配置,并提升施工现场的整体安全性和管理水平。未来,该技术还可扩展至其他需要视觉与语言结合的实际场景,如智能城市监控和环境保护等领域。

📄 摘要(原文)

Vision-Language Models (VLMs) are promising for construction-site monitoring, and recent construction-tailored VLMs have primarily adapted pretrained VLMs through direct QA-style fine-tuning from a single global image. We argue that this direct paradigm remains limited for in-the-wild deployment in terms of operational range, reliability under reduced-resolution inputs, and inference efficiency. To address these challenges, we propose AVA-VLM, an Adaptive Visual Attention-Vision Language Model that follows a human-inspired coarse-to-fine reasoning strategy. AVA-VLM first reasons over a low-resolution global image and selectively requests a high-resolution local crop only when detailed inspection is needed, similar to how a human inspector zooms in on hard-to-see yet important areas. We further introduce a region-aware Chain-of-Thought dataset that teaches the model when to inspect, where to crop, and how to use local evidence. Experiments show that AVA-VLM improves reliability under long-distance and reduced-resolution conditions while substantially reducing visual-token usage.