OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

📄 arXiv: 2607.09068v1 📥 PDF

作者: Yang Chen, Yunwen Li, Yufan Shen, Minghao Liu, Tianyu Zheng, Bin Fu, Qunshu Lin, Zhi Yu, Botian Shi

分类: cs.CV, cs.AI

发布日期: 2026-07-10

🔗 代码/项目: GITHUB


💡 一句话要点

提出OmniMapBench以解决视觉中心推理的基准问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉推理 地图文档 基准测试 视觉依赖指数 大规模语言模型 多模态学习 文档理解

📋 核心要点

  1. 现有文档理解基准常常将视觉内容简化为文本,导致模型在视觉推理方面的能力受到限制。
  2. OmniMapBench通过提供2,096对手动标注的问题-答案对,专注于不可简化的视觉推理,促进地图文档的视觉中心推理。
  3. 在对25个领先的LVLMs进行评估时,最佳模型的准确率仅为75.03%,显示出OmniMapBench的挑战性。

📝 摘要(中文)

随着大规模视觉语言模型(LVLMs)的进步,复杂的视觉基础推理需要强有力的基准测试。现有文档理解基准的一个关键限制是,视觉内容往往可以简化为文本,从而使得模型在没有真正的视觉基础的情况下也能取得高性能。为了解决这一限制,本文提出了OmniMapBench,旨在促进地图文档的视觉中心推理。该基准包含2,096对手动标注的问题-答案对,涵盖来自九个类别的1,603份地图文档。它设计用于探测从感知到多步视觉推理的技能层次。为量化基准特性,提出了一种简单而有效的基准级别指标:视觉依赖指数(VDI),定义为当图像被与问题无关的描述替换时的准确率下降。OmniMapBench的VDI高于现有基准,定量验证了其对不可简化视觉推理的关注。对25个领先的LVLMs进行了全面评估,结果显示,表现最佳的模型仅达到75.03%的准确率,突显了OmniMapBench对当前LVLMs所带来的挑战。

🔬 方法详解

问题定义:本文旨在解决现有文档理解基准中视觉内容可简化为文本的问题,导致模型在视觉推理能力上的不足。

核心思路:通过引入OmniMapBench基准,提供不可简化的视觉推理任务,促进对地图文档的深入理解。该基准设计了多层次的技能考察,从感知到多步推理,确保模型在视觉推理上具备真实能力。

技术框架:OmniMapBench的整体架构包括数据收集、手动标注、问题-答案对生成和性能评估四个主要模块。数据来源于九个类别的地图文档,确保多样性和复杂性。

关键创新:最重要的创新点在于提出了视觉依赖指数(VDI),用于量化模型在视觉推理任务中的表现,强调了不可简化视觉推理的重要性。与现有基准相比,VDI提供了更为严格的评估标准。

关键设计:在设计过程中,采用了手动标注的方式确保问题-答案对的质量,设置了多样化的任务类型,并通过对比实验验证了VDI的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在对25个领先的LVLMs进行评估时,最佳模型的准确率仅为75.03%,显示出OmniMapBench在推动视觉推理能力方面的挑战性。VDI的引入为模型性能提供了新的评估标准,强调了视觉推理的复杂性。

🎯 应用场景

OmniMapBench的研究成果可广泛应用于地图文档的自动理解、智能问答系统以及增强现实等领域。通过提升视觉推理能力,未来可在城市规划、导航系统和教育等多个实际场景中发挥重要作用。

📄 摘要(原文)

Recent advancements in LVLMs necessitate robust benchmarks for complex, visually grounded reasoning. A critical limitation is identified in many document understanding benchmarks: visual content is often reducible to text, enabling high performance without genuine visual grounding. To address this limitation, OmniMapBench is introduced to foster visual-centric reasoning for map documents. The benchmark comprises 2,096 manually annotated question-answer pairs across 1,603 map documents from nine categories. It is designed to probe a hierarchy of skills, ranging from perception to multi-step visual reasoning. To quantify benchmark properties, a simple yet effective benchmark-level metric is proposed: the Visual Dependency Index (VDI), defined as the accuracy drop when images are replaced with question-agnostic descriptions. OmniMapBench exhibits higher VDI than established benchmarks, which quantitatively validates its focus on irreducible visual reasoning. Comprehensive evaluations of 25 leading LVLMs are conducted on OmniMapBench. A significant performance gap is observed, with the top-performing model achieving only 75.03\% accuracy. This result underscores the challenges posed by OmniMapBench to current LVLMs. This work aims to catalyze progress in visual-centric reasoning for document understanding of LVLMs. The dataset and code are publicly available at https://github.com/SIGMME/OmniMapBench.