HoloCount: A Holistic Visual Counting Benchmark for MLLMs

📄 arXiv: 2607.06420v1 📥 PDF

作者: Jinhong Deng, Limeng Qiao, Guanglu Wan

分类: cs.CV

发布日期: 2026-07-07

备注: Technical report

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出HoloCount以解决多模态大语言模型的计数精度问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 视觉计数 鲁棒性测试 空间推理 数据集构建

📋 核心要点

  1. 现有的计数基准主要集中在简化环境中的基本感知,未能捕捉复杂的失败模式。
  2. HoloCount通过三层层次分类法评估MLLMs在语义计数、分析计数和鲁棒性测试中的表现。
  3. 对20多种最先进的MLLMs的评估显示,模型在复杂推理和不利场景下性能显著下降。

📝 摘要(中文)

视觉计数是多模态智能的基础,要求精细的定位和空间推理的无缝结合。尽管多模态大语言模型(MLLMs)在定性场景理解上取得了显著成功,但其定量精度仍然是一个重大瓶颈,常常表现为持续的数字幻觉。现有的计数基准主要集中在简化环境中的基本感知,未能捕捉在逻辑约束或对抗条件下出现的复杂失败模式。为了解决这些局限性,我们提出了HoloCount,这是一个围绕三层层次分类法构建的整体性和诊断性丰富的基准。HoloCount评估MLLMs在语义计数、分析计数和鲁棒性测试等方面的表现。通过对20多种最先进的MLLMs进行全面评估,我们揭示了一个关键的性能差距:即使是顶尖模型,在任务从感知转向复杂分析推理和不利场景时,性能显著下降。我们的发现为当前MLLM计数能力提供了系统的全景,并为开发更为扎实和可靠的多模态系统提供了路线图。

🔬 方法详解

问题定义:本论文旨在解决多模态大语言模型在视觉计数中的定量精度不足问题,现有方法在复杂逻辑和对抗条件下表现不佳,导致数字幻觉现象频繁出现。

核心思路:HoloCount通过引入三层层次分类法,全面评估MLLMs的计数能力,涵盖语义计数、分析计数和鲁棒性测试,以此来揭示模型在不同任务中的性能差异。

技术框架:HoloCount的整体架构包括三个主要模块:语义计数模块,专注于原子和属性基础的枚举;分析计数模块,评估空间和集合基础的逻辑组合;鲁棒性测试模块,检验模型在高密度场景和语言偏见下的完整性。

关键创新:HoloCount的关键创新在于其三层层次分类法的设计,能够系统性地揭示MLLMs在复杂计数任务中的性能差距,与现有方法相比,提供了更为全面的评估框架。

关键设计:在设计中,HoloCount采用了多样化的场景设置和对抗条件,以确保模型在各种情况下的鲁棒性,此外,数据集的构建也考虑了高密度场景和语言偏见等因素。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,20多种最先进的MLLMs在从感知任务转向复杂分析推理时,性能下降幅度显著,揭示了当前模型在处理高密度场景和逻辑推理时的不足。这一发现为未来的模型改进提供了重要依据。

🎯 应用场景

HoloCount的研究成果在多模态智能系统的开发中具有重要应用价值,尤其是在需要精确计数和空间推理的领域,如自动驾驶、智能监控和机器人视觉等。未来,该基准可能推动更为可靠的多模态系统的设计与实现。

📄 摘要(原文)

Visual counting is a fundamental pillar of multimodal intelligence, requiring a seamless integration of fine-grained grounding and spatial reasoning. While Multimodal Large Language Models (MLLMs) have achieved remarkable success in qualitative scene understanding, their quantitative precision remains a significant bottleneck, often characterized by persistent numerical hallucinations. Existing counting benchmarks primarily focus on basic perception in simplified contexts, failing to capture the complex failure modes that emerge under logical constraints or adversarial conditions. To address these limitations, we introduce HoloCount, a holistic and diagnostically rich benchmark structured around a three-level hierarchical taxonomy. HoloCount evaluates MLLMs across: (1) Semantic Counting, focusing on atomic and property-based enumeration; (2) Analytical Counting, assessing logical composition through spatial and set-based reasoning; and (3) Robustness Testing, probing model integrity against adverse scenarios and grounded counter-priors, such as high-density scenes and linguistic biases. Through an exhaustive evaluation of over 20 state-of-the-art MLLMs, we reveal a critical performance gap: even top-tier models degrade significantly as tasks transition from perception to complex analytical reasoning and adverse scenarios. Our findings provide a systematic landscape of current MLLM counting capabilities and offer a roadmap for developing more grounded and reliable multimodal systems. The dataset is available at https://mm-mvr.github.io/HoloCount/.