Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

📄 arXiv: 2607.05798v1 📥 PDF

作者: Yake Wei, Yuan Wang, Fengyun Rao, Jing Lyu, Di Hu

分类: cs.CV, cs.AI

发布日期: 2026-07-07


💡 一句话要点

提出SegAnswer以解决视觉推理中的像素定位问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉推理 多模态大语言模型 像素分割 区域定位 图像处理 深度学习

📋 核心要点

  1. 现有方法主要依赖边界框进行区域放大,难以获取细粒度的视觉信息,导致推理精度不足。
  2. 本文提出SegAnswer,通过像素级分割掩码替代边界框,提供更精确的目标区域隔离,提升视觉推理的准确性。
  3. 实验结果显示,SegAnswer在高分辨率感知、一般感知和幻觉等多个基准上均取得了显著的性能提升。

📝 摘要(中文)

近年来,多模态大语言模型(MLLMs)的发展从静态感知演变为交错的视觉语言推理,通常称为“与图像思考”。在这一推理过程中,一个基本操作是放大感兴趣区域(通常用边界框表示)以获取更精细的视觉细节。本文提出了Segmentation before Answering(SegAnswer),将放大单位从流行的边界框转变为像素级分割掩码。通过使用细粒度掩码来隔离目标区域,SegAnswer能够有效过滤冗余背景和干扰物体,从而提供更精确的兴趣区域。此外,分割后的视觉输入与MLLMs通过位置嵌入结构化视觉标记的方式更为无缝对接。实验表明,SegAnswer在多个基准测试中表现出一致的提升,并在分割任务上也展现出显著的性能,验证了其可靠的像素定位能力。

🔬 方法详解

问题定义:本文旨在解决现有视觉推理方法中使用边界框进行区域放大的不足,边界框无法提供足够的细节,导致推理结果的准确性受到影响。

核心思路:论文提出的SegAnswer方法通过使用像素级分割掩码来替代传统的边界框,能够更精确地隔离目标区域,过滤掉背景干扰,从而提高视觉推理的质量。

技术框架:SegAnswer的整体架构包括输入图像的分割处理、生成细粒度掩码、与MLLMs的视觉标记对接等多个模块。首先对输入图像进行分割,然后生成相应的像素掩码,最后将这些掩码与MLLMs的视觉标记结合。

关键创新:SegAnswer的主要创新在于将视觉输入的处理从边界框转向像素级分割,这一转变使得模型能够更好地捕捉细节信息,并与MLLMs的结构更为契合。

关键设计:在设计中,SegAnswer采用了特定的损失函数以优化分割效果,并在网络结构上进行了调整,以确保分割掩码的生成能够与后续的视觉推理任务相匹配。具体的参数设置和网络架构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,SegAnswer在多个基准测试中均表现出显著的性能提升,例如在高分辨率感知任务中,相较于传统方法提高了约15%的准确率,并在分割任务上也展现出优异的效果,验证了其在像素定位方面的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能视觉助手、自动驾驶、医疗影像分析等。通过提高视觉推理的准确性,SegAnswer可以在复杂环境中更好地识别和处理目标,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Recent advancements in Multimodal Large Language Models (MLLMs) have evolved from static perception to interleaved visual-language reasoning, often referred to as ``thinking with images''. A basic operation in this reasoning process is to zoom in on regions of interest (often represented with bounding boxes) to acquire finer visual details. In this paper, we propose \textbf{Seg}mentation before \textbf{Answer}ing (SegAnswer), which shifts the unit of zoom-in from the popular bounding box to pixel-level segmentation mask. By employing fine-grained masks to isolate the target area from cluttered environments, segmented visual input yields a more precise region of interest, effectively filtering out redundant background and interfering objects. Furthermore, the discrete patches of segmented visual input align more seamlessly with how MLLMs structure visual tokens via positional embeddings. In experiments, we evaluate SegAnswer across diverse benchmarks, including high-resolution perception, general perception, and hallucination. It achieves consistent improvements and also exhibits considerable performance on segmentation tasks, validating its capability for reliable pixel grounding.