Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V
作者: Jianwei Yang, Hao Zhang, Feng Li, Xueyan Zou, Chunyuan Li, Jianfeng Gao
分类: cs.CV, cs.AI, cs.CL, cs.HC
发布日期: 2023-10-17 (更新: 2023-11-06)
🔗 代码/项目: GITHUB
💡 一句话要点
提出Set-of-Mark方法以提升GPT-4V的视觉定位能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉定位 多模态模型 图像分割 GPT-4V 深度学习
📋 核心要点
- 现有的多模态模型在视觉定位任务中表现不足,尤其是在细粒度的视觉理解上。
- 论文提出的Set-of-Mark方法通过对图像进行区域划分并标记,增强了模型的视觉理解能力。
- 实验结果显示,使用SoM的GPT-4V在多个任务上超越了当前最先进的模型,证明了其有效性。
📝 摘要(中文)
我们提出了一种新的视觉提示方法Set-of-Mark(SoM),旨在释放大型多模态模型(LMMs)如GPT-4V的视觉定位能力。通过使用现成的交互式分割模型(如SEEM/SAM),我们将图像划分为不同粒度的区域,并用字母数字、掩码和框等标记覆盖这些区域。使用标记后的图像作为输入,GPT-4V能够回答需要视觉定位的问题。我们进行了全面的实证研究,验证了SoM在多种细粒度视觉和多模态任务上的有效性。例如,我们的实验表明,使用SoM的GPT-4V在零-shot设置下超越了最先进的完全微调的参考表达理解和分割模型RefCOCOg。SoM提示的代码已公开发布。
🔬 方法详解
问题定义:本论文旨在解决大型多模态模型在视觉定位任务中的不足,尤其是在细粒度视觉理解方面,现有方法往往无法有效处理复杂的视觉信息。
核心思路:论文提出的Set-of-Mark方法通过将图像划分为不同的区域,并用标记进行覆盖,增强了模型对视觉信息的理解能力。这种设计使得模型能够更好地进行视觉定位和理解。
技术框架:整体架构包括使用交互式分割模型(如SEEM/SAM)对图像进行区域划分,接着将这些区域用不同的标记(如字母数字、掩码、框)进行覆盖,最后将处理后的图像输入到GPT-4V中进行问答。
关键创新:最重要的技术创新点在于引入了Set-of-Mark方法,通过标记化的区域划分,显著提升了模型的视觉定位能力。这一方法与现有的视觉提示方法相比,提供了更高的灵活性和准确性。
关键设计:在参数设置上,使用了多种标记形式以适应不同的视觉任务,损失函数设计上考虑了视觉信息的细粒度特性,网络结构上则结合了分割模型与GPT-4V的优势。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用Set-of-Mark方法的GPT-4V在零-shot设置下,在RefCOCOg数据集上超越了当前最先进的完全微调的参考表达理解和分割模型,证明了SoM方法的有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括智能问答系统、图像理解、自动驾驶等。通过提升多模态模型的视觉定位能力,SoM方法可以在实际场景中提供更准确的视觉信息处理,推动相关技术的发展和应用。
📄 摘要(原文)
We present Set-of-Mark (SoM), a new visual prompting method, to unleash the visual grounding abilities of large multimodal models (LMMs), such as GPT-4V. As illustrated in Fig. 1 (right), we employ off-the-shelf interactive segmentation models, such as SEEM/SAM, to partition an image into regions at different levels of granularity, and overlay these regions with a set of marks e.g., alphanumerics, masks, boxes. Using the marked image as input, GPT-4V can answer the questions that require visual grounding. We perform a comprehensive empirical study to validate the effectiveness of SoM on a wide range of fine-grained vision and multimodal tasks. For example, our experiments show that GPT-4V with SoM in zero-shot setting outperforms the state-of-the-art fully-finetuned referring expression comprehension and segmentation model on RefCOCOg. Code for SoM prompting is made public at: https://github.com/microsoft/SoM.