Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
作者: Shiyu Xuan, Qingpei Guo, Ming Yang, Shiliang Zhang
分类: cs.CV, cs.AI
发布日期: 2023-10-01 (更新: 2024-03-13)
🔗 代码/项目: GITHUB
💡 一句话要点
提出新框架以提升多模态大语言模型的细粒度图像理解能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 细粒度图像理解 指令调优 自一致性自举 视觉编码器调优 数据集构建 图像感知
📋 核心要点
- 现有的多模态大语言模型在细粒度图像理解任务中的表现仍然有限,无法满足实际应用需求。
- 本文提出了一种新方法,通过利用现有数据集的注释低成本构建指令调优数据集,并引入自一致性自举方法生成高质量的指代表达边界框对。
- 实验结果显示,模型在GQA上比Qwen-VL提高了5.2%的准确率,并在RefCOCO_val上超越Kosmos-2达24.7%,在MMBench排行榜上取得了第一名。
📝 摘要(中文)
多模态大语言模型(MLLMs)在多种多模态任务中表现出色,但在细粒度图像理解任务中的性能仍然有限。为了解决这一问题,本文提出了一种新框架,以增强MLLMs的细粒度图像理解能力。具体而言,我们提出了一种低成本构建指令调优数据集的方法,利用现有数据集中的注释。同时,引入了一种自一致性自举方法,将现有的密集对象注释扩展为高质量的指代表达边界框对。这些方法使得生成的高质量指令数据涵盖了细粒度图像感知所需的多种基本能力。此外,我们认为在指令调优过程中应对视觉编码器进行调优,以缩小全图像感知与细粒度图像感知之间的差距。实验结果表明,我们的方法具有优越的性能。
🔬 方法详解
问题定义:本文旨在解决多模态大语言模型在细粒度图像理解任务中的性能不足问题。现有方法在处理复杂图像内容时,往往无法有效捕捉细节信息,导致理解能力受限。
核心思路:提出了一种新框架,通过低成本构建指令调优数据集,并利用自一致性自举方法生成高质量的指代表达边界框对,从而提升模型的细粒度图像理解能力。
技术框架:整体架构包括数据集构建模块、指令调优模块和视觉编码器调优模块。首先,通过现有数据集的注释生成指令数据;然后,进行模型的指令调优;最后,调优视觉编码器以缩小感知差距。
关键创新:最重要的创新在于提出了自一致性自举方法,将密集对象注释扩展为高质量的指代表达边界框对,这一方法显著提升了数据集的质量和模型的理解能力。
关键设计:在模型训练中,采用了特定的损失函数以优化指令数据的生成质量,并对视觉编码器的参数进行了细致调节,以确保在指令调优过程中能够有效捕捉图像细节。具体的网络结构和参数设置在论文中详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,本文提出的模型在GQA数据集上比Qwen-VL提高了5.2%的准确率,并在RefCOCO_val上超越Kosmos-2达24.7%。此外,模型在MMBench排行榜上取得了第一名,展现了其优越的性能和广泛的适用性。
🎯 应用场景
该研究的潜在应用领域包括智能图像检索、自动图像标注和人机交互等。通过提升多模态大语言模型的细粒度图像理解能力,可以在实际应用中实现更高效的图像处理和理解,为相关行业带来显著的价值和影响。
📄 摘要(原文)
Multi-modal Large Language Models (MLLMs) have shown remarkable capabilities in various multi-modal tasks. Nevertheless, their performance in fine-grained image understanding tasks is still limited. To address this issue, this paper proposes a new framework to enhance the fine-grained image understanding abilities of MLLMs. Specifically, we present a new method for constructing the instruction tuning dataset at a low cost by leveraging annotations in existing datasets. A self-consistent bootstrapping method is also introduced to extend existing dense object annotations into high-quality referring-expression-bounding-box pairs. These methods enable the generation of high-quality instruction data which includes a wide range of fundamental abilities essential for fine-grained image perception. Moreover, we argue that the visual encoder should be tuned during instruction tuning to mitigate the gap between full image perception and fine-grained image perception. Experimental results demonstrate the superior performance of our method. For instance, our model exhibits a 5.2% accuracy improvement over Qwen-VL on GQA and surpasses the accuracy of Kosmos-2 by 24.7% on RefCOCO_val. We have also attained the top rank on the leaderboard of MMBench. This promising performance is achieved by training on only publicly available data, making it easily reproducible. The models, datasets, and codes are publicly available at https://github.com/SY-Xuan/Pink.