Improved Baselines with Visual Instruction Tuning

📄 arXiv: 2310.03744v2 📥 PDF

作者: Haotian Liu, Chunyuan Li, Yuheng Li, Yong Jae Lee

分类: cs.CV, cs.AI, cs.CL, cs.LG

发布日期: 2023-10-05 (更新: 2024-05-15)

备注: Camera ready, CVPR 2024 (highlight). LLaVA project page: https://llava-vl.github.io


💡 一句话要点

通过视觉指令调优提升多模态模型基线性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态模型 视觉指令调优 数据效率 视觉-语言融合 问答系统 深度学习

📋 核心要点

  1. 现有的多模态模型在视觉指令调优方面存在数据效率低和性能提升有限的问题。
  2. 本文通过对LLaVA进行简单修改,采用新的视觉-语言连接器和任务导向的数据格式,提升了模型性能。
  3. 实验结果表明,经过改进的模型在11个基准测试中达到了最先进的性能,显著提升了基线效果。

📝 摘要(中文)

近年来,大型多模态模型(LMM)在视觉指令调优方面取得了显著进展。本文展示了LLaVA中全连接的视觉-语言跨模态连接器的强大和数据高效性。通过对LLaVA进行简单修改,采用CLIP-ViT-L-336px与MLP投影,并添加学术任务导向的VQA数据,建立了更强的基线,在11个基准测试中实现了最先进的性能。最终的13B检查点仅使用了120万条公开数据,并在单个8-A100节点上完成了约1天的全训练。我们希望这能使最先进的LMM研究更加可及。代码和模型将公开发布。

🔬 方法详解

问题定义:本文旨在解决现有多模态模型在视觉指令调优中的数据效率低和性能不足的问题。现有方法在处理复杂任务时,往往需要大量数据和计算资源。

核心思路:通过对LLaVA模型进行简单的结构修改,结合CLIP-ViT-L-336px和MLP投影,利用学术任务导向的VQA数据进行训练,从而提高模型的性能和数据利用率。

技术框架:整体架构包括视觉-语言跨模态连接器、MLP投影模块和任务导向的数据输入。模型通过这些模块实现了更高效的特征融合和信息传递。

关键创新:最重要的创新在于通过简单的结构调整和数据格式优化,显著提升了模型的性能,使其在多个基准测试中表现出色。这与现有方法的复杂性形成鲜明对比。

关键设计:在参数设置上,使用了CLIP-ViT-L-336px作为视觉特征提取器,并通过MLP进行投影。同时,采用了简单的响应格式来处理VQA数据,确保了训练过程的高效性。实验中仅使用了120万条公开数据,训练时间也大幅缩短。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,经过改进的模型在11个基准测试中达到了最先进的性能,显著提升了基线效果。最终的13B检查点在仅使用120万条公开数据的情况下,训练时间仅为约1天,展现了极高的数据效率和性能提升。

🎯 应用场景

该研究的潜在应用领域包括智能问答系统、图像理解和多模态交互等。通过提升多模态模型的性能,可以在教育、医疗、自动驾驶等多个行业中实现更高效的智能应用。未来,该技术可能会推动更广泛的多模态研究和应用的发展。

📄 摘要(原文)

Large multimodal models (LMM) have recently shown encouraging progress with visual instruction tuning. In this note, we show that the fully-connected vision-language cross-modal connector in LLaVA is surprisingly powerful and data-efficient. With simple modifications to LLaVA, namely, using CLIP-ViT-L-336px with an MLP projection and adding academic-task-oriented VQA data with simple response formatting prompts, we establish stronger baselines that achieve state-of-the-art across 11 benchmarks. Our final 13B checkpoint uses merely 1.2M publicly available data, and finishes full training in ~1 day on a single 8-A100 node. We hope this can make state-of-the-art LMM research more accessible. Code and model will be publicly available.