MoqaGPT : Zero-Shot Multi-modal Open-domain Question Answering with Large Language Model

📄 arXiv: 2310.13265v1 📥 PDF

作者: Le Zhang, Yihong Wu, Fengran Mo, Jian-Yun Nie, Aishwarya Agrawal

分类: cs.CL

发布日期: 2023-10-20

备注: Accepted into EMNLP2023 Findings

🔗 代码/项目: GITHUB


💡 一句话要点

提出MoqaGPT以解决多模态开放域问答问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态问答 大型语言模型 信息检索 零-shot学习 框架设计

📋 核心要点

  1. 现有的多模态开放域问答方法在处理不同模态的信息检索和融合时存在局限性,尤其是大型语言模型的应用效果不佳。
  2. 本文提出的MoqaGPT框架采用分而治之的策略,能够灵活应对多种模态,并在零-shot条件下进行有效的问答。
  3. 实验结果表明,MoqaGPT在多个数据集上显著提升了问答性能,尤其是在MMCoQA和MultiModalQA数据集上,F1和EM分数均有显著提高。

📝 摘要(中文)

多模态开放域问答通常需要从多种模态(如图像、表格、段落等)中检索证据,现有的大型语言模型(如GPT-4)在此任务中表现不足。为使大型语言模型能够以零-shot方式处理该任务,本文提出了MoqaGPT,一个简单灵活的框架。该框架采用分而治之的策略,避免复杂的多模态排序,能够适应新模态并无缝过渡到新模型。MoqaGPT分别从每种模态中检索和提取答案,然后利用大型语言模型融合这些多模态信息以生成最终答案。该方法在MMCoQA数据集上提升了F1分数37.91点,EM分数34.07点,相较于监督基线有显著提升。在MultiModalQA数据集上,MoqaGPT超越了零-shot基线,F1提升9.5点,EM提升10.1点,显著缩小了与监督方法的差距。

🔬 方法详解

问题定义:本文旨在解决多模态开放域问答中,现有方法在信息检索和融合方面的不足,尤其是大型语言模型在处理多模态数据时的局限性。

核心思路:MoqaGPT通过分而治之的策略,分别从每种模态中检索答案,然后利用大型语言模型进行信息融合,从而实现高效的问答。该设计旨在简化多模态处理过程,避免复杂的排序机制。

技术框架:MoqaGPT的整体架构包括多个模块:首先是模态检索模块,针对每种模态进行独立的答案提取;其次是信息融合模块,利用大型语言模型将不同模态的信息整合为最终答案。

关键创新:MoqaGPT的主要创新在于其灵活的框架设计,能够适应新模态并无缝切换到新模型,显著提升了多模态问答的性能。与现有方法相比,该框架避免了复杂的多模态排序过程。

关键设计:在模型设计上,MoqaGPT采用了特定的损失函数和参数设置,以优化多模态信息的融合效果。具体的网络结构和参数细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在MMCoQA数据集上,MoqaGPT的F1分数提升了37.91点,EM分数提升了34.07点,显著超越了监督基线。在MultiModalQA数据集上,F1和EM分数分别提升了9.5点和10.1点,显示出其在零-shot条件下的强大性能,接近监督方法的效果。

🎯 应用场景

MoqaGPT的研究成果具有广泛的应用潜力,特别是在智能问答系统、信息检索和人机交互等领域。其灵活的多模态处理能力可以提升用户体验,帮助用户更高效地获取信息。此外,该框架的设计理念也为未来的多模态学习研究提供了新的思路。

📄 摘要(原文)

Multi-modal open-domain question answering typically requires evidence retrieval from databases across diverse modalities, such as images, tables, passages, etc. Even Large Language Models (LLMs) like GPT-4 fall short in this task. To enable LLMs to tackle the task in a zero-shot manner, we introduce MoqaGPT, a straightforward and flexible framework. Using a divide-and-conquer strategy that bypasses intricate multi-modality ranking, our framework can accommodate new modalities and seamlessly transition to new models for the task. Built upon LLMs, MoqaGPT retrieves and extracts answers from each modality separately, then fuses this multi-modal information using LLMs to produce a final answer. Our methodology boosts performance on the MMCoQA dataset, improving F1 by +37.91 points and EM by +34.07 points over the supervised baseline. On the MultiModalQA dataset, MoqaGPT surpasses the zero-shot baseline, improving F1 by 9.5 points and EM by 10.1 points, and significantly closes the gap with supervised methods. Our codebase is available at https://github.com/lezhang7/MOQAGPT.