DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

📄 arXiv: 2607.23944v1 📥 PDF

作者: Hao Yang, Jin Wang, Xuejie Zhang

分类: cs.AI

发布日期: 2026-07-27

DOI: 10.18653/v1/2026.findings-acl.1933

🔗 代码/项目: GITHUB


💡 一句话要点

提出DICA以解决多模态大语言模型的视觉推理问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 视觉推理 对比对齐 信息论指标 注意力机制 幻觉现象 智能问答 图像描述生成

📋 核心要点

  1. 现有多模态大语言模型在视觉推理中存在注意力漂移和视觉证据利用不足的问题,导致生成内容的幻觉现象。
  2. 本研究提出DICA,通过跟踪视觉注意力熵和输出图像相关性两个指标,进行针对性的对比对齐,恢复视觉基础。
  3. 实验结果显示,DICA在多个基准测试中表现优异,显著降低了幻觉现象,提高了推理的可靠性。

📝 摘要(中文)

人类视觉推理通常遵循从全局到细节的注意力过程,但多模态大语言模型可能因注意力漂移和视觉证据的不足而偏离这一模式,导致幻觉现象。为此,本研究提出了双指标引导对比对齐(DICA),在推理过程中跟踪两个信息论指标:视觉注意力熵(VAE)和输出图像相关性(OIC)。VAE反映视觉注意力的集中程度,而OIC则衡量生成输出与视觉输入的依赖关系。VAE的异常增加或OIC的减少对应不同的失败模式,触发针对性的对比对齐以恢复视觉基础。实验结果表明,DICA在多个基准测试中持续优于现有方法,并显著减少幻觉现象,突显了指标驱动干预在提高多模态推理可靠性方面的有效性。

🔬 方法详解

问题定义:本论文旨在解决多模态大语言模型在视觉推理中出现的注意力漂移和视觉证据利用不足的问题,这些问题会导致生成内容的幻觉现象。

核心思路:论文提出的DICA方法通过引入视觉注意力熵(VAE)和输出图像相关性(OIC)两个信息论指标,实时监测模型的视觉注意力分布和生成输出的相关性,从而进行针对性的对比对齐,恢复视觉基础。

技术框架:DICA的整体架构包括两个主要模块:首先是指标监测模块,实时计算VAE和OIC;其次是对比对齐模块,根据监测结果进行调整,以确保生成的输出与视觉输入保持一致。

关键创新:DICA的核心创新在于引入了两个信息论指标(VAE和OIC)作为引导,能够有效识别模型的失败模式并进行针对性干预,这与传统方法仅依赖固定策略的设计有本质区别。

关键设计:在DICA中,VAE用于评估视觉注意力的集中程度,OIC则用于衡量生成输出与视觉输入的依赖关系。模型的损失函数设计考虑了这两个指标的影响,以实现更好的对比对齐效果。具体的参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,DICA在多个基准测试中表现优异,相较于现有方法,幻觉现象减少了显著的比例,具体性能提升幅度达到XX%(具体数据需根据原文补充),验证了指标驱动干预的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能问答系统、图像描述生成和多模态交互等场景。通过提高多模态推理的可靠性,DICA能够在实际应用中减少生成内容的幻觉现象,从而提升用户体验和系统的可信度。未来,DICA的思路也可能扩展到其他多模态学习任务中,推动相关领域的发展。

📄 摘要(原文)

Human visual reasoning typically follows a coarse-to-fine attention process, starting from global scene understanding and gradually focusing on question-relevant regions. However, multimodal large language models may deviate from this pattern due to attention drift and the underutilization of visual evidence, which can lead to hallucinations. To mitigate these issues, this study proposes a Dual-Indicator Guided Contrastive Alignment (DICA), which tracks two information-theoretic indicators during inference: Visual Attention Entropy (VAE), which reflects the concentration of visual attention, and Output Image Correlation (OIC), which measures the dependence of generated outputs on the visual input. An abnormal increase in VAE or a decrease in OIC corresponds to different failure modes, which trigger targeted contrastive alignment to restore visual grounding. Experimental results across multiple benchmarks demonstrate that DICA consistently outperforms existing approaches and substantially reduces hallucinations, highlighting the effectiveness of indicator-driven intervention in improving multimodal inference reliability. The code is publicly available at https://github.com/BGWH123/DICA/.