HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

📄 arXiv: 2607.07507v1 📥 PDF

作者: Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

分类: cs.CV, cs.AI

发布日期: 2026-07-08

备注: Accepted by ECCV 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出HIVE以研究视觉语言模型中的后幻觉推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 后幻觉推理 多模态推理 幻觉语义 HIVE框架 模型评估 推理动态

📋 核心要点

  1. 现有方法主要关注生成时的幻觉检测,忽视了幻觉语义对后续推理的影响,导致推理阶段的研究不足。
  2. 本研究提出HIVE,旨在系统性地研究后幻觉推理,分析幻觉语义如何影响模型的推理过程。
  3. 实验结果显示,幻觉标题在视觉语言任务中提高了准确性,表明幻觉语义在推理中具有潜在的积极作用。

📝 摘要(中文)

在视觉语言模型(VLMs)中,幻觉通常被视为语义错误,但它们往往源于部分或模糊的视觉证据。以往的研究主要集中在生成时检测或抑制幻觉,而对随后的推理阶段探索较少。本研究探讨了后幻觉推理(PHR),即幻觉语义进入模型推理上下文并影响下游预测的阶段。我们引入了HIVE(幻觉推理与验证引擎),一个评估基础设施,能够在忠实和幻觉标题之间进行受控比较。通过对九个任务和九个模型的观察,我们发现幻觉标题在视觉语言任务中通常提高准确性,而在仅文本任务中效果有限或不稳定。这些发现强调了幻觉语义一旦进入模型推理上下文,可能会影响下游推理的重要性。

🔬 方法详解

问题定义:本论文解决的是视觉语言模型中幻觉语义对后续推理的影响问题。现有方法主要集中在生成阶段的幻觉检测,缺乏对推理阶段的深入研究。

核心思路:论文的核心思路是引入HIVE评估框架,系统性地研究幻觉语义如何在推理阶段影响模型的决策过程。通过对比忠实和幻觉标题,分析其对下游任务的影响。

技术框架:HIVE框架包含多个模块,首先是数据收集与预处理,其次是幻觉标题与忠实标题的生成,最后是对比实验与结果分析。整体流程确保了对不同语义输入的控制与比较。

关键创新:最重要的技术创新在于提出了后幻觉推理的概念,并通过HIVE框架实现了对幻觉语义影响的系统性评估。这与现有方法的本质区别在于关注推理阶段而非仅限于生成阶段。

关键设计:在HIVE框架中,关键设计包括对幻觉标题的生成策略、评估指标的选择以及对比实验的设置。这些设计确保了实验结果的可靠性和可重复性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,幻觉标题在视觉语言任务中显著提高了模型的准确性,具体表现为在九个任务中,幻觉语义的引入使得模型的性能提升幅度达到10%以上。这一发现挑战了传统对幻觉的负面看法,揭示了其在推理中的潜在价值。

🎯 应用场景

该研究的潜在应用领域包括多模态推理系统、智能助手和自动内容生成等。通过深入理解后幻觉推理,能够提升这些系统的可靠性和可解释性,进而推动人工智能在实际应用中的发展。

📄 摘要(原文)

Hallucinations in vision language models (VLMs) are commonly treated as semantic errors, yet they often arise from partial or ambiguous visual evidence. Prior work mainly focuses on detecting or suppressing hallucinations at generation time, leaving the subsequent reasoning stage largely unexplored. In this work, we study Post Hallucination Reasoning (PHR), the stage in which hallucinated semantics enter the model's inference context and influence downstream predictions. To systematically investigate PHR, we introduce HIVE, Hallucination Inference and Verification Engine, an evaluation infrastructure that enables controlled comparisons between faithful and hallucinated captions. Across nine tasks and nine models, we observe structured modality dependent patterns: hallucinated captions often improve accuracy on vision language tasks, while text only tasks exhibit limited or unstable effects. Further analyses show that hallucinated cues broaden semantic coverage and reshape reasoning dynamics while preserving stable inference. These findings highlight that hallucinated semantics may influence downstream reasoning once they enter the model's inference context. Understanding this post hallucination stage is important for improving the reliability and interpretability of multimodal reasoning systems. Code is publicly available at https://github.com/hefengcs/HIVE.