Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions
作者: Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao
分类: cs.AI
发布日期: 2026-07-16
💡 一句话要点
提出CEDI框架以解决多模态大语言模型评估的现实有效性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 动态评估 视觉幻觉 三方互动 对话系统 人工智能评估
📋 核心要点
- 现有的多模态大语言模型评估方法在真实应用中效果不佳,主要由于静态基准测试无法反映动态交互的复杂性。
- 本文提出CEDI框架,通过三方互动的方式进行多轮对话评估,旨在更真实地捕捉模型的表现和潜在问题。
- 实验证明,CEDI能够揭示更多的视觉幻觉,且这些幻觉在长对话中更容易累积,模型在拒绝性问题上表现脆弱。
📝 摘要(中文)
多模态大语言模型(MLLMs)在基准测试上取得了显著进展,但其在真实世界中的有效性仍不确定。这一差距源于基准测试在受控、静态环境下与真实应用的动态、互动和情境化特性之间的根本不匹配。为此,本文提出CEDI(通过动态多轮互动对MLLMs进行情境化评估)框架,将评估重新定义为评估模型、自动考官和评分者之间的三方互动。考官通过基于图的任务表示进行多轮半结构化对话,采用多样化策略以引导模型表现的证据。实验证明,CEDI能够揭示比传统静态评估更多的视觉幻觉,且这些幻觉更接近实际应用中的情况。
🔬 方法详解
问题定义:本文旨在解决多模态大语言模型在真实应用中评估效果不佳的问题。现有方法主要依赖静态基准测试,无法捕捉动态交互中的复杂性和多样性。
核心思路:CEDI框架通过三方互动的方式进行评估,考官与模型之间进行多轮对话,利用图结构引导对话,旨在更全面地评估模型的表现。
技术框架:CEDI的整体架构包括三个主要模块:评估模型、自动考官和评分者。考官通过图结构任务表示进行多轮对话,采用不同策略引导模型输出。
关键创新:CEDI的主要创新在于将评估过程转变为动态的、互动的对话形式,能够揭示传统静态评估无法捕捉的模型表现问题。
关键设计:在设计上,CEDI采用了多样化的对话策略,包括澄清请求和对抗性探测,以引导模型输出更真实的表现证据。
🖼️ 关键图片
📊 实验亮点
实验结果显示,CEDI框架能够揭示出比传统静态评估多出显著的视觉幻觉,且这些幻觉更贴近实际应用场景。具体而言,CEDI在多个模型和数据集上表现出更高的敏感性,尤其是在长对话中,幻觉的累积现象更加明显。
🎯 应用场景
CEDI框架的潜在应用领域包括多模态大语言模型的评估、人工智能助手的性能测试以及人机交互系统的优化。通过更真实的评估方式,CEDI可以帮助开发者识别和修正模型中的潜在缺陷,从而提升实际应用的可靠性和有效性。
📄 摘要(原文)
Multi-modal Large Language Models (MLLMs) have made substantial advances on benchmarks, yet their real-world effectiveness remains uncertain. This gap stems from the fundamental misalignment between benchmarks in controlled, static settings and the dynamic, interactive, and contextualized nature of real-world applications. To bridge this gap, we propose CEDI (Contextualized Evaluations of MLLMs through Dynamic, multi-round Interactions), a framework that recasts evaluation as a three-party interaction between an evaluatee model, an automated examiner, and a grader. The examiner conducts multi-turn, semi-structured conversation guided by a graph-based representation of the task. By navigating state-space transitions, CEDI deploys diverse strategies, from clarification requests to adversarial probes, to elicit performance evidence. We apply CEDI to visual hallucinations. Empirical results across multiple models, diverse settings, datasets, and domains show that contextualized, interactive evaluations reveal not only significantly more hallucinations than conventional static evaluation but also ones that more closely resemble those arising in practical use cases. We further show that hallucinations often accumulate over long contexts, through self-reinforcing dialogue history, and models are particularly vulnerable to questions requiring premise rejection or refusal. Together, these findings highlight CEDI as a step toward realistic, systematic, and ecologically valid assessments of MLLMs' capabilities. Code is available at github.com/williamium3000/cedi.