Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation
作者: Zhengxian Wu, Junjie Gao, Kai Yang
分类: cs.AI, cs.CV
发布日期: 2026-07-22
期刊: SIGIR 2026 SynthIR Workshop
🔗 代码/项目: GITHUB
💡 一句话要点
提出六类分类法以诊断多模态智能搜索中的隐性失败问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态搜索 隐性失败 轨迹级评估 ReAct框架 知识密集型问题 证据基础质量 分类法 智能系统
📋 核心要点
- 现有多模态智能搜索系统的评估主要集中在最终答案的准确性,忽视了搜索过程中的隐性失败问题。
- 论文提出了一种六类分类法,构建了轨迹级诊断管道,评估答案的正确性和证据基础的质量。
- 实验结果显示,表面准确性高估了真实的轨迹级正确性,隐性失败是能力依赖的,且常常是转移而非消失。
📝 摘要(中文)
多模态智能搜索系统越来越依赖外部工具来回答知识密集型视觉问题。然而,现有评估主要集中在最终答案的准确性上,可能忽视搜索轨迹中的失败。在本研究中,我们探讨了隐性失败等隐藏的可靠性问题。我们提出了一种涵盖模态捷径、虚幻定位、错误证据正确答案案例、过度检索清洗、跨模态矛盾和来源幻觉的六类分类法。基于该分类法,我们构建了一个轨迹级诊断管道,在统一的ReAct风格框架下评估答案的正确性和证据基础的质量。对四个前沿多模态模型的MMSearch-Plus轨迹的实验表明,表面准确性始终高估了真实的轨迹级正确性。我们进一步使用交叉评估、空白图像压力测试和工具消融实验,表明隐性失败是依赖于能力的,并且往往是转移而非消失。
🔬 方法详解
问题定义:本研究旨在解决多模态智能搜索系统中隐性失败的问题,现有方法往往只关注最终答案的准确性,忽视了搜索轨迹中的潜在失败,导致评估结果不够全面。
核心思路:论文提出了一种六类分类法来识别和诊断隐性失败,构建了一个轨迹级诊断管道,以统一的ReAct风格框架评估答案的正确性和证据基础的质量,从而提高评估的全面性和准确性。
技术框架:整体架构包括六类隐性失败的分类、轨迹级诊断管道和评估模块。分类模块识别不同类型的隐性失败,诊断管道则在每个搜索轨迹中评估答案和证据的质量。
关键创新:最重要的技术创新在于提出了六类隐性失败的分类法,这一方法与现有的仅关注最终答案的评估方法本质上不同,能够更全面地揭示搜索过程中的问题。
关键设计:在设计中,采用了统一的ReAct风格框架,结合了多种评估指标,确保了对答案正确性和证据基础质量的全面评估,同时引入了交叉评估和压力测试等技术细节以增强结果的可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,表面准确性高估了真实的轨迹级正确性,隐性失败的识别和分类显著提高了评估的准确性。通过交叉评估和压力测试,验证了隐性失败的能力依赖性,提供了新的视角来理解多模态搜索系统的性能。
🎯 应用场景
该研究的潜在应用领域包括智能搜索引擎、问答系统和多模态交互应用等。通过识别和诊断隐性失败,能够提升系统的可靠性和用户体验,未来可能对多模态人工智能的发展产生深远影响。
📄 摘要(原文)
Multimodal agentic search systems increasingly rely on external tools to answer knowledge-intensive visual questions. However, existing evaluations mainly focus on final-answer accuracy and may miss failures in the search trajectory. In this work, we study such hidden reliability issues as silent failures. We introduce a six-category taxonomy covering modality shortcuts, phantom grounding, wrong-evidence-right-answer cases, over-retrieval laundering, cross-modal contradiction, and provenance hallucination. Based on this taxonomy, we build a trajectory-level diagnostic pipeline that evaluates both answer correctness and evidence-grounding quality under a unified ReAct-style scaffold. Experiments on MMSearch-Plus trajectories across four frontier multimodal models show that surface accuracy consistently overestimates true trajectory-level correctness. We further use cross-judge validation, blank-image stress tests, and tool ablations to show that silent failures are capability-dependent and often shift rather than disappear. Home-page: https://github.com/DingWu1021/silent-failures-multimodal-agentic-search