Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA
作者: Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi
分类: cs.AI
发布日期: 2026-07-13
💡 一句话要点
提出Omni-Decision以解决多模态QA中的证据追踪问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态问答 证据追踪 智能代理 信息整合 跨模态学习
📋 核心要点
- 现有的多模态问答系统在证据追踪和管理方面存在不足,难以有效整合来自不同模态的信息。
- Omni-Decision通过维护结构化的证据状态,将多模态问答转化为查询范围的证据闭合过程,提升了证据获取的效率。
- 实验结果显示,Omni-Decision在OmniGAIA和WorldSense数据集上分别提高了27.3和30.2个百分点,验证了其有效性。
📝 摘要(中文)
Omni-modal证据寻求问答要求代理能够回答证据分散在视频、音频、图像、网页和计算结果中的问题。现有的多模态系统常常将证据留在草稿、工具轨迹或自由形式的历史中,导致难以追踪已确认的证据、未解决的冲突以及何时证据足够回答的问题。我们提出了Omni-Decision,这是一种无训练的证据状态系统,将多模态问答转化为查询范围的证据闭合过程。对于每个查询,Omni-Decision维护一个结构化的证据状态,包含确认的证据、未解决的冲突、事实和计算依赖关系以及开放的证据需求。通过确定性状态更新,来自媒体、网络、计算和验证模块的异构观察被规范化、判断和提交。这一设计实现了有针对性的证据获取,保留了稀疏的跨模态线索,并提供了可检查的修复和停止控制。Omni-Decision在OmniGAIA上取得了45.6%的准确率,在WorldSense上为58.3%,分别比基线提高了27.3和30.2个百分点。
🔬 方法详解
问题定义:本论文旨在解决多模态问答中证据追踪和管理的挑战,现有方法往往无法有效整合和利用分散的证据信息。
核心思路:论文提出的Omni-Decision系统通过维护一个结构化的证据状态,转变了多模态问答的处理方式,使得证据的获取和验证更加高效和有序。
技术框架:Omni-Decision的整体架构包括多个模块:查询处理模块、证据获取模块、验证模块和状态更新模块。每个模块负责特定的任务,确保证据的有效整合和管理。
关键创新:该系统的核心创新在于引入了明确的证据状态控制机制,使得多步证据寻求过程中的每一步都可以被追踪和管理,这与现有方法的自由形式历史记录有本质区别。
关键设计:在设计中,Omni-Decision采用了确定性状态更新机制,确保来自不同模态的观察结果能够被有效规范化和判断,同时设定了明确的证据需求和冲突处理策略。具体的参数设置和损失函数设计尚未详细披露。
🖼️ 关键图片
📊 实验亮点
在实验中,Omni-Decision在OmniGAIA数据集上达到了45.6%的准确率,在WorldSense数据集上达到了58.3%的准确率,分别比基线提高了27.3和30.2个百分点,显示出其在多模态问答中的显著优势。
🎯 应用场景
Omni-Decision的研究成果在多个领域具有广泛的应用潜力,包括智能问答系统、信息检索、教育技术和多媒体内容分析等。通过提升多模态信息的整合能力,该系统能够为用户提供更准确和全面的答案,进而推动相关领域的发展。
📄 摘要(原文)
Omni-modal evidence-seeking QA requires agents to answer questions whose evidence is sparsely distributed across videos, audio, images, web pages, and computation results. Existing agentic multimodal systems often leave evidence in scratchpads, tool trajectories, or free-form histories, making it difficult to track what has been grounded, what remains missing, and when the evidence is sufficient to answer. We propose Omni-Decision, a training-free evidence-state system that turns omni-modal QA into a query-scoped evidence-closure process. For each query, Omni-Decision maintains a structured evidence state containing confirmed evidence, unresolved conflicts, fact and computation dependencies, and open evidence needs. A shared state view conditions planning, evidence acquisition, validation, repair, and finalization. Heterogeneous observations from media, web, computation, and verification modules are normalized, judged, and committed through deterministic state updates. This design enables targeted evidence acquisition, preserves sparse cross-modal cues, and provides inspectable control over repair and stopping. Omni-Decision achieves 45.6% accuracy on OmniGAIA and 58.3% on WorldSense, improving over the baselines by +27.3 and +30.2 percentage points, respectively. No-state ablations and trajectory audits further support the role of explicit evidence-state control in multi-step omni-modal evidence seeking.