ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding
作者: Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi
分类: cs.AI
发布日期: 2026-07-20
备注: ICML 2026 - main
💡 一句话要点
提出ST-Veto以提升扩散多模态大语言模型的推理能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 扩散模型 多模态推理 视觉语言模型 泰勒预测 时空令牌否决 图像注意力 无训练方法
📋 核心要点
- 现有的视觉语言模型在推理时存在高生成成本和错误累积的问题,限制了其自我修正能力。
- 本文提出的ST-Veto方法通过观察所有令牌位置,利用泰勒预测和图像注意力质量来优化推理过程。
- 实验结果表明,ST-Veto在多个基准测试中准确率提升最多9%,且无需额外训练或生成成本。
📝 摘要(中文)
视觉语言模型(VLMs)在链式思维提示下实现了强大的推理能力,但面临高序列生成成本、错误累积和有限的自我修正等问题。扩散多模态大语言模型(dMLLMs)通过无序生成的方式提高了效率并支持迭代优化,但其推理能力及提升方法尚未深入探讨。本文提出了一种无训练的方法——时空令牌否决(ST-Veto),该方法在每个扩散步骤中观察所有令牌位置。ST-Veto通过二阶泰勒预测置信度动态,否决时间上不稳定的令牌,并利用图像注意力质量过滤弱基础令牌,替换为更安全的候选项。在多个dMLLMs和多模态推理基准测试中,ST-Veto的表现优于标准解码策略和先前的VLM推理方法,准确率提高了最多9%,且没有额外的训练或生成成本。
🔬 方法详解
问题定义:本文旨在解决扩散多模态大语言模型在推理过程中面临的效率低下和错误累积问题。现有方法依赖于当前步骤的置信度,导致时间上不稳定的令牌未能得到有效处理。
核心思路:ST-Veto方法的核心在于利用每个扩散步骤中所有令牌位置的信息,通过二阶泰勒预测置信度动态来否决不稳定的令牌,并用更可靠的候选项进行替换。
技术框架:该方法的整体架构包括两个主要模块:首先,通过泰勒预测评估每个令牌的置信度变化;其次,利用图像注意力质量对弱基础令牌进行过滤和替换。
关键创新:ST-Veto的主要创新在于其训练-free的设计,能够在不增加额外训练成本的情况下,显著提升推理的准确性和稳定性。这与传统方法依赖于单步置信度的方式形成鲜明对比。
关键设计:在实现中,ST-Veto采用了二阶泰勒展开来预测置信度变化,并设计了图像注意力质量的计算方法,以确保替换的候选项在语义上更为安全和可靠。具体的参数设置和损失函数设计未在摘要中详细说明,需参考原文获取更多细节。
🖼️ 关键图片
📊 实验亮点
在多个扩散多模态大语言模型和多模态推理基准测试中,ST-Veto的准确率提升最多达到9%,显著优于标准解码策略和以往的视觉语言模型推理方法,展示了其在推理效率和准确性上的优势。
🎯 应用场景
该研究的潜在应用领域包括智能问答系统、图像描述生成和多模态交互等。通过提升扩散多模态大语言模型的推理能力,ST-Veto能够在更复杂的场景中实现更高效的推理和生成,具有重要的实际价值和未来影响。
📄 摘要(原文)
Vision Language Models (VLMs) achieve strong reasoning with Chain-of-Thought (CoT) prompting but incur high sequential-generation cost, error accumulation, and limited self-correction. Diffusion Multimodal Large Language Models (dMLLMs) unmask tokens in an order-agnostic process, improving efficiency and enabling iterative refinement, yet their reasoning and how to enhance it remain underexplored. We propose a training-free method, Spatio-Temporal Token Veto (ST-Veto), which leverages the ability to observe all token positions at each diffusion step. Rather than relying only on current-step confidence, ST-Veto vetoes temporally unstable tokens via second-order Taylor prediction of confidence dynamics and filters weakly grounded tokens using image-attention mass, swapping them with safer candidates. Across multiple dMLLMs and multimodal reasoning benchmarks, ST-Veto consistently outperforms standard decoding policies and prior VLM reasoning methods, improving accuracy by up to 9% with no additional training or generation cost. Analyses show that ST-Veto steers generation toward higher-confidence, better-grounded paths.