TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding

📄 arXiv: 2607.11131v1 📥 PDF

作者: Quynh Vo, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan, Thong Nguyen

分类: cs.CL

发布日期: 2026-07-13

备注: Work in progress


💡 一句话要点

提出TIGER框架以解决多模态推理中的视觉内容不一致问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态推理 推测解码 视觉内容一致性 文本条件生成 策略训练 蒸馏学习 生成模型

📋 核心要点

  1. 现有的推测解码方法在视觉语言模型中效果有限,草拟者常常在关键视觉内容上出现偏差,导致生成效率低下。
  2. TIGER框架通过动态选择与文本状态相关的视觉标记,优化草拟者的训练过程,以提高推测的有效性和效率。
  3. 实验结果显示,TIGER在接受前缀长度和推测速度上均有显著提升,同时在下游任务中保持了良好的质量与延迟平衡。

📝 摘要(中文)

论文提出了一种名为TIGER的文本条件视觉门控路由框架,旨在加速多模态推理中的自回归生成。现有的推测解码方法在视觉语言模型中效果有限,主要因为轻量级草拟者在关键视觉内容上常常出现偏差。TIGER通过动态选择与当前文本状态相关的稀疏视觉标记,优化了草拟者的训练过程,并通过接受对齐的策略训练提高了推测的有效性。实验结果表明,TIGER在接受前缀长度和推测速度上均有显著提升,同时在下游任务中保持了良好的质量与延迟平衡。

🔬 方法详解

问题定义:论文要解决的问题是现有的推测解码方法在多模态生成中的效率低下,尤其是在视觉语言模型中,草拟者在关键视觉内容上常常出现偏差,导致生成的文本与视觉信息不一致。

核心思路:TIGER框架的核心思路是通过文本条件的视觉门控路由,动态选择与当前文本状态相关的视觉标记,而不是使用完整的视觉标记集或固定的压缩接口,从而提高生成的准确性和效率。

技术框架:TIGER的整体架构包括草拟者和验证者两个主要模块。草拟者负责生成初步的文本输出,而验证者则对生成的内容进行验证,确保其与视觉信息的一致性。通过接受对齐的策略训练,草拟者能够在生成过程中更好地适应验证者的反馈。

关键创新:TIGER的关键创新在于接受对齐的组策略训练,通过验证者派生的奖励机制,优化草拟者的生成过程。这一方法不仅鼓励草拟者模仿目标模型,还促使其生成更长前缀的推测内容,从而提高了生成的有效性。

关键设计:在技术细节上,TIGER采用了基于KL锚定的蒸馏热启动方法,结合接受前缀长度的优化,确保草拟者在训练时能够更好地适应验证者的要求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,TIGER在接受前缀长度上实现了显著提升,推测速度也有明显加快。在与基线方法的对比中,TIGER在质量与延迟的权衡上表现出色,确保了下游任务的准确性与效率。

🎯 应用场景

TIGER框架在多模态生成任务中具有广泛的应用潜力,尤其是在需要结合文本和视觉信息的场景,如智能助手、自动内容生成和增强现实等领域。其高效的推测解码能力能够显著提升生成系统的响应速度和准确性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Speculative decoding accelerates autoregressive generation by letting a lightweight drafter propose multiple tokens that are verified by a larger target model. Although effective for text-only LLMs, speculative decoding yields limited gains in VLMs because drafters often diverge on vision-critical content, while existing multimodal acceleration methods do not directly address irrelevant visual evidence or optimize the verifier-accepted prefix length that governs speedup. We propose TIGER, a Text-conditioned vIsual GatEd Routing framework for multimodal speculative decoding. TIGER dynamically selects a sparse set of context-relevant visual tokens based on the drafter's current textual state, rather than expose the full visual token set or a fixed compressed interface. To better align training with inference-time efficiency, we optimize the drafter with acceptance-aligned group-based policy training using verifier-derived rewards based on accepted prefix length, built on top of distillation warm start with KL anchoring. This encourages the drafter not only to imitate the target model, but also to produce speculative continuations that survive verification for longer prefixes. Experiments show that TIGER yields consistent gains in accepted prefix length and speculative speedup under exact verifier-side speculative decoding, while achieving favorable quality-latency trade-offs with comparable downstream accuracy in visual-routing analyses.