Hierarchical Denoising For Multi-Step Visual Reasoning

📄 arXiv: 2607.15278v1 📥 PDF

作者: Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

分类: cs.CV

发布日期: 2026-07-16

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出HDR框架以解决视频多步推理中的逻辑一致性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视频推理 层次化潜变量 稀疏注意力 逻辑一致性 机器人交互

📋 核心要点

  1. 现有的视频推理模型在逻辑一致性和低延迟流式输出方面存在不足,难以处理复杂的推理任务。
  2. 本文提出HDR框架,通过层次化潜变量实现粗到细的推理,优化了视频生成过程中的推理效率。
  3. 实验结果显示,HDR成功率从34.22提升至60.29,且在低延迟下实现了54.2倍的推理速度提升。

📝 摘要(中文)

视频模型正在演变为视觉基础模型,但在多步推理方面仍然缺乏人类般的能力。流式自回归扩散模型在推理效率上表现良好,但在逻辑一致性和复杂推理任务的低延迟流式输出方面存在局限。本文提出HDR(Hierarchical Denoising for Visual Reasoning),一个将层次潜变量整合到因果视频生成中的统一框架,支持多步推理。HDR通过树状层次组织视频潜变量,允许在流式输出之前进行粗到细的推理。实验表明,HDR在成功率和推理轨迹一致性上显著优于现有方法,并在真实世界机器人实验中展示了其潜在应用。

🔬 方法详解

问题定义:本文旨在解决现有视频推理模型在逻辑一致性和推理效率方面的不足,尤其是在复杂任务中的表现。现有的流式自回归扩散模型和双向扩散模型在推理能力和计算成本上均存在局限。

核心思路:HDR框架通过引入层次化潜变量,允许在生成视频时进行粗到细的推理。这种设计使得模型能够在流式输出之前进行全局规划和逐步细化,从而提高推理的准确性和一致性。

技术框架:HDR的整体架构包括粗糙去噪层和细致去噪层,前者用于保留不确定的假设以进行全局规划,后者则逐步将这些假设细化为具体的视觉状态。此外,稀疏层次注意力模式(SHAP)被引入以降低时间注意力成本。

关键创新:HDR的主要创新在于其层次化的潜变量结构和稀疏注意力机制,这与现有方法的密集帧级去噪形成鲜明对比,显著提升了推理效率和逻辑一致性。

关键设计:HDR在设计上采用了层次化的潜变量组织结构,结合了多层去噪机制和SHAP,以优化推理过程中的计算效率和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

HDR在多步视频推理任务中表现出色,相较于流式自回归扩散基线,成功率从34.22提升至60.29,进步幅度达到76.2%。此外,HDR在推理速度上实现了54.2倍的提升,保持了82.9%的全数据性能,仅使用2%的训练数据。

🎯 应用场景

HDR框架在多步推理任务中展现出强大的潜力,尤其适用于机器人与物理环境的交互和世界建模。其高效的推理能力和低延迟特性使其在实时应用中具有重要价值,未来可广泛应用于智能机器人、自动驾驶和复杂决策系统等领域。

📄 摘要(原文)

Video models are evolving into vision foundation models, yet they still lack human-like multi-step reasoning. Streaming autoregressive diffusion models are efficient but limited in reasoning, while bidirectional diffusion enables global revision with high inference costs due to dense frame-level denoising. Both paradigms struggle to achieve logical consistency and low-latency streaming for complex reasoning tasks. We propose HDR (Hierarchical Denoising for Visual Reasoning), a unified framework that integrates hierarchical latents into causal video generation for multi-step reasoning. HDR organizes video latents into a tree-structured hierarchy, enabling coarse-to-fine reasoning before streaming output. Coarse denoising layers preserve uncertain hypotheses for global planning, while finer layers progressively refine them into concrete visual states. A sparse hierarchical attention pattern (SHAP) further reduces temporal attention costs. We introduce a level-stratified multi-step video reasoning benchmark with out-of-distribution cases, covering six tasks: maze navigation, Tower of Hanoi, one-line drawing, sliding puzzle, Sokoban, and water pouring. Compared with streaming autoregressive diffusion baselines, HDR improves success from 34.22 to 60.29 (76.2% relative gain) and increases average progress from 76.00 to 89.56, demonstrating more consistent reasoning trajectories. HDR maintains low-latency streaming at 0.70 seconds per latent, achieving 54.2 times faster inference than bidirectional diffusion. It also retains 82.9% of full-data performance with only 2% training data, compared with 52.0% for bidirectional diffusion. Real-world robot experiments further demonstrate HDR's potential for physical interaction and world modeling. Project demo: https://hierarchical-diffusion-reasoning.github.io/.