Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
作者: Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai
分类: cs.CV
发布日期: 2026-07-20
💡 一句话要点
提出视频流思维以解决视频理解中的响应延迟问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视频流思维 视频理解 实时推理 多轮交互 自动化训练数据
📋 核心要点
- 现有视频理解方法主要集中于流媒体感知,缺乏有效的逻辑推理机制,导致响应延迟问题。
- 本文提出视频流思维(VST),允许在观看视频时进行实时推理,从而提高理解效率。
- VST-7B在StreamingBench和OVO-Bench等基准测试中分别取得79.5%和59.3%的优异成绩,响应速度提升15.7倍。
📝 摘要(中文)
在线视频大语言模型(VideoLLMs)在支持实时互动中扮演着重要角色。然而,现有方法主要关注流媒体感知,缺乏同步的逻辑推理流。为了解决这一权衡,本文提出了一种新颖的流媒体视频理解范式——视频流思维(VST),该机制在观看视频时激活对输入视频片段的推理,从而提高及时理解和连贯认知,同时通过在视频播放过程中分摊推理延迟来保持实时响应。此外,本文还引入了综合的后训练管道,结合VST-SFT和VST-RL,提升多轮视频交互环境中的端到端性能。实验结果表明,VST-7B在多个在线基准测试中表现优异,响应速度显著提高,展示了其在多样化视频理解任务中的高效性和强泛化能力。
🔬 方法详解
问题定义:本文旨在解决现有视频理解方法在实时交互中面临的响应延迟问题,现有方法往往无法同步进行感知与推理,导致用户体验不佳。
核心思路:论文提出视频流思维(VST),通过在视频播放过程中激活推理机制,实现观看与思考的同步,从而提高理解的及时性和连贯性。
技术框架:VST的整体架构包括两个主要模块:VST-SFT用于结构性适应离线VideoLLM到因果流媒体推理,VST-RL则通过自我探索提升多轮视频交互的性能。此外,自动化训练数据合成管道利用视频知识图谱生成高质量的流媒体问答对。
关键创新:VST的核心创新在于其“观看时思考”的机制,显著提升了推理效率,并通过分摊推理延迟来保持实时响应,这与传统方法的单一感知模式形成鲜明对比。
关键设计:在训练过程中,采用了基于实体-关系的流媒体链式思维来强化多证据推理,并确保对视频流的持续关注,具体的损失函数和网络结构设计未在摘要中详细说明,需参考原文。
🖼️ 关键图片
📊 实验亮点
实验结果显示,VST-7B在StreamingBench上取得79.5%的准确率,在OVO-Bench上达到59.3%。与Video-R1相比,VST的响应速度提高了15.7倍,并在VideoHolmes上实现了5.4%的性能提升,展示了其在多样化视频理解任务中的高效性。
🎯 应用场景
该研究的潜在应用领域包括在线教育、视频监控、智能助手等场景,能够实现更为流畅和智能的视频交互体验。未来,VST有望推动视频理解技术的进一步发展,提升人机交互的自然性和效率。
📄 摘要(原文)
Online Video Large Language Models (VideoLLMs) play a critical role in supporting responsive, real-time interaction. Existing methods focus on streaming perception, lacking a synchronized logical reasoning stream. However, directly applying test-time scaling methods incurs unacceptable response latency. To address this trade-off, we propose Video Streaming Thinking (VST), a novel paradigm for streaming video understanding. It supports a thinking while watching mechanism, which activates reasoning over incoming video clips during streaming. This design improves timely comprehension and coherent cognition while preserving real-time responsiveness by amortizing LLM reasoning latency over video playback. Furthermore, we introduce a comprehensive post-training pipeline that integrates VST-SFT, which structurally adapts the offline VideoLLM to causal streaming reasoning, and VST-RL, which provides end-to-end improvement through self-exploration in a multi-turn video interaction environment. Additionally, we devise an automated training-data synthesis pipeline that uses video knowledge graphs to generate high-quality streaming QA pairs, with an entity-relation grounded streaming Chain-of-Thought to enforce multi-evidence reasoning and sustained attention to the video stream. Extensive evaluations show that VST-7B performs strongly on online benchmarks, e.g. 79.5% on StreamingBench and 59.3% on OVO-Bench. Meanwhile, VST remains competitive on offline long-form or reasoning benchmarks. Compared with Video-R1, VST responds 15.7 times faster and achieves +5.4% improvement on VideoHolmes, demonstrating higher efficiency and strong generalization across diverse video understanding tasks. Code, data, and models will be released atthis https URL.