StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation
作者: Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee
分类: cs.CV, cs.AI
发布日期: 2026-07-22
备注: Code and models are available at https://github.com/KlingAIResearch/StreamHOI
💡 一句话要点
提出StreamHOI以解决实时人机交互视频生成问题
🎯 匹配领域: 支柱五:交互与反应 (Interaction & Reaction)
关键词: 人机交互 视频生成 流式处理 深度学习 记忆网络
📋 核心要点
- 现有的HOI视频生成方法主要集中于离线短视频,难以适应实时交互的需求,导致应用场景受限。
- 本文提出StreamHOI,通过优化历史记忆组织和模块特定训练,提升流式HOI视频生成的效率和质量。
- 实验结果表明,StreamHOI在交互可信度和生成速度上显著优于现有方法,达到了17.6 FPS的生成速度。
📝 摘要(中文)
现有的人机交互(HOI)视频生成方法主要局限于离线短视频生成,难以满足实时交互应用的需求。本文提出了StreamHOI,一个低延迟的长时段HOI视频生成框架。我们研究了图像到视频的流式生成器如何组织历史记忆,以在有限延迟下保留交互信息。研究发现,标准的局部记忆设计在流式HOI生成中面临权衡,不同的变换器模块对HOI区域和周边区域的历史记忆偏好各异。为此,StreamHOI通过离线HOI感知模块分析和偏置引导的记忆专用训练来适应生成器的模块特定记忆布局。此外,我们引入了记忆距离缩放模块,以增强对早期交互状态的长距离访问。与长视频基线和近期HOI生成方法的广泛比较表明,StreamHOI在交互可信度、物体保真度和人类质量方面表现出色,达到了17.6 FPS的速度和0.75秒的首块延迟。
🔬 方法详解
问题定义:本文旨在解决现有HOI视频生成方法在实时交互应用中的局限性,特别是离线短视频生成无法满足实时需求的问题。
核心思路:StreamHOI通过研究图像到视频生成器如何有效组织历史记忆,以在有限延迟下保留交互信息,从而实现低延迟的长时段HOI视频生成。
技术框架:StreamHOI的整体架构包括历史记忆组织、模块特定训练和记忆距离缩放模块。历史记忆组织用于优化信息存储,模块特定训练则通过分析不同变换器模块的行为来调整生成器。记忆距离缩放模块则增强了对早期交互状态的访问能力。
关键创新:StreamHOI的核心创新在于偏置引导的记忆专用训练和记忆距离缩放模块,这些设计使得生成器能够更好地适应不同模块的需求,显著提升了生成效率和质量。
关键设计:在参数设置上,StreamHOI采用了偏置引导的训练策略,损失函数设计考虑了交互可信度和生成速度的平衡,网络结构则通过模块特定的记忆布局来优化生成过程。
🖼️ 关键图片
📊 实验亮点
实验结果显示,StreamHOI在交互可信度、物体保真度和人类质量方面表现优异,生成速度达到17.6 FPS,首块延迟仅为0.75秒,显著优于现有的长视频基线和近期HOI生成方法。
🎯 应用场景
该研究的潜在应用领域包括实时视频监控、虚拟现实和增强现实等场景,能够为人机交互提供更自然的体验。未来,StreamHOI有望在智能家居、游戏开发等领域发挥重要作用,推动相关技术的发展。
📄 摘要(原文)
Existing human--object interaction (HOI) video generation methods are largely limited to offline short-video generation with complex driving conditions, making them unsuitable for real-time interactive applications. We present \emph{StreamHOI}, a low-latency streaming framework for long-duration HOI video generation. Instead of converting heavily conditioned HOI pipelines into streaming systems, we study how an image-to-video streaming generator should organize historical memory to preserve interactions under bounded latency. We find that the standard sink-local memory design faces a trade-off in streaming HOI generation, and different transformer blocks show different historical-memory preferences for HOI regions and surrounding regions. To match memory composition with block behavior, StreamHOI performs offline HOI-aware block profiling and applies bias-guided memory-specialized training to adapt the generator to block-specific memory layouts. We further introduce a memory distance scaling module to strengthen long-range access to early interaction states. Extensive comparisons with both long-video baselines and recent HOI generation methods demonstrate that StreamHOI achieves strong interaction plausibility, object fidelity, human quality and efficiency, reaching 17.6 FPS with 0.75s first-chunk latency.