ActionSplice: In-Flight Action Editing for Interactive World Models

📄 arXiv: 2609.08230v1 📥 PDF

作者: Pardis Taghavi, Tingyu Guo, Jonas Lossner, Gaurav Pandey, Reza Langari

分类: cs.CV, cs.LG

发布日期: 2026-09-08

备注: 15 pages, 6 figures. Project page: https://pardistaghavi.github.io/actionsplice-website/


💡 一句话要点

提出ActionSplice以解决视频生成中的动作编辑问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 视频生成 动作编辑 反事实状态传输 实时交互 效率提升

📋 核心要点

  1. 现有的chunk-autoregressive视频生成方法在动作编辑时面临回滚和状态不一致的问题,导致效率低下。
  2. 本文提出的ActionSplice框架通过反事实状态传输(CST)解决了动作编辑过程中的状态一致性问题,提升了采样效率。
  3. 实验结果显示,CSTR和CSTT在多个数据集上分别减少了61.5%和56.1%的LPIPS,同时实现了2.73倍和1.69倍的速度提升。

📝 摘要(中文)

Chunk-autoregressive视频世界模型通常在生成每个块时仅基于一个动作进行条件化。在采样过程中接收到的动作必须等待下一个块,或者触发回滚以重复已完成的评估。本文提出了ActionSplice,一个将此问题表述为反事实状态传输(CST)的推理框架。轻量级的校正器将中断的主干表示传输到由修订动作诱导的匹配状态。世界模型和采样器保持不变,采样在不重放已完成评估的情况下恢复。实验结果表明,CSTR和CSTT在多个基准上显著降低了回滚相关的LPIPS,并提供了显著的速度提升。

🔬 方法详解

问题定义:本文旨在解决在chunk-autoregressive视频生成中,动作编辑导致的状态不一致和效率低下的问题。现有方法在接收到新动作时需要等待或回滚,影响了生成效率。

核心思路:ActionSplice通过反事实状态传输(CST)来处理动作编辑,允许在不重放已完成评估的情况下,快速恢复采样过程。该方法设计的核心在于轻量级校正器的引入,使得状态能够在同一求解步骤中快速调整。

技术框架:ActionSplice的整体架构包括两个主要模块:反事实状态传输模块和轻量级校正器。反事实状态传输模块负责处理状态的调整,而校正器则确保状态的快速传输与更新。

关键创新:最重要的创新在于引入了CST框架,使得在动作编辑时能够有效地传输状态,避免了传统方法中的回滚和重放过程,从而提高了效率。

关键设计:在设计中,CSTR和CSTT分别针对全块更新和时间拼接进行了优化,确保了在不同场景下的灵活性和高效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在HY-WM1.5和minWM-Wan Action2V数据集上,CSTR相较于直接条件交换减少了61.5%和75.9%的回滚相关LPIPS,而CSTT则分别减少了56.1%和77.5%。此外,CST*T在速度上提供了2.73倍和1.69倍的提升,显示出显著的性能优势。

🎯 应用场景

该研究的潜在应用领域包括游戏开发、虚拟现实和动画制作等,能够显著提升视频生成的实时性和交互性。未来,ActionSplice可能在更广泛的动态内容生成和编辑任务中发挥重要作用,推动相关技术的发展。

📄 摘要(原文)

Chunk-autoregressive video world models typically condition each generated chunk on one action. An action received during sampling must therefore wait for the next chunk, condition future solver evaluations on a state produced under the previous action, or trigger rollback that repeats completed evaluations. We introduce ActionSplice, an inference framework that formulates this problem as Counterfactual State Transport (CST). A lightweight corrector transports the interrupted backbone-native representation toward the matched state induced by the revised action at the same solver step. The world model and sampler remain frozen, and sampling resumes without replaying completed evaluations. The retargeting variant $\mathrm{CST}{R}$ updates the entire active chunk, while the temporal-splicing variant $\mathrm{CST}{T}$ preserves a temporal prefix and updates only the suffix. Across minWM-Wan Action2V and HY-WM1.5, $\mathrm{CST}{R}$ reduces rollback-relative LPIPS by 61.5% and 75.9% relative to direct condition swapping. $\mathrm{CST}{T}$ reduces suffix LPIPS by 56.1% and 77.5%, respectively, while providing $2.73\times$ and $1.69\times$ pixel-ready speedups over waiting. Under the HY-WorldPlay protocol, $\mathrm{CST}_{R}$ obtains a PSNR of 25.66 dB, an SSIM of 0.6902, and an LPIPS of 0.1337 against the original rollout.