EgoPlay: Event-Triggered Video Editing for Egocentric Streams
作者: Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal
分类: cs.CV, cs.AI
发布日期: 2026-07-27
备注: Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay
💡 一句话要点
提出EgoPlay以解决自我中心视频编辑中的事件触发问题
🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)
关键词: 自我中心视频 事件触发编辑 视频编辑器 深度学习 扩散变换器 数据集构建 模型训练 视频处理
📋 核心要点
- 现有方法在自我中心视频编辑中难以有效处理事件触发的编辑需求,常常需要将事件检测与编辑过程分开进行,导致效率低下。
- EgoPlay通过将事件识别、时间约束和像素级编辑整合到一个端到端模型中,提供了一种新的事件触发视频编辑解决方案,简化了编辑流程。
- 在Ego4D基准测试中,EgoPlay在编辑质量、视觉质量和背景一致性上分别比EgoEdit提升了17.7%、16.9%和16.4%。
📝 摘要(中文)
我们介绍了EgoPlay,一种针对自我中心视频流的事件触发视频编辑器。EgoPlay通过对预训练的V2V扩散变换器进行微调,使用主要来自Ego4D的数据构建事件条件数据。给定单目视频和形式为“当X发生时,做Y”的事件触发提示,EgoPlay能够推断事件X的发生时间,保留事件前的帧,并仅对事件后的内容应用编辑Y。EgoPlay在一个端到端模型中联合学习事件识别、时间约束和像素级编辑,处理负面和多事件提示。我们构建了一个包含106K事件触发剪辑-提示对的大规模数据集,并在Ego4D基准上显著超越了现有的最先进方法EgoEdit。
🔬 方法详解
问题定义:论文旨在解决自我中心视频编辑中事件触发编辑的挑战,现有方法通常需要将事件检测与编辑过程分开,导致效率低下和效果不佳。
核心思路:EgoPlay通过一个端到端的模型联合学习事件识别、时间约束和像素级编辑,能够在同一框架内处理事件触发的编辑需求,提升了编辑的灵活性和准确性。
技术框架:EgoPlay的整体架构包括数据输入、事件识别模块、编辑应用模块和输出生成。首先,输入单目视频和事件触发提示,模型识别事件并保留相关帧,然后应用编辑操作。
关键创新:EgoPlay的主要创新在于将事件识别和视频编辑整合到一个模型中,避免了传统方法中事件检测与编辑分开的局限性,提升了处理效率和编辑质量。
关键设计:在模型设计中,采用了双向视频扩散编辑器,并引入事件触发监督机制,确保模型在处理多事件提示时的准确性。此外,构建了106K事件触发剪辑-提示对的数据集,支持模型的训练和评估。
🖼️ 关键图片
📊 实验亮点
EgoPlay在Ego4D基准测试中表现优异,相较于现有的EgoEdit方法,在编辑质量、视觉质量和背景一致性上分别提升了17.7%、16.9%和16.4%。此外,EgoPlay还超越了基于VLM的检测-编辑基线,提升幅度达到15.7%、14.5%和13.5%,且GPU内存使用量不到一半。
🎯 应用场景
EgoPlay的研究成果具有广泛的应用潜力,尤其在视频内容创作、社交媒体编辑和虚拟现实等领域。通过高效的事件触发编辑,用户能够更灵活地处理视频内容,提升创作效率和质量。未来,该技术还可能推动自动化视频编辑工具的发展,使得非专业用户也能轻松创建高质量的视频作品。
📄 摘要(原文)
We introduce EgoPlay, an event-triggered video-to-video editor for egocentric streams, obtained by fine-tuning a pretrained V2V diffusion transformer on event-conditioned data built primarily from Ego4D. Given a monocular video and an event-triggered prompt of the form "when X happens, do Y," EgoPlay infers whether and when event X occurs, preserves pre-event frames, and applies edit Y only to the post-event continuation. Rather than cascading a separate event detector with an editor, EgoPlay learns event recognition, temporal restraint, and pixel-level editing jointly in a single end-to-end model, while also handling negative and multi-event prompts. To support this, we construct a large-scale dataset of 106K event-triggered clip-prompt pairs spanning positive triggers, fabricated-trigger negatives, and multi-event prompts. We then train a bidirectional video diffusion editor with event-triggered supervision and derive a causal variant for chunk-by-chunk streamable inference. We further introduce an event-aware evaluation protocol that separately measures post-trigger editing quality, pre-trigger preservation, and false-trigger robustness. On the Ego4D benchmark, EgoPlay substantially outperforms EgoEdit, the state-of-the-art instruction-based egocentric video editing baseline, with relative gains of 17.7%, 16.9%, and 16.4% in editing quality, visual quality, and background consistency. It also surpasses a VLM-guided detector-editor baseline by 15.7%, 14.5%, and 13.5% on the same metrics, while using less than half the GPU memory.