Programmable World Model

📄 arXiv: 2609.10540v1 📥 PDF

作者: Zheng-Hui Huang, Guixu Lin, Jiacheng Lin, Yi-Chuan Huang, Ruihan Yu, Muyao Niu, Siqi Yang, Yu-Lun Liu, Yung-Yu Chuang, Kaipeng Zhang, Zhixiang Wang

分类: cs.CV

发布日期: 2026-09-09

备注: Homepage: https://alaya-lab.github.io/pwm GitHub: https://github.com/AlayaLab/pwm


💡 一句话要点

提出可编程世界模型以解决持久状态管理问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation)

关键词: 可编程世界模型 持久状态管理 交互视频生成 自然语言处理 3D定向边界框 游戏开发 虚拟现实 增强现实

📋 核心要点

  1. 现有视频世界模型在生成真实互动体验方面表现良好,但缺乏有效的持久状态管理和可编程规则执行机制。
  2. 本文提出的可编程世界模型框架,通过将世界状态演变与视觉生成解耦,实现对实体状态和交互的直接控制。
  3. 在CombatStateBench基准测试中,本文方法实现了94%的计数准确率和98%的状态准确率,显著优于现有交互视频世界模型。

📝 摘要(中文)

近年来,视频世界模型生成的视觉体验越来越真实和互动,但在维护持久世界状态和执行可编程规则方面仍缺乏可靠机制。本文提出可编程世界模型框架,将世界状态演变与视觉观察生成解耦。代理通过自然语言指令转换为可执行程序,指定实体状态和状态转移规则,从而实现对个体实体及其交互的直接控制。轻量级引擎执行这些程序以更新和维护明确的持久全球世界状态,包括离屏实体和非视觉属性。为将世界状态与视觉生成连接,本文引入状态增强的3D定向边界框作为中间表示。该设计允许用户创建具有预定义机制的可玩游戏,并在整个游戏过程中保持持久的世界状态。

🔬 方法详解

问题定义:本文旨在解决现有视频世界模型在持久状态管理和可编程规则执行方面的不足,现有方法无法有效维护世界状态,导致交互体验不连贯。

核心思路:提出的可编程世界模型框架将世界状态演变与视觉观察生成解耦,允许代理通过自然语言指令生成可执行程序,从而实现对个体实体的精确控制。

技术框架:该框架包括多个模块:首先,代理将自然语言指令转换为程序;其次,轻量级引擎执行这些程序以更新持久的全球世界状态;最后,使用状态增强的3D定向边界框将世界状态与视觉生成连接。

关键创新:最重要的创新在于将世界状态的显式演变与生成渲染分离,允许在长时间交互中保持一致的世界状态,这与现有方法的设计理念有本质区别。

关键设计:在技术细节上,采用状态增强的3D定向边界框作为中间表示,并结合目标相机轨迹生成像素对齐的时空条件信号,以驱动预训练的视频模型进行生成渲染。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在CombatStateBench基准测试中,本文方法实现了94%的计数准确率和98%的状态准确率,显著优于现有的交互视频世界模型,支持一致的长时间生成,展示了将显式状态演变与生成渲染分离的有效性。

🎯 应用场景

该研究的潜在应用领域包括游戏开发、虚拟现实和增强现实等,能够为开发者提供更灵活的工具来创建复杂的交互环境。通过实现持久的世界状态和可编程规则,用户可以设计出更具沉浸感和互动性的体验,推动相关技术的发展与应用。

📄 摘要(原文)

Recent video world models generate increasingly realistic and interactive visual experiences, yet lack reliable mechanisms for maintaining persistent world state and enforcing programmable rules over extended interactions. We introduce Programmable World Model, a framework that decouples world-state evolution from visual observation generation. An agent translates natural-language instructions into executable programs that specify entity states and state-transition rules, enabling direct control over individual entities and their interactions. A lightweight engine executes these programs to update and maintain an explicit, persistent global world state, including off-screen entities and non-visual attributes. To connect world state with visual generation, we introduce state-augmented 3D oriented bounding boxes (OBBs) as an intermediate representation. This representation, together with the target camera trajectory, is deterministically compiled into pixel-aligned spatiotemporal conditioning signals for a pretrained video model serving as the generative renderer. This design allows users to create playable games with predefined mechanics, direct control over individual entities, and persistent world state throughout gameplay. We further introduce CombatStateBench, a benchmark for evaluating programmable world models. On CombatStateBench, our method achieves 94% Count Accuracy and 98% State Accuracy, substantially outperforming existing interactive video world models while supporting coherent long-horizon generation. These results demonstrate the effectiveness of separating explicit state evolution from generative rendering for building persistent, programmable worlds.