GROOT: Learning to Follow Instructions by Watching Gameplay Videos
作者: Shaofei Cai, Bowei Zhang, Zihao Wang, Xiaojian Ma, Anji Liu, Yitao Liang
分类: cs.AI, cs.LG
发布日期: 2023-10-12 (更新: 2023-11-29)
💡 一句话要点
提出GROOT以解决开放世界环境中的指令跟随问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放世界 指令跟随 视频学习 因果变换器 游戏AI 目标空间 控制器设计
📋 核心要点
- 核心问题:现有方法在开放世界环境中难以有效处理开放式指令,且依赖昂贵的文本注释。
- 方法要点:提出通过观看游戏视频来学习指令跟随控制器,利用视频作为目标规范,避免文本注释的需求。
- 实验或效果:GROOT在Minecraft SkillForge基准测试中表现优异,70%的胜率显著优于最佳通用代理基线。
📝 摘要(中文)
本文研究了在开放世界环境中构建能够遵循开放式指令的控制器的问题。我们提出通过参考视频作为指令,这种方式提供了丰富的目标规范,同时消除了对昂贵的文本-游戏注释的需求。我们开发了一种新的学习框架,使得可以从游戏视频中学习这种指令跟随控制器,并生成一个视频指令编码器,从而诱导出结构化的目标空间。我们在简单而有效的基于因果变换器的编码器-解码器架构中实现了我们的代理GROOT,并在提出的Minecraft SkillForge基准上与开放世界的对手和人类玩家进行了评估。Elo评分清晰地显示GROOT正在缩小人机差距,并且在最佳通用代理基线中展现出70%的胜率。对诱导目标空间的定性分析进一步展示了一些有趣的涌现特性,包括目标组合和复杂游戏行为合成。
🔬 方法详解
问题定义:本文旨在解决在开放世界环境中如何有效地构建能够遵循开放式指令的控制器。现有方法通常依赖于昂贵的文本注释,限制了其应用范围。
核心思路:我们提出通过观看游戏视频来学习指令跟随控制器。这种方法利用视频提供的丰富信息作为目标规范,避免了对文本注释的依赖,从而降低了数据获取成本。
技术框架:GROOT的架构采用了简单而有效的编码器-解码器设计,基于因果变换器。整体流程包括视频输入的编码、目标空间的诱导以及控制器的学习。
关键创新:本研究的主要创新在于提出了一种新的学习框架,能够从游戏视频中学习指令跟随控制器,并生成结构化的目标空间。这一方法与传统依赖文本注释的方式本质上不同。
关键设计:在技术细节上,我们设计了特定的损失函数以优化目标空间的诱导,并调整了网络结构以适应因果变换器的特性。具体参数设置和网络层数经过多次实验验证,以确保最佳性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,GROOT在Minecraft SkillForge基准测试中表现出色,70%的胜率明显优于最佳通用代理基线,显示出其在缩小人机差距方面的潜力。Elo评分进一步验证了其优越性。
🎯 应用场景
该研究的潜在应用领域包括游戏AI、机器人控制和人机交互等。通过实现更自然的指令跟随能力,GROOT可以在多种开放世界环境中提升智能体的表现,具有广泛的实际价值和未来影响。
📄 摘要(原文)
We study the problem of building a controller that can follow open-ended instructions in open-world environments. We propose to follow reference videos as instructions, which offer expressive goal specifications while eliminating the need for expensive text-gameplay annotations. A new learning framework is derived to allow learning such instruction-following controllers from gameplay videos while producing a video instruction encoder that induces a structured goal space. We implement our agent GROOT in a simple yet effective encoder-decoder architecture based on causal transformers. We evaluate GROOT against open-world counterparts and human players on a proposed Minecraft SkillForge benchmark. The Elo ratings clearly show that GROOT is closing the human-machine gap as well as exhibiting a 70% winning rate over the best generalist agent baseline. Qualitative analysis of the induced goal space further demonstrates some interesting emergent properties, including the goal composition and complex gameplay behavior synthesis. The project page is available at https://craftjarvis-groot.github.io.