Open-Ended Instructable Embodied Agents with Memory-Augmented Large Language Models
作者: Gabriel Sarch, Yue Wu, Michael J. Tarr, Katerina Fragkiadaki
分类: cs.AI, cs.CL, cs.LG, cs.RO
发布日期: 2023-10-23 (更新: 2023-11-20)
备注: Project page with code & videos: https://helper-agent-llm.github.io
💡 一句话要点
提出基于记忆增强的大语言模型的开放式可指令化实体代理
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 记忆增强 人机对话 机器人技术 个性化推理
📋 核心要点
- 现有方法在解析开放领域自然语言和适应用户个性化程序时存在局限性,固定提示无法满足多样化的用户需求。
- 论文提出的HELPER通过外部记忆存储语言-程序对,利用检索增强的LLM提示来解析人机对话,增强了灵活性和适应性。
- 实验结果显示,HELPER在TEACh基准测试中实现了EDH和TfD的性能提升,TfD的表现比之前的最先进水平提高了1.7倍。
📝 摘要(中文)
预训练并冻结的大语言模型(LLMs)能够通过适当的少量示例提示,将简单的场景重排指令映射到机器人视觉运动功能的程序中。然而,固定提示在解析开放领域自然语言和适应用户个性化程序时存在不足。本文提出了HELPER,一个配备外部语言-程序对记忆的实体代理,通过检索增强的LLM提示,将自由形式的人机对话解析为行动程序。该记忆在部署过程中扩展,以包括用户语言和行动计划的对,以帮助未来的推理并个性化用户的语言和日常操作。HELPER在TEACh基准测试中在对话历史执行(EDH)和对话轨迹(TfD)方面设定了新的最先进水平,在TfD上比之前的最先进水平提高了1.7倍。
🔬 方法详解
问题定义:本文旨在解决现有固定提示方法在解析开放领域自然语言和适应用户个性化程序时的不足,特别是在用户的个性化指令和程序未在提示工程时已知的情况下。
核心思路:论文的核心思路是引入一个外部记忆模块,存储语言-程序对,通过检索相关记忆来增强LLM的提示能力,从而实现更灵活的人机对话解析。
技术框架:整体架构包括一个外部记忆模块和一个基于检索的提示生成模块。用户的对话、指令和纠正信息被用于检索相关的记忆,并作为上下文提示示例供LLM查询。
关键创新:最重要的技术创新在于引入外部记忆机制,使得代理能够在部署过程中不断扩展记忆,个性化用户的语言和行动计划,从而提升推理能力和适应性。
关键设计:在设计中,记忆模块的扩展策略和检索算法是关键,确保能够有效地从用户的对话中提取相关信息,并将其整合到LLM的提示中。
🖼️ 关键图片
📊 实验亮点
实验结果表明,HELPER在TEACh基准测试中在对话历史执行(EDH)和对话轨迹(TfD)方面均设定了新的最先进水平,特别是在TfD上实现了1.7倍的性能提升,显示出其优越的适应性和灵活性。
🎯 应用场景
该研究的潜在应用领域包括人机交互、智能家居、服务机器人等,能够显著提升机器人对用户指令的理解和执行能力,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Pre-trained and frozen large language models (LLMs) can effectively map simple scene rearrangement instructions to programs over a robot's visuomotor functions through appropriate few-shot example prompting. To parse open-domain natural language and adapt to a user's idiosyncratic procedures, not known during prompt engineering time, fixed prompts fall short. In this paper, we introduce HELPER, an embodied agent equipped with an external memory of language-program pairs that parses free-form human-robot dialogue into action programs through retrieval-augmented LLM prompting: relevant memories are retrieved based on the current dialogue, instruction, correction, or VLM description, and used as in-context prompt examples for LLM querying. The memory is expanded during deployment to include pairs of user's language and action plans, to assist future inferences and personalize them to the user's language and routines. HELPER sets a new state-of-the-art in the TEACh benchmark in both Execution from Dialog History (EDH) and Trajectory from Dialogue (TfD), with a 1.7x improvement over the previous state-of-the-art for TfD. Our models, code, and video results can be found in our project's website: https://helper-agent-llm.github.io.