VAL: Interactive Task Learning with GPT Dialog Parsing

📄 arXiv: 2310.01627v2 📥 PDF

作者: Lane Lawley, Christopher J. MacLellan

分类: cs.HC, cs.AI, cs.CL

发布日期: 2023-10-02 (更新: 2024-04-22)

备注: Paper was accepted for publication in Proceedings of the CHI Conference on Human Factors in Computing Systems (CHI '24), May 11-16, 2024, Honolulu, HI, USA. ACM, New York, NY, USA, 18 pages

DOI: 10.1145/3613904.3641915


💡 一句话要点

提出VAL系统以解决交互式任务学习中的语言解析问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 交互式任务学习 大型语言模型 符号推理 自然语言处理 知识获取

📋 核心要点

  1. 现有的交互式任务学习系统在语言解析方面存在脆弱性,导致其可用性受到限制。
  2. VAL系统通过将大型语言模型用于特定任务,结合符号推理,支持从自然语言中逐步学习任务知识。
  3. 实验表明,大多数用户能够自然地与VAL互动并成功传授知识,显示出系统的有效性和易用性。

📝 摘要(中文)

机器学习通常需要数百万个样本来生成静态的黑箱模型。相比之下,交互式任务学习(ITL)强调从人类提供的有限指令中逐步获取知识。然而,ITL系统常常受到脆弱且易出错的语言解析的困扰,限制了其可用性。大型语言模型(LLMs)对脆弱性具有抵抗力,但缺乏可解释性且无法逐步学习。本文提出VAL,一个具有新理念的ITL系统,通过在算法框架内仅将LLMs用于特定任务(如谓词和参数选择),VAL利用LLMs的优势支持从自然语言中交互学习层次任务知识。获取的知识具有可解释性,并能推广以支持新任务的执行而无需额外训练。我们在视频游戏环境中研究了用户与VAL的互动,发现大多数用户能够成功使用他们认为自然的语言教导VAL。

🔬 方法详解

问题定义:本文解决的是交互式任务学习中语言解析的脆弱性问题。现有ITL系统在解析自然语言指令时容易出错,影响其实际应用。

核心思路:VAL系统的核心思路是将大型语言模型(LLMs)与符号推理相结合,仅在特定任务中使用LLMs,从而实现逐步学习和知识的可解释性。

技术框架:VAL的整体架构包括多个模块,首先是自然语言输入解析模块,然后是任务知识的逐步学习模块,最后是执行模块,支持新任务的执行。

关键创新:VAL的主要创新在于其将LLMs与符号推理的结合使用,使得系统既能利用LLMs的强大能力,又能保持知识的可解释性和逐步学习的能力。

关键设计:在设计上,VAL采用了特定的损失函数来优化任务学习过程,并在网络结构中引入了符号推理组件,以增强系统的可解释性和灵活性。

📊 实验亮点

实验结果显示,大多数用户能够使用自然语言成功教导VAL,表明系统在用户友好性和学习效率方面具有显著优势。与传统ITL系统相比,VAL在知识获取的可解释性和推广能力上有明显提升,用户的满意度也显著提高。

🎯 应用场景

VAL系统具有广泛的应用潜力,尤其在需要人机交互的领域,如教育、游戏和智能助手等。通过支持自然语言的交互式学习,VAL能够帮助用户更高效地传授知识,并提升系统的智能化水平。未来,VAL的理念和框架可能会影响更多的ITL系统设计,推动人机交互的进一步发展。

📄 摘要(原文)

Machine learning often requires millions of examples to produce static, black-box models. In contrast, interactive task learning (ITL) emphasizes incremental knowledge acquisition from limited instruction provided by humans in modalities such as natural language. However, ITL systems often suffer from brittle, error-prone language parsing, which limits their usability. Large language models (LLMs) are resistant to brittleness but are not interpretable and cannot learn incrementally. We present VAL, an ITL system with a new philosophy for LLM/symbolic integration. By using LLMs only for specific tasks--such as predicate and argument selection--within an algorithmic framework, VAL reaps the benefits of LLMs to support interactive learning of hierarchical task knowledge from natural language. Acquired knowledge is human interpretable and generalizes to support execution of novel tasks without additional training. We studied users' interactions with VAL in a video game setting, finding that most users could successfully teach VAL using language they felt was natural.