Symbolic Planning and Code Generation for Grounded Dialogue
作者: Justin T. Chiu, Wenting Zhao, Derek Chen, Saujas Vaduguru, Alexander M. Rush, Daniel Fried
分类: cs.CL, cs.AI
发布日期: 2023-10-26
备注: Accepted to EMNLP 2023
💡 一句话要点
提出模块化对话系统以解决任务导向对话中的局限性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 任务导向对话 大型语言模型 符号规划 代码生成 对话系统 人机交互 智能助手
📋 核心要点
- 现有的对话系统在任务导向对话中难以有效引导至目标,且对新颖基础的处理能力不足。
- 本文提出的系统通过结合大型语言模型与符号规划器,实现了对话状态的跟踪和响应的生成。
- 在OneCommon对话任务中,系统的任务成功率从56%提升至69%,显示出显著的性能改进。
📝 摘要(中文)
大型语言模型(LLMs)在文本和代码处理方面表现出色,但在任务导向对话中应用有限,难以引导至任务目标且无法处理新颖的基础。本文提出了一种模块化且可解释的基础对话系统,通过将LLMs与符号规划器和基础代码执行相结合,解决了这些问题。该系统由阅读器和规划器组成:阅读器利用LLM将合作伙伴的发言转换为可执行代码,调用执行基础的函数。翻译后的代码输出用于跟踪对话状态,而符号规划器则决定下一个合适的响应。我们在OneCommon对话任务上评估了系统性能,该任务涉及对散点图像的协作参考解析。我们的系统在最具挑战性的设置中,任务成功率从56%提高至69%,显著超越了之前的最先进水平。
🔬 方法详解
问题定义:本文旨在解决现有任务导向对话系统在引导目标和处理新颖基础方面的不足。现有方法往往难以有效地将对话内容转化为可执行的任务指令,导致对话效果不佳。
核心思路:论文提出的系统通过模块化设计,将大型语言模型与符号规划器结合,利用LLM将对话转化为可执行代码,从而实现对话状态的动态跟踪和响应生成。这样的设计使得系统在处理复杂对话时更加灵活和高效。
技术框架:系统主要由两个模块组成:阅读器和规划器。阅读器负责将合作伙伴的发言转化为可执行代码,而规划器则基于当前对话状态决定下一个响应。整体流程包括输入解析、代码生成、状态更新和响应生成。
关键创新:该研究的核心创新在于将符号规划与LLM结合,形成了一种新的对话生成机制。这种机制不仅提高了对话的可解释性,还增强了系统在复杂任务中的适应能力。
关键设计:系统在参数设置上进行了优化,确保LLM能够准确理解输入并生成有效的代码。同时,符号规划器的设计使得系统能够在对话中保持状态一致性,提升了整体的对话质量。通过这些设计,系统在处理复杂任务时表现出更高的成功率。
🖼️ 关键图片
📊 实验亮点
在OneCommon对话任务中,提出的系统在最具挑战性的设置下,任务成功率从56%提升至69%,显著超越了之前的最先进水平。这一结果表明,系统在复杂对话场景中的有效性和可靠性,展示了其在实际应用中的潜力。
🎯 应用场景
该研究的潜在应用场景包括智能客服、虚拟助手和人机交互系统等领域。通过提高对话系统的任务导向能力,能够显著提升用户体验和系统效率,具有广泛的实际价值和未来影响。随着技术的进步,该系统有望在更多复杂任务中得到应用,推动智能对话系统的发展。
📄 摘要(原文)
Large language models (LLMs) excel at processing and generating both text and code. However, LLMs have had limited applicability in grounded task-oriented dialogue as they are difficult to steer toward task objectives and fail to handle novel grounding. We present a modular and interpretable grounded dialogue system that addresses these shortcomings by composing LLMs with a symbolic planner and grounded code execution. Our system consists of a reader and planner: the reader leverages an LLM to convert partner utterances into executable code, calling functions that perform grounding. The translated code's output is stored to track dialogue state, while a symbolic planner determines the next appropriate response. We evaluate our system's performance on the demanding OneCommon dialogue task, involving collaborative reference resolution on abstract images of scattered dots. Our system substantially outperforms the previous state-of-the-art, including improving task success in human evaluations from 56% to 69% in the most challenging setting.