Can Large Language Models be Good Path Planners? A Benchmark and Investigation on Spatial-temporal Reasoning

📄 arXiv: 2310.03249v3 📥 PDF

作者: Mohamed Aghzal, Erion Plaku, Ziyu Yao

分类: cs.CL

发布日期: 2023-10-05 (更新: 2025-02-24)


💡 一句话要点

提出PPNL基准以评估大语言模型的路径规划能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 路径规划 时空推理 大型语言模型 微调 基准评估 机器人导航 自动驾驶

📋 核心要点

  1. 现有的大语言模型在长期规划和空间推理任务中表现不佳,限制了其在复杂环境中的应用。
  2. 本文提出PPNL基准,通过设计路径规划任务,评估LLMs在时空推理中的表现,探索其潜力。
  3. 实验表明,GPT-4在少量示例提示下表现良好,但在长期推理方面仍有不足,而微调后的模型在特定任务上表现优异。

📝 摘要(中文)

大型语言模型(LLMs)在多个任务上取得了显著成功,但在需要长期规划和空间推理的场景中仍面临局限。为此,本文提出了一种新的基准,称为路径规划自然语言(PPNL),用于评估LLMs的时空推理能力。该基准通过制定“路径规划”任务,要求LLM在避免障碍和遵循约束的情况下导航到目标位置。通过该基准,本文系统性地研究了包括GPT-4在内的不同LLMs,采用不同的少量示例提示方法,以及通过微调的不同规模的BART和T5。实验结果显示,少量示例的GPT-4在时空推理方面表现出潜力,但在长期时间推理上仍存在不足。相较之下,微调后的LLMs在分布内推理任务上取得了令人印象深刻的结果,但在更大环境或障碍更多的环境中泛化能力不足。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在复杂路径规划任务中的局限性,尤其是在长期规划和空间推理方面的不足。现有方法在面对障碍和约束时,往往无法有效导航。

核心思路:论文提出PPNL基准,通过设计特定的路径规划任务,评估LLMs的时空推理能力。该方法通过结合少量示例提示和微调策略,探索LLMs在复杂环境中的表现。

技术框架:整体架构包括任务设计、模型选择和评估指标三个主要模块。任务设计部分定义了路径规划的具体要求,模型选择则涵盖了不同规模的LLMs,评估指标用于量化模型的推理能力。

关键创新:最重要的创新点在于提出了PPNL基准,系统性地评估LLMs在路径规划中的表现,填补了现有研究在时空推理能力评估方面的空白。

关键设计:在实验中,采用了不同的提示方法和微调策略,设置了多种环境条件和障碍物配置,以确保评估的全面性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,GPT-4在少量示例提示下的时空推理能力表现出色,但在长期推理方面仍存在不足。微调后的LLMs在分布内推理任务上取得了高达85%的准确率,但在更复杂环境中的泛化能力显著下降,表现不佳。

🎯 应用场景

该研究的潜在应用领域包括机器人导航、自动驾驶、智能家居等需要复杂路径规划的场景。通过提升大语言模型在时空推理方面的能力,可以为这些领域提供更智能的解决方案,推动相关技术的发展。

📄 摘要(原文)

Large language models (LLMs) have achieved remarkable success across a wide spectrum of tasks; however, they still face limitations in scenarios that demand long-term planning and spatial reasoning. To facilitate this line of research, in this work, we propose a new benchmark, termed $\textbf{P}$ath $\textbf{P}$lanning from $\textbf{N}$atural $\textbf{L}$anguage ($\textbf{PPNL}$). Our benchmark evaluates LLMs' spatial-temporal reasoning by formulating ''path planning'' tasks that require an LLM to navigate to target locations while avoiding obstacles and adhering to constraints. Leveraging this benchmark, we systematically investigate LLMs including GPT-4 via different few-shot prompting methodologies as well as BART and T5 of various sizes via fine-tuning. Our experimental results show the promise of few-shot GPT-4 in spatial reasoning, when it is prompted to reason and act interleavedly, although it still fails to perform long-term temporal reasoning. In contrast, while fine-tuned LLMs achieved impressive results on in-distribution reasoning tasks, they struggled to generalize to larger environments or environments with more obstacles.