Diversity of Thought Improves Reasoning Abilities of LLMs
作者: Ranjita Naik, Varun Chandrasekaran, Mert Yuksekgonul, Hamid Palangi, Besmira Nushi
分类: cs.CL, cs.AI
发布日期: 2023-10-11 (更新: 2024-02-23)
💡 一句话要点
提出DIVSE方法以提升大语言模型的推理能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 推理能力 多样性提示 自集成 复杂推理 自然语言处理 反馈机制
📋 核心要点
- 大语言模型在需要复杂推理的任务中表现不足,现有方法未能有效利用输入提示的多样性。
- 本文提出通过反馈生成多样化输入提示的方法,以增强模型的推理能力,称为DIVSE和IDIV-SE。
- 实验结果表明,DIV-SE在规划和图着色基准上显著提升了性能,改善了准确性与成本的权衡。
📝 摘要(中文)
大语言模型(LLMs)在复杂推理任务中表现不佳。尽管通过将问题分解为更小的推理步骤或通过修改解码步骤进行集成可以提高性能,但这些方法假设输入提示是固定的,并期望解码策略引入所需的多样性。本文讨论如何通过生成和利用输入提示的变体来实现思维多样性。我们提出了一种方法,通过从LLM获取反馈来自动改善提示的多样性。我们的方法DIVSE(多样化推理路径自集成)在多个推理调用中集成多样化提示,或在单个推理调用中使用多样化方法;后者称为IDIV-SE(调用内多样化推理路径自集成)。我们的结果超越了先前的工作,特别是DIV-SE在具有挑战性的规划和图着色基准上提升了最先进的性能。
🔬 方法详解
问题定义:本文旨在解决大语言模型在复杂推理任务中表现不佳的问题。现有方法通常依赖固定的输入提示和解码策略,未能有效引入多样性,导致推理能力受限。
核心思路:论文的核心思路是通过生成多样化的输入提示来增强模型的推理能力。具体而言,通过从模型获取反馈,自动生成适合特定问题的多样化提示,从而提高推理的灵活性和准确性。
技术框架:整体架构包括两个主要模块:首先是多样化提示生成模块,通过LLM反馈生成多种输入提示;其次是集成模块,分别实现DIV-SE和IDIV-SE,前者在多个推理调用中集成提示,后者在单个调用中使用多样化方法。
关键创新:最重要的技术创新在于引入了基于反馈的提示多样化生成机制,区别于传统方法依赖固定提示和解码策略的方式。这种方法能够更灵活地适应不同的推理任务。
关键设计:在设计中,关键参数包括提示生成的反馈机制和集成策略的选择。损失函数的设计考虑了多样性与准确性的平衡,确保生成的提示既具多样性又能有效解决问题。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DIV-SE在规划和图着色基准上达到了最先进的性能,相较于之前的方法,准确性显著提升,尤其在复杂推理任务中表现出色,改善了准确性与成本的权衡。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的复杂推理任务,如自动问答、对话系统和文本生成等。通过提升大语言模型的推理能力,能够在实际应用中提供更准确和灵活的解决方案,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large language models (LLMs) are documented to struggle in settings that require complex reasoning. Nevertheless, instructing the model to break down the problem into smaller reasoning steps, or ensembling various generations through modifying decoding steps boosts performance. However, these methods assume that the input prompt is fixed and expect the decoding strategies to introduce the diversity needed for ensembling. In this work, we discuss how one can create and leverage variations of the input prompt as a means of diversity of thought. We propose a method that automatically improves prompt diversity by soliciting feedback from the LLM to ideate approaches that are apt for the problem. We then ensemble the diverse prompts in our method DIVSE (DIVerse reasoning path Self-Ensemble) across multiple inference calls, or use diverse approaches within a single inference call; we call the latter IDIV-SE (In-call DIVerse reasoning path Self-Ensemble). Apart from our approaches outperforming prior work, DIV-SE(in particular) advances state-of-the-art performance on the challenging planning and graph coloring benchmarks. Our results improve the Pareto frontier of the accuracy-cost trade-off.