Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning

📄 arXiv: 2310.03094v3 📥 PDF

作者: Murong Yue, Jie Zhao, Min Zhang, Liang Du, Ziyu Yao

分类: cs.CL, cs.AI, cs.LG

发布日期: 2023-10-04 (更新: 2024-02-08)

备注: Accepted to ICLR 2024


💡 一句话要点

提出LLM级联方法以降低推理任务成本

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 推理任务 成本优化 答案一致性 思维表示 级联方法 机器学习

📋 核心要点

  1. 现有大型语言模型在推理任务中的高成本限制了其广泛应用,尤其是在复杂问题上。
  2. 本文提出了一种LLM级联方法,通过将简单问题交给较弱的LLM处理,节省使用成本。
  3. 实验结果表明,所提方法在六个推理基准数据集上表现出色,成本仅为使用强大LLM的40%。

📝 摘要(中文)

大型语言模型(LLMs)如GPT-4在多种任务中表现出色,但使用付费API服务的高成本限制了其应用。本文研究了构建LLM级联的方法,以降低推理任务的使用成本。该级联管道的直觉是,简单问题可以由较弱但更经济的LLM处理,而只有复杂问题才需要更强大且昂贵的LLM。为实现这一决策,我们将较弱LLM的“答案一致性”视为问题难度的信号,并提出了多种答案采样和一致性检查方法,包括利用两种思维表示的混合(即思维链和程序思维)。通过在六个推理基准数据集上的实验,我们证明了所提出的LLM级联方法可以在仅需40%成本的情况下,实现与单独使用强大LLM相当的性能。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在推理任务中高昂的使用成本问题。现有方法往往依赖于强大的LLM,导致费用过高,限制了其应用范围。

核心思路:论文提出的核心思路是构建LLM级联,通过将简单问题交给较弱的LLM处理,只有在遇到复杂问题时才调用更强大的LLM。这种方法利用较弱LLM的答案一致性作为问题难度的指示信号。

技术框架:整体架构包括两个主要阶段:首先,使用较弱的LLM处理问题并生成答案;其次,进行答案一致性检查,若一致性高则直接使用该答案,若一致性低则转交给强大的LLM进行处理。

关键创新:最重要的技术创新在于引入了两种思维表示的混合(思维链和程序思维),用于答案采样和一致性检查。这一方法与传统的单一LLM使用方式有本质区别,能够有效降低成本。

关键设计:在设计中,关键参数包括LLM的选择(GPT-3.5-turbo作为较弱LLM,GPT-4作为强LLM),以及答案一致性检查的具体算法。这些设计确保了在保证性能的同时,最大限度地降低了成本。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提出的LLM级联方法在六个推理基准数据集上表现出色,性能与单独使用强大LLM相当,但成本仅为其40%。这一显著的成本效益提升为推理任务的实际应用提供了新的可能性。

🎯 应用场景

该研究的潜在应用领域包括教育、金融和医疗等需要推理能力的场景。通过降低使用大型语言模型的成本,更多的企业和研究机构能够利用这些先进技术,推动智能化应用的发展,提升决策效率和准确性。

📄 摘要(原文)

Large language models (LLMs) such as GPT-4 have exhibited remarkable performance in a variety of tasks, but this strong performance often comes with the high expense of using paid API services. In this paper, we are motivated to study building an LLM cascade to save the cost of using LLMs, particularly for performing reasoning (e.g., mathematical, causal) tasks. Our cascade pipeline follows the intuition that simpler questions can be addressed by a weaker but more affordable LLM, whereas only the challenging questions necessitate the stronger and more expensive LLM. To realize this decision-making, we consider the "answer consistency" of the weaker LLM as a signal of the question difficulty and propose several methods for the answer sampling and consistency checking, including one leveraging a mixture of two thought representations (i.e., Chain-of-Thought and Program-of-Thought). Through experiments on six reasoning benchmark datasets, with GPT-3.5-turbo and GPT-4 being the weaker and stronger LLMs, respectively, we demonstrate that our proposed LLM cascades can achieve performance comparable to using solely the stronger LLM but require only 40% of its cost.