LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models

📄 arXiv: 2310.05736v2 📥 PDF

作者: Huiqiang Jiang, Qianhui Wu, Chin-Yew Lin, Yuqing Yang, Lili Qiu

分类: cs.CL, cs.LG

发布日期: 2023-10-09 (更新: 2023-12-06)

备注: Accepted at EMNLP 2023


💡 一句话要点

提出LLMLingua以解决大语言模型推理效率低下问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 提示压缩 推理效率 语义完整性 机器学习

📋 核心要点

  1. 现有方法在处理长提示时效率低下,导致推理速度缓慢和成本增加。
  2. 本文提出LLMLingua,通过粗到细的压缩方法和预算控制器,保持语义完整性并提高推理效率。
  3. 实验结果显示,LLMLingua在多个数据集上实现了最先进的性能,压缩比可达20倍,且性能损失极小。

📝 摘要(中文)

大语言模型(LLMs)因其卓越的能力被广泛应用于各种场景。随着链式思维(CoT)提示和上下文学习(ICL)等技术的发展,输入到LLMs的提示变得越来越冗长,甚至超过数万个标记。为加速模型推理并降低成本,本文提出了LLMLingua,一种粗到细的提示压缩方法,采用预算控制器以在高压缩比下保持语义完整性,使用基于标记的迭代压缩算法更好地建模压缩内容间的相互依赖关系,并引入基于指令调优的方法实现语言模型间的分布对齐。实验结果表明,该方法在GSM8K、BBH、ShareGPT和Arxiv-March23等四个数据集上表现出色,允许高达20倍的压缩,同时性能损失极小。

🔬 方法详解

问题定义:本文旨在解决大语言模型在处理冗长提示时推理效率低下的问题。现有方法在高压缩比下往往无法保持语义完整性,导致性能下降。

核心思路:LLMLingua通过引入预算控制器和基于标记的迭代压缩算法,旨在在高压缩比下保持语义的完整性,同时提升推理速度。

技术框架:该方法的整体架构包括三个主要模块:预算控制器、迭代压缩算法和指令调优模块。预算控制器负责控制压缩程度,迭代压缩算法用于优化压缩内容间的相互依赖性,而指令调优模块则确保模型间的分布对齐。

关键创新:LLMLingua的主要创新在于其独特的预算控制机制和迭代压缩算法,这使得在高压缩比下仍能保持语义的完整性,与传统方法相比具有显著优势。

关键设计:在设计中,采用了动态调整的压缩参数和特定的损失函数,以优化压缩效果。同时,网络结构经过精心设计,以适应不同类型的输入数据。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,LLMLingua在GSM8K、BBH、ShareGPT和Arxiv-March23等数据集上达到了最先进的性能,压缩比高达20倍,且性能损失极小,展示了其在实际应用中的有效性和优势。

🎯 应用场景

LLMLingua的研究成果在多个领域具有广泛的应用潜力,包括自然语言处理、对话系统和智能助手等。通过提高推理效率,该方法能够降低计算成本,促进大语言模型在实际应用中的普及和推广,具有重要的实际价值和未来影响。

📄 摘要(原文)

Large language models (LLMs) have been applied in various applications due to their astonishing capabilities. With advancements in technologies such as chain-of-thought (CoT) prompting and in-context learning (ICL), the prompts fed to LLMs are becoming increasingly lengthy, even exceeding tens of thousands of tokens. To accelerate model inference and reduce cost, this paper presents LLMLingua, a coarse-to-fine prompt compression method that involves a budget controller to maintain semantic integrity under high compression ratios, a token-level iterative compression algorithm to better model the interdependence between compressed contents, and an instruction tuning based method for distribution alignment between language models. We conduct experiments and analysis over four datasets from different scenarios, i.e., GSM8K, BBH, ShareGPT, and Arxiv-March23; showing that the proposed approach yields state-of-the-art performance and allows for up to 20x compression with little performance loss. Our code is available at https://aka.ms/LLMLingua.