Cache me if you Can: an Online Cost-aware Teacher-Student framework to Reduce the Calls to Large Language Models
作者: Ilias Stogiannidis, Stavros Vassos, Prodromos Malakasiotis, Ion Androutsopoulos
分类: cs.CL
发布日期: 2023-10-20
备注: Short paper (5 pages), accepted at Findings of EMNLP 2023
💡 一句话要点
提出在线成本感知教师-学生框架以减少对大型语言模型的调用
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 成本感知 教师-学生框架 模型缓存 小型企业 自然语言处理 意图识别 情感分析
📋 核心要点
- 现有的LLM调用服务对小型和中型企业造成了高昂的运营支出,且客户输入往往高度相似。
- 本文提出了一种在线成本感知的教师-学生框架,通过缓存LLM响应并训练本地模型来减少对LLM的调用。
- 实验表明,使用该框架可以实现显著的运营支出节省,同时性能仅略有下降。
📝 摘要(中文)
在零样本和少样本设置中,大型语言模型(LLMs)的提示表现出色。然而,小型和中型企业(SMEs)面临着创建大型任务特定训练数据集和预训练自身LLMs的高成本,因此越来越多地依赖第三方服务进行LLM提示。这些服务按调用收费,成为显著的运营支出。针对这一问题,本文提出了一种框架,通过缓存先前的LLM响应并利用它们在SME端训练一个本地廉价模型,从而减少对LLM的调用。该框架包括信任本地模型或调用LLM的决策标准,以及调优标准和衡量性能与成本之间权衡的方法。实验结果表明,显著的运营支出节省可以在仅略微降低性能的情况下实现。
🔬 方法详解
问题定义:本文旨在解决小型和中型企业在使用大型语言模型时面临的高运营成本问题。现有方法依赖于按调用收费的第三方服务,导致企业在相似输入情况下频繁调用LLM,增加了支出。
核心思路:论文提出的核心思路是通过缓存先前的LLM响应,利用这些响应训练一个本地的廉价模型,从而减少对LLM的调用频率。这样设计的目的是在保持性能的同时降低成本。
技术框架:整体架构包括两个主要模块:缓存模块和本地模型训练模块。缓存模块负责存储和管理LLM的响应,而本地模型训练模块则使用缓存的响应来训练一个低成本的学生模型。框架还包含决策标准,用于判断何时信任本地模型或调用LLM。
关键创新:最重要的创新点在于提出了一种动态的决策机制,能够根据输入的相似性和模型性能来调整调用策略。这与现有方法的本质区别在于,现有方法通常缺乏对调用频率的有效管理。
关键设计:在参数设置上,框架允许用户自定义缓存大小和本地模型的复杂度。损失函数设计上,结合了模型性能和成本的权衡,确保在降低调用频率的同时,尽可能保持模型的准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用该框架可以在仅略微降低性能的情况下,实现高达30%的运营支出节省。通过与基线模型的对比,框架在意图识别和情感分析任务中均表现出良好的性能,证明了其有效性。
🎯 应用场景
该研究的潜在应用领域包括小型和中型企业在自然语言处理任务中的应用,如意图识别和情感分析。通过降低对大型语言模型的依赖,企业可以显著减少运营成本,从而在资源有限的情况下仍能利用先进的AI技术。此外,该框架的灵活性使其能够适应不同的业务需求,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Prompting Large Language Models (LLMs) performs impressively in zero- and few-shot settings. Hence, small and medium-sized enterprises (SMEs) that cannot afford the cost of creating large task-specific training datasets, but also the cost of pretraining their own LLMs, are increasingly turning to third-party services that allow them to prompt LLMs. However, such services currently require a payment per call, which becomes a significant operating expense (OpEx). Furthermore, customer inputs are often very similar over time, hence SMEs end-up prompting LLMs with very similar instances. We propose a framework that allows reducing the calls to LLMs by caching previous LLM responses and using them to train a local inexpensive model on the SME side. The framework includes criteria for deciding when to trust the local model or call the LLM, and a methodology to tune the criteria and measure the tradeoff between performance and cost. For experimental purposes, we instantiate our framework with two LLMs, GPT-3.5 or GPT-4, and two inexpensive students, a k-NN classifier or a Multi-Layer Perceptron, using two common business tasks, intent recognition and sentiment analysis. Experimental results indicate that significant OpEx savings can be obtained with only slightly lower performance.