Retrieval-based Knowledge Transfer: An Effective Approach for Extreme Large Language Model Compression
作者: Jiduan Liu, Jiahao Liu, Qifan Wang, Jingang Wang, Xunliang Cai, Dongyan Zhao, Ran Lucien Wang, Rui Yan
分类: cs.CL, cs.AI
发布日期: 2023-10-24
备注: EMNLP 2023 Findings
💡 一句话要点
提出基于检索的知识转移以解决极端大语言模型压缩问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 模型压缩 知识转移 自然语言处理 强化学习 小模型推理 大语言模型
📋 核心要点
- 现有的模型压缩技术在面对极端大语言模型时,往往无法有效实现极端压缩,导致实际应用受限。
- 本文提出的基于检索的知识转移(RetriKT)方法,通过构建知识库,使小规模模型能够有效检索和利用大模型的知识。
- 实验结果显示,该方法在SuperGLUE和GLUE基准测试中的低资源任务上显著提升了小规模模型的性能。
📝 摘要(中文)
大规模预训练语言模型(LLMs)在各种自然语言处理任务中表现出色,但其庞大的体积在实际应用中带来了巨大的挑战。尽管已有多种模型压缩技术被提出,但大多数方法在面对模型规模差异较大的情况下并不适用。本文提出了一种新颖的压缩范式——基于检索的知识转移(RetriKT),该方法有效地将LLMs的知识转移到极小规模的模型(例如1%)。具体而言,我们从LLMs中提取知识构建知识库,小规模模型可以从中检索相关信息并利用其进行有效推理。为提高模型质量,采用了软提示调优和近端策略优化(PPO)强化学习技术。大量实验结果表明,该方法显著提升了小规模模型的性能。
🔬 方法详解
问题定义:本文旨在解决大规模预训练语言模型在实际应用中的体积过大问题,现有压缩方法在极端模型压缩时效果不佳,导致难以部署。
核心思路:提出基于检索的知识转移(RetriKT)方法,通过从大模型中提取知识构建知识库,使小模型能够检索并利用这些知识进行推理,从而实现有效的模型压缩。
技术框架:该方法的整体架构包括知识提取、知识库构建和小模型推理三个主要模块。首先,从大模型中提取知识,构建一个知识库;然后,小模型在推理时可以从知识库中检索相关信息。
关键创新:最重要的创新点在于通过知识检索而非直接蒸馏,实现了极端小模型的知识转移,克服了传统方法在大规模模型压缩中的局限性。
关键设计:在模型训练中,采用软提示调优和近端策略优化(PPO)强化学习技术,以提高小模型的推理质量和性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,基于检索的知识转移方法在SuperGLUE和GLUE基准测试中的低资源任务上,显著提升了小规模模型的性能,具体提升幅度达到XX%(具体数据待补充),相较于传统压缩方法具有明显优势。
🎯 应用场景
该研究的潜在应用领域包括移动设备上的自然语言处理、边缘计算环境中的智能助手以及资源受限的应用场景。通过有效压缩大模型,能够在保持性能的同时,降低计算资源需求,推动智能应用的普及和发展。
📄 摘要(原文)
Large-scale pre-trained language models (LLMs) have demonstrated exceptional performance in various natural language processing (NLP) tasks. However, the massive size of these models poses huge challenges for their deployment in real-world applications. While numerous model compression techniques have been proposed, most of them are not well-suited for achieving extreme model compression when there is a significant gap in model scale. In this paper, we introduce a novel compression paradigm called Retrieval-based Knowledge Transfer (RetriKT), which effectively transfers the knowledge of LLMs to extremely small-scale models (e.g., 1%). In particular, our approach extracts knowledge from LLMs to construct a knowledge store, from which the small-scale model can retrieve relevant information and leverage it for effective inference. To improve the quality of the model, soft prompt tuning and Proximal Policy Optimization (PPO) reinforcement learning techniques are employed. Extensive experiments are conducted on low-resource tasks from SuperGLUE and GLUE benchmarks. The results demonstrate that the proposed approach significantly enhances the performance of small-scale models by leveraging the knowledge from LLMs.