BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models

📄 arXiv: 2310.01329v2 📥 PDF

作者: Qingqing Cao, Sewon Min, Yizhong Wang, Hannaneh Hajishirzi

分类: cs.CL, cs.AI

发布日期: 2023-10-02 (更新: 2024-05-03)

备注: ICLR 2024 camera-ready version


💡 一句话要点

提出二进制令牌表示以提高检索增强语言模型的效率

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 检索增强 二进制表示 自然语言处理 推理效率 模型压缩

📋 核心要点

  1. 现有的检索增强语言模型在处理大量检索文本时速度较慢,难以扩展,且存在准确性和隐私泄露等问题。
  2. 本文提出的二进制令牌表示(BTR)通过使用1位向量来预计算令牌,从而显著降低推理时的计算需求。
  3. 实验结果显示,BTR在五个知识密集型自然语言处理任务中,推理速度提高了最多4倍,存储需求减少超过100倍,同时保持了95%以上的性能。

📝 摘要(中文)

检索增强技术解决了大型语言模型中的许多关键问题,如幻觉、过时和隐私泄露。然而,由于处理大量检索文本,运行检索增强语言模型的速度较慢且难以扩展。本文提出了二进制令牌表示(BTR),使用1位向量预计算段落中的每个令牌,显著减少推理过程中的计算量。尽管可能会损失一些准确性,但我们的新校准技术和训练目标恢复了性能。结合离线和运行时压缩,仅需127GB的磁盘空间即可编码30亿个维基百科令牌。在五个知识密集型自然语言处理任务上的实验表明,BTR使得最先进的推理速度提高了最多4倍,并将存储需求减少了100倍以上,同时保持了超过95%的任务性能。

🔬 方法详解

问题定义:本文旨在解决现有检索增强语言模型在推理过程中速度慢、难以扩展以及可能的准确性损失等问题。现有方法在处理大量检索文本时,计算开销巨大,导致性能瓶颈。

核心思路:论文提出的二进制令牌表示(BTR)通过将每个令牌表示为1位向量,显著减少了推理过程中的计算量。尽管这种表示可能导致准确性下降,但通过新的校准技术和训练目标,能够恢复模型性能。

技术框架:整体架构包括两个主要阶段:首先是离线预处理阶段,在此阶段对大量文本进行编码并生成二进制令牌;其次是运行时阶段,模型使用这些预计算的令牌进行快速推理。

关键创新:最重要的技术创新在于引入了二进制令牌表示(BTR),与传统的浮点表示相比,BTR在存储和计算效率上具有显著优势。通过新的校准和训练方法,克服了二进制表示带来的准确性损失。

关键设计:在设计中,采用了特定的损失函数来优化二进制表示的训练过程,并在网络结构中引入了适应性参数设置,以确保模型在推理时的高效性和准确性。

📊 实验亮点

实验结果表明,BTR在五个知识密集型自然语言处理任务中,推理速度提升最高可达4倍,存储需求减少超过100倍,同时保持超过95%的任务性能,展现出其在效率和性能上的显著优势。

🎯 应用场景

该研究的潜在应用领域包括信息检索、对话系统和知识问答等,能够显著提高大型语言模型在实际应用中的效率和可扩展性。未来,BTR技术可能会推动更多高效的自然语言处理系统的开发,降低计算资源的需求。

📄 摘要(原文)

Retrieval augmentation addresses many critical problems in large language models such as hallucination, staleness, and privacy leaks. However, running retrieval-augmented language models (LMs) is slow and difficult to scale due to processing large amounts of retrieved text. We introduce binary token representations (BTR), which use 1-bit vectors to precompute every token in passages, significantly reducing computation during inference. Despite the potential loss of accuracy, our new calibration techniques and training objectives restore performance. Combined with offline and runtime compression, this only requires 127GB of disk space for encoding 3 billion tokens in Wikipedia. Our experiments show that on five knowledge-intensive NLP tasks, BTR accelerates state-of-the-art inference by up to 4x and reduces storage by over 100x while maintaining over 95% task performance.