TRACE: A Comprehensive Benchmark for Continual Learning in Large Language Models

📄 arXiv: 2310.06762v1 📥 PDF

作者: Xiao Wang, Yuansen Zhang, Tianze Chen, Songyang Gao, Senjie Jin, Xianjun Yang, Zhiheng Xi, Rui Zheng, Yicheng Zou, Tao Gui, Qi Zhang, Xuanjing Huang

分类: cs.CL

发布日期: 2023-10-10


💡 一句话要点

提出TRACE基准以评估大型语言模型的持续学习能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 持续学习 大型语言模型 基准评估 推理增强 灾难性遗忘 多任务学习 自动评估

📋 核心要点

  1. 现有的持续学习基准未能充分挑战对齐的大型语言模型,导致其持续学习能力评估不足。
  2. TRACE基准通过8个具有挑战性的任务数据集,标准化评估流程,旨在提升对LLMs持续学习能力的评估。
  3. 实验结果显示,经过TRACE训练后,LLMs的性能显著下降,提出的RCL方法有效减轻了灾难性遗忘现象。

📝 摘要(中文)

对齐的大型语言模型(LLMs)在任务解决、遵循指令和安全性方面表现出色。然而,这些模型的持续学习能力却被忽视。现有的持续学习基准缺乏足够的挑战性,无法充分评估领先的对齐LLMs。本文提出TRACE,一个新颖的基准,旨在评估LLMs的持续学习能力。TRACE包含8个不同的数据集,涵盖领域特定任务、多语言能力、代码生成和数学推理等具有挑战性的任务。所有数据集都标准化为统一格式,便于对LLMs进行自动评估。实验表明,在TRACE上训练后,对齐LLMs的通用能力和遵循指令的能力显著下降,凸显了在特定任务性能与保持LLMs原有能力之间找到合适平衡的挑战。基于此,提出了推理增强的持续学习(RCL)方法,有效减少了LLMs的灾难性遗忘。

🔬 方法详解

问题定义:本文解决的是对齐大型语言模型在持续学习中的能力评估问题。现有方法的痛点在于缺乏足够复杂的基准,无法真实反映模型的持续学习能力。

核心思路:TRACE基准通过设计8个具有挑战性的任务,涵盖多种能力,旨在全面评估LLMs的持续学习表现。同时,提出RCL方法,通过结合任务特定线索与元推理,减少模型的灾难性遗忘。

技术框架:TRACE的整体架构包括数据集的标准化、任务的多样性以及自动评估机制。主要模块包括数据集构建、模型训练和性能评估。

关键创新:TRACE基准的创新在于其多样性和挑战性,能够有效评估LLMs的持续学习能力。而RCL方法则通过引入推理路径,显著提升了模型在新任务上的收敛速度和能力保持。

关键设计:在RCL方法中,设计了特定的损失函数以平衡新任务学习与旧知识保持,同时采用了适应性学习率策略,以加速模型在新任务上的训练。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,经过TRACE训练后,llama2-chat 13B在gsm8k数据集上的准确率从28.8%骤降至2%,突显了持续学习中的性能下降问题。同时,RCL方法有效减少了灾难性遗忘,提升了模型在新任务上的学习效率。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、智能助手和教育技术等。通过提升大型语言模型的持续学习能力,可以更好地适应动态变化的任务需求,增强模型的实用性和灵活性,未来可能对人机交互和自动化系统产生深远影响。

📄 摘要(原文)

Aligned large language models (LLMs) demonstrate exceptional capabilities in task-solving, following instructions, and ensuring safety. However, the continual learning aspect of these aligned LLMs has been largely overlooked. Existing continual learning benchmarks lack sufficient challenge for leading aligned LLMs, owing to both their simplicity and the models' potential exposure during instruction tuning. In this paper, we introduce TRACE, a novel benchmark designed to evaluate continual learning in LLMs. TRACE consists of 8 distinct datasets spanning challenging tasks including domain-specific tasks, multilingual capabilities, code generation, and mathematical reasoning. All datasets are standardized into a unified format, allowing for effortless automatic evaluation of LLMs. Our experiments show that after training on TRACE, aligned LLMs exhibit significant declines in both general ability and instruction-following capabilities. For example, the accuracy of llama2-chat 13B on gsm8k dataset declined precipitously from 28.8\% to 2\% after training on our datasets. This highlights the challenge of finding a suitable tradeoff between achieving performance on specific tasks while preserving the original prowess of LLMs. Empirical findings suggest that tasks inherently equipped with reasoning paths contribute significantly to preserving certain capabilities of LLMs against potential declines. Motivated by this, we introduce the Reasoning-augmented Continual Learning (RCL) approach. RCL integrates task-specific cues with meta-rationales, effectively reducing catastrophic forgetting in LLMs while expediting convergence on novel tasks.