Zephyr: Direct Distillation of LM Alignment

📄 arXiv: 2310.16944v1 📥 PDF

作者: Lewis Tunstall, Edward Beeching, Nathan Lambert, Nazneen Rajani, Kashif Rasul, Younes Belkada, Shengyi Huang, Leandro von Werra, Clémentine Fourrier, Nathan Habib, Nathan Sarrazin, Omar Sanseviero, Alexander M. Rush, Thomas Wolf

分类: cs.LG, cs.CL

发布日期: 2023-10-25

🔗 代码/项目: GITHUB


💡 一句话要点

提出Zephyr以解决语言模型对用户意图的对齐问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 语言模型 意图对齐 蒸馏训练 偏好优化 自然语言处理 对话系统 AI反馈

📋 核心要点

  1. 现有的语言模型在用户意图对齐方面存在不足,无法有效响应自然语言提示。
  2. 本文提出了一种新的蒸馏直接偏好优化(dDPO)方法,通过利用偏好数据来训练更小的语言模型。
  3. Zephyr-7B在多个聊天基准测试中表现优异,超越了Llama2-Chat-70B,且训练时间短,无需人工标注。

📝 摘要(中文)

本研究旨在生成一个更小的语言模型,以更好地对齐用户意图。以往研究表明,应用蒸馏监督微调(dSFT)可以显著提高任务准确性,但这些模型通常不够对齐,无法有效响应自然提示。为此,本文利用来自AI反馈(AIF)的偏好数据,通过蒸馏直接偏好优化(dDPO)来训练一个聊天模型,显著改善意图对齐。最终结果Zephyr-7B在7B参数模型的聊天基准上达到了最新的状态,并且无需人工标注,尤其在MT-Bench上的表现超越了最佳的开源RLHF模型Llama2-Chat-70B。

🔬 方法详解

问题定义:本研究解决的是现有语言模型在用户意图对齐方面的不足,尤其是它们对自然提示的响应能力较差。现有的蒸馏方法虽然提高了任务准确性,但未能有效对齐用户意图。

核心思路:论文提出通过蒸馏直接偏好优化(dDPO)来利用AI反馈中的偏好数据,从而训练出一个更小且更对齐用户意图的语言模型。这样的设计旨在减少对人工标注的依赖,同时提高模型的响应能力。

技术框架:整体架构包括数据收集、偏好数据的处理、dDPO训练过程和模型评估。首先,收集教师模型输出的排名数据,然后应用dDPO进行模型训练,最后在多个基准上进行评估。

关键创新:最重要的技术创新在于引入了偏好数据进行直接优化,这与传统的蒸馏方法不同,后者通常依赖于单一的损失函数。通过这种方式,模型能够更好地捕捉用户意图。

关键设计:在训练过程中,采用了特定的损失函数来优化模型的输出,使其更符合用户的自然语言提示。同时,训练过程仅需数小时,且不需要额外的采样步骤,显著提高了效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

Zephyr-7B在MT-Bench基准测试中表现优异,超越了Llama2-Chat-70B,成为7B参数模型中的最新状态,显示出显著的性能提升。该模型的训练时间仅需数小时,且无需人工标注,展现了其高效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括智能客服、对话系统和个性化推荐等场景。通过提升语言模型对用户意图的对齐能力,Zephyr可以在实际应用中提供更自然和准确的交互体验,未来可能对人机交互的方式产生深远影响。

📄 摘要(原文)

We aim to produce a smaller language model that is aligned to user intent. Previous research has shown that applying distilled supervised fine-tuning (dSFT) on larger models significantly improves task accuracy; however, these models are unaligned, i.e. they do not respond well to natural prompts. To distill this property, we experiment with the use of preference data from AI Feedback (AIF). Starting from a dataset of outputs ranked by a teacher model, we apply distilled direct preference optimization (dDPO) to learn a chat model with significantly improved intent alignment. The approach requires only a few hours of training without any additional sampling during fine-tuning. The final result, Zephyr-7B, sets the state-of-the-art on chat benchmarks for 7B parameter models, and requires no human annotation. In particular, results on MT-Bench show that Zephyr-7B surpasses Llama2-Chat-70B, the best open-access RLHF-based model. Code, models, data, and tutorials for the system are available at https://github.com/huggingface/alignment-handbook.