FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
作者: Yuxin Jiang, Yufei Wang, Xingshan Zeng, Wanjun Zhong, Liangyou Li, Fei Mi, Lifeng Shang, Xin Jiang, Qun Liu, Wei Wang
分类: cs.CL
发布日期: 2023-10-31 (更新: 2024-06-05)
备注: 22 pages, 11 figures, 16 tables. ACL 2024 main camera-ready version
🔗 代码/项目: GITHUB
💡 一句话要点
提出FollowBench以解决大语言模型指令遵循评估不足的问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 指令遵循 评估基准 细粒度约束 多层次机制 自然语言处理 开放式指令 模型评估
📋 核心要点
- 现有基准测试主要关注响应质量,而忽视了响应是否遵循指令中的细粒度约束,导致评估不全面。
- 本文提出FollowBench,通过多层次机制逐步添加约束,全面评估大语言模型的指令遵循能力。
- 在对13个流行的LLMs进行评估后,发现它们在遵循指令方面存在明显弱点,为未来研究提供了改进方向。
📝 摘要(中文)
指令遵循能力对于大语言模型(LLMs)在实际应用中的表现至关重要。现有基准主要关注响应质量,而未能有效评估响应是否遵循指令中的约束。为填补这一研究空白,本文提出FollowBench,一个多层次细粒度约束遵循基准。FollowBench全面涵盖五种不同类型的细粒度约束(内容、情境、风格、格式和示例)。为实现对不同难度的精确约束遵循评估,我们引入了多层次机制,在每个增加的层级中逐步添加单一约束。通过对13个闭源和开源流行LLMs在FollowBench上的评估,我们揭示了LLMs在指令遵循方面的弱点,并指向未来研究的潜在方向。数据和代码已公开发布。
🔬 方法详解
问题定义:本文旨在解决现有大语言模型在指令遵循评估中的不足,特别是缺乏对细粒度约束的评估。现有方法往往只关注响应的质量,而未能考虑响应是否符合指令中的具体要求。
核心思路:论文提出FollowBench,通过引入多层次机制,逐步增加约束,以便更精确地评估模型在遵循指令时的表现。这种设计旨在全面考察模型在不同约束下的能力。
技术框架:FollowBench的整体架构包括五种类型的细粒度约束,分别是内容、情境、风格、格式和示例。每个约束在不同的层级中逐步引入,形成一个多层次的评估体系。
关键创新:最重要的创新点在于引入了约束演变路径的提示机制,使得强大的LLMs能够更好地处理复杂的开放式指令。这一方法与传统的单一约束评估方法有本质区别。
关键设计:在设计中,关键参数包括约束的类型和层级设置,损失函数则侧重于评估模型对每个约束的遵循程度。网络结构上,采用了适应性提示机制,以增强模型对不同约束的响应能力。
🖼️ 关键图片
📊 实验亮点
在对13个流行的闭源和开源LLMs进行评估时,FollowBench揭示了这些模型在指令遵循方面的显著弱点,特别是在复杂约束下的表现不佳。这一发现为未来的研究提供了重要的改进方向,强调了在指令遵循能力上的提升需求。
🎯 应用场景
FollowBench的研究成果可广泛应用于自然语言处理领域,特别是在需要严格遵循指令的任务中,如自动问答、对话系统和内容生成等。通过提升大语言模型的指令遵循能力,能够显著提高其在实际应用中的有效性和可靠性,未来可能推动智能助手和自动化系统的发展。
📄 摘要(原文)
The ability to follow instructions is crucial for Large Language Models (LLMs) to handle various real-world applications. Existing benchmarks primarily focus on evaluating pure response quality, rather than assessing whether the response follows constraints stated in the instruction. To fill this research gap, in this paper, we propose FollowBench, a Multi-level Fine-grained Constraints Following Benchmark for LLMs. FollowBench comprehensively includes five different types (i.e., Content, Situation, Style, Format, and Example) of fine-grained constraints. To enable a precise constraint following estimation on diverse difficulties, we introduce a Multi-level mechanism that incrementally adds a single constraint to the initial instruction at each increased level. To assess whether LLMs' outputs have satisfied every individual constraint, we propose to prompt strong LLMs with constraint-evolution paths to handle challenging open-ended instructions. By evaluating 13 closed-source and open-source popular LLMs on FollowBench, we highlight the weaknesses of LLMs in instruction following and point towards potential avenues for future work. The data and code are publicly available at https://github.com/YJiangcm/FollowBench.