Establishing Vocabulary Tests as a Benchmark for Evaluating Large Language Models

📄 arXiv: 2310.14703v2 📥 PDF

作者: Gonzalo Martínez, Javier Conde, Elena Merino-Gómez, Beatriz Bermúdez-Margaretto, José Alberto Hernández, Pedro Reviriego, Marc Brysbaert

分类: cs.CL

发布日期: 2023-10-23 (更新: 2024-01-29)


💡 一句话要点

提出词汇测试作为评估大型语言模型的新基准

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 词汇测试 语言理解 评估基准 模型性能

📋 核心要点

  1. 现有大型语言模型的评估方法多集中于特定任务,忽视了基础的词汇知识评估,导致对模型语言能力的理解不够全面。
  2. 本文提出将词汇测试作为评估大型语言模型的新基准,强调其在语言理解和生成中的重要性。
  3. 通过对七种大型语言模型的评估,发现它们在词汇知识上存在显著差距,揭示了模型间的性能差异和学习机制的复杂性。

📝 摘要(中文)

词汇测试曾是语言建模评估的基石,但在当前大型语言模型(LLMs)如Llama、Mistral和GPT的评估中被忽视。现有评估基准多集中于特定任务或领域知识,忽略了语言理解和生成的基本语言学方面。本文倡导重视词汇测试,作为评估LLM性能的有效工具。通过对七种LLM在两种语言下的两种词汇测试格式进行评估,发现它们在词汇知识上存在显著差距。这些发现揭示了LLM词汇表示的复杂性、学习机制及模型和语言间的性能差异。此外,自动生成和执行词汇测试的能力为扩展评估方法提供了新机会,能够更全面地展示LLM的语言能力。

🔬 方法详解

问题定义:本文旨在解决当前大型语言模型评估中对词汇知识的忽视,现有方法未能全面反映模型的语言能力和理解深度。

核心思路:通过重视词汇测试,本文提出将其作为评估大型语言模型性能的新基准,强调词汇知识在语言理解中的基础性作用。

技术框架:研究中评估了七种大型语言模型,采用两种不同的词汇测试格式,涵盖两种语言,整体流程包括模型选择、测试设计和结果分析。

关键创新:最重要的创新在于将传统的词汇测试重新引入到现代大型语言模型的评估中,填补了现有评估方法的空白,提供了新的视角。

关键设计:在实验中,设计了两种词汇测试格式,具体参数设置和测试内容经过精心设计,以确保能够有效评估模型的词汇知识和理解能力。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,七种大型语言模型在词汇知识的掌握上存在显著差距,部分模型在特定测试中表现不佳。这些发现揭示了模型间的性能差异,强调了词汇知识在语言理解中的重要性,为后续研究提供了新的方向。

🎯 应用场景

该研究的潜在应用领域包括教育、语言学习和自然语言处理等。通过引入词汇测试作为评估工具,可以更全面地了解大型语言模型的语言能力,从而在实际应用中提高模型的可靠性和有效性,促进更好的语言理解和生成。

📄 摘要(原文)

Vocabulary tests, once a cornerstone of language modeling evaluation, have been largely overlooked in the current landscape of Large Language Models (LLMs) like Llama, Mistral, and GPT. While most LLM evaluation benchmarks focus on specific tasks or domain-specific knowledge, they often neglect the fundamental linguistic aspects of language understanding and production. In this paper, we advocate for the revival of vocabulary tests as a valuable tool for assessing LLM performance. We evaluate seven LLMs using two vocabulary test formats across two languages and uncover surprising gaps in their lexical knowledge. These findings shed light on the intricacies of LLM word representations, their learning mechanisms, and performance variations across models and languages. Moreover, the ability to automatically generate and perform vocabulary tests offers new opportunities to expand the approach and provide a more complete picture of LLMs' language skills.