Large Language Models Only Pass Primary School Exams in Indonesia: A Comprehensive Test on IndoMMLU
作者: Fajri Koto, Nurul Aisyah, Haonan Li, Timothy Baldwin
分类: cs.CL
发布日期: 2023-10-07 (更新: 2023-10-21)
备注: Accepted at EMNLP 2023
💡 一句话要点
提出IndoMMLU基准以评估印尼语言模型能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 印尼语言 多任务学习 语言理解 教育评估 文化知识
📋 核心要点
- 现有大型语言模型在非英语数据集上的评估不足,特别是针对印尼文化和语言的能力评估缺乏合适的数据集。
- 本文提出IndoMMLU基准,涵盖印尼从小学到大学入学考试的多任务语言理解,填补了这一领域的空白。
- 实证结果表明,GPT-3.5仅能通过印尼小学水平的测试,显示出对当地语言和文化的知识掌握不足。
📝 摘要(中文)
尽管大型语言模型(LLMs)通常在大规模多语言文本上进行预训练,但其推理能力和现实知识主要基于英语数据集进行评估。评估LLM在英语之外的能力变得越来越重要,但由于缺乏合适的数据集而受到阻碍。本文介绍了IndoMMLU,这是第一个针对印尼文化和语言的多任务语言理解基准,涵盖了从小学到大学入学考试的问题。通过专业教师的参与,我们收集了14,981个问题,涉及64个任务和教育水平,其中46%的问题集中在印尼语言能力及九种地方语言和文化的知识评估上。实证评估显示,GPT-3.5仅能通过印尼小学水平的测试,对当地语言和文化的知识有限,而其他较小的模型如BLOOMZ和Falcon的表现更低。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在印尼语言和文化理解能力评估不足的问题。现有方法主要集中在英语数据集,缺乏对印尼特有文化和语言的评估。
核心思路:通过构建IndoMMLU基准,提供一个多任务的语言理解测试,涵盖印尼的教育体系和文化背景,以全面评估LLM的能力。
技术框架:IndoMMLU基准由14,981个问题组成,分为64个任务,涵盖小学到大学入学考试,问题设计由专业教师参与,确保内容的专业性和准确性。
关键创新:IndoMMLU是首个专注于印尼文化和语言的多任务语言理解基准,填补了现有评估工具的空白,提供了更全面的评估标准。
关键设计:问题设计中,46%的问题专注于印尼语言能力及九种地方语言和文化,确保了多样性和代表性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,GPT-3.5仅能通过印尼小学水平的测试,表现有限。相比之下,其他模型如BLOOMZ和Falcon的表现更低,表明当前大型语言模型在印尼语言和文化理解方面的能力亟待提升。
🎯 应用场景
该研究为评估大型语言模型在印尼语言和文化理解能力提供了新的基准,具有重要的实际价值。未来可以应用于教育评估、语言学习工具的开发,以及提升模型在多语言环境中的表现。
📄 摘要(原文)
Although large language models (LLMs) are often pre-trained on large-scale multilingual texts, their reasoning abilities and real-world knowledge are mainly evaluated based on English datasets. Assessing LLM capabilities beyond English is increasingly vital but hindered due to the lack of suitable datasets. In this work, we introduce IndoMMLU, the first multi-task language understanding benchmark for Indonesian culture and languages, which consists of questions from primary school to university entrance exams in Indonesia. By employing professional teachers, we obtain 14,981 questions across 64 tasks and education levels, with 46% of the questions focusing on assessing proficiency in the Indonesian language and knowledge of nine local languages and cultures in Indonesia. Our empirical evaluations show that GPT-3.5 only manages to pass the Indonesian primary school level, with limited knowledge of local Indonesian languages and culture. Other smaller models such as BLOOMZ and Falcon perform at even lower levels.