Can Large Language Model Comprehend Ancient Chinese? A Preliminary Test on ACLUE

📄 arXiv: 2310.09550v1 📥 PDF

作者: Yixuan Zhang, Haonan Li

分类: cs.CL

发布日期: 2023-10-14

备注: Accepted at RANLP 2023


💡 一句话要点

提出ACLUE基准以评估大型语言模型对古汉语的理解能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 古汉语 ACLUE 语言理解 评估基准 自然语言处理 模型评估

📋 核心要点

  1. 现有大型语言模型在古汉语理解方面的能力尚未得到充分验证,缺乏系统性评估。
  2. 本文提出ACLUE基准,通过15个多样化任务评估语言模型在古汉语理解上的能力,填补这一研究空白。
  3. 实验结果显示,ChatGLM2在古汉语理解任务中表现最佳,平均得分为37.4%,与现代汉语的表现存在明显差距。

📝 摘要(中文)

大型语言模型(LLMs)在理解和生成语言方面展现了显著能力,但其对古代语言,尤其是古汉语的理解能力仍然缺乏探索。为填补这一空白,本文提出了ACLUE,一个评估语言模型理解古汉语能力的基准。ACLUE包含15个任务,涵盖了音韵、词汇、句法、语义、推理和知识等多种技能。通过对八种最先进的LLMs的评估,我们观察到它们在现代汉语和古汉语之间的表现存在显著差异。其中,ChatGLM2表现最为突出,平均得分达到37.4%。我们已公开了相关代码和数据。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在古汉语理解能力评估方面的不足,现有方法缺乏针对古代语言的系统性测试和基准。

核心思路:通过设计ACLUE基准,涵盖多种语言理解任务,全面评估模型在古汉语的表现,帮助识别模型的优势与不足。

技术框架:ACLUE基准由15个任务组成,涉及音韵、词汇、句法、语义、推理和知识等多个方面,形成一个多维度的评估体系。

关键创新:ACLUE是首个专门针对古汉语理解能力的评估基准,填补了现有研究的空白,提供了系统的评估标准。

关键设计:在任务设计中,考虑了古汉语的特殊性,确保每个任务能够有效评估模型在古汉语理解中的不同能力。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,八种评估的最先进LLMs在古汉语理解任务中的表现差异明显,ChatGLM2以37.4%的平均得分领先,显示出其在古汉语处理上的优势,为未来的研究提供了重要参考。

🎯 应用场景

该研究的潜在应用领域包括教育、文化遗产保护和语言学研究。通过评估大型语言模型在古汉语的理解能力,可以为古代文献的自动翻译、文本分析和语言学习提供技术支持,推动相关领域的发展。

📄 摘要(原文)

Large language models (LLMs) have showcased remarkable capabilities in understanding and generating language. However, their ability in comprehending ancient languages, particularly ancient Chinese, remains largely unexplored. To bridge this gap, we present ACLUE, an evaluation benchmark designed to assess the capability of language models in comprehending ancient Chinese. ACLUE consists of 15 tasks cover a range of skills, spanning phonetic, lexical, syntactic, semantic, inference and knowledge. Through the evaluation of eight state-of-the-art LLMs, we observed a noticeable disparity in their performance between modern Chinese and ancient Chinese. Among the assessed models, ChatGLM2 demonstrates the most remarkable performance, achieving an average score of 37.4%. We have made our code and data public available.