When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs

📄 arXiv: 2607.21445v1 📥 PDF

作者: Anna Mosolova, Djamé Seddah

分类: cs.CL

发布日期: 2026-07-23

备注: submitted to the ARR


💡 一句话要点

提出TriviaRoomQA基准以评估多语言LLM的日常知识表现

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多语言模型 日常知识 知识评估 问答系统 流行文化

📋 核心要点

  1. 现有的基准测试主要集中在学术知识,未能有效评估LLMs在日常文化和冷门知识上的表现。
  2. 论文提出TriviaRoomQA基准,通过多语言和多主题的问答测试,全面评估LLMs的日常知识能力。
  3. 实验结果显示,模型在知识密集型主题表现强劲,但在流行文化方面存在显著弱点,且表现因语言而异。

📝 摘要(中文)

本论文探讨了大型语言模型(LLMs)在问答竞赛中的表现,特别是在日常文化和冷门知识方面。我们引入了TriviaRoomQA,一个多语言基准,旨在评估288个主题的日常知识。该基准包含3300个并行的多项选择题,覆盖六种欧洲语言,并额外提供5340个法语问题以进行更细致的案例研究。通过对30个来自不同地区的开放权重LLM的评估,我们发现这些模型在历史、地理和数学等知识密集型主题上表现良好,但在流行文化主题如名人、音乐和电影等方面则显著较弱。此外,即使是相同的问题,模型在不同语言上的表现也存在差异,表明获取事实知识并非总是语言独立的。我们的数据集和实验揭示了一个重要的知识差距,这一差距未被现有的学术基准所捕捉。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型在日常知识和文化知识方面的评估不足,现有方法未能捕捉到这些知识的表现差异。

核心思路:通过引入TriviaRoomQA基准,论文设计了一套多语言的问答系统,专注于评估模型在日常和冷门知识上的能力。

技术框架:该框架包括数据集构建、问题设计和模型评估三个主要模块。数据集包含多种语言的并行问题,确保评估的全面性。

关键创新:最重要的创新在于构建了一个多语言的日常知识评估基准,填补了现有学术基准的空白,特别是在流行文化领域的知识评估。

关键设计:在数据集设计中,设置了3300个多项选择题和5340个法语问题,确保了题目的多样性和覆盖面,同时考虑了不同语言的表现差异。实验中评估了30个不同参数规模的LLM,确保了结果的广泛适用性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,模型在历史、地理和数学等知识密集型主题上表现良好,得分普遍高于80分,但在流行文化主题如名人和音乐方面的得分普遍低于50分,显示出显著的知识差距。

🎯 应用场景

该研究的潜在应用领域包括教育、娱乐和人工智能助手等,能够帮助开发更具文化适应性的语言模型,提升其在多语言环境中的表现。未来,TriviaRoomQA基准可用于推动LLMs在日常知识领域的进一步研究和优化。

📄 摘要(原文)

Quiz rooms, trivia nights, and quiz shows challenge human knowledge across a wide range of topics, from canonical facts to everyday culture. In this paper, we examine whether large language models (LLMs) can perform competitively in such settings, using quiz-style questions to test them on both common and niche topics. We introduce TriviaRoomQA, a multilingual benchmark designed to evaluate everyday, culturally grounded, and long-tail knowledge across 288 topics. The benchmark contains 3,300 parallel multiple-choice questions in six European languages and additional 5,340 French-only questions for a more fine-grained case study. We evaluate 30 open-weight LLMs from European, Asian, and North American providers, covering models from 7 to 70B parameters. We find that models are strong on knowledge-intensive topics such as history, geography, and mathematics, but substantially weaker on everyday popular-culture topics such as celebrities, music, movies, and news. Moreover, model performance varies across languages even for the same underlying questions, suggesting that access to factual knowledge is not always language-independent. In sum, our dataset and experiments demonstrate an important knowledge gap which is not captured by existing academic-based saturated benchmarks.