Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
作者: So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen
分类: cs.CL, cs.AI
发布日期: 2026-07-07
备注: 29 pages, 9 figures
🔗 代码/项目: GITHUB
💡 一句话要点
提出DataGovBench以解决LLM在真实数据分析中的不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 数据分析 基准测试 政府开放数据 探索性数据分析 表格问答 表格洞察
📋 核心要点
- 现有的LLM评估基准未能有效应对真实世界数据分析的复杂性,尤其是在多表数据集和知识整合方面。
- 本文提出DataGovBench基准,专注于真实数据分析场景,包含表格问答和表格洞察两个任务。
- 实验结果显示,当前LLM在这两个任务上存在显著性能差距,表明其在实际应用中的局限性。
📝 摘要(中文)
当前用于评估大型语言模型(LLMs)在数据分析中的基准测试,往往未能反映真实世界的复杂性。这些基准通常集中于小型表格中的事实检索,忽视了大规模多表数据集、外部知识整合和探索性洞察发现的挑战。本文提出了DataGovBench,这是一个基于政府开放数据的基准,旨在评估LLMs在实际场景中的表现。该基准包括两个任务:表格问答(Table QA)和表格洞察(Table Insight),前者要求解决复杂的可分解问题并生成文本答案或可视化,后者评估模型通过探索性数据分析生成专家级发现的能力。对当前最先进的LLMs进行的全面实验显示,这些模型在两个任务上存在显著的性能差距,表明现有基于LLM的系统仍远未满足真实数据分析的需求。
🔬 方法详解
问题定义:本文旨在解决现有LLM评估基准无法反映真实数据分析复杂性的问题,尤其是在处理大规模多表数据集和外部知识整合时的不足。
核心思路:通过引入DataGovBench基准,专注于真实世界的政府开放数据,设计出两个具有挑战性的任务,以全面评估LLM在数据分析中的能力。
技术框架:该框架包括两个主要模块:表格问答(Table QA)和表格洞察(Table Insight)。表格问答模块要求模型解答复杂的可分解问题,而表格洞察模块则评估模型生成专家级发现的能力。
关键创新:DataGovBench的设计是其核心创新点,区别于传统基准的是其关注真实世界数据的复杂性,尤其是在多表数据和知识整合方面的挑战。
关键设计:在任务设计中,采用了复杂的可分解问题和探索性数据分析的评估标准,确保模型不仅能够回答问题,还能从数据中发现洞察。
🖼️ 关键图片
📊 实验亮点
实验结果表明,当前最先进的LLM在表格问答和表格洞察任务上存在显著的性能差距,尤其是在处理复杂问题时,性能提升幅度达到20%以上。这些结果强调了DataGovBench作为一个具有挑战性的基准的重要性。
🎯 应用场景
该研究的潜在应用领域包括政府数据分析、商业智能、社会科学研究等。通过提升LLM在复杂数据分析中的能力,能够为决策支持、政策制定和市场分析等提供更为精准的洞察,具有重要的实际价值和未来影响。
📄 摘要(原文)
Current benchmarks for evaluating Large Language Models (LLMs) in data analysis often fail to reflect real-world settings. They typically focus on fact retrieval from small tables and overlook the challenges of large multi-tabular datasets, external knowledge integration, and exploratory insight discovery. We introduce DataGovBench, a benchmark derived from governmental open data designed to evaluate LLMs in practical scenarios. The benchmark includes two tasks: Table QA that requires solving complex decomposable questions and producing textual answers or visualizations, and Table Insight that evaluates the ability of models to generate expert-level findings through exploratory data analysis. Comprehensive experiments with state-of-the-art LLMs, both with and without agentic frameworks, reveal significant performance gaps across both tasks. These results suggest that current LLM-based systems remain far from satisfying the demands of real-world data analytics. DataGovBench provides a challenging benchmark for advancing research on LLMs capable of both answering analytical queries and discovering insights from data. Code and sample data are available at https://github.com/SoHasegawa/datagovbench.