Llemma: An Open Language Model For Mathematics

📄 arXiv: 2310.10631v3 📥 PDF

作者: Zhangir Azerbayev, Hailey Schoelkopf, Keiran Paster, Marco Dos Santos, Stephen McAleer, Albert Q. Jiang, Jia Deng, Stella Biderman, Sean Welleck

分类: cs.CL, cs.AI, cs.LO

发布日期: 2023-10-16 (更新: 2024-03-15)

备注: Updated references; corrected description of COPRA search budget


💡 一句话要点

提出Llemma以提升数学语言模型的性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 数学语言模型 预训练 定理证明 工具使用 开源模型

📋 核心要点

  1. 现有的数学语言模型在处理复杂数学问题时表现不佳,尤其是在推理和定理证明方面。
  2. Llemma通过在包含科学论文和数学代码的Proof-Pile-2数据集上继续预训练,提升了模型的数学理解能力。
  3. 在MATH基准测试中,Llemma在同等参数基础上超越了所有已知的开放模型,显示出显著的性能提升。

📝 摘要(中文)

我们提出了Llemma,一个针对数学的开源大型语言模型。通过在Proof-Pile-2数据集上继续对Code Llama进行预训练,Llemma在MATH基准测试中超越了所有已知的开放基础模型以及未发布的Minerva模型套件。此外,Llemma能够在不进行进一步微调的情况下进行工具使用和形式化定理证明。我们公开发布了所有相关材料,包括70亿和340亿参数模型、Proof-Pile-2数据集以及复现实验的代码。

🔬 方法详解

问题定义:本论文旨在解决现有数学语言模型在复杂数学推理和定理证明中的不足,尤其是在准确性和工具使用能力方面的挑战。

核心思路:Llemma通过在Proof-Pile-2数据集上继续对Code Llama进行预训练,增强了模型对数学内容的理解和处理能力,从而提升了其在数学任务中的表现。

技术框架:Llemma的整体架构基于大型语言模型,包含预训练和微调两个主要阶段。预训练阶段使用了丰富的数学相关数据,微调阶段则专注于特定的数学任务。

关键创新:Llemma的主要创新在于其在数学领域的专用预训练,结合了科学论文和数学代码的数据集,使其在数学推理和定理证明方面的能力显著增强。

关键设计:模型参数设置包括70亿和340亿的不同规模,损失函数采用了适合数学推理的设计,网络结构则优化了对数学表达的理解能力。通过这些设计,Llemma能够在不进行额外微调的情况下,直接进行工具使用和定理证明。

🖼️ 关键图片

fig_0

📊 实验亮点

在MATH基准测试中,Llemma在同等参数基础上超越了所有已知的开放基础模型,尤其是未发布的Minerva模型套件,显示出显著的性能提升。这一成果证明了Llemma在数学推理和定理证明方面的有效性和优越性。

🎯 应用场景

Llemma的潜在应用领域包括教育、科学研究和自动化定理证明等。它可以帮助学生和研究人员更好地理解和解决数学问题,同时在科学计算和算法验证中发挥重要作用。未来,Llemma可能会推动数学相关领域的进一步研究和应用。

📄 摘要(原文)

We present Llemma, a large language model for mathematics. We continue pretraining Code Llama on the Proof-Pile-2, a mixture of scientific papers, web data containing mathematics, and mathematical code, yielding Llemma. On the MATH benchmark Llemma outperforms all known open base models, as well as the unreleased Minerva model suite on an equi-parameter basis. Moreover, Llemma is capable of tool use and formal theorem proving without any further finetuning. We openly release all artifacts, including 7 billion and 34 billion parameter models, the Proof-Pile-2, and code to replicate our experiments.