MuggleMath: Assessing the Impact of Query and Response Augmentation on Math Reasoning

📄 arXiv: 2310.05506v3 📥 PDF

作者: Chengpeng Li, Zheng Yuan, Hongyi Yuan, Guanting Dong, Keming Lu, Jiancan Wu, Chuanqi Tan, Xiang Wang, Chang Zhou

分类: cs.CL, cs.AI, cs.LG

发布日期: 2023-10-09 (更新: 2024-07-17)

备注: Accepted to ACL 2024 Main Conference

🔗 代码/项目: GITHUB


💡 一句话要点

提出MuggleMath以提升数学推理任务的模型性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 数学推理 数据增强 大型语言模型 模型微调 推理路径 教育技术 人工智能

📋 核心要点

  1. 现有的数学推理模型在处理复杂查询和多样化推理路径时效果不佳,导致性能与专有模型存在显著差距。
  2. 论文提出通过数据增强策略,特别是查询演变和多样化推理路径,来提升模型在数学推理任务中的表现。
  3. 实验结果表明,MuggleMath在GSM8K和MATH数据集上达到了新的最先进水平,且增强数据量与模型性能之间呈现对数线性关系。

📝 摘要(中文)

在大型语言模型(LLMs)的数学推理中,通过查询演变和多样化推理路径的微调数据增强被实证验证为有效,显著缩小了开源LLMs与前沿专有LLMs之间的差距。本文探讨了数学推理中的数据增强策略,旨在回答:哪些数据增强策略更有效?增强数据量与模型性能之间的关系是什么?数据增强能否激励对域外数学推理任务的泛化?为此,我们创建了两个新数据集AugGSM8K和AugMATH,通过复杂化和多样化查询以及从GSM8K和MATH中采样多个推理路径。通过在AugGSM8K和AugMATH上微调LLaMA模型,我们获得了一系列名为MuggleMath的LLMs,MuggleMath在GSM8K和MATH上实现了新的最先进水平。我们发现MuggleMath的性能与增强数据量之间存在对数线性关系,且在域外数学推理泛化方面表现较弱,表明覆盖更广泛主题的查询增强更有利于泛化。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在数学推理任务中由于数据不足和查询单一导致的性能瓶颈,现有方法在处理复杂和多样化的数学问题时表现不佳。

核心思路:通过创建新的数据集AugGSM8K和AugMATH,采用查询复杂化和多样化推理路径的方式进行数据增强,从而提升模型的推理能力和泛化能力。

技术框架:整体流程包括数据集的构建、模型的微调和性能评估。首先,通过复杂化查询和多样化推理路径生成增强数据;然后在LLaMA模型上进行微调,最后评估模型在标准数学推理任务上的表现。

关键创新:最重要的创新点在于提出了基于查询演变和多样化推理路径的系统性数据增强策略,这一方法显著提升了模型在数学推理任务中的表现,与传统方法相比具有更强的适应性和泛化能力。

关键设计:在数据增强过程中,采用了多样化的查询生成策略和多条推理路径采样,确保生成的数据覆盖更广泛的数学主题。此外,微调过程中使用了特定的损失函数和参数设置,以优化模型在新数据集上的学习效果。

🖼️ 关键图片

img_0

📊 实验亮点

MuggleMath在GSM8K和MATH数据集上实现了新的最先进水平,性能提升显著。实验结果显示,增强数据量与模型性能之间存在对数线性关系,且在不同数据集之间的泛化能力表现出一定的局限性,提示了查询多样化的重要性。

🎯 应用场景

该研究的潜在应用领域包括教育技术、智能辅导系统和自动化数学问题解决工具。通过提升模型在数学推理任务中的表现,可以为学生提供更有效的学习支持,促进个性化学习和智能教育的发展。未来,MuggleMath的技术也可能扩展到其他领域的推理任务中,推动人工智能在复杂问题解决中的应用。

📄 摘要(原文)

In math reasoning with large language models (LLMs), fine-tuning data augmentation by query evolution and diverse reasoning paths is empirically verified effective, profoundly narrowing the gap between open-sourced LLMs and cutting-edge proprietary LLMs. In this paper, we conduct an investigation for such data augmentation in math reasoning and are intended to answer: (1) What strategies of data augmentation are more effective; (2) What is the scaling relationship between the amount of augmented data and model performance; and (3) Can data augmentation incentivize generalization to out-of-domain mathematical reasoning tasks? To this end, we create two new dataset AugGSM8K and AugMATH, by complicating and diversifying the queries and sampling multiple reasoning paths from GSM8K and MATH. We obtained a series of LLMs called MuggleMath by fine-tuning LLaMA models on AugGSM8K and AugMATH. MuggleMath substantially achieves new state-of-the-art on GSM8K and MATH. A log-linear relationship and a segmented log-linear are presented between MuggleMath's performance and the amount of augmented data on GSM8K and MATH, respectively. We also find that it is weak in out-of-domain math reasoning generalization from AugGSM8K to MATH and from AugMATH to GSM8K, which suggests that augmenting queries that cover a broader range of subjects is more beneficial for generalization. We release our codes and augmented data in https://github.com/OFA-Sys/gsm8k-ScRel.