SkyMath: Technical Report
作者: Liu Yang, Haihua Yang, Wenjun Cheng, Lei Lin, Chenxia Li, Yifu Chen, Lunan Liu, Jianfei Pan, Tianwen Wei, Biye Li, Liang Zhao, Lijie Wang, Bo Zhu, Guoliang Li, Xuejie Wu, Xilin Luo, Rui Hu
分类: cs.CL, cs.AI
发布日期: 2023-10-25 (更新: 2023-10-26)
💡 一句话要点
提出SkyMath以提升数学推理能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 数学推理 自我比较微调 自然语言处理 性能提升
📋 核心要点
- 现有的语言模型在数学推理任务中表现不足,尤其在复杂问题的解决上存在挑战。
- SkyMath通过自我比较微调技术,专注于提升数学推理能力,针对现有模型的不足进行优化。
- 在GSM8K数据集上,SkyMath的表现超过了所有同类开源模型,达到了新的性能标准。
📝 摘要(中文)
大型语言模型(LLMs)在解决多种自然语言处理(NLP)任务方面展现了巨大潜力,包括数学推理。本文提出了SkyMath,一个拥有130亿参数的数学专用大型语言模型。通过自我比较微调,我们显著增强了Skywork-13B-Base的数学推理能力。在GSM8K数据集上,SkyMath超越了所有已知相似规模的开源模型,并建立了新的SOTA性能。
🔬 方法详解
问题定义:本文旨在解决现有大型语言模型在数学推理任务中的不足,尤其是在处理复杂数学问题时的表现不佳。现有方法在准确性和推理能力上存在明显的局限性。
核心思路:SkyMath的核心思路是通过自我比较微调技术,增强模型的数学推理能力。这种方法通过对模型输出的自我评估和调整,提升了其在数学问题上的解答能力。
技术框架:SkyMath的整体架构包括数据预处理、模型训练和自我比较微调三个主要模块。首先,收集并处理数学问题数据;其次,训练基础模型;最后,通过自我比较微调进一步优化模型性能。
关键创新:SkyMath的主要创新在于引入自我比较微调技术,这一方法与传统的微调方式不同,能够更有效地提升模型在数学推理方面的能力。
关键设计:在模型设计中,SkyMath采用了130亿参数的架构,结合特定的损失函数和优化算法,以确保在数学推理任务中的高效学习和准确性。
🖼️ 关键图片
📊 实验亮点
SkyMath在GSM8K数据集上的表现显著优于所有已知的相似规模开源模型,达到了新的SOTA性能。这一成果展示了其在数学推理任务中的强大能力,具体提升幅度尚未披露。
🎯 应用场景
SkyMath的研究成果在教育、科学计算和工程设计等领域具有广泛的应用潜力。它可以用于自动化数学问题求解、教育辅导系统以及复杂工程问题的建模与分析,未来可能推动相关领域的智能化进程。
📄 摘要(原文)
Large language models (LLMs) have shown great potential to solve varieties of natural language processing (NLP) tasks, including mathematical reasoning. In this work, we present SkyMath, a large language model for mathematics with 13 billion parameters. By applying self-compare fine-tuning, we have enhanced mathematical reasoning abilities of Skywork-13B-Base remarkably. On GSM8K, SkyMath outperforms all known open-source models of similar size and has established a new SOTA performance.