Amortizing Scaling Law Construction Costs

📄 arXiv: 2609.05016v1 📥 PDF

作者: Abhash Kumar Jha, Diana Alexandra Onuţu, Neeratyoy Mallik, Swagatam Haldar, Sam Laing, Niccolò Ajroldi, Shiwei Liu, Joaquin Vanschoren, Aaron Klein

分类: cs.LG, cs.AI

发布日期: 2026-09-04

备注: 5 pages, 2 figures, workshop


💡 一句话要点

提出高效的缩放法构建框架以降低训练成本

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 缩放法 贝叶斯优化 计算效率 模型训练 资源节省

📋 核心要点

  1. 现有的缩放法推导过程需要在多个超参数上进行广泛的训练,计算成本极高。
  2. 本文提出将数据收集视为贝叶斯优化问题,通过逐步扩展计算预算来提高效率。
  3. 实验结果显示,该方法能够在不训练每个配置的情况下,准确拟合缩放法,节省大量计算资源。

📝 摘要(中文)

缩放法指导大型基础模型的设计选择,但推导过程需要在超参数、令牌预算和参数计数上进行广泛的训练,计算成本高昂。本文提出了一种高效的缩放法构建框架,将数据收集形式化为贝叶斯优化问题,并引入了在受限计算预算下比较缩放法拟合方法的指标。实验表明,逐步扩展计算预算显著提高了恢复效率,结合代理评估可以准确拟合缩放法,节省高达10到100倍的计算资源。

🔬 方法详解

问题定义:本文旨在解决现有缩放法构建过程中计算成本高、效率低的问题。现有方法需要在多个超参数配置上进行全面训练,导致资源浪费和时间消耗。

核心思路:论文提出将数据收集过程视为贝叶斯优化问题,通过逐步扩展计算预算来优化配置选择,从而提高缩放法的构建效率。

技术框架:整体框架包括数据收集、贝叶斯优化和缩放法拟合三个主要模块。首先,通过贝叶斯优化选择最优配置,然后逐步扩展计算预算,最后进行缩放法拟合。

关键创新:最重要的创新在于将数据收集与贝叶斯优化结合,允许在有限的计算预算下高效恢复缩放法,显著减少了对全配置网格的训练需求。

关键设计:在参数设置上,采用了动态扩展计算预算的策略,并结合代理评估技术,以增强观察到的配置,从而实现更全面的实验网格恢复。具体损失函数和网络结构细节在论文中有详细描述。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,所提出的方法在计算预算受限的情况下,能够以高达10到100倍的计算资源节省实现准确的缩放法拟合,显著优于传统的全配置训练方法。

🎯 应用场景

该研究的潜在应用领域包括大型基础模型的训练与优化,尤其是在资源受限的环境中。通过降低计算成本,该方法可以使更多的研究者和开发者能够训练和部署大型模型,推动人工智能技术的普及与发展。

📄 摘要(原文)

Scaling laws guide the design choices for training large foundation models, but deriving them involves training an exhaustive grid over hyperparameters, token budgets, and parameter counts, which is computationally expensive. Fitting a scaling law, however, only requires the best-loss frontier across compute scales, discarding most of the trained configurations. We propose a framework for efficient scaling law construction that formulates data collection as a Bayesian optimization problem, and introduce metrics for comparing scaling law fitting methods under constrained compute budgets. We find that progressively expanding the compute budget during acquisition, mirroring the compute-ordered evaluation of configurations in practice, substantially improves recovery efficiency. Augmenting the observed configurations with surrogate-fantasized evaluations then recovers the broader experimental grid, allowing accurate scaling law fitting without training every configuration. Together, these can closely match scaling law fits over a full dense grid at computational savings of up to $10\text{--}100\times$.