Distillation of Synthetic Data for Time Series Foundation Models

📄 arXiv: 2609.09586v1 📥 PDF

作者: Niloy Biswas, Noureddine El Karoui

分类: stat.ML, cs.LG

发布日期: 2026-09-09

备注: 10 pages, 3 figures


💡 一句话要点

提出合成数据蒸馏方法以提升时间序列基础模型训练效率

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 时间序列模型 合成数据 蒸馏训练 模型优化 高效训练

📋 核心要点

  1. 现有的时间序列基础模型预训练方法主要依赖于与实际未来值的比较,存在效率低下的问题。
  2. 本文提出的合成数据蒸馏(SDD)方法,通过比较输出与条件预测分布,优化了训练过程。
  3. 实验证明,SDD在不同规模的模型上均加快了验证损失的收敛速度,减少了训练迭代次数。

📝 摘要(中文)

时间序列基础模型(TSFMs)越来越多地在已知数据生成过程中预训练合成生成的时间序列轨迹。现有的预训练方法基于损失目标,将TSFM输出与每个轨迹的实际未来值进行比较。本文提出了一种新的损失目标,将TSFM输出与每个轨迹的条件预测分布进行比较,称为合成数据蒸馏(SDD)。SDD相当于训练目标的Rao-Blackwell化,保持随机梯度的期望不变,同时在Loewner偏序下证明减少随机梯度的协方差。我们在不同规模的TSFM模型上对SDD进行了实证验证,观察到每个模型规模的验证损失收敛速度加快:在高斯过程数据上,SDD在训练迭代次数减少10%-40%的情况下,达到了或改善了现有损失的表现。

🔬 方法详解

问题定义:本文旨在解决现有时间序列基础模型(TSFMs)预训练过程中效率低下的问题。现有方法主要依赖于将模型输出与实际未来值进行比较,导致训练时间较长且收敛速度慢。

核心思路:论文提出的合成数据蒸馏(SDD)方法,通过将模型输出与条件预测分布进行比较,优化了损失目标。这一设计旨在提高训练效率,同时保持随机梯度的期望不变。

技术框架:SDD方法的整体架构包括数据生成、模型训练和损失计算三个主要模块。在数据生成阶段,利用已知的生成过程生成合成时间序列;在模型训练阶段,使用SDD损失目标进行优化;最后,通过验证损失监控模型性能。

关键创新:SDD的核心创新在于其Rao-Blackwell化的训练目标设计,这一方法在保持随机梯度期望不变的同时,有效降低了随机梯度的协方差。这与传统方法的本质区别在于,SDD更关注于条件预测分布而非实际值。

关键设计:在损失函数的设计上,SDD采用了与条件预测分布相关的损失目标,确保模型在训练过程中能够更好地捕捉数据的潜在结构。此外,实验中对模型规模进行了多样化设置,从4M到2.5B参数不等,以验证方法的普适性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,SDD方法在不同规模的模型上均实现了验证损失的快速收敛,相较于传统方法,训练迭代次数减少了10%-40%。在高斯过程数据上,SDD达到了或改善了现有损失的表现,展现出显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括金融市场预测、气象数据分析和工业过程监控等时间序列相关任务。通过提高时间序列基础模型的训练效率,SDD方法能够为实时预测和决策支持系统提供更为准确和高效的解决方案,具有重要的实际价值和未来影响。

📄 摘要(原文)

Time series foundation models (TSFMs) are increasingly pre-trained on synthetically generated time series trajectories, where the data generating process is known. Current pre-training recipes are based on loss objectives which compare TSFM outputs to realized future values of each trajectory. We instead propose loss objectives which compare TSFM outputs to the conditional forecast distribution of each trajectory, a procedure we call synthetic data distillation (SDD). SDD corresponds to a Rao-Blackwellization of the training objective, in that it leaves the expectation of stochastic gradients unchanged while provably reducing the covariance of the stochastic gradient under the Loewner partial ordering. We empirically validate SDD on a TSFM model family of sizes from $4$M to $2.5$B parameters, and observe faster convergence of validation loss at every model size: on Gaussian Process data, SDD attains or improves upon the Status Quo loss whilst requiring $10\%-40\%$ less training iterations.