Large Language Models Are Zero-Shot Time Series Forecasters

📄 arXiv: 2310.07820v3 📥 PDF

作者: Nate Gruver, Marc Finzi, Shikai Qiu, Andrew Gordon Wilson

分类: cs.LG

发布日期: 2023-10-11 (更新: 2024-08-12)

备注: NeurIPS 2023. Code available at: https://github.com/ngruver/llmtime


💡 一句话要点

提出将时间序列预测转化为文本生成的零-shot方法

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 时间序列预测 大语言模型 零-shot学习 多模态分布 数据标记化

📋 核心要点

  1. 现有的时间序列预测方法通常依赖于专门设计的模型,难以处理多模态特征和缺失数据。
  2. 本文提出将时间序列视为文本,通过大语言模型进行零-shot预测,利用其强大的文本生成能力。
  3. 实验结果表明,LLMs在时间序列预测上表现优异,甚至在某些情况下超越了传统模型,且能处理缺失数据。

📝 摘要(中文)

通过将时间序列编码为数字字符串,本文将时间序列预测框架化为文本中的下一个标记预测。研究发现,像GPT-3和LLaMA-2这样的语言模型能够在零-shot条件下进行时间序列外推,其性能可与专门训练的时间序列模型相媲美或超越。为此,本文提出了有效的时间序列数据标记化程序,并将离散分布转化为连续值的灵活密度。我们认为,LLMs在时间序列上的成功源于其自然表示多模态分布的能力,以及对简单性和重复性的偏好,这与许多时间序列的显著特征(如重复的季节性趋势)相一致。此外,LLMs能够自然处理缺失数据、适应文本侧信息,并回答问题以帮助解释预测。尽管模型规模的增加通常能提升性能,但我们发现GPT-4在数字标记化和不良的不确定性校准方面表现不如GPT-3,这可能与对齐干预(如RLHF)有关。

🔬 方法详解

问题定义:本文旨在解决传统时间序列预测模型在处理多模态特征和缺失数据时的局限性。现有方法往往需要大量标注数据和复杂的模型设计,难以适应不同类型的时间序列数据。

核心思路:论文的核心思路是将时间序列数据编码为字符串形式,并利用大语言模型(LLMs)进行下一个标记的预测,从而实现时间序列的零-shot外推。通过这种方式,LLMs能够利用其在文本生成中的优势,处理复杂的时间序列特征。

技术框架:整体架构包括数据预处理、标记化、模型训练和预测四个主要模块。首先,将时间序列数据转化为适合LLMs处理的格式;然后,利用LLMs进行训练和预测,最后将预测结果解码为时间序列形式。

关键创新:最重要的技术创新在于将时间序列预测问题转化为文本生成任务,利用LLMs的强大能力进行零-shot学习。这一方法与传统的时间序列模型相比,具有更高的灵活性和适应性。

关键设计:在参数设置上,本文对时间序列的标记化过程进行了优化,确保数字能够被有效处理。此外,损失函数的设计考虑了多模态分布的特点,以提高模型的预测准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,GPT-3和LLaMA-2在零-shot时间序列预测中表现出色,性能可与专门设计的模型相媲美。具体而言,LLMs在处理具有重复季节性趋势的时间序列时,能够有效捕捉其特征。此外,尽管GPT-4的规模更大,但在某些情况下却因数字标记化问题表现不如GPT-3,显示出模型设计对性能的显著影响。

🎯 应用场景

该研究的潜在应用领域包括金融市场预测、气象数据分析和供应链管理等。通过利用大语言模型的强大能力,能够在缺乏大量标注数据的情况下,快速适应不同的时间序列预测任务,提升预测的准确性和效率。未来,该方法可能会推动时间序列分析领域的进一步发展,促进跨领域的应用。

📄 摘要(原文)

By encoding time series as a string of numerical digits, we can frame time series forecasting as next-token prediction in text. Developing this approach, we find that large language models (LLMs) such as GPT-3 and LLaMA-2 can surprisingly zero-shot extrapolate time series at a level comparable to or exceeding the performance of purpose-built time series models trained on the downstream tasks. To facilitate this performance, we propose procedures for effectively tokenizing time series data and converting discrete distributions over tokens into highly flexible densities over continuous values. We argue the success of LLMs for time series stems from their ability to naturally represent multimodal distributions, in conjunction with biases for simplicity, and repetition, which align with the salient features in many time series, such as repeated seasonal trends. We also show how LLMs can naturally handle missing data without imputation through non-numerical text, accommodate textual side information, and answer questions to help explain predictions. While we find that increasing model size generally improves performance on time series, we show GPT-4 can perform worse than GPT-3 because of how it tokenizes numbers, and poor uncertainty calibration, which is likely the result of alignment interventions such as RLHF.