游乐游手机版
首页/AI热点日报/热点详情

深度学习时间序列预测的总结与未来趋势

类型:热点整理2026-07-22
2023年时间序列预测领域取得了扎实进展,变换器架构持续改进并涌现基变换器、交叉变换器、逆变换器等创新方法。大语言模型零样本预测及多模态学习成为新兴研究方向。未来变换器改进与多模态预测将深度融合并推动应用发展。

2023年,大语言模型和Stable Diffusion无疑是主角。但在时间序列这个相对低调的领域,进展虽然不惊天动地,却相当扎实。NeurIPS、ICML、AAAI这些顶会上,Transformer结构的改进层出不穷——BasisFormer、Crossformer、Inverted Transformer、Patch Transformer,还有把数值时间序列和文本、图像数据揉在一起的CrossVIVIT,直接把LLM拿来作时间序列预测的尝试,以及像SAN这样的新型正则化技术。一句话概括就是:大家都在努力把时间序列预测往前推,哪怕每一步都不大。

下面这篇文章,就带你回顾2023年深度学习在时间序列预测领域的关键进展,并展望一下2024年可能的方向。

NeurIPS 2023

今年的NeurIPS上,关于Transformer、归一化、平稳性和多模态学习都有不少有趣的论文。不过坦白说,时间序列预测领域并没有出现碘伏性的突破,更多的是实实在在的、渐进的性能改进,以及一些很有意思的概念验证。

1、Adaptive Normalization for Non-stationary Time Series

这篇论文拿出了一个“模型不可知的归一化框架”,专门用来驯服非平稳时间序列数据。作者设计的SAN分两步走:先训练一个统计预测模型(通常是ARIMA),再训练真正的深度时间序列基础模型。统计模型负责把时间序列切片、归一化和反归一化,目的是让基础模型学到更健壮的特征表示,同时甩掉非平稳性。用作者的话说,“通过对切片级别的特性建模,SAN能消除局部区域的非平稳性”。SAN还能显式预测目标窗口的统计量(比如标准差和均值),这让它在面对非平稳数据时,比普通模型更能适应分布的变化。

在电力、汇率、交通等标准时间序列预测基准上,以Transformer作为基础模型,SAN持续提升了性能。不过,这个模型把统计模型(ARIMA)和普通的Transformer绑在一起,调优和调试在新的数据集上会有点麻烦。另外,几乎所有时间序列模型都把序列输入长度当作超参数,而SAN的“切片”和普通的序列窗口到底有什么区别?作者并没有说清楚。但即便如此,基于它的实验结果和即插即用的特性,这依然是一个相当有分量的贡献。

2、BasisFormer

BasisFormer通过可学习、可解释的“基”(basis)来改进通用Transformer架构。这里的“基”类似于N-BEATS提出的神经基,比如为基于多项式的函数学习趋势、季节性等的系数。模型分三块:基模块、系数模块和预测模块。基模块通过自监督的方式,为历史和未来的时间序列数据确定一组数据基底趋势,这依赖于对比学习和一个叫InfoNCE的特定损失函数。系数模块则通过交叉注意力来“衡量时间序列和一组基趋势之间的相似度”。最后,预测模块融合这些信息输出结果。

在ETH1、ETH、天气、汇率等标准数据集上,BasisFormer比Fedformer、Informer等模型性能提高了11-15%。不过,它没有和后来发布的Inverted Transformer比较。从目前的结果看,Inverted Transformer和Crossformer可能略胜一筹。还记得去年那篇《Transformers在时间序列预测中真的有效吗?》吗?它批评了许多Transformer模型,然后展示了一个简单的D-Linear如何轻松超越它们。从BasisFormer开始,2023年的工作已经慢慢在回应这些质疑了。不过,这篇论文的技术虽然可靠,但理解起来有点费劲。作者引入了“学习基”的概念,却没有真正说清楚这个思路的新颖性以及它与其他模型的根本区别。

3、Improving day-ahead Solar Irradiance Time Series Forecasting by Leveraging Spatio-Temporal Context

这篇论文提出了一种基于混合视觉和时间序列深度学习的架构,专门用来预测第二天的太阳能产量。太阳能产量深受云层覆盖影响,这在卫星图像数据中一目了然,但在纯数值数据里很难体现。除了模型本身,研究人员还构建并开源了一个多模态卫星图像数据集,这本身就是一个很有价值的贡献。

作者描述了一个多级Transformer架构,同时处理数值时间序列和图像数据。时间序列数据通过时间Transformer,图像数据通过视觉Transformer,然后一个交叉注意力模块把两者融合。最后,数据进入一个最终的时序Transformer输出预测。论文里还提到一个有趣的设计叫ROPE(旋转位置编码),它在编码/位置嵌入中生成坐标对,用来描述云层到太阳能站的距离。作者在新数据集上进行了评估,和Informer、Reformer、Crossformer等模型进行了比较,他们的方法在整合图像数据的任务中表现更好。ROPE的概念对于任何使用地理坐标数据的人来说都有潜在的帮助,数据集本身对多模态预测的研究也是一大贡献。

4、Large Language Models Are Zero-Shot Time Series Forecasters

这篇论文探讨了一个很有意思的问题:预训练的大语言模型能不能直接把时间序列数据当作整数输入,然后以零样本的方式预测未来?作者描述了使用GPT-3、GPT-4以及开源LLM直接与时间序列数值交互,不做任何结构修改的情况。他们假设,这种零样本预测能力来源于预训练知识的普遍通用性。在标准时间序列基准数据集上,模型没有达到SOTA性能,但考虑到它是完全零样本、没有额外微调的,这个表现已经相当不错了。

LLM能在时间序列数据上“开箱即用”,因为它们是在海量文本数据上训练的。这个方向值得未来深入探索,这篇论文是挺好的一步。不过,目前该模型只能处理单变量时间序列。

ICML、ICLR 2023

除了NeurIPS,ICML和ICLR 2023也发表了多篇关于时间序列预测和深度学习的重要论文。以下几篇我觉得特别有意思,对2024年仍有参考价值。

1、Crossformer

Crossformer是专门为多元时间序列预测(MTS)设计的。它采用维度分段嵌入(DSW)机制,这和普通嵌入不同,它以二维格式处理数据,并在变量和时间维度上显式地从MTS数据生成时间段。在ETH、汇率等标准MTS数据集上,它发布时优于大多数模型,包括Informer和DLinear。作者还对DSW进行了消融实验。在预测河流流量时,Crossformer表现不错,但一次性预测多个目标时,性能似乎会明显下降。不过可以肯定的是,它比Informer和相关的Transformer模型要好。

2、Learning Perturbations to Explain Time Series Predictions

大多数深度学习解释技术里的扰动方法都是面向静态数据的(图像和文本)。但对时间序列,尤其是多元时间序列,需要更大范围的扰动来学习随机影响。作者提出了一种基于深度学习的方法,通过学习数据的掩码和相关的扰动,来更好地解释特征的重要性。掩码和扰动后的输入被送入模型,输出与原始数据的输出进行比较,根据差值计算损失。越来越多研究人员在深入探索如何解释深度学习模型,这本身就是一件好事。这篇论文概述了现有方法的不足,并提出了改进方案。但额外的神经网络来学习扰动的思路增加了不必要的复杂性。毕竟,每增加一层或一个网络,都可能引发问题,尤其是在已经很大的网络上。奥卡姆剃刀原则是值得牢记的。

3、Learning Deep Time Index Models

这篇论文通过光流和元学习来讨论预测,核心是学习如何预测非平稳时间序列。不熟悉元学习的读者可以跳过,简单说就是它常被用在计算机视觉数据集上,比如MAML这样对新图像类进行少样本学习的论文。MAML有一个内部循环和一个外部循环:外部循环教模型“如何学习”,内部循环针对特定任务进行微调。这里,作者把这个思想搬过来,把时间序列中的每一个非平稳性都当作一个新的学习任务。新的“任务”就是长时间序列中的块。在ETH、温度和汇率数据集上,虽然模型没有达到SOTA,但已经和当前最先进的架构不相上下。这篇论文为时间序列预测提供了一个有趣的新视角,相对于常规方法有了突破,这大概也是它被录用而没有刷掉的原因之一。

4、Inverted Transformers are Effective for Time Series Forecasting

Inverted Transformers是2024年的一篇论文,目前是时间序列预测数据集上的SOTA。它的做法很直接:把Transformer架构翻转了。整个时间序列序列用来创建令牌,然后各个时间序列独立进行嵌入表示,注意力机制作用在多个时间序列嵌入上。它有点像Crossformer,但遵循的是标准Transformer架构。在标准数据集上,它的性能优于Informer、Reformer、Crossformer等所有其他模型。这是一篇很有说服力的论文。不过需要注意的是,在某些情况下,它领先的幅度并没有那么显著。所以,看到这篇论文,不妨自己先跑一遍测试。

TimeGPT

最后,必须提一下TimeGPT。它没有被任何主要会议接收,评估方法也颇有争议。但因为它在互联网上获得了不少关注,这里还是要说几句。

首先,作者没有将自己的结果与SOTA模型进行严格比较,只是笼统地说“测试集包括来自多个领域的30多万个时间序列,包括金融、网络流量、物联网、天气、需求和电力”,但没有提供测试集链接,论文里也没说明这些数据集是什么。其次,论文中的架构图和描述非常糟糕,看起来像是拼凑了其他论文的图表,然后塞进了注意力机制和LLM相关的流行词汇。第三,作者所在的Nixtla公司规模很小,它是否有足够的计算资源来训练一个“成功的时间序列基础模型”?这么说虽然有点冒犯,但如果我说自己一个人用一周时间训练了一个LLM,恐怕没人会信。OpenAI、谷歌、亚马逊、Meta这些巨头花巨额计算资源才能创建庞大模型。如果TimeGPT真的只是一个简单的Transformer模型,在大量时间序列数据上训练就能成功,那为什么其他机构甚至个人不能用大量GPU复现这个结果?答案只有一个:事情没那么简单。目前,创建时间序列“基础模型”的能力还远不成熟。多元时间序列预测的关键是学习协变量之间的依赖关系,但MTS的维度在不同数据集之间差异巨大。对于文本数据的Transformer,一个单词映射到一个数字ID,创建特定维度的嵌入。但对MTS,不仅值会变,一个数据集可能有100个变量,另一个只有10个。这使得设计一个通用映射层来将不同大小的MTS数据集映射到公共嵌入维度几乎不可能。这也就是我们之前发布的Lag-Llama只能做单变量预测的原因。

另一条线索是,在其他时间序列(即使变量数量相同的数据集)上预训练模型,在当前的架构下,并不会带来性能的提升。

总结及未来方向分析

回顾2023年,我们看到了Transformer在时间序列预测中的持续改进,也看到了LLM和多模态学习的新思路。可以确定的是,进入2024年,我们会继续看到Transformer架构的进步。同时,多模态时间序列预测和分类领域很可能会有更深入的发展。

来源:https://m.elecfans.com/article/2413721.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。