两条时间轴:扩散模型与概率时间序列预测的五年(2021–2026)
1. 引言:问题与判据¶
多变量概率时间序列预测的任务陈述很短:给定 $D$ 维序列的历史 $\mathbf{x}^0_{1:t_0-1}$ 与协变量,输出未来若干步的联合预测分布,而非 $D$ 条边际、更非 $D$ 个点。当 $D$ 达到数百至数千(电力负荷、交通断面、组合层面的风险因子),任务的难点全部集中在一处:发射分布(emission distribution)的表达力。
2021 年之前的三类方案各有一种确定的失败方式。全协方差高斯的参数量为 $O(D^2)$、似然计算为 $O(D^3)$,且只能表达二阶相关;低秩 copula(GP-Copula 一系)以表达力换可计算性;归一化流(normalizing flows)虽有 tractable 似然,却受 Jacobian 行列式的结构约束,并且——这是一个几何陈述——连续可逆变换无法撕裂支撑集,因此会在不连通模式之间的连接处分配虚假密度 [1, 13]。
TimeGrad [1] 的回答是把当时刚刚在图像上成熟的去噪扩散模型(DDPM [2, 3])改造为序列模型的条件发射头。五年之后,ICLR 2026 的 TEDM [29] 已把采样复杂度压到预测视界的线性,AAAI 2026 的 SimDiff [30] 则让扩散模型在最保守的判据——点预测均方误差——上与回归方法正面竞争。本文不打算穷举这五年的文献(系统综述见 Su 等 [34]),而是抽出两条线索,把"在坐标系里移动过位置"的论文串起来:
线索一(纵向):文献的演化复演了理论的逻辑结构。score-based 生成建模的数学是一条单行道:先有得分函数绕开配分函数,才有朗之万采样兑现得分;先把离散链写成 SDE 的离散化,才有 Anderson 的反时方程;先有同边际的概率流 ODE,才有流匹配把参考测度变成设计变量;最后在 Fokker–Planck 的分布层,所有上述对象成为同一方程的不同投影。我们将看到,2021–2026 年的代表性论文恰好按这个顺序逐级兑现。
线索二(横向):扩散时间与物理时间的关系。TimeGrad 把去噪指标 $n$ 安排在每个物理时刻 $t$ 的 $\mathbb{R}^D$ 截面内运行——两轴正交。此后五年,这两条轴经历了并置(CSDI)、同构利用(MG-TSD)、对齐(DYffusion、ARMD),直到 2026 年被 TEDM 合并为一条。这个几何关系是给任何一篇时序扩散论文定位的最快办法。
2. 理论底座:五个支点¶
为读后文,先备五件工具。每件只给一个公式与一句话;其完整推导、反例与数值实验,见 [M4AI, Ch. 17–21] 的系统处理——即该书第四部分 "Score Functions, Dynamics, and Diffusion";其第 13–16 章先以概率、KL 散度与变分下界铺设密度视角,第 17 章起转入本文所需的几何视角。
支点一:得分函数与去噪得分匹配 [M4AI, Ch. 17]。得分函数 $s(\mathbf{x}) = \nabla_{\mathbf{x}} \log p(\mathbf{x})$ 是对数密度的局部几何,它不含配分函数——这正是能量模型可训练的原因。但真实数据集中在低维流形附近,流形上得分无定义;解法是加噪:对 $q_\sigma(\tilde{\mathbf{x}}|\mathbf{x}) = \mathcal{N}(\tilde{\mathbf{x}};\mathbf{x},\sigma^2\mathbf{I})$,有恒等式
于是"预测噪声 $\boldsymbol{\epsilon}$"与"估计得分"只差一个缩放 [4, 5, 6]。一切 $\epsilon$-参数化的扩散模型都是隐式的得分估计器。多尺度噪声(从大 $\sigma$ 到小 $\sigma$)则同时解决了流形问题与低密度区覆盖问题。
支点二:朗之万采样 [M4AI, Ch. 18]。有了得分还需要把它兑现为样本。未调整朗之万算法(ULA)
是"梯度上升 + 噪声注入"。噪声不可省略:去掉它,迭代塌缩到众数,得到的是优化器而非采样器。退火版本(annealed Langevin)让噪声尺度由大到小,与支点一的多尺度结构严丝合缝。
支点三:反时 SDE [M4AI, Ch. 19]。把离散加噪链看作 Euler–Maruyama 离散,其连续极限是方差保持(VP)SDE:$d\mathbf{x} = -\tfrac{1}{2}\beta(t)\mathbf{x}\,dt + \sqrt{\beta(t)}\,d\mathbf{W}$。Anderson(1982)[8] 给出其时间反演:
得分函数在此不是建模偏好,而是时间反演的代价:不知道 $\nabla\log p_t$ 就写不出反向方程。这一支点解释了支点一为何必须先行。
支点四:概率流 ODE 与流匹配 [M4AI, Ch. 20]。同一族边际分布 $\{p_t\}$ 可以由确定性动力学携带:
DDIM [9] 是其离散对应物;流匹配 [21, 22] 则更进一步,不再绕道 score 与 SDE,直接回归连接 $p_0$ 与 $p_1$ 的速度场——此时连接两端的路径乃至参考测度本身都成了设计变量,最优传输给出选择路径的准则。同一章的线性状态空间模型与零阶保持(ZOH)、双线性离散化,则是"离散算法 ↔ 连续过程"这一对偶原理在序列建模骨干上的另一次出场。
支点五:Fokker–Planck 与三层描述 [M4AI, Ch. 21]。路径层(样本轨迹)、方程层(SDE/ODE)之上还有分布层:密度 $p_t$ 服从 Fokker–Planck 方程
前向扩散在这一层是 OU 过程/热方程,闭式解给出任意时刻的边际并解释了为何终态收敛于标准高斯;反向问题在这一层是 ill-posed 的——除非提供 $\nabla\log p_t$,这就是"为什么必须学得分"的分布层一句话证明。
这五个支点之间的递进不是任意排列:每一个都以前一个为前提。下文将看到,文献在五年里按同一顺序把它们一一兑现。
3. 2021:三种初始条件¶
3.1 TimeGrad:正交两轴的确立¶
TimeGrad [1] 的全部结构可以写成一行因子分解:
其中 $\mathbf{h}_{t-1}$ 是 RNN 对历史与协变量的编码,而每个因子由一个条件 DDPM 实现:去噪网络 $\boldsymbol{\epsilon}_\theta(\mathbf{x}^n_t, \mathbf{h}_{t-1}, n)$ 比图像版本多吃一个条件输入,条件变分下界的推导原样通过。训练目标是熟悉的简化损失
原文明言其"与噪声条件得分网络(NCSN)的得分匹配损失同形"——这正是支点一的恒等式(系统推导见 [M4AI, Ch. 17],其中 ELBO 一侧的来路见 [M4AI, Ch. 14–16])。采样算法被作者直接命名为 annealed Langevin dynamics:$n>1$ 时注入噪声 $\mathbf{z}\sim\mathcal{N}(\mathbf{0},\mathbf{I})$,$n=1$ 时置 $\mathbf{z}=\mathbf{0}$,从噪声最强的扰动分布逐级降尺度——支点二的逐字工程实现,包括"噪声为何不可省"这一条 [M4AI, Ch. 18]。实验上,TimeGrad 在六个公开数据集(维度最高至 2000)上以 CRPS$_{\text{sum}}$ 全面刷新当时的最优结果;其消融显示扩散步数 $N$ 降到约 10 仍可用、约 100 最优——这条曲线是后来整个快采样文献的伏笔。
对它的诚实评估是:数学上零新结果。闭式前向边际、闭式后验、$\epsilon$-参数化全部来自 Ho 等 [2];创新发生在组合层——把 DDPM 从无条件图像生成器改造成序列模型的通用概率发射头,绕开了高斯的 $O(D^2)/O(D^3)$、copula 的低秩与流模型的拓扑约束。但有一项结构贡献当时不显眼、五年后回看却是原点:TimeGrad 确立了两条时间轴的正交布局——去噪指标 $n$ 在每个物理时刻 $t$ 的 $\mathbb{R}^D$ 截面内运行,与时间方向垂直。此后所有时序扩散模型,都可以按它们如何处置这两条轴来定位。
3.2 CSDI:两轴并置¶
同年的 CSDI [10] 给出第一种替代处置:把整个时间 $\times$ 维度块当作一张"图"统一加噪去噪。扩散指标 $n$ 仍独立于 $t$,但其作用域从单个截面扩展到整块——两轴由正交变为并置。这个选择一举三得:预测成为"右侧整块缺失"的插补特例,插补与预测被统一;非自回归生成避免了逐步滚动的误差累积;块内的 Transformer 可以同时取时间与特征两个方向的注意力。代价是条件结构更重,且整块生成放弃了自回归外推的归纳偏置。自此,{自回归, 整块} 成为这一文献的第一个分类轴。
3.3 ScoreGrad:离散到连续¶
ScoreGrad [11] 把 TimeGrad 的离散链走到其连续极限:前向写成条件 SDE,采样即数值求解反时 SDE——支点三 [M4AI, Ch. 19] 的逐字实现,作者亦自我定位为"第一个用于时序预测的连续能量生成模型"。值得一记的是其代码库后续加入的条件 ODE 采样器:约 20 步采样、最高近 4.9 倍加速而无性能损失——这是支点四(概率流 ODE [M4AI, Ch. 20])在时序上的最早实证之一。
至 2021 年底,坐标系的四个角已经立好:$\{$自回归, 整块$\}\times\{$离散, 连续$\}$。此后五年,是在这张图上的移动与折叠。
4. 2023–2024:引导项的语法¶
这一阶段几乎没有人改动前向过程;全部创新发生在反向漂移里加什么。统一的语法来自得分的线性可组合性:由贝叶斯公式,
条件化即在无条件得分上加一个引导项——这是支点一与支点二的联合推论([M4AI, Ch. 17–18])。各家的差别只在引导项的来源:
TimeDiff(Shen & Kwok,ICML 2023)[14] 在非自回归阵营内精化条件机制,以 future mixup 与自回归初始化缓解整块生成对时序归纳偏置的丢失。TSDiff(NeurIPS 2023)[15] 把可组合性用到最纯粹:无条件训练,推断期以观测自引导(observation self-guidance)注入条件——条件化被完全推迟到采样时刻,模型本体对下游任务保持不可知。SSSD(TMLR 2023)[16] 则替换骨干:以 S4 结构化状态空间承载长程依赖——读者会认出,这正是 [M4AI, Ch. 20] 中线性状态空间模型、对角化与 ZOH 离散化那一节在扩散语境下的落地。MG-TSD(ICLR 2024)[18] 观察到一个漂亮的同构:前向扩散"由细到粗"的退化方向,与时间序列做粗粒度平均的方向在结构上同构,于是用粗粒度序列直接监督中间噪声级——两轴未合并,但其同构性第一次被当作监督信号利用。TMDM(ICLR 2024)[19] 把 Transformer 先验深度嵌入条件两端;RATD(NeurIPS 2024)[20] 把检索增强搬进引导项:以嵌入检索从历史库中取出最相关的参考序列引导去噪,针对的是时序数据集体量不足、难例稀少与"引导缺位"这两个限制因素。
还有一篇出自相邻领域的论文必须记入这条线索:DYffusion(NeurIPS 2023)[17] 在时空场预报中把扩散步与时间插值直接耦合——预报与插值交替推进,扩散方向第一次与物理时间方向对齐。它面向气象而非通用基准,因此在时序社区内长期被低估;回看,它是两轴合并最早的信号。
5. 2025:参考测度的觉醒¶
2021–2024 年的问题是"如何更好地学反向";2025 年的问题倒了过来:正向本来就该是什么? 在支点五的语言里 [M4AI, Ch. 21]:两端分布固定之后,中间的路径测度从来不是公理,而是设计变量。
转折的载体是流匹配 [21, 22] 进入时序。TSFlow(ICLR 2025)[23] 给出了这一年最干净的论证:标准扩散把 $\mathcal{N}(\mathbf{0},\mathbf{I})$ 当作先验,但它与时序数据的分布相距太远,使传输路径不必要地长;改用核函数匹配时间结构的(条件)高斯过程作先验,配合最优传输路径与条件先验采样,无条件训练的模型即可胜任概率预测。这是五年里少见的数学层面的精化——它改的不是网络,而是参考测度;其背景正是 [M4AI, Ch. 20] 流匹配与最优传输一节所铺设的"路径选择"视角。同一思想的另一个实现方向是 NsDiff(ICML 2025)[24]:以 location-scale 形式的噪声让前向过程本身携带非平稳先验——先验不动,动的是噪声形态。ARMD(AAAI 2025)[25] 则更激进:以未来序列为初态、历史序列为终态,让滑动演化本身充当扩散路径——扩散方向被直接解释为时间方向,这是两轴合并的直接前奏。其余如 CGFM(条件引导流匹配做残差精修)与 D3U(ICLR 2025,确定性与不确定性解耦)[26] 各自占据工程生态位,不再展开。
当先验、噪声形态与路径都成为设计变量,剩下的问题只有一个:把整个设计空间摊开来系统地选。这正是 2026 年的故事。
6. 2026:两轴合并与设计空间¶
TEDM(ICLR 2026)[29] 把 Karras 等人在图像上建立的 EDM 方法论 [27]——将噪声调度、网络预条件化与采样器解耦为可独立优化的模块化设计空间——系统移植到时序预测,并在移植中完成了一个五年悬而未决的动作:把物理时间与扩散时间归并到同一条轴(原文:"reducing the physical time and the diffusion time to the same axis",并为此给出理论支撑)。两项直接后果:其一,噪声与信号的缩放可以从数据中经验计算,外部手工 schedule 被整体免除;其二,原本 $O(SH)$($S$ 个扩散步 $\times$ $H$ 个预测步)的采样复杂度坍缩为预测视界的线性。轻量骨干加低延迟采样,使其成为这条线第一个在工程意义上"实时可部署"的方案。谱系上应当把 DYffusion(2023,时空场)[17]、rolling diffusion 与 ERDM(2025)[28]、ARMD(2025)[25] 列为其前驱:沿前导时间递增噪声、令扩散方向承载时间方向,是同一个想法的三次逼近;TEDM 把它做成了设计空间内的系统选择。五年前 TimeGrad 立起的正交两轴,在此折叠为一。
值得立刻指出折叠的代价:同轴化意味着每个物理步原则上只经过一次去噪,"每步内多次精炼"的自由度被交出。对强多峰、重尾的截面分布,这个折叠是否无损,目前没有分布层的回答——我们在 §8 把它列为开放问题。
同年的 SimDiff(AAAI 2026)[30] 开辟的是另一条战线:点预测。扩散模型五年来有一个不大体面的事实——分布预测的优势并未自动兑现为点预测精度,与回归式方法相比常常落后。SimDiff 的回应是做减法:单一 Transformer 兼任降噪器与预测器、完全端到端、不依赖外部预训练或联合训练的回归器;以归一化无关性增强对分布漂移的适应,以 median-of-means 聚合多次推断——把生成多样性反过来变成均方误差的资源。"Simpler yet better" 的标题姿态,本身就是对此前堆叠混合架构路线的一句批评。
7. 平行轨道与评估判据¶
与上述全部工作平行,2024 年起时序基础模型(Chronos [31]、Moirai [32]、TimesFM [33] 等)以"token 化 + 序列模型 + 大规模预训练"的配方占据了工业预测的主流,零样本能力是其压倒性卖点。但需要看清其概率输出的形态:多经分位数头或参数混合头给出逐维边际。边际不是联合分布——分位数头不交付 copula。凡是问题的输入本质上是截面联合结构的场合——风险聚合、组合层面的分位数、尾部共动、情景生成——扩散与流这条生成式路线仍然没有替代品。这也是它对金融语境的全部相关性所在,无需更多修辞。
这里必须对这五年的记分牌本身提出一个批评。自 TimeGrad 起,该文献的主指标是 CRPS$_{\text{sum}}$:先对 $D$ 个维度求和、再对和的一维分布计算 CRPS。它是 proper 的 [1, 35]——真分布在期望意义下得分最优——但 proper 不等于敏感:求和把 $D$ 维相依结构压缩成"和"的一维分布,凡是不改变和的分布的相依差异,它一概看不见。换言之,五年的 SOTA 竞赛,大半建立在一个对"多变量"这个定语恰好钝感的指标上。更有分辨力的替代品早已存在:能量分数(energy score)[35] 与 variogram score [36] 对联合结构敏感得多。在两轴合并、采样降为线性之后,这一文献下一步最便宜也最体面的改进,也许不是新模型,而是换记分牌。
8. 四个开放问题¶
(一)自回归滚动下的误差复合。 学到的得分带有估计误差,单步条件分布因此有可量化的偏差;自回归滚动 $H$ 步后,偏差如何随 $H$ 增长?反向方程对得分误差的敏感性在无条件设定下已有零星结果,但条件 + 滚动设定下没有定量理论。这本质上是反时 Fokker–Planck 问题 ill-posedness [M4AI, Ch. 21] 的条件版本:每一步都在求解一个适定性脆弱的反问题,并把解喂给下一步。
(二)参考测度的最优性。 TSFlow 用最优传输缩短路径,但"传输成本短"与"预测分数好"之间没有已证明的对应。给定一个预测损失(CRPS、能量分数),最优的先验与路径族是什么?这是一个干净的、目前完全敞开的变分问题。
(三)轴合并的信息代价。 TEDM 式同轴化在何种截面分布类下是无损的?多峰或重尾时,是否存在一个可判定的准则,告诉我们何时必须保留每步内的精炼步数 $S>1$?没有这个准则,"线性采样"在困难分布上只是一个未经审计的折扣。
(四)离散–连续的来回账目。 训练发生在离散步,分析发生在连续极限,部署又回到离散——这正是 [M4AI, Ch. 20] 所称的离散–连续对偶原理在工程中的实况。三层之间的误差(离散化误差、得分估计误差、滚动复合误差)各有零散的界,但没有统一的账目。把账算通,这条文献才算有了自己的数值分析。
9. 结语:文献复演理论¶
回收两条线索。
第一条是纵向的爬升。TimeGrad(2021)在算法层工作——退火朗之万的离散迭代;ScoreGrad(2021)升到过程层——反时 SDE;DDIM 式加速与流匹配把问题移入几何层——确定性流与传输路径;TSFlow、NsDiff 与 TEDM(2025–26)最终在测度与设计空间层做选择。读者若把这条爬升与 [M4AI] 第 17 至 21 章的章节顺序并排——得分与能量模型、朗之万采样、随机微分方程、概率流与连续极限、Fokker–Planck 与分布动力学——会发现两者逐级对应。这不是文献抄了教科书,而是这条逻辑链本来只有一种走法:教科书把它一次写完,领域用五年把它走完。
第二条是横向的折叠。$n$ 与 $t$:正交(TimeGrad)、并置(CSDI)、同构利用(MG-TSD)、对齐(DYffusion、ARMD)、合并(TEDM)。一张坐标,放下五年。
往下看,两条线索指向同一处。纵向上,理论中尚未被文献兑现的只剩分布层的定量控制——即 §8 的第一与第四问;横向上,轴已合并,再往前要么开新轴(多模态条件、跨频率、跨资产类的联合结构),要么回头偿还理论债。把路走完和把路写出来,从来是同一件事的两半。
参考文献¶
[1] K. Rasul, C. Seward, I. Schuster, R. Vollgraf. Autoregressive Denoising Diffusion Models for Multivariate Probabilistic Time Series Forecasting. ICML 2021. arXiv:2101.12072.
[2] J. Ho, A. Jain, P. Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS 2020.
[3] J. Sohl-Dickstein, E. Weiss, N. Maheswaranathan, S. Ganguli. Deep Unsupervised Learning using Nonequilibrium Thermodynamics. ICML 2015.
[4] A. Hyvärinen. Estimation of Non-Normalized Statistical Models by Score Matching. JMLR 6:695–709, 2005.
[5] P. Vincent. A Connection Between Score Matching and Denoising Autoencoders. Neural Computation 23(7), 2011.
[6] Y. Song, S. Ermon. Generative Modeling by Estimating Gradients of the Data Distribution. NeurIPS 2019.
[7] Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon, B. Poole. Score-Based Generative Modeling through Stochastic Differential Equations. ICLR 2021.
[8] B. D. O. Anderson. Reverse-time Diffusion Equation Models. Stochastic Processes and their Applications 12(3):313–326, 1982.
[9] J. Song, C. Meng, S. Ermon. Denoising Diffusion Implicit Models. ICLR 2021.
[10] Y. Tashiro, J. Song, Y. Song, S. Ermon. CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation. NeurIPS 2021.
[11] T. Yan, H. Zhang, T. Zhou, Y. Zhan, Y. Xia. ScoreGrad: Multivariate Probabilistic Time Series Forecasting with Continuous Energy-based Generative Models. arXiv:2106.10121, 2021.
[12] D. Salinas, V. Flunkert, J. Gasthaus, T. Januschowski. DeepAR: Probabilistic Forecasting with Autoregressive Recurrent Networks. International Journal of Forecasting, 2020.
[13] D. Salinas, M. Bohlke-Schneider, L. Callot, R. Medico, J. Gasthaus. High-dimensional Multivariate Forecasting with Low-rank Gaussian Copula Processes. NeurIPS 2019.
[14] L. Shen, J. Kwok. Non-autoregressive Conditional Diffusion Models for Time Series Prediction. ICML 2023.
[15] M. Kollovieh, A. F. Ansari, M. Bohlke-Schneider, J. Zschiegner, H. Wang, Y. B. Wang. Predict, Refine, Synthesize: Self-Guiding Diffusion Models for Probabilistic Time Series Forecasting. NeurIPS 2023.
[16] J. M. López Alcaraz, N. Strodthoff. Diffusion-based Time Series Imputation and Forecasting with Structured State Space Models. TMLR 2023. arXiv:2208.09399.
[17] S. Rühling Cachay, B. Zhao, H. Joren, R. Yu. DYffusion: A Dynamics-informed Diffusion Model for Spatiotemporal Forecasting. NeurIPS 2023.
[18] X. Fan, Y. Wu, C. Xu, Y. Huang, W. Liu, J. Bian. MG-TSD: Multi-Granularity Time Series Diffusion Models with Guided Learning Process. ICLR 2024.
[19] Y. Li, W. Chen, X. Hu, B. Chen, M. Zhou. Transformer-Modulated Diffusion Models for Probabilistic Multivariate Time Series Forecasting. ICLR 2024.
[20] J. Liu, L. Yang, H. Li, S. Hong. Retrieval-Augmented Diffusion Models for Time Series Forecasting. NeurIPS 2024. arXiv:2410.18712.
[21] Y. Lipman, R. T. Q. Chen, H. Ben-Hamu, M. Nickel, M. Le. Flow Matching for Generative Modeling. ICLR 2023. arXiv:2210.02747.
[22] X. Liu, C. Gong, Q. Liu. Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow. ICLR 2023. arXiv:2209.03003.
[23] M. Kollovieh, M. Lienen, D. Lüdke, L. Schwinn, S. Günnemann. Flow Matching with Gaussian Process Priors for Probabilistic Time Series Forecasting. ICLR 2025. arXiv:2410.03024.
[24] W. Ye, Z. Xu, N. Gui. Non-stationary Diffusion for Probabilistic Time Series Forecasting. ICML 2025. arXiv:2505.04278.
[25] J. Gao, Q. Cao, Y. Chen. Auto-Regressive Moving Diffusion Models for Time Series Forecasting. AAAI 2025.
[26] Q. Li, Z. Zhang, L. Yao, Z. Li, T. Zhong, Y. Zhang. Diffusion-based Decoupled Deterministic and Uncertain Framework for Probabilistic Multivariate Time Series Forecasting. ICLR 2025.
[27] T. Karras, M. Aittala, T. Aila, S. Laine. Elucidating the Design Space of Diffusion-Based Generative Models. NeurIPS 2022.
[28] S. Rühling Cachay et al. Elucidated Rolling Diffusion Models for Probabilistic Forecasting of Complex Dynamics. arXiv:2506.20024, 2025.
[29] TEDM: Time Series Forecasting with Elucidated Diffusion Models. ICLR 2026. https://openreview.net/forum?id=kQee8MObMc
[30] H. Ding, X. Wang, T. Zhou, T. Yao. SimDiff: Simpler Yet Better Diffusion Model for Time Series Point Forecasting. AAAI 2026. arXiv:2511.19256.
[31] A. F. Ansari et al. Chronos: Learning the Language of Time Series. 2024.
[32] G. Woo et al. Unified Training of Universal Time Series Forecasting Transformers (Moirai). ICML 2024.
[33] A. Das, W. Kong, R. Sen, Y. Zhou. A Decoder-only Foundation Model for Time-series Forecasting (TimesFM). ICML 2024.
[34] C. Su et al. Diffusion Models for Time Series Forecasting: A Survey. arXiv:2507.14507, 2025.
[35] T. Gneiting, A. E. Raftery. Strictly Proper Scoring Rules, Prediction, and Estimation. JASA 102(477):359–378, 2007.
[36] M. Scheuerer, T. M. Hamill. Variogram-Based Proper Scoring Rules for Probabilistic Forecasts of Multivariate Quantities. Monthly Weather Review 143(4), 2015.
[M4AI] Xuan Xin(玄心). Mathematics for AI and Machine Learning. 2026. 全书 21 章分四部分:线性代数(Ch. 1–10)、微分与优化(Ch. 11–12)、概率与信息论(Ch. 13–16,含 KL 散度、ELBO 与变分推断)、得分函数・动力学・扩散(Ch. 17–21)。本文引用其第四部分各章——第 17 章(得分函数与能量模型)、第 18 章(朗之万动力学与采样)、第 19 章(随机微分方程与伊藤微积分)、第 20 章(ODE、SDE 与算法的连续极限)、第 21 章(Fokker–Planck 与分布动力学)——并以 [M4AI, Ch. N] 标注。官网:https://math4ai.org/ ;Amazon:https://www.amazon.com/dp/B0GSXVFMLD
起点与离散→连续(2021)
- TimeGrad — Autoregressive Denoising Diffusion Models for Multivariate Probabilistic TS Forecasting, ICML 2021 — https://arxiv.org/abs/2101.12072
- ScoreGrad — Multivariate Probabilistic TS Forecasting with Continuous Energy-based Generative Models — https://arxiv.org/abs/2106.10121
- CSDI — Conditional Score-based Diffusion Models for Probabilistic TS Imputation, NeurIPS 2021 — https://arxiv.org/abs/2107.03502
条件化与骨干改进(2023–24)
- TimeDiff — Non-autoregressive Conditional Diffusion Models for TS Prediction, ICML 2023 — https://arxiv.org/abs/2306.05043
- TSDiff — Predict, Refine, Synthesize: Self-Guiding Diffusion Models, NeurIPS 2023 — https://arxiv.org/abs/2307.11494
- SSSD — Diffusion-based TS Imputation and Forecasting with Structured State Space Models, TMLR 2023 — https://arxiv.org/abs/2208.09399
- MG-TSD — Multi-Granularity TS Diffusion Models with Guided Learning Process, ICLR 2024 — https://arxiv.org/abs/2403.05751
Flow matching 时代(2025)
- TSFlow — Flow Matching with Gaussian Process Priors, ICLR 2025 — https://arxiv.org/abs/2410.03024
- NsDiff — Non-stationary Diffusion for Probabilistic TS Forecasting, ICML 2025 — https://arxiv.org/abs/2505.04278
- CGFM — Bridging the Last Mile of Prediction: Conditional Guided Flow Matching — https://arxiv.org/abs/2507.07192
平行轨道:基础模型
- Chronos — Learning the Language of Time Series(Amazon)— https://arxiv.org/abs/2403.07815
- Moirai — Unified Training of Universal TS Forecasting Transformers(Salesforce,ICML 2024 Oral)— https://arxiv.org/abs/2402.02592
- TimesFM — A Decoder-only Foundation Model for Time-series Forecasting(Google,ICML 2024)— https://arxiv.org/abs/2310.10688
- Toto(Datadog)有两篇:2024 技术报告 https://arxiv.org/abs/2407.07874 ;2025 开源权重版(Toto-1.0 + BOOM 基准)1.51 亿参数、decoder-only、预训练语料为其他基础模型的 4–10 倍 — https://arxiv.org/abs/2505.14766
综述
- Su et al. — Diffusion Models for TS Forecasting: A Survey — https://arxiv.org/abs/2507.14507