ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

开源时间序列模型深度对比研究

开源时间序列模型深度对比研究 一、现在的时间序列模型版图是什么样时间序列建模这三年走了三段路每段都把前一段的常识推翻了一次Transformer 革命期2020-2022Informer / Autoformer / FEDformer 把注意力机制搬进长序列预测论文 SOTA 一路刷新业内一度认为序列建模 Transformer。线性回潮期2023DLinear、NLinear、TiDE 这类单层线性论文证明在 ETT / Electricity / Traffic / Weather 等长序列基准上简单线性模型打平甚至超过复杂 Transformer。Zeng et al., AAAI 2023DLinear和后续的 iTransformerICLR 2024是这一转折的两个锚点。基础模型期2024-2025TimesFM、Chronos、Moirai、Time-MoE 把 NLP/CV 的预训练-零样本范式带进时间序列开始出现训一次、跑全场景的通用预报器。基础模型不是来消灭专家模型的而是来改写工作流的——它把每个数据集从零训一个模型压缩成零样本起手 少量微调。但论文榜单和工业落地之间依然隔着一条很宽的河。二、分类框架别再按深不深分了选型时按下面四个维度切比传统 vs 深度学习有用得多维度取值为什么重要范式统计/ML · 深度学习 · 基础模型决定数据量、算力、可解释性的底线任务长/短期预测 · 缺失值填补 · 异常检测 · 分类同一个模型在不同任务上排名可能完全反转变量结构单变量 · 多变量变量间相关多变量模型不一定优于逐序列单变量业界踩坑无数协变量支持是否吃外生变量天气、电价、促销真实业务里这是能不能上线的最关键开关三、第一代经典统计与机器学习成熟度 9/10永远是首选项这一类模型有 40 年工程沉淀可解释、快、小数据可用概率预测预测区间成熟。在先上一版能用的阶段它们几乎总是成本最低的选择。模型类型开源实现强项短板适用场景ARIMA / SARIMA统计statsforecast、pmdarima理论扎实、可解释、带置信区间多变量弱、需平稳性处理、参数要调单序列、有明显趋势/周期ETS / Holt-Winters统计statsforecast季节性建模干净非线性吃力需求/销量短期预测Prophet统计加性Metaprophet节假日/变点友好、非专家可用精度一般、大数据慢业务指标、带日历效应Theta / TBATS统计statsforecast多季节周期TBATS复杂、易过拟合多重季节如电负荷XGBoost / LightGBMMLmlforecast吃任意特征、精度高、快要手工造时间特征、本质是逐点回归特征丰富的表格型预测2025 年一篇电力价格预测基准Luxembourg 大学德国/法/荷/奥/比五国日前市场里双季节 MSTL纯统计在跨国家、跨指标上表现最稳没有任何预训练基础模型在统计意义上超过它Chronos-Bolt 和 Time-MoE 在基础模型里最强但也只是和传统模型打成平手。至少 80% 的业务预测场景统计 GBDT组合仍是性价比之王。先把这层做扎实再谈深度学习。四、第二代深度学习模型研究热度最高工业成熟度参差这一代按架构族拆族内差异比族间更大。4.1 MLP 系性价比最高的深度学习路线N-BEATS / N-HiTSNixtla 官方实现ICLR 2020 / AAAI 2023基函数展开 多速率分层插值长期预测友好推理极快。N-HiTS 在 M4 上 sMAPE 约 11.9属前列。TSMixerGoogleTMLR 2023all-MLP交替做 time-mixing 和 feature-mixing。它是第一个在长序列多变量基准上能打平 SOTA 单变量模型的多变量模型说明交叉变量信息在此类数据上收益有限。TimeMixerICLR 2024多尺度分解 多层混合在 TSLib 长序列Look-Back-Searching榜单排第一。TiDEGoogle2024MLP 编码器-解码器带协变量支持参数效率高。4.2 CNN 系TimesNetICLR 2023把 1D 序列 reshape 成 2D 来捕捉多周期是 TSLib 榜单的多面手——长期/短期预测、填补、异常检测、分类五类任务里它四项排第一。4.3 RNN 系DeepARAmazon自回归 似然建模原生概率输出吃协变量。老牌但稳健适合零售/销量。LSTM / GRU / TCNNeuralForecast 里仍有位置作为对照基线和小数据兜底。4.4 Transformer 系最热闹但坑最多Informer / Autoformer / FEDformer2021-2022长序列注意力/频域分解的开山作但 2023 年后被线性模型大面积反超现在多作基线。PatchTSTICLR 2023把序列切片成 patch仿 ViT通道独立CI长序列预测常客是很多后续工作的对照。iTransformerICLR 2024倒置结构——把变量当 token、时间当通道反而更好建模多变量相关性。TSLib 长序列 Look-Back-96 榜单第二。TimeXerNeurIPS 2024主打带外生变量的预测范式TSLib 长序列 Look-Back-96 榜单第一。作者明确建议这是未来更对的任务定义。4.5 SSM 系新方向潜力大、生态嫩S-Mamba / MambaTS2024用选择性状态空间模型替代注意力近线性复杂度。S-Mamba 在 13 个公开集上以更低算力打平/超过 Transformer且对变量顺序鲁棒、零样本泛化好。这是 2024-2025 Mamba for TS 论文潮的起点截至 2026 已有 awesome-mamba-ts 这类汇总库但生产级封装远不如 Nixtla 成熟。深度学习一句话选型海量同频序列需求、电价→ N-HiTS / TSMixer / PatchTST多变量强相关电网多测点、产线多传感器→ iTransformer / TimeXer要一个模型通吃多任务→ TimesNet算力受限又要深度学习 → 线性/MLP 系别上 Transformer五、第三代时间序列基础模型2024-2025范式转移核心卖点预训练一次零样本/少样本直接预报无需为每个数据集从头训练。下面这张表是本文重点。模型机构架构预训练规模参数量原生多变量概率输出推理速度成熟度/许可TimesFM 2.5GoogleDecoder-only patch 嵌入~100B 时间点~200M否单变量2.5 加 XReg 协变量分位数头2.5快高 / ApacheHF VertexChronos / Chronos-BoltAmazonT5 encoder-only值量化成 token公开合成9M–710M 五档Chronos-2 起支持原生token 分布Bolt 比原版快 ~250×、省 ~20× 显存高 / ApacheMoirai / Moirai-MoESalesforceDecoder-only MoEany-variate attentionLOTSA 27B 观测9 域MoE 至数十亿是设计即多变量分位数 多 token中高 / ApacheTime-MoE学界Shi et al.稀疏 MoE TransformerTime-300B 300B 点9 域~2.4B是分位数中稀疏激活中 / 开源权重TinyTimeMixers (TTM)IBMMLP-Mixer中等极小数百万有限是极快中高 / ApacheTabPFN-TSPrior Labs表格基础模型迁移合成表格小依赖特征工程是快中 / 开源TimeGPTNixtla未公开未公开未公开是是API闭源 / 商业 API几个关键点Chronos 把连续值缩放量化成离散词表用 T5 类模型预测下一个 token天然出概率分布Bolt 用 patch 直接多步分位数解码速度和精度双提升。Moirai 的any-variate attention能处理任意数量输入变量而无需固定维度这点对相关性强的金融/电网组合是结构性优势Time-MoE 用稀疏专家把 2.4B 参数压成每次只激活一小部分兼顾容量与推理成本。金融场景 GIFT-Eval97 个任务配置基准里Chronos-2 综合胜率最高但排名随频率/资产/预测步长剧烈波动传统专家模型在三个金融任务里有两个仍能打平或反超预训练模型Marconi et al., 2025。其他值得盯的方向DatadogToto面向可观测性IT 指标/日志的基础模型多变量异常检测。TiREX扩展 LSTM 上下文学习长短 horizon 都强。Sundial用 TimeFlow Loss 直接在连续值上训 Transformer免量化。TabPFN-TS只用合成表格数据预训练却在标准时序基准上零样本表现意外的好——说明时序基础模型未必非得用时序数据训。六、基准与真相榜单之外的三件事短期预测M4仍是经典模型的秀场N-BEATS / N-HiTS / TimesNet 等 sMAPE 在 11.8–11.9 区间领跑深度学习并未系统性碾压。Codesota 的 M4 榜单里 TimesNet 11.8、N-HiTS/N-BEATS 11.9 居前。长序列TSLib深度学习领先Look-Back-96 前三 TimeXer iTransformer TimeMixerLook-Back-Searching 第一 TimeMixer。评估本身正在失信多篇研究指出部分基础模型的评测集与预训练集重叠精度被虚高47%–184%。TSLib 团队 2025.10 自己提出 Accuracy Law 来识别已饱和、差异无统计意义的数据集。大量新模型小幅超越 SOTA的论文差异落到真实业务里基本是噪声。底线任何模型的最终判断必须回到你自己的数据做回测。论文数字只能用于列候选清单。七、选型决策框架工程落地首选工具栈Nixtla 全家桶statsforecastmlforecastneuralforecasthierarchicalforecast统一.fit()/.predict()接口30 模型一键对比还能接 Ray/Optuna 自动调参。这是目前开源界最接近生产就绪的封装。八、我的判断基础模型是范式转移但不是银弹。它解决的是冷启动和跨域泛化不是在你自己的分布上做到极致。真实业务里基础模型零样本往往只是个强基线真正拉开差距的是在你数据上的微调。工程上别重造轮子从 Nixtla 全家桶起步。它把经典、深度学习、甚至部分基础模型Chronos 已接入 AutoGluon统一了接口回测成本最低。别被 SOTA 数字绑架。长序列榜单前几名TimeXer/iTransformer/TimeMixer差异极小且很多数据集已饱和。花一周调参去追 0.5% MSE不如把特征工程和协变量做对。Mamba/SSM 是值得押注的方向但现在是研究红利期不是生产红利期。近线性复杂度对长序列、多变量、边缘部署很有想象空间但封装、文档、社区都比 Transformer 系嫩一个身位上生产前先小范围验证。多变量 ≠ 更好。TSMixer 那篇论文最大的贡献是用量化分析证明在很多长序列基准上交叉变量信息收益有限。盲目上多变量模型常常换来更高算力、更低可解释性精度还不如逐序列线性。九、逐算法优势分析与使用场景详解9.1 第一代经典统计与机器学习ARIMA / SARIMA优势分析统计理论完备输出天然带置信区间对单序列的线性趋势/周期捕捉稳健系数可解释模型即业务含义训练成本极低。短板是多变量弱、要求序列平稳、参数需调。使用场景单指标预测某商品周销量、某传感器温度需要可解释 预测区间的监管/汇报场景以及一切模型的对照基线。ETS / Holt-Winters优势分析指数平滑对近期数据加权更合理季节性建模干净AutoETS 可自动选模型结构几乎免调参。使用场景需求/销量短期预测、库存补货不存在强外生驱动、周期清晰的中短序列。Prophet优势分析加性模型把趋势 季节 节假日 变点显式拆开业务方看得懂对缺失值、异常值鲁棒不用会深度学习也能用支持自定义节假日/促销。使用场景带强日历效应的业务指标GMV、日活、订单需要快速向非技术方解释为什么涨/跌促销/节假日密集的场景。Theta / TBATS优势分析TBATS 原生支持多重季节周期日 周 年这是多数模型做不到的Theta 简单稳健、不易过拟合。使用场景电负荷日 周 季节叠加、呼叫中心话务量、任何多重周期叠加的序列。XGBoost / LightGBM优势分析能吃任意结构化特征价格、天气、促销、one-hot 时间精度高且快增量训练方便特征重要性可解释。短板是本质逐点回归不天然建模时序依赖要手工造 lag/rolling 特征预测区间需额外做。使用场景特征丰富的表格型预测销量受价格/促销驱动竞赛型问题作为深度学习上强度量前的强基线。9.2 第二代深度学习N-BEATS / N-HiTS优势分析纯 MLP、无递归训练快、易并行N-HiTS 的多速率分层插值对长期预测尤其友好可把预测拆成趋势/季节分量有一定可解释性Nixtla 官方实现稳定。N-HiTS 在 M4 上 sMAPE 约 11.9居前列。使用场景零售需求、能源负荷等海量同频序列需要快推理 长期 horizon不想上 Transformer 又要用深度学习的场景。TSMixer优势分析all-MLP参数效率极高、训练便宜time/feature mixing 兼顾时序与交叉变量论文证明在长序列多变量基准上能打平 SOTA 单变量模型适合大规模部署。使用场景多变量但不确定交叉变量是否有用的场景先用它验证收益企业级大规模预测千级 SKU/测点算力敏感的生产环境。TimeMixer优势分析多尺度分解 混合对不同时频模式都能抓TSLib 长序列Look-Back-Searching榜单第一鲁棒性强。使用场景长期预测且不确定最佳回看窗口多尺度周期混合的序列如负荷 天气。TiDE优势分析MLP 编解码 协变量支持 抗协变量噪声参数效率高比 RNN/Transformer 轻。使用场景有丰富外生变量但变量带噪声希望用深度学习又保持轻量。TimesNet优势分析把 1D 序列 reshape 成 2D 捕捉多周期是 TSLib 的多面手——预测/填补/异常/分类五类任务四项排第一单一模型覆盖多种需求。使用场景一个团队要同时做预测 异常 填补数据中等、不想维护多套模型作为多任务基线。DeepAR优势分析概率输出原生似然建模吃协变量Amazon 工业验证适合分层/相关序列。使用场景零售销量概率预测需要安全库存分位数多序列共享模式。LSTM / GRU / TCN优势分析递归/卷积对局部时序依赖建模直观TCN 并行好、感受野可控小数据比 Transformer 稳。使用场景短序列、小数据作为基线嵌入式/边缘设备。Informer / Autoformer / FEDformer优势分析长序列注意力/频域分解的开创性思路生态成熟可作基线。使用场景现在更多作教学/对照基线新项目不建议作为首选——2023 年后已被线性/MLP 大面积反超。仅在需要频域分解思路或已有工程沉淀时考虑。PatchTST优势分析patch 通道独立CI降低过拟合、提升长序列表现接近 Transformer 上限又比原版轻是很多后续研究的对照标准件。使用场景长序列单变量/通道独立多变量需要 Transformer 类但怕复杂度研究对照。iTransformer优势分析倒置结构把变量当 token、时间当通道天然建模多变量相关性TSLib 长序列 Look-Back-96 榜单第二对变量数变化鲁棒。使用场景变量强相关电网、产线、金融组合变量集合会变动多变量预测首选之一。TimeXer优势分析专为带外生变量的预测设计显式融合内生 外生TSLib 长序列 Look-Back-96 榜单第一作者明确建议这是未来更对的任务定义。使用场景外生变量是主驱动天气→负荷、促销→销量需要把协变量用满工业预测的主流范式。S-Mamba / MambaTS优势分析选择性 SSM 近线性复杂度长序列/多变量算力友好对变量顺序鲁棒零样本泛化好。S-Mamba 在 13 个公开集上以更低算力打平/超过 Transformer。短板是生态嫩、生产封装少。使用场景超长序列/多测点且算力受限边缘/实时。适合作为前瞻技术储备与小规模验证暂不建议放核心生产。9.3 第三代基础模型预训练-零样本TimesFM 2.5优势分析decoder-only patch~200M 轻量100B 时间点预训练零样本强2.5 加分位数头概率 XReg协变量单变量快且稳Vertex/HF 易获取。短板是原生单变量多变量靠 XReg 近似。使用场景单序列零样本快速出第一版web 流量、需求需要概率区间已有 GCP 栈跨域冷启动。Chronos / Chronos-Bolt优势分析把值量化成 token原生概率分布五档尺寸9M–710M灵活Bolt 比原版快 ~250×、省 ~20× 显存且精度略升CPU 也能跑2025-10 起支持多变量/协变量。短板是早期纯单变量多变量为后加。使用场景低算力/CPU 推理Bolt small 300 预测/秒需要概率风险区间冷启动跨域金融GIFT-Eval 上 Chronos-2 综合胜率最高。Moirai / Moirai-MoE优势分析any-variate attention 原生多变量处理任意变量数而无需固定维度LOTSA 27B 观测跨 9 域MoE 扩容同时保持效率多变量建模结构性最强。短板是模型大、推理中、调参复杂。使用场景相关性强的多变量组合金融组合、电网多测点跨频率/跨域统一建模需要一个模型吃下全部序列。Time-MoE优势分析2.4B 稀疏专家容量大但每次只激活少量专家精度-算力权衡好Time-300B300B 点预训练。短板是开源权重但工程封装一般、资源需求高。使用场景追求上限的多变量长序列有 GPU 资源、要冲精度研究/竞赛。TinyTimeMixers (TTM)优势分析MLP-Mixer 极轻量数百万参数训练/推理快适合微调IBM 工业背景。短板是容量有限极复杂模式吃亏。使用场景资源受限但要深度学习/基础模型能力领域微调如能源边缘部署。TabPFN-TS优势分析从合成表格预训练迁移到时序零样本意外强小模型。仅用合成表格数据预训练却在标准时序基准上零样本表现好说明时序基础模型未必非得用时序数据训。短板是依赖特征工程、范式新、生态弱。使用场景时序不长的表格型问题想试非时序预训练思路研究探索。TimeGPT优势分析闭源 API开箱即用、免运维Nixtla 背书接入成本低。使用场景不想自建模型、要快速验证想法POC/原型数据合规允许出域时。长期核心生产不建议——黑盒、不透明、付费、数据出域有合规风险。时间序列领域不存在全能冠军​ —— 经典统计/ML 仍是低成本首选与可靠基线深度学习在特定长序列与多变量场景有结构性优势基础模型带来零样本工作流革新但需本地微调才能真正落地行业落地应优先用 Nixtla 全家桶跑基线再按子场景选择性上深度学习或基础模型能源能碳/VPP/电力交易场景尤其要先以统计GBDT 打底、再用多变量模型或微调基础模型突破精度上限。
返回列表