ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

时间序列预测中如何构建层级化的 Transformer 架构?

时间序列预测中如何构建层级化的 Transformer 架构? 前言本文介绍一篇 KDD 2024 中的时间序列预测工作来自中科大的研究者提出了一种新的生成式预训练分层 Transformer 架构用于预测命名为 GPHT。近年来学界和业界致力于通过引入先进的网络架构和自监督预训练策略来提高时间序列预测的准确性。然而现有方法存在两大缺点。本文介绍一篇 KDD 2024 中的时间序列预测工作来自中科大的研究者提出了一种新的生成式预训练分层 Transformer 架构用于预测命名为 GPHT。 ![](https://img-blog.csdnimg.cn/img_convert/8d9c5c6b5b8620da25ca844926060973.png) 【论文标题】 Generative Pretrained Hierarchical Transformer for Time Series Forecasting 【论文地址】 https://arxiv.org/abs/2402.16516 【论文源码】 https://github.com/icantnamemyself/gpht **论文背景** 时间序列预测作为时间序列分析中的一项基础任务近年来的热度居高不下。一方面基于深度学习的方法因其能够捕获时间和跨纬度依赖性的能力而取得成功。另一方面受自然语言处理NLP和计算机视觉CV领域预训练方法近期显著进展的启发学界业界提出了各种基于预训练的时间序列分析方法。对比学习技术在区分性预训练方法中得到了广泛应用其中模型被期望从构建的正负样本对中学习表示。此外将生成性目标如掩码时间序列建模纳入预训练任务也已被深入研究目的是在重建过程中提取通用知识。 另外考虑到时间序列和自然语言之间的共性最近的一些研究开始通过提示或微调将预训练语言模型调整为准确的预测器。所有这些方法都取得了显著成功甚至能够有效地与监督预测方法竞争。 尽管这些预训练预测器非常有效但在提升性能方面仍然存在重大挑战。 首先这些方法往往依赖于单一数据集进行训练由于训练数据的规模有限限制了模型的泛化能力。其次广泛采用的一步生成方案需要定制化的预测头部并忽略了输出序列中的时间依赖性同时在不同预测范围长度设置下也会导致训练成本的增加。 针对上述的研究背景和现有挑战研究者提出了一种生成式预训练的层次 Transformer 模型即 GPHT。该模型能够在不同的数据场景和预测设置中具有良好的泛化能力。 研究者将来自不同范围的时间序列作为一个整体进行处理摒弃了异质性并将来自不同数据集的每个变量的值连接起来形成用于预训练的混合数据集。并且用自回归解码替换了大多数最新预测方法所采用的常规一步生成方法以提高灵活性和性能。此外文中还引入了层次结构以更好地捕获混合数据集中的各种模式。 **模型方法** GPHT 模型具有两个关键特征一是 GPHT 在时间序列标记上以自回归方式进行预测。二是 GPHT 在包含多阶段分层 Transformer 块的混合数据集上进行预训练擅长捕捉来自各种数据场景的时间序列之间的共性。 ![](https://img-blog.csdnimg.cn/img_convert/65cb42434a59461cd2379975bf3ec682.png) 图1GPHT模型图 GPHT 采用通道独立假设将每个多变量时间序列视为多个独立的单变量时间序列。本质上GPHT 在输入序列的每个变量上进行单独的预测并将结果预测拼接起来以生成最终预测。 研究者将这种方法扩展到混合预训练数据集的构建中忽略了每个变量的异质性并且没有考虑额外的信息。因此它可以无缝地应用于更多样化的场景其中协变量信息可能缺失且数据本身可能是合成的。模型在预训练数据集的构建中将来自不同领域的多变量时间序列混合不考虑额外信息以丰富训练数据的多样性。 **01 序列标记化** 序列标记化技术在时间序列建模中已被证明是有效的方法。在本文中为了处理时间序列数据中的噪声和稀疏信息分布研究者采用非重叠的标记化策略将输入系列转换为时间序列标记序列。这不仅有助于减轻噪声和稀疏信息分布的影响还增强了模型更好地捕获局部语义的能力最终有助于实现更鲁棒和准确的时间序列预测。 此外研究者引入了实例归一化层以解决时间序列数据中的分布偏移问题增强模型对不同时间分布的适应性。 **02 分层Transformer模块** 多尺度表示学习已在各种时间序列建模任务中展示了其有效性这得益于实际时间序列数据中常见的多重周期性特征。此外为了更好地发现由不同数据场景组成的混合数据集中隐藏的共性研究者认为分层编码器是不可或缺的。 这里研究者在分层 Transformer 模块中引入了一种基于标记的多阶段表示学习方法通过最大池化操作和多层变换器网络来学习粗粒度和细粒度的时间序列模式。每个阶段的变换器块学习不同尺度的表示通过上采样操作将预测结果映射回原始时间序列标记。这种全面的多阶段表示学习和预测方法能够捕获不同尺度下的复杂时间模式有助于提高模型在处理各种时间序列场景时的有效性。 **03 迭代残差学习** 利用多阶段层次变换器块GPHT 通过迭代残差学习策略将预测过程转化为迭代方式逐步精细化预测结果。输入下一个阶段的是前一阶段输入和输出的残差通过自回归训练模式每个标记可以被视为下一个标记的预测值。 直观上分层 Transformer 内的池化操作允许模型专注于较低频率的特定模式。此外较深层块的任务被简化因为较浅的层过滤掉了已良好近似的信号。因此迭代残差学习策略使模型能够专注于细化更精细的细节从而实现预测精度的逐步提升。此外该策略自然适合混合预训练数据集中多样化的模式并具有适应各种时间结构的能力从而保证了良好的泛化性。 **04 优化目标** 文中定义了 GPHT 的中间预测结果为所有层次变换器块输出的总和并通过逆实例归一化层进行反归一化恢复输入系列的特性。 为了充分利用混合数据集并更好地捕捉时间依赖性预训练任务被构建为标准的语言建模任务采用逐标记的自回归损失函数作为优化目标这同样是一个预测任务。 **05 推理** 鉴于预训练任务可以被视为一个预测任务预训练的 GPHT 可以直接应用于下游预测任务而无需任何修改。而 GPHT 也可以通过微调来进一步提升。在实践中为了在保持泛化能力和在特定数据集上提高性能之间取得平衡文中采用了一种参数高效的调整策略。 在推理过程中得益于上述训练模式和通道独立假设GPHT 在理论上能够对任何输入的多变量时间序列进行通用预测而不管预测范围即时间步长的长度如何。预测过程类似于语言模型的解码过程。给定任何输入该模型可以首先预测下一个第一个标记。然后将这个预测标记拼接到输入序列的末尾以生成对第二个标记的预测。 **实验效果 ** 研究者在8个广泛使用的数据集上进行了充分的实验并与主流的自监督预训练模型和监督模型进行了比较。结果表明在传统的长期预测任务中GPHT 在各种微调、零样本/少样本学习设置下均优于基线模型。 ![](https://img-blog.csdnimg.cn/img_convert/0d3c1c5b97b2ce27dafddd5da49087ab.png) 表1将GPHT与最先进的自监督方法和监督方法进行比较的多变量时间序列预测结果 GPHT 在不同数据集上的平均 MSE 降低了9.23%在 Exchange 数据集上、1.60%在Traffic数据集上和3.00%在 ETTh1 数据集上。在 MAE 评估中改进更为明显分别降低了5.30%、3.97%和5.07%。GPHT 在较短的预测范围内表现更优这归功于其显式地对输出系列的时间依赖性进行建模。 文中通过比较不同层次的 GPHT 模型在所有基准数据集上的表现发现增加层次可以提高模型的性能。随着阶段数的增加GPHT 在理论上更能够捕获混合数据集中各种时间依赖性如不同的周期性。 ![](https://img-blog.csdnimg.cn/img_convert/4f6804f8d711b3cb145945f483b23d98.png) 图2具有不同层次Transformer块阶段的GHPT性能比较 在混合数据集上进行预训练使模型能够利用时间序列之间的共性从而更好地转移到特定数据集。与从头开始训练的 GPHT 相比预训练导致平均 MAE 减少了5.75% ![](https://img-blog.csdnimg.cn/img_convert/b75ab0b00bb895b97dfc330ca5b62904.png) 图3在基准数据集上GPHT与未进行预训练的GPHT之间的MAE评估 # 最后的最后 **感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。** 因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。 **这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】** img srchttps://img-blog.csdnimg.cn/img_convert/d6374d29e3f73db630f431e5a66ee8d9.jpeg stylemargin: auto / ## 大模型知识脑图 为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。 ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/5cac48273d614c9996c485fe32ce82f9.png) ## 经典书籍阅读 阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。 ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/209b04165a2a4e5dba7f9274cf7abacb.png) ## 实战案例 光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。 ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/98e60092860742049149a5eb4dbd5496.png) ## 面试资料 我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下 ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/c2c70128a0ed46f39d5a89320c66d76f.png) ## 640套AI大模型报告合集 这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。 ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/5ce90b1d8ef843fb8db8d74fa53cb276.png) **这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】** img srchttps://img-blog.csdnimg.cn/img_convert/d6374d29e3f73db630f431e5a66ee8d9.jpeg stylemargin: auto /
返回列表