ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

HDMixer:长度可扩展补丁的分层依赖多元时序预测网络

HDMixer:长度可扩展补丁的分层依赖多元时序预测网络 论文标题HDMixer: Hierarchical Dependency with Extendable Patch for Multivariate Time Series Forecasting视频及改进思路讲解https://space.bilibili.com/51422950?spm_id_from333.1007.0.0摘要补丁化方法通过把序列切分为补丁来增强局部语义但定长补丁容易丢失时间边界信息例如被切断的完整峰值与周期同时已有方法主要建模补丁之间的长期依赖对补丁内部的短期依赖与跨变量补丁间的复杂交互关注不足。为此作者提出一个纯MLP架构HDMixer用长度可扩展补丁器LEP自适应地扩展补丁长度、以双线性插值在每个补丁内均匀采样固定数量的时间点得到语义更完整的补丁再用分层依赖探索器HDE以三层MLP分别建模补丁内短期、补丁间长期与跨变量依赖参数跨维度共享既省内存又增强泛化并引入补丁熵损失保证补丁扩展确实带来信息增益。Q1这个模型试图解决什么问题核心问题是定长补丁会切断完整的峰值与周期、造成语义不连贯与边界丢失而现有建模又只盯着补丁间长期依赖忽视补丁内短期与跨变量交互如何在保持纯MLP轻量的前提下同时拿到语义更完整的补丁与分层短期、长期、跨变量的高效交互。图注定长补丁与可扩展补丁对比定长补丁黑会切断波形、产生语义不连贯与边界丢失可扩展补丁红自适应延伸边界能容纳完整的峰值与周期。1.语义不连贯与边界丢失固定长度、固定起点的补丁可能把一个完整峰值或一段周期切成两半补丁只拿到局部片段语义被破坏2.依赖建模不完整补丁化模型大多只在补丁之间做注意力/映射长期依赖补丁内部的短期变化与跨变量补丁的交互缺乏专门建模。Q2相关研究1.补丁化方法如PatchTST用定长补丁增强局部语义、压缩序列但边界信息容易丢失且主要建模补丁间长期依赖2.线性/分解类方法如DLinear结构极简、训练快采用直接多步DMS预测、一次性输出全部未来点避免逐步递推误差但表达能力有限3.跨变量方法如Crossformer、MTGNN显式建模变量交互但高维下计算重、易过拟合4.HDMixer坚持纯MLP路线、借鉴DMS设计用可扩展补丁加三层混合MLP替代注意力兼顾语义完整性与分层依赖。Q3模型如何解决这个问题输入经LEP生成可扩展补丁再由堆叠K个块的HDE做分层依赖建模最后Flatten并经直接多步映射头输出。图注HDMixer整体结构左侧长度可扩展补丁器LEP学习偏移与扩展尺度、插值采样右侧分层依赖探索器HDEK个混合块分别做短期、长期、跨变量顶部为整体流水线。长度可扩展补丁器LEP在定长补丁中第i个补丁由中心坐标ci与采样点数D刻画半长l(D-1)/2采样区间为[ci-l,cil]、间隔为1得到D个原始观测。LEP把它扩展为五元组(ci,D,δc,δL,δR)其中中心偏移δc、左右边界扩展δL与δR都可学习。δc由Tanh约束、可正可负用于移动补丁中心δL、δR经ReLU约束为非负用于延伸左右边界。补丁实际起止点随之改变采样间隔自适应、每个补丁仍采D点。由于采样索引通常是分数LEP用双线性插值从相邻整数点取值并保证可微同时通过系数限制偏移与扩展幅度减少相邻补丁重叠、避免补丁过于相似。图注LEP结构左图示意中心偏移δc与左右扩展δL、δR及插值点右侧为参数生成分支特征经线性层与Tanh/ReLU分别产生中心偏移与非负边界扩展再插值采样得到补丁张量。补丁熵损失为保证补丁扩展确实带来信息增益作者借鉴近似熵定义补丁熵PaEn比较可扩展补丁与定长补丁切出的子模式相似度。信息增益损失Lp-(ΦLE-ΦLF)在训练中最小化可扩展补丁的子模式相似度即提升补丁序列的复杂度与区分度使每个补丁承载更多有效信息。分层依赖探索器HDEHDE由K个HDMixer块堆叠而成每个块包含三层混合MLP均采用LayerNorm、两层线性变换、GELU激活与残差连接通道混合MLP沿补丁内部维度作用、捕捉补丁内短期依赖绿时间混合MLP沿补丁维度作用、捕捉补丁间长期依赖红变量混合MLP沿变量维度作用、捕捉跨变量依赖蓝。与CNN金字塔结构不同HDE各层输入维度保持一致避免长序列信息在深层丢失在某一维度做交互时参数在其他维度共享使网络规模不随变量数或序列长度快速膨胀节省内存并通过学习不同变量共性提升泛化与鲁棒性。最后把表示展平用直接多步线性头一次性映射到预测长度。图注HDE单个混合块三组“置换—归一化—线性—GELU—线性—置换—相加”结构分别沿补丁内、补丁间、变量维度做混合并以残差相加得到输出。Q4实验结果数据集作者在9个真实世界数据集上做了充分实验沿用Autoformer发布的标准划分与设置覆盖工业、能源、交通、气象、金融、医疗六类场景1.ETTh1、ETTh2电力变压器油温数据7个变量每小时采样按月份划分训练/验证/测试2.ETTm1、ETTm2同属变压器数据7个变量15分钟采样序列更长、高频细节更多3.ElectricityECL321个用户的用电量每小时采样属于高维强周期数据4.Traffic862条道路的路网占用率每小时采样变量维度最高5.Weather21个气象指标10分钟采样含温度、湿度、气压等6.Exchange Rate8种外币对美元的日汇率每天采样非平稳、噪声大7.ILI美国CDC流感样病例比例7个变量每周统计含突发疫情峰值。基线与实验设置对比6个有代表性的先进方法分属四个家族3个Transformer模型PatchTST通道独立补丁、Crossformer跨维度注意力、Autoformer自相关加分解线性模型DLinearCNN模型MICN多尺度等距卷积GNN模型MTGNN变量图网络。预测长度上ILI取T∈{24,36,48,60}其余数据集取T∈{96,192,336,720}部分基线结果直接取自PatchTST论文以保证口径一致HDMixer对批大小与学习率做网格搜索取最优。主结果图注主结果MSE/MAE越低越好加粗为第一、下划线为第二HDMixer在全部9个数据集、共72个数据集—预测长度设置中取得59个第一、13个第二。整体量化上HDMixer相比Transformer类方法MSE平均降低7.27%、MAE降低4.21%相比GNN方法MTGNNMSE大幅降低59.66%、MAE降低42.39%。下面逐数据集说明数值均取自表1。1.ILIHDMixer的MSE为1.305/1.428/1.233/1.496四档全部第一最强对手PatchTST为1.522/1.430/1.673/1.529DLinear高达2.215/1.963/2.130/2.368MTGNN更是4.268—5.333在T48上相对PatchTST降低约26%LEP把完整疫情峰值纳入补丁是关键。2.WeatherHDMixer为0.145/0.194/0.237/0.317四档全部第一PatchTST以0.152/0.197/0.249/0.320紧随优势随预测长度稳定720档仍领先0.317对0.320而Autoformer为0.249—0.415、明显偏差。3.TrafficHDMixer为0.366/0.385/0.403/0.441与PatchTST0.367/0.385/0.398/0.434极为接近、互有胜负二者显著优于DLinear0.410—0.466与Crossformer0.512—0.573超高维路网中通道独立补丁已很强跨变量增益有限。4.ElectricityHDMixer为0.129/0.145/0.170/0.193短期96、192与长期720均为第一720档优于PatchTST的0.202Crossformer长期恶化到0.404差距明显。5.ETTh1HDMixer为0.373/0.412/0.392/0.44896、336、720为第一长期720相比DLinear的0.472、MTGNN的0.916优势显著仅192档略逊于DLinear的0.405。6.ETTh2HDMixer为0.262/0.317/0.308/0.390前三档第一720档0.390略高于PatchTST的0.379但远优于DLinear的0.605与Crossformer的1.181。7.ETTm1HDMixer为0.291/0.332/0.363/0.424与PatchTST0.290/0.332/0.366/0.420几乎持平336档第一明显优于Crossformer长期的0.600与MTGNN的0.713。8.ETTm2HDMixer为0.162/0.213/0.275/0.355四档全部第一且优势随长度扩大720档0.355远优于Crossformer的0.996与DLinear的0.397。9.Exchange RateHDMixer为0.078/0.168/0.311/0.641短期96第一0.078对DLinear0.081长期720为0.641、略优于DLinear的0.643汇率高度非平稳HDMixer与DLinear接近、明显优于其他深度模型。扩展长度敏感性Table 2图注不同最大扩展长度的量化结果把补丁最大可扩展长度分别设为原长的0.25、0.5、1倍在ETTm2、Weather、ILI上对比。结果显示扩展长度的影响呈明显的三段式1.0.25倍扩展不足、补丁仍接近定长提升有限例如ETTm2-96为0.1690.5倍时0.162、Weather-96为0.1500.5倍时0.1452.0.5倍ETTm2为0.162/0.213/0.274/0.355、Weather为0.145/0.194/0.237/0.317、ILI为1.305/1.428/1.233/1.526整体最优3.1倍与0.5倍接近、互有胜负如Weather-96的0.144略低但ILI-60的1.512略差但扩展1倍会显著增大相邻补丁重叠与语义冗余综合预测性能与避免过度语义重叠作者最终把补丁最大扩展长度设为原长的0.5倍对应D_bD/4。消融实验Table 3图注组件消融分别去掉长期依赖MLPW/O-LTD、变量交互MLPW/O-VI、短期依赖MLPW/O-STD与可扩展补丁器W/O-LEP改用定长补丁16在ETTm2、Weather、ILI上对比。1.去掉LEPW/O-LEP性能下降最明显三个数据集MSE平均恶化约5.6%ILI上变为1.615/1.625/1.474/1.631相对完整模型1.305/1.428/1.233/1.526T24恶化约23.8%说明可扩展补丁贡献最大2.去掉长期依赖W/O-LTDILI为1.418/1.604/1.304/1.565、Weather-720由0.317升到0.322长期趋势建模受损Weather更强调长期依赖3.去掉变量交互W/O-VIETTm2为0.169/0.224/0.285/0.36596档相对完整模型0.162恶化约4.3%说明ETTm2更依赖变量交互4.去掉短期依赖W/O-STDILI为1.561/1.613/1.423/1.596短期峰值捕捉明显受损T24恶化约19.6%。消融共同表明不同数据集受益于不同维度的交互但LEP在所有数据集上都是最关键的组件。效率分析Figure 5图注效率对比ETTh2、输出长度192左图MSE对每批训练时间右图MSE对内存占用HDMixer均位于左下角。从图中可读出各方法的大致位置HDMixer训练约30ms/批、内存约1.2GB、MSE约0.318PatchTST约50ms、3.8GB、0.34DLinear约10ms、1GB但MSE高达0.385MICN约90ms、1.5GB、0.41Crossformer约150ms、2.5GB、0.40Autoformer约170ms、4.5GB、0.425。HDMixer在精度最好的同时训练速度接近最快的DLinear、内存也最小实现了精度、速度、内存三者的最佳平衡。Q5有什么可以进一步探索的点1.让补丁的扩展长度与中心偏移完全内容感知、随信号自适应而非用统一系数约束2.把补丁熵损失与其他正则结合进一步降低补丁冗余、提升信息密度3.把可扩展补丁思想迁移到频域、图网络或状态空间模型等其他骨干4.研究变量规模超大时的跨变量建模与可扩展性避免变量混合层随维度膨胀。Q6总结一下模型的主要内容HDMixer由长度可扩展补丁器LEP双线性插值加补丁熵损失、分层依赖探索器HDE短期、长期、跨变量三层混合MLP参数跨维共享与直接多步预测头组成是一个轻量纯MLP模型在72个设置中拿下59个第一、13个第二。它的核心价值是让补丁语义更完整、让依赖建模更分层在不使用注意力的情况下同时兼顾预测性能与计算效率。
返回列表