
相关链接论文DOIhttps://doi.org/10.1145/3770855.3817648代码仓库https://github.com/decisionintelligence/CCD讲解和改进思路https://space.bilibili.com/51422950?spm_id_from333.1007.0.0摘要多变量时序预测的精度依赖于捕捉准确的通道相关性。近期研究主要关注在单个频率、单个尺度内捕捉不同通道关系但复杂的通道依赖更多存在于跨尺度、跨频率的相关中作者称之为交叉相关Cross-Correlations。受计算机视觉启发捕捉这类二维依赖的高效策略是把时序表示成具有类图像结构的通道-频率视图与通道-尺度视图再用卷积神经网络捕捉复杂交叉相关。但相关部分在视图中常非局部分布作者提出自适应二维重排Adaptive 2-Dimensional Shuffle在卷积前对视图行列重排这些视图仍缺乏良好定义的空间属性作者进一步提出交叉可变形卷积Cross Deformable Convolution设计更数据自适应的核形状并引入动态稀疏交互。在真实数据集上的大量实验表明CCD取得了当前最优的预测性能。Q1这个模型试图解决什么问题核心问题是以往多变量预测只建模同一频率或同一尺度内的通道关系Intra-Correlations却忽视了更普遍、有时更强的跨频率、跨尺度通道关系Cross-Correlations而把时序组织成类图像视图后用CNN捕捉时又面临相关部分非局部分布、视图缺乏空间属性两大障碍。图注两类通道相关示意。(a)通道-频率视图傅里叶变换后把频谱切成不重叠patch重组成[频率patch索引、通道索引、patch内数据点]的3D张量(b)通道-尺度视图上采样后重组成[尺度索引、通道索引、尺度内数据点]。红色箭头为同一频率/尺度内的Intra-Correlations绿色箭头为跨频率/尺度的Cross-CorrelationsIntra是Cross的特例。1.交叉相关被忽视对角线区域为Intra、非对角线区域为Cross真实数据中部分Cross-Correlations甚至比对应的Intra更强如尺度S1的C2与尺度S3的C3之间但现有方法只在单频率或单尺度内建模通道关系2.相关部分非局部分布在通道-频率、通道-尺度视图中相邻索引不代表相关真正有交叉相关的两部分常分散在局部邻域之外直接用CNN感受野会混入不相关特征而非有意义的局部模式大核/膨胀卷积虽扩大感受野却同时引入更多噪声与冗余3.视图缺乏空间属性与自然图像不同这些视图没有几何属性且两个维度含义不同、存在固有不对称这使可变形卷积的动态采样位置难学也使注意力易对训练数据中的噪声或虚假相关过fit、损害泛化。图注基于真实数据集的交叉相关热力图左下为通道-频率视图、右上为通道-尺度视图。绿框case1、红框case2分别标出一处Intra与一处Cross可见非对角线Cross区域颜色深、依赖强相关强度并不弱于对角线Intra区域。Q2相关研究1.频域建模FreTS用频率能量压缩增强MLPFEDformer结合傅里叶卷积与分解FITS完全在复频域做插值2.多尺度建模SCINet用层级下采样树Pyraformer构建金字塔图MICN用多分支不同核Scaleformer从粗到细迭代TimeMixer、AMD用MLP做跨尺度交互3.通道依赖建模注意力类Crossformer、iTransformer把通道当tokenDUET用掩码注意力处理部分依赖Fredformer在频域捕捉每个频率内的Intra图网络类CrossGNN、MSGNet用图/超图/动态图卷积类TimesNet、ModernTCN沿时间维做1D/2D卷积MLP类TSMixer、TimeMixer做通道混合Mamba类TimePro直接在超状态上做变量交互4.共同缺口上述方法只考虑单一频率或尺度内的通道关系忽视跨频率、跨尺度、更普遍的Cross-CorrelationsCCD通过类图像视图与交叉可变形卷积填补该缺口。Q3模型如何解决这个问题整体架构CCD把时序结构化为通道-尺度CS与通道-频率CF两个视图用基于可变形卷积的方法捕捉交叉相关。两个视图生成器先把输入转成类图像结构再并行执行相同操作先做自适应二维重排缓解非局部分布再用交叉可变形卷积提取信息最后恢复原始顺序、分别送入MLP预测头两路预测相加输出。图注CCD整体框架。(a)总览CS/CF视图生成器把时序转成类图像结构经2D Shuffle、×N层Cross DConv、Invert Shuffle后到MLP Head(b)自适应二维重排先做尺度/频率重排、再做通道重排由全局指标生成排序分数(c)交叉可变形卷积含非均匀交叉扩展初始化与动态掩码调制。视图生成器1.CS视图生成器为避免平均池化带来信息损失用核大小为{d0,…,dMs}的一组并行1D卷积提取多尺度序列再用Ms个线性层在序列级嵌入得到通道-尺度视图CS∈R^(N×Ms×dims)2.CF视图生成器先做FFT再把数据切成Mf个不重叠频率patch以解耦不同频率F∈C^(N×Mf)用线性层在patch级嵌入得到通道-频率视图CF∈R^(N×Mf×dims)。自适应二维重排式1-5为降低短期噪声对通道、频率排序学习的影响引入全局指标Ic∈R^(N×dims)、If∈R^(Mf×dims)以长期视角学习鲁棒、可泛化的排序。把指标维度求和得到排序分数score_c、score_f用argsort得到目标重排顺序式1-2τcargsort(score_c)、τfargsort(score_f)。标准排序离散且不可微软排序用概率分布近似又会引入噪声、牺牲精度。CCD依次施加τc、τf重排CF得CF′并对分数做同样重排通过直通代理显式定义反向梯度式3-4最终式5CFshufCF′⊙grad_c⊙grad_f过程中记录τc、τf以便逆重排。交叉可变形卷积式6-181.交叉形初始化式6-7标准可变形卷积用方形、均匀采样Ssquare{(x,y)||x|,|y|≤r}采样点二次增长、开销与噪声大CCD改用交叉形Scross{(x,0)||x|≤rf}∪{(0,y)||y|≤rc}沿频率、通道两维独立、非对称扩展采样点只线性增长默认沿两轴捕捉Intra、在此基础上探索Cross2.非均匀采样式8在交叉形不同位置分配不同数量采样点位置s的采样数nums由其到中心距离‖s‖按正态分布决定numsmax(⌊nummax/(σ√2π)·exp(−(‖s‖−μ)²/2σ²)⌋,1)鼓励重排把更多相关patch移到网格中心附近3.偏移与自适应位置式9-11用2D深度可分离卷积φ1生成偏移ΔPφ1(CFshuf)得自适应位置PP0ΔP位置通常为分数用双线性插值ψ取特征Zψ(CFshuf,P)4.动态掩码调制式12-18用卷积学习调制系数W与掩码阈值Γ用可微软掩码把低于阈值的W压向零Winflog(sigmoid((W−Γ)/0.01))、Wmaskedsoftmax(WinfW)实现动态稀疏再做采样点与中心点的特征交互、求和并残差连接得CFout。预测式19-231.通道-尺度预测逆重排恢复顺序后用更具表达力的MLP头而非线性层把展平的CSinvert映射为ŶsMLPs(CSinvert)2.通道-频率预测先在频域分别预测实部、虚部组合成复数做iFFT再用线性层在时域精修得Ŷf3.最终预测式23ŶŶsŶf两路相加。Q4实验效果如何数据集在8个广泛使用的多变量时序基准上评估ETTh1、ETTh2、ETTm1、ETTm2、Electricity、Solar、Weather、Traffic覆盖电力、能源、环境、交通等领域与不同通道维度、采样频率。预测时长为{96,192,336,720}回看窗口统一设为96。图注数据集统计。ETT为7变量ETTh按小时、ETTm每15分钟Electricity 321变量Solar 137变量Weather 21变量Traffic 862变量划分比例为6:2:2或7:1:2。基线与训练设置选择近年SOTA作为基线DUET、TimePro、TimeKAN、AMD、Fredformer、MSGNet、iTransformer、PatchTST、Crossformer、TimesNet涵盖CNN、Transformer、GNN、MLP、KAN、Mamba等架构其中频率由TimeKAN、Fredformer建模尺度由AMD、MSGNet建模通道由DUET、TimePro、iTransformer建模。用MSE与MAE作为指标采用TFB代码库统一评估按TFB与TSFM-Bench设置不使用drop-last技巧所有基线在相同环境与设置下重新评估实验基于PyTorch、在NVIDIA Tesla-A800 GPU上完成。主要结果CCD在32个MSE case中的25个、32个MAE case中的31个取得最优展现强且一致的预测能力。相比尺度建模方法AMDMSE/MAE降低6.73%/8.08%相比频率建模方法TimeKAN降低5.68%/8.68%相比通道相关建模方法DUET与TimeProMSE降低4.05%/3.69%、MAE降低3.47%/6.74%相比捕捉Intra的iTransformer、MSGNet、FredformerMSE降低14.77%/3.76%、MAE降低13.25%/6.38%。图注完整主结果输入964个预测时长Avg为四时长平均。CCD在8数据集、11模型对比中绝大多数case最优加粗显式建模Cross-Correlations对复杂通道依赖更有效。消融实验对五个关键组件做消融去掉通道-尺度分支、去掉通道-频率分支、去掉二维重排、用标准初始化替换非均匀交叉扩展初始化、去掉动态掩码调制。图注消融研究4个预测时长平均。去掉任一视图分支都使性能明显下降在规模较小、需要丰富特征的ETTh2上尤为突出去掉二维重排后受非局部分布困扰、各数据集一致变差ETTh2 .392、ETTm2 .289、Weather .256、Solar .235替换为标准初始化使偏移难学、性能普遍下降去掉调制后变成静态平均所有采样点、引入更多噪声。完整CCD为.362/.389、.270/.313、.241/.263、.218/.222。可微重排对比把自适应二维重排与用概率分布近似排序的可微排序方法对比。CCD不改变优化目标、直接由全局指标学习顺序避免梯度偏差软排序、快速排序用近似概率目标替换原目标会引入偏差、噪声与不确定性。图注可微重排对比无梯度、soft rank、fast rank、本文方法。本文方法在4数据集上一致最优.362/.389、.270/.313、.241/.263、.218/.222优势在对噪声更敏感的小样本ETTh2上尤其明显。参数敏感性研究频率patch数Mf、隐维dims、交叉扩展初始化的通道半径rc与频率半径rf。图注参数敏感性。(a)patch数增多使交叉相关更丰富但噪声增加通常选8或12(b)方法不依赖很大隐维即可取得强结果选48或64兼顾效率(c)(d)模型对增大感受野半径鲁棒得益于动态掩码调制对冗余采样点的动态剪枝半径3或5通常最优。初始化形状对比为公平对比去掉通道-尺度分支、采用均匀采样在含137通道的Solar上输入与预测时长均为96探索方形、竖线、横线、交叉四种初始化形状、采样点数0到40的影响。图注初始化形状对比。(a)四种形状(b)不同采样点数的MSE。方形在点数很少时如num4因宽局部感受野有效但视图缺几何属性且不对称点增多后引入更多噪声、num9时明显下降竖线、横线更倾向捕捉Intra、单向扩展丢失大量信息交叉形可沿两维独立非对称扩展采样点先初始化在Intra位置、再学偏移捕捉关键Cross性能最优且鲁棒。与先进可变形卷积对比把交叉可变形卷积与标准DCN及先进变体DSConv、FDNet、DCNv3对比。图注可变形卷积对比ETTm2/Weather/Solar。DCN、DCNv3、DSConv虽灵活但原本为图像空间结构设计、邻位有明确几何含义直接用于时序视图时其可变形采样易关注信息量低、弱相关位置提升有限且不稳Cross DConv在3数据集一致最优.270/.313、.241/.263、.218/.222。Q5有哪些可以继续探索的点作者在附录列出的局限1.边缘部署CCD在GPU上效率高、参数量适中但可变形卷积固有的不规则内存访问模式在资源受限的边缘设备上可能带来优化挑战与额外计算开销2.可解释性自适应二维重排虽提升了CNN的感受野效率但重排后的潜在特征图打乱了数据原始拓扑结构难以直接从中间层得到直观解释3.极短序列CCD依赖通道-频率、通道-尺度视图生成当输入序列极短时有效的尺度与频率分解变难削弱了交叉相关建模可用信息的丰富度。Q6总结CCD针对多变量时序预测提出了一个捕捉跨变量、跨频率、跨尺度复杂交叉相关的新框架先把时序转成通道-频率与通道-尺度视图用自适应二维重排把可能相关的部分重排到相邻位置、缓解非局部分布再用交叉可变形卷积——含非均匀交叉扩展初始化与动态掩码调制——灵活、动态、稀疏地建模交叉依赖。CCD在多个领域真实数据集上取得当前最优性能证明显式建模Cross-Correlations比只做Intra-Correlations更能准确刻画复杂通道关系。