SSDA:通过双重适应弥合光谱和结构差距,实现基于视觉的时间序列预测
大型视觉模型(LVM)通过将时间序列数据渲染为图像进行预测,但存在光谱和结构差距。SSDA提出双重适应方法,包括频谱幅度对齐器(SMA)和结构引导的低秩适应(SG-LoRA),在七个基准测试中优于基于LVM和LLM的基线。
近年来,大型视觉模型(LVM)在时间序列预测领域展现出惊人潜力,其方法是将时间序列数据转换为图像形式,从而利用预训练模型的知识。然而,这一成功建立在未经充分检验的前提上:渲染后的时间序列图像与自然图像足够相似,使得模型能够有效迁移。研究团队在最新论文中指出,两者之间仍存在光谱和结构两个关键差距,从根本上限制了LVM在时间序列预测中的表现。
光谱差距方面,研究发现渲染后的时间序列图像在功率谱上明显比LVM预训练时识别的自然图像更浅。这意味着,LVM在自然图像上学习到的特征表示无法直接迁移到时间序列图像上。结构差距方面,将一维时间序列重塑为二维网格,会制造出虚假的空间邻接关系,同时切断真实的时间连续性,从而误导预训练LVM的空间归纳偏置。例如,相邻的时间点可能在网格中并不相邻,而原本不相邻的时间点却被安排在相邻位置。
为了解决这些问题,作者提出了SSDA(Spectral and Structural Dual Adaptation)网络,这是一个双分支结构,分别在光谱和结构层面进行适应,以释放LVM的全部潜力。在数据层面,频谱幅度对齐器(SMA)利用二维快速傅里叶变换(2D FFT),选择性地增强幅度谱使其接近自然图像统计特性,同时保留相位信息。这样,渲染图像的光谱分布就被拉向自然图像的分布。在模型层面,结构引导的低秩适应(SG-LoRA)将位置感知的时间编码注入到补丁嵌入中,并通过低秩更新调整注意力机制,使模型能够正确理解时间顺序。两个分支的输出经过自适应融合,生成最终预测结果。
通过在七个真实世界基准测试上的广泛实验,SSDA在全样本和少样本设置下均一致优于基于LVM和LLM的强基线模型。这些基准包括电力、交通、天气等多个领域的预测任务。代码已公开,相关论文可在arXiv上获取。这项研究为利用视觉模型进行时间序列预测提供了新的思路,有望推动该领域的发展,特别是在少样本学习场景下具有重要应用价值。