SSDA:通過雙重適應彌合光譜和結構差距,實現基於視覺的時間序列預測
大型視覺模型(LVM)通過將時間序列數據渲染為圖像進行預測,但存在光譜和結構差距。SSDA提出雙重適應方法,包括頻譜幅度對齊器(SMA)和結構引導的低秩適應(SG-LoRA),在七個基準測試中優於基於LVM和LLM的基線。
近年來,大型視覺模型(LVM)在時間序列預測領域展現出驚人潛力,其方法是將時間序列數據轉換為圖像形式,從而利用預訓練模型的知識。然而,這一成功建立在未經充分檢驗的前提上:渲染後的時間序列圖像與自然圖像足夠相似,使得模型能夠有效遷移。研究團隊在最新論文中指出,兩者之間仍存在光譜和結構兩個關鍵差距,從根本上限制了LVM在時間序列預測中的表現。
光譜差距方面,研究發現渲染後的時間序列圖像在功率譜上明顯比LVM預訓練時識別的自然圖像更淺。這意味着,LVM在自然圖像上學習到的特徵表示無法直接遷移到時間序列圖像上。結構差距方面,將一維時間序列重塑為二維網格,會製造出虛假的空間鄰接關係,同時切斷真實的時間連續性,從而誤導預訓練LVM的空間歸納偏置。例如,相鄰的時間點可能在網格中並不相鄰,而原本不相鄰的時間點卻被安排在相鄰位置。
為了解決這些問題,作者提出了SSDA(Spectral and Structural Dual Adaptation)網絡,這是一個雙分支結構,分別在光譜和結構層面進行適應,以釋放LVM的全部潛力。在數據層面,頻譜幅度對齊器(SMA)利用二維快速傅里葉變換(2D FFT),選擇性地增強幅度譜使其接近自然圖像統計特性,同時保留相位信息。這樣,渲染圖像的光譜分佈就被拉向自然圖像的分佈。在模型層面,結構引導的低秩適應(SG-LoRA)將位置感知的時間編碼注入到補丁嵌入中,並通過低秩更新調整注意力機制,使模型能夠正確理解時間順序。兩個分支的輸出經過自適應融合,生成最終預測結果。
通過在七個真實世界基準測試上的廣泛實驗,SSDA在全樣本和少樣本設置下均一致優於基於LVM和LLM的強基線模型。這些基準包括電力、交通、天氣等多個領域的預測任務。代碼已公開,相關論文可在arXiv上獲取。這項研究為利用視覺模型進行時間序列預測提供了新的思路,有望推動該領域的發展,特別是在少樣本學習場景下具有重要應用價值。