Toto 2.0:時間序列預測進入縮放時代
Datadog發佈了Toto 2.0系列開源時間序列預測模型,參數規模從4M到2.5B。結果表明,隨着模型增大,性能持續提升,在BOOM、GIFT-Eval和TIME基準測試中均取得最佳成績。Toto 2.0相比上一代參數效率提升7倍,推理速度顯著加快,且僅使用可觀測性和合成數據訓練,未使用任何公開數據集,卻能在通用基準上領先。
Datadog今日在Hugging Face上發佈了Toto 2.0,一個開源的時間序列預測基礎模型家族,參數規模從400萬到25億不等。這一系列模型旨在回答一個簡單而開放的問題:時間序列基礎模型(TSFM)能否隨着規模擴大而改進?結果明確顯示:可以。
關鍵結果包括:規模擴展有效——每個規模的模型都在前一基礎上有所提升,在25億參數時未見飽和跡象。在所有測試的基準上都達到同類最佳:Toto 2.0在Datadog的可觀測性預測基準BOOM、通用基準GIFT-Eval以及新的抗污染零樣本基準TIME上均佔據榜首。相比Toto 1.0實現代際躍升:Toto 2.0在同等質量下參數效率提升7倍,推理速度大幅加快。僅使用可觀測性和合成數據訓練,未接觸任何公開預測數據,卻在通用基準上領先。
在BOOM基準上,每個Toto 2.0規模都位於帕累託前沿,三個最大規模型號領跑,CRPS排名分別為3.88(2.5B)、3.96(1B)和4.25(313M)。22M型號以5.52的CRPS排名超越Toto 1.0的6.94,實現了7倍的參數效率提升。即使最小的4M型號也以7.17的CRPS排名與Toto 1.0和Chronos-2(7.39)相當,非常適合邊緣部署。
在GIFT-Eval基礎模型子集上,Toto 2.0三個最大規模的CRPS排名分別為19.5、20.3和20.5,領先於其他所有基礎模型。若考慮微調、集成和智能體系統,Toto 2.0集成模型(FnF)和微調後的2.5B模型分別佔據排行榜前兩位。集成模型中的元學習器軟最大權重顯示,Toto家族平均貢獻了39%的預測,高於其他任何模型。
在TIME基準上,2.5B、313M和1B模型包攬所有指標的前三名,22M模型也在排名指標上位列第五,超越所有前代基礎模型。
推理延遲方面,Toto 2.0通過連續補丁掩碼(CPM)等改進,實現了單次並行預測,無需逐步自迴歸生成。對於1024步預測,Toto 1.0需要最多16步,而Toto 2.0只需一次前向傳播。與Toto 1.0和Chronos-2相比,每個Toto 2.0規模的延遲都更低。
未來方向包括縮小與經典基線的長期預測差距、數據策展、評估方法以及多模態融合。Toto 2.0模型權重和訓練基礎設施庫(dd_unit_scaling)均已基於Apache 2.0許可開源。