空氣質量競技場:用於空氣質量預測的大規模多區域地面監測資料集與時間序列基礎模型基準
空氣汙染每年導致約790萬人過早死亡,準確預測成為公共衛生優先事項。現有基準在地域範圍和汙染物覆蓋上過於狹窄,且未評估最新時間序列基礎模型。本研究提出Air Quality Arena (AQA),一個覆蓋7個國家、4大洲、6種主要汙染物、超過14,000個站點-汙染物序列的大規模多國資料集和基準。透過11個時間序列基礎模型和經典基線評估,結果表明時間序列基礎模型在零樣本預測中有效且持續優於經典基線,最佳模型採用跨模態架構,利用視覺基礎模型進行時間序列預測。資料集和基準已公開發布。
空氣汙染是當今全球公共衛生的重大威脅。據世界衛生組織估計,每年約有790萬人因空氣汙染而過早死亡。精準的空氣汙染預測對於減輕這一危害、指導公眾健康決策至關重要。近年來,機器學習技術被越來越多地應用於空氣質量預測領域,然而,現有的基準資料集在地理覆蓋範圍和汙染物種類上均存在侷限,且尚未充分評估最新一代時間序列基礎模型(TSFMs)在大規模真實世界資料上的表現。
為彌補這一空白,研究團隊提出了Air Quality Arena(AQA),這是一個包含大規模多國、多汙染物資料集(AQA-Data)和配套基準測試框架(AQA-Bench)的綜合平臺。AQA-Data涵蓋了來自7個不同國家(橫跨4大洲)的超過14,000個站點-汙染物時間序列,記錄了6種主要空氣汙染物(如PM2.5、PM10、NO2、O3、SO2、CO)在三年時間跨度內的濃度變化。這一規模使得AQA成為目前最全面的空氣質量機器學習基準之一。
研究團隊對AQA-Data進行了系統性基準測試,評估了11種領先的時間序列基礎模型和多種經典基線方法(如ARIMA、LSTM等),重點關注短期(例如未來24-72小時)空氣質量預測任務。實驗結果表明,時間序列基礎模型在零樣本(zero-shot)預測場景下表現出色,無需針對特定任務進行微調即可獲得優於經典基線的結果。尤其值得關注的是,表現最佳的模型採用了一種創新的跨模態架構,該架構利用視覺基礎模型(vision foundation model)來處理時間序列資料,從而實現了更精準的預測。
AQA專案的所有資料、程式碼和基準結果均已公開發布在AirQualityArena.github.io上,供研究社群使用和復現。該工作不僅為時間序列基礎模型在環境科學領域的應用提供了有力驗證,也為未來的空氣質量預測研究奠定了堅實的資料基礎。研究人員表示,隨著更多地域和汙染物的納入,AQA將持續更新,成為全球空氣質量建模的重要參考基準。
(注:本文基於arXiv預印本2607.19381v1撰寫,原文標題為“Air Quality Arena: A Large-Scale Multi-Region Ground Monitoring Dataset and Benchmark for Air Quality Forecasting with Time-Series Foundation Models”,作者為Rishi Bharadwaj等。)