空气质量竞技场:用于空气质量预测的大规模多区域地面监测数据集与时间序列基础模型基准
空气污染每年导致约790万人过早死亡,准确预测成为公共卫生优先事项。现有基准在地域范围和污染物覆盖上过于狭窄,且未评估最新时间序列基础模型。本研究提出Air Quality Arena (AQA),一个覆盖7个国家、4大洲、6种主要污染物、超过14,000个站点-污染物序列的大规模多国数据集和基准。通过11个时间序列基础模型和经典基线评估,结果表明时间序列基础模型在零样本预测中有效且持续优于经典基线,最佳模型采用跨模态架构,利用视觉基础模型进行时间序列预测。数据集和基准已公开发布。
空气污染是当今全球公共卫生的重大威胁。据世界卫生组织估计,每年约有790万人因空气污染而过早死亡。精准的空气污染预测对于减轻这一危害、指导公众健康决策至关重要。近年来,机器学习技术被越来越多地应用于空气质量预测领域,然而,现有的基准数据集在地理覆盖范围和污染物种类上均存在局限,且尚未充分评估最新一代时间序列基础模型(TSFMs)在大规模真实世界数据上的表现。
为弥补这一空白,研究团队提出了Air Quality Arena(AQA),这是一个包含大规模多国、多污染物数据集(AQA-Data)和配套基准测试框架(AQA-Bench)的综合平台。AQA-Data涵盖了来自7个不同国家(横跨4大洲)的超过14,000个站点-污染物时间序列,记录了6种主要空气污染物(如PM2.5、PM10、NO2、O3、SO2、CO)在三年时间跨度内的浓度变化。这一规模使得AQA成为目前最全面的空气质量机器学习基准之一。
研究团队对AQA-Data进行了系统性基准测试,评估了11种领先的时间序列基础模型和多种经典基线方法(如ARIMA、LSTM等),重点关注短期(例如未来24-72小时)空气质量预测任务。实验结果表明,时间序列基础模型在零样本(zero-shot)预测场景下表现出色,无需针对特定任务进行微调即可获得优于经典基线的结果。尤其值得关注的是,表现最佳的模型采用了一种创新的跨模态架构,该架构利用视觉基础模型(vision foundation model)来处理时间序列数据,从而实现了更精准的预测。
AQA项目的所有数据、代码和基准结果均已公开发布在AirQualityArena.github.io上,供研究社区使用和复现。该工作不仅为时间序列基础模型在环境科学领域的应用提供了有力验证,也为未来的空气质量预测研究奠定了坚实的数据基础。研究人员表示,随着更多地域和污染物的纳入,AQA将持续更新,成为全球空气质量建模的重要参考基准。
(注:本文基于arXiv预印本2607.19381v1撰写,原文标题为“Air Quality Arena: A Large-Scale Multi-Region Ground Monitoring Dataset and Benchmark for Air Quality Forecasting with Time-Series Foundation Models”,作者为Rishi Bharadwaj等。)