DoTime:面向干预与反事实时间序列的合成基准生成器
DoTime 是一个开源、可扩展且具有理论基础的多元时间序列结构因果模型(TSCM)生成器,旨在为干预和反事实估计提供大规模基准。它提供连续时间干预窗口、带正性保护的反事实采样、机制切换 SCM 等新能力,并附带 10 万条轨迹和八种识别结构的评测套件。实验显示,在结构匹配的评估中,基于干预先验拟合网络(PFN)在方向准确率上始终优于同容量观测模型。
近日,arXiv 上发布了一篇题为《DoTime: A Synthetic Benchmark Generator for Interventional and Counterfactual Time Series》的论文(arXiv:2607.27263),由 Dennis Thumm 等三位作者于 2026 年 7 月 29 日提交。论文指出,现有时间序列因果推断基准大多局限于观测数据、规模较小或面向特定领域,导致在医疗、政策评估和气候科学等关键场景中,干预效应和反事实估计缺乏充分的评测工具。为此,团队提出了 DoTime——一个开源、可扩展且具有理论基础的多元时间序列结构因果模型(TSCM)生成器,并以 dotime PyPI 包的形式发布,同时附带四个冻结的评测套件。
与已有生成器相比,DoTime 引入了一系列新能力:支持连续时间干预窗口;提供带正性保护(positivity guard)的反事实采样模式;将机制切换 SCM 作为中断时间序列的严格推广;通过切换 SCM 参数在构造上保证非平稳动态;此外还支持确定性的斜坡和正弦干预轮廓,使趋势和结构断裂能够落在评估窗口内部。这些特性使得基准能够覆盖更贴近真实应用的干预与反事实场景。
在数据规模与结构方面,发布的套件包含训练规模的 10 万条轨迹快照,以及八种具名的识别结构。每条轨迹都具有精确的真值:干预轨迹对始终来自同一个 SCM,连续时间套件中则包含共享噪声的反事实样本。团队还提供了参考基线与评估框架,方便研究者复现和对比。
论文还提出了一个可证伪的声明:在相同容量的模型下,使用干预数据进行训练会比纯观测训练带来可衡量的方向准确率优势。实验在每种训练臂上使用三个随机种子,并在结构匹配的保留片段上评估。结果显示,干预先验拟合网络(PFN)的准确率差距在所有结构、轨迹长度和种子组合上均为正。这一工作不仅为因果时间序列研究提供了标准化基准,也展示了将生成器作为因果基础模型先验的潜力。