DiScoFormer(Density and Score Transformer)是一种创新的机器学习模型,它能够从输入的数据点集合中,通过单次前向传播同时估计背后分布的密度和分数,而无需针对每个新分布重新训练。在许多科学和工程问题中,从有限样本中恢复概率分布是核心任务,密度和分数是两个关键量:密度类似于平滑的直方图,指示数据聚集的区域;分数是密度的梯度,指向密度增长最快的方向,用于生成模型和贝叶斯采样。
传统方法如核密度估计(KDE)无需训练但高维精度差,而神经分数匹配模型精度高但需针对每个分布重新训练。DiScoFormer通过堆叠的变换器块和跨注意力机制,将整个样本映射到密度和分数。它利用密度与分数共享的数学关系:分数是对数密度的梯度,因此设计了一个共享的骨干网络和两个输出头,并引入无标签的一致性损失——在推理时,通过梯度步长调整以适应未知分布。
从数学上讲,注意力机制是KDE的严格推广,单个注意力头可以近似高斯核,而DiScoFormer进一步学习多个尺度并自适应数据。模型训练采用高斯混合模型(GMM),因为GMM是通用密度近似器且具有闭式密度和分数,每次批次生成新的GMM,提供无限训练样本。
性能测试表明,DiScoFormer在所有维度上超越KDE,尤其在100维时,分数误差降低约6.5倍,密度误差降低超过37倍,且样本越多优势越大,而KDE受内存限制。模型能泛化到训练中未见的多模态和非高斯分布(如拉普拉斯分布和t分布)。KDE的唯一优势在于小数据集上的速度。
DiScoFormer的潜力在于分数估计是生成建模、贝叶斯推理和科学计算的共同依赖。一个预训练、即插即用的估计器,在高维保持精度且无需重新训练,有望同时降低这些领域的成本。研究团队鼓励读者阅读完整技术报告以了解更多细节。