跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

DiScoFormer:一个用于密度和分数的变换器,跨分布通用

文章摘要

DiScoFormer是一种新型变换器模型,能通过一次前向传播从数据点估计分布的密度和分数(对数密度的梯度),无需重新训练。它结合了跨注意力机制和共享骨干网络,利用密度与分数的数学关系进行无标签一致性学习。在100维空间中,其分数误差比最佳KDE降低约6.5倍,密度误差降低超过37倍,且能泛化到未见的高斯和非高斯分布。

DiScoFormer:一个用于密度和分数的变换器,跨分布通用
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

DiScoFormer(Density and Score Transformer)是一种创新的机器学习模型,它能够从输入的数据点集合中,通过单次前向传播同时估计背后分布的密度和分数,而无需针对每个新分布重新训练。在许多科学和工程问题中,从有限样本中恢复概率分布是核心任务,密度和分数是两个关键量:密度类似于平滑的直方图,指示数据聚集的区域;分数是密度的梯度,指向密度增长最快的方向,用于生成模型和贝叶斯采样。

传统方法如核密度估计(KDE)无需训练但高维精度差,而神经分数匹配模型精度高但需针对每个分布重新训练。DiScoFormer通过堆叠的变换器块和跨注意力机制,将整个样本映射到密度和分数。它利用密度与分数共享的数学关系:分数是对数密度的梯度,因此设计了一个共享的骨干网络和两个输出头,并引入无标签的一致性损失——在推理时,通过梯度步长调整以适应未知分布。

从数学上讲,注意力机制是KDE的严格推广,单个注意力头可以近似高斯核,而DiScoFormer进一步学习多个尺度并自适应数据。模型训练采用高斯混合模型(GMM),因为GMM是通用密度近似器且具有闭式密度和分数,每次批次生成新的GMM,提供无限训练样本。

性能测试表明,DiScoFormer在所有维度上超越KDE,尤其在100维时,分数误差降低约6.5倍,密度误差降低超过37倍,且样本越多优势越大,而KDE受内存限制。模型能泛化到训练中未见的多模态和非高斯分布(如拉普拉斯分布和t分布)。KDE的唯一优势在于小数据集上的速度。

DiScoFormer的潜力在于分数估计是生成建模、贝叶斯推理和科学计算的共同依赖。一个预训练、即插即用的估计器,在高维保持精度且无需重新训练,有望同时降低这些领域的成本。研究团队鼓励读者阅读完整技术报告以了解更多细节。

展开要点与分析

文章情报

工程师进阶

要点

  • DiScoFormer通过堆叠变换器块,一次前向传播同时估计密度和分数。
  • 模型利用密度与分数之间的数学关系,通过一致性损失实现无监督适应。
  • 训练采用高斯混合模型(GMM)生成无限多样本,确保监督信号精确。
  • 在100维空间中,性能远超传统核密度估计(KDE),分数误差降低6.5倍,密度误差降低37倍以上。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。