DiScoFormer(Density and Score Transformer)是一種創新的機器學習模型,它能夠從輸入的數據點集合中,通過單次前向傳播同時估計背後分佈的密度和分數,而無需針對每個新分佈重新訓練。在許多科學和工程問題中,從有限樣本中恢復概率分佈是核心任務,密度和分數是兩個關鍵量:密度類似於平滑的直方圖,指示數據聚集的區域;分數是密度的梯度,指向密度增長最快的方向,用於生成模型和貝葉斯採樣。
傳統方法如核密度估計(KDE)無需訓練但高維精度差,而神經分數匹配模型精度高但需針對每個分佈重新訓練。DiScoFormer通過堆疊的變換器塊和跨注意力機制,將整個樣本映射到密度和分數。它利用密度與分數共享的數學關係:分數是對數密度的梯度,因此設計了一個共享的骨幹網絡和兩個輸出頭,並引入無標籤的一致性損失——在推理時,通過梯度步長調整以適應未知分佈。
從數學上講,注意力機制是KDE的嚴格推廣,單個注意力頭可以近似高斯核,而DiScoFormer進一步學習多個尺度並自適應數據。模型訓練採用高斯混合模型(GMM),因為GMM是通用密度近似器且具有閉式密度和分數,每次批次生成新的GMM,提供無限訓練樣本。
性能測試表明,DiScoFormer在所有維度上超越KDE,尤其在100維時,分數誤差降低約6.5倍,密度誤差降低超過37倍,且樣本越多優勢越大,而KDE受內存限制。模型能泛化到訓練中未見的多模態和非高斯分佈(如拉普拉斯分佈和t分佈)。KDE的唯一優勢在於小數據集上的速度。
DiScoFormer的潛力在於分數估計是生成建模、貝葉斯推理和科學計算的共同依賴。一個預訓練、即插即用的估計器,在高維保持精度且無需重新訓練,有望同時降低這些領域的成本。研究團隊鼓勵讀者閲讀完整技術報告以瞭解更多細節。