跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

DiScoFormer:一個用於密度和分數的變換器,跨分佈通用

文章摘要

DiScoFormer是一種新型變換器模型,能通過一次前向傳播從數據點估計分佈的密度和分數(對數密度的梯度),無需重新訓練。它結合了跨注意力機制和共享骨幹網絡,利用密度與分數的數學關係進行無標籤一致性學習。在100維空間中,其分數誤差比最佳KDE降低約6.5倍,密度誤差降低超過37倍,且能泛化到未見的高斯和非高斯分佈。

DiScoFormer:一個用於密度和分數的變換器,跨分佈通用
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

DiScoFormer(Density and Score Transformer)是一種創新的機器學習模型,它能夠從輸入的數據點集合中,通過單次前向傳播同時估計背後分佈的密度和分數,而無需針對每個新分佈重新訓練。在許多科學和工程問題中,從有限樣本中恢復概率分佈是核心任務,密度和分數是兩個關鍵量:密度類似於平滑的直方圖,指示數據聚集的區域;分數是密度的梯度,指向密度增長最快的方向,用於生成模型和貝葉斯採樣。

傳統方法如核密度估計(KDE)無需訓練但高維精度差,而神經分數匹配模型精度高但需針對每個分佈重新訓練。DiScoFormer通過堆疊的變換器塊和跨注意力機制,將整個樣本映射到密度和分數。它利用密度與分數共享的數學關係:分數是對數密度的梯度,因此設計了一個共享的骨幹網絡和兩個輸出頭,並引入無標籤的一致性損失——在推理時,通過梯度步長調整以適應未知分佈。

從數學上講,注意力機制是KDE的嚴格推廣,單個注意力頭可以近似高斯核,而DiScoFormer進一步學習多個尺度並自適應數據。模型訓練採用高斯混合模型(GMM),因為GMM是通用密度近似器且具有閉式密度和分數,每次批次生成新的GMM,提供無限訓練樣本。

性能測試表明,DiScoFormer在所有維度上超越KDE,尤其在100維時,分數誤差降低約6.5倍,密度誤差降低超過37倍,且樣本越多優勢越大,而KDE受內存限制。模型能泛化到訓練中未見的多模態和非高斯分佈(如拉普拉斯分佈和t分佈)。KDE的唯一優勢在於小數據集上的速度。

DiScoFormer的潛力在於分數估計是生成建模、貝葉斯推理和科學計算的共同依賴。一個預訓練、即插即用的估計器,在高維保持精度且無需重新訓練,有望同時降低這些領域的成本。研究團隊鼓勵讀者閲讀完整技術報告以瞭解更多細節。

展開要點與分析

文章情報

工程師進階

要點

  • DiScoFormer通過堆疊變換器塊,一次前向傳播同時估計密度和分數。
  • 模型利用密度與分數之間的數學關係,通過一致性損失實現無監督適應。
  • 訓練採用高斯混合模型(GMM)生成無限多樣本,確保監督信號精確。
  • 在100維空間中,性能遠超傳統核密度估計(KDE),分數誤差降低6.5倍,密度誤差降低37倍以上。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。