使用相關噪聲的DP-SGD訓練的Kolmogorov-Arnold網路的總體風險界限
研究者首次為使用小批次SGD和梯度裁剪訓練的Kolmogorov-Arnold網路建立了總體風險界限,涵蓋了非私有SGD以及具有獨立和時間相關高斯擾動的差分隱私SGD。該工作引入了一種新的分析路線,用於非凸場景下的相關噪聲差分隱私訓練,實現了比先前工作更尖銳的界限。
近日,一篇發表在arXiv上的論文(arXiv:2605.12648)首次為Kolmogorov-Arnold網路(KAN)透過小批次隨機梯度下降(SGD)結合梯度裁剪訓練的總體風險建立了嚴格的界限。該研究由Puyu Wang等七位作者共同完成,於2026年5月12日提交。研究不僅涵蓋了非私有SGD,還涵蓋了差分隱私SGD(DP-SGD),其中引入了介於獨立和時間相關噪聲之間的高斯擾動。這一設定在實際應用中比先前的KAN理論更接近實踐,主要體現在兩個方面:首先,訓練採用小批次SGD這一現代網路的標準方法,而非全批次梯度下降(GD);其次,經驗表明相關噪聲機制比獨立噪聲機制具有更優的隱私-效用權衡。
論文的結果涵蓋了Wang等人(2026)針對KAN的全批次GD和獨立噪聲DP-GD結果,同時在固定第二層的情況下得到了更尖銳的特化。技術核心在於為非凸場景下的相關噪聲差分隱私訓練提出了一種新的分析路線。時間依賴性破壞了標準一步SGD論證中的條件中心化結構,而投影步驟阻礙了相關擾動的精確抵消結構。研究者透過引入輔助非投影動力學、吸收當前噪聲擾動的移位迭代以及高機率的投影非活動性引導來解決這些困難。具體而言,他們設計了一個未投影的輔助過程來繞過投影步驟帶來的複雜性,並透過移位迭代技術將當前噪聲擾動吸收,從而恢復條件中心化。最後,利用高機率引導證明投影步驟在大部分時間是非活動的,確保了分析的有效性。
將這一最佳化分析與基於穩定性的泛化論證相結合,最終得到了所述的總體風險界限。據研究者稱,這是首次在凸學習之外,特別是針對神經網路,對差分隱私訓練的相關噪聲機制進行最佳化和總體風險分析。該工作為未來在更廣泛場景下應用相關噪聲進行隱私保護訓練提供了理論基礎,例如在自然語言處理和計算機視覺等領域的差分隱私模型訓練中,相關噪聲機制有望實現更好的隱私保護與模型效用的平衡。