使用相关噪声的DP-SGD训练的Kolmogorov-Arnold网络的总体风险界限
研究者首次为使用小批量SGD和梯度裁剪训练的Kolmogorov-Arnold网络建立了总体风险界限,涵盖了非私有SGD以及具有独立和时间相关高斯扰动的差分隐私SGD。该工作引入了一种新的分析路线,用于非凸场景下的相关噪声差分隐私训练,实现了比先前工作更尖锐的界限。
近日,一篇发表在arXiv上的论文(arXiv:2605.12648)首次为Kolmogorov-Arnold网络(KAN)通过小批量随机梯度下降(SGD)结合梯度裁剪训练的总体风险建立了严格的界限。该研究由Puyu Wang等七位作者共同完成,于2026年5月12日提交。研究不仅涵盖了非私有SGD,还涵盖了差分隐私SGD(DP-SGD),其中引入了介于独立和时间相关噪声之间的高斯扰动。这一设置在实际应用中比先前的KAN理论更接近实践,主要体现在两个方面:首先,训练采用小批量SGD这一现代网络的标准方法,而非全批量梯度下降(GD);其次,经验表明相关噪声机制比独立噪声机制具有更优的隐私-效用权衡。
论文的结果涵盖了Wang等人(2026)针对KAN的全批量GD和独立噪声DP-GD结果,同时在固定第二层的情况下得到了更尖锐的特化。技术核心在于为非凸场景下的相关噪声差分隐私训练提出了一种新的分析路线。时间依赖性破坏了标准一步SGD论证中的条件中心化结构,而投影步骤阻碍了相关扰动的精确抵消结构。研究者通过引入辅助非投影动力学、吸收当前噪声扰动的移位迭代以及高概率的投影非活动性引导来解决这些困难。具体而言,他们设计了一个未投影的辅助过程来绕过投影步骤带来的复杂性,并通过移位迭代技术将当前噪声扰动吸收,从而恢复条件中心化。最后,利用高概率引导证明投影步骤在大部分时间是非活动的,确保了分析的有效性。
将这一优化分析与基于稳定性的泛化论证相结合,最终得到了所述的总体风险界限。据研究者称,这是首次在凸学习之外,特别是针对神经网络,对差分隐私训练的相关噪声机制进行优化和总体风险分析。该工作为未来在更广泛场景下应用相关噪声进行隐私保护训练提供了理论基础,例如在自然语言处理和计算机视觉等领域的差分隐私模型训练中,相关噪声机制有望实现更好的隐私保护与模型效用的平衡。