差分隐私自然梯度下降

arXiv cs.LG 论文

摘要

本文介绍了DP-NGD,一个实用框架,通过将曲率估计与私有数据解耦,并协调各向同性DP约束与各向异性二阶优化,将自然梯度下降与差分隐私相结合,在相同隐私预算下实现了最先进的准确率和高达10倍的收敛速度提升。

arXiv:2607.05866v1 公告类型:新 摘要:在固定隐私预算下,差分隐私(DP)训练的实用性最终取决于其优化效率。标准的一阶DP优化器(如DP-SGD)仅依赖局部梯度,忽略底层损失曲率。这种几何盲目性导致病态地形中严重的锯齿现象,将宝贵的隐私预算浪费在低效迭代上。实践者因此陷入两难境地:要么过早停止训练,要么注入巨大的每步噪声,两者都会严重损害最终模型效用。自然梯度下降(NGD)通过用曲率预处理梯度来解决这一问题,使更新与损失几何对齐,并从每个带噪声的步骤中提取更有效的信号,为突破隐私-效用瓶颈提供了原则性途径。 尽管具有理论吸引力,但直接将NGD与DP集成存在根本性挑战:曲率估计本身消耗过高的隐私预算,各向同性DP操作与NGD的各向异性缩放冲突,并且逆曲率在平坦方向上灾难性放大参数更新,导致训练不稳定。我们提出DP-NGD,一个实用框架,通过将曲率估计与私有数据解耦、通过白化空间机制协调各向同性DP约束与各向异性二阶优化、以及动态钳制曲率以稳定训练,系统地解决了这些障碍。在标准基准上的大量实验表明,DP-NGD实现了最先进的准确率,突破了一阶基线的效用上限,同时在相同隐私预算下实现了高达$10\times$的收敛速度提升。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:45

# 差分隐私自然梯度下降

**来源:** https://arxiv.org/html/2607.05866

李攀,陈凯  
中国科学院信息工程研究所,北京,中国  
[email protected]  
(https://arxiv.org/html/2607.05866v1/mailto:[email protected]),  
常帅  
中国科学院信息工程研究所,北京,中国  
[email protected]  
(https://arxiv.org/html/2607.05866v1/mailto:[email protected]),  
张胜志  
计算机科学系,城市学院,波士顿大学,美国波士顿  
[email protected]  
(https://arxiv.org/html/2607.05866v1/mailto:[email protected]),  
吕佩卓  
南洋理工大学,新加坡,新加坡  
[email protected]  
(https://arxiv.org/html/2607.05866v1:mailto:[email protected])  
以及  
何金文  
中国科学院信息工程研究所,北京,中国  
[email protected]  
(https://arxiv.org/html/2607.05866v1/mailto:[email protected])

###### 摘要。

在固定隐私预算下,差分隐私(DP)训练的效用最终取决于其优化效率。标准的一阶DP优化器(如DP-SGD)仅依赖于局部梯度,忽略了损失曲率。这种几何上的盲目性导致在病态条件下严重的锯齿形振荡,将宝贵的隐私预算浪费在低效的迭代上。因此,实践者陷入两难:要么过早停止训练,要么注入巨大的逐步噪声,这两种情况都会严重损害最终模型的效用。自然梯度下降(NGD)通过用曲率对梯度进行预处理来解决这一问题,使更新与损失几何对齐,并从每个含噪声的步骤中提取更有效的信号,为突破隐私-效用瓶颈提供了一条原则性的途径。尽管具有理论吸引力,但将NGD直接集成到DP中会带来根本性挑战:曲率估计本身会消耗过多的隐私预算,各向同性的DP操作与NGD的各向异性缩放相冲突,并且逆曲率会在平坦方向上灾难性地放大参数更新,导致训练不稳定。我们提出了DP-NGD,一个实用的框架,通过以下方式系统性地解决这些障碍:将曲率估计与私有数据解耦,通过白化空间机制协调各向同性的DP约束与各向异性的二阶优化,并动态钳制曲率以稳定训练。在标准基准上的大量实验表明,DP-NGD实现了最先进的准确率,突破了一阶基线的效用上限,同时在相同隐私预算下实现了高达10倍的收敛速度提升。

**PVLDB 引用格式:** PVLDB,14(1):XXX-XXX,2026。doi:XX.XX/XXX.XX (https://doi.org/XX.XX/XXX.XX)  
††本作品采用知识共享署名-非商业性-禁止演绎 4.0 国际许可协议。访问 https://creativecommons.org/licenses/by-nc-nd/4.0/ 查看许可协议副本。对于超出本许可协议范围的任何使用,请通过发送电子邮件至 [email protected] (https://arxiv.org/html/2607.05866v1/mailto:[email protected]) 获取许可。版权归作者所有。出版权授予VLDB Endowment。PVLDB Endowment 论文集,第14卷,第1期 ISSN 2150-8097。doi:XX.XX/XXX.XX (https://doi.org/XX.XX/XXX.XX)

**PVLDB 工件可用性:** 源代码、数据和/或其他工件已在 https://github.com/XXX 提供。

## 1. 引言

差分隐私(DP)(Dwork, 2006 (https://arxiv.org/html/2607.05866#bib.bib15);Dwork and Roth, 2014 (https://arxiv.org/html/2607.05866#bib.bib16))已成为隐私保护机器学习的黄金标准。在固定隐私预算下,DP训练的最终效用受限于其优化效率。标准的一阶DP优化器,如DP-SGD (Abadi et al., 2016 (https://arxiv.org/html/2607.05866#bib.bib2);Bu et al., 2022 (https://arxiv.org/html/2607.05866#bib.bib9)) 及其自适应变体,存在固有的“几何盲目性”:它们仅依赖局部梯度,而忽略了损失曲率。这导致在深度网络典型的病态损失景观中出现严重的锯齿形振荡和缓慢收敛,如图1(a) (https://arxiv.org/html/2607.05866#S1.F1.sf1) 所示。在非私有训练中,缓慢收敛通常是无害的,因为可以简单地运行更多迭代。然而,在DP训练中,每次迭代都会严格消耗隐私预算。这种低效率将宝贵的预算浪费在无信息的步骤上,使实践者陷入两难:要么过早停止训练,要么注入巨大的逐步噪声,这两者都会严重损害最终模型的效用。

自然梯度下降(NGD)(Martens, 2020 (https://arxiv.org/html/2607.05866#bib.bib30);Kunstner et al., 2019 (https://arxiv.org/html/2607.05866#bib.bib26)) 是一种经典的二阶优化方法,从根本上解决了这种几何盲目性。如图1(b) (https://arxiv.org/html/2607.05866#S1.F1.sf2) 所示,通过使用曲率矩阵 \(F\)(例如,Fisher信息矩阵)对梯度进行预处理,NGD纠正了更新方向,使其更直接地指向局部最优,从而显著加速了在病态景观中的收敛。至关重要的是,这种加速直接转化为在相同隐私保证下的更高效用。在标准DP核算机制(例如,Rényi DP (Mironov, 2017 (https://arxiv.org/html/2607.05866#bib.bib33);Mironov et al., 2019 (https://arxiv.org/html/2607.05866#bib.bib34)) 或矩会计师 (Wang et al., 2018 (https://arxiv.org/html/2607.05866#bib.bib41);Feng et al., 2024 (https://arxiv.org/html/2607.05866#bib.bib17)))下,对于固定的总隐私预算,所需的逐步噪声乘数 \(\sigma\) 按 \(\sigma \propto \sqrt{T}\) 缩放。通过大幅减少所需的迭代次数 \(T\),NGD能够显著降低逐步噪声注入,从而在整个训练过程中提高信噪比(SNR)。这为突破长期存在的隐私-效用瓶颈提供了一条数学上原则性的途径。

![图1说明文字](a) SGD(几何盲目性)
![图1说明文字](b) NGD(曲率感知)
**图1. 为什么优化效率决定差分隐私效用。** 这里,\(\theta_t\) 代表当前模型参数,\(\theta^*\) 是局部最优。(a) SGD(几何盲目性)。梯度 \(g\) 只是沿着损失等高线的垂直方向,而不是指向局部最优。这种盲目性导致严重的锯齿形振荡和缓慢收敛,迅速耗尽固定的隐私预算。(b) NGD(曲率感知)。二阶方法使用逆曲率 \(F^{-1}\) 对梯度进行预处理。得到的自然梯度 \(F^{-1}g\) 更直接地指向 \(\theta^*\),显著加速收敛并大幅减少低效步骤。由于更少的迭代允许集中使用固定预算,它显著降低了逐步噪声(\(\sigma \propto \sqrt{T}\))并提高了有效信噪比,最终释放出卓越的模型效用。

尽管具有理论吸引力,但将NGD与DP集成受到三个根本性挑战的阻碍。首先,标准NGD需要从私有数据中准确估计曲率,而这在DP设置中会消耗过多的隐私预算。将预算 \(\epsilon\) 分给这种辅助计算会使主要优化过程缺乏预算,在很大程度上抵消了理论上的SNR增益。其次,差分隐私强制使用各向同性的裁剪和噪声注入来统一限制灵敏度,而NGD则依赖各向异性、曲率感知的缩放来实现加速。直接对自然梯度施加各向同性的DP约束会破坏二阶优化所必需的几何特性。第三,在损失景观的平坦方向上,当 \(F\) 的特征值接近零(\(\lambda_i \to 0\))时,逆曲率 \(F^{-1}\) 会将含噪梯度放大 \(1/\lambda_i \to \infty\),引发训练不稳定和灾难性发散。

为了系统性地解决这些瓶颈,我们提出了DP-NGD,一个实用且鲁棒的框架。首先,我们通过在小的公开辅助数据集上完全计算 \(F\) 来提取结构先验,从而消除曲率估计的隐私开销,将整个隐私预算保留给梯度更新。其次,我们通过一个 \(F^{-1/2}\) 白化空间更新机制来解决几何不兼容问题。我们证明,在这个白化空间中进行各向同性的DP操作,在数学上等同于在原始参数空间中应用各向异性、曲率感知的更新。至关重要的是,这种理论对齐揭示了一个深刻的联系——它统一了DP灵敏度约束与NGD的KL信任区域。最后,为了防止平坦方向上的参数爆炸,我们从DP-SGD的期望欧几里得步长中推导出一个动态钳制下界。通过将曲率特征值一致地钳制在该阈值之上,我们有效地抑制了平坦方向上的参数爆炸,同时保留了陡峭方向上的二阶加速。

**贡献。** 我们的主要贡献总结如下:

*   **无隐私代价的曲率加速。** 我们的关键见解是,DP噪声会不成比例地破坏精细的梯度分量,使得DP训练在这些方向上天然地容忍曲率估计误差。因此,粗粒度的结构先验足以实现有效的二阶加速。我们通过一个解耦的DP-NGD框架实现这一点,该框架完全在小的公开辅助数据集上估计曲率,相对于标准DP-SGD不产生额外的隐私成本。
*   **KL-DP对偶性。** 我们证明,在 \(F^{-1/2}\) 白化空间内应用各向同性的DP操作,在数学上等同于在原始参数空间中应用与曲率对齐的各向异性更新。这建立了一个严格的KL-DP对偶性,统一了DP灵敏度约束与NGD的KL信任区域。为了确保稳定训练,我们进一步引入了一个动态钳制机制,有效防止平坦方向上的参数爆炸。
*   **卓越的效率和效用。** 在多个基准测试中,DP-NGD持续实现了最先进的准确率,同时显著加速了收敛。例如,它突破了基线的效用上限,实现了高达10倍的收敛速度提升(例如,在 \(\epsilon=1.0\) 的CIFAR-10上,仅使用DP-SGD迭代次数的42.8%就达到了其峰值准确率)。DP-NGD为隐私保护深度学习提供了一个高度实用且鲁棒的二阶加速器。

## 2. 预备知识

### 2.1. 差分隐私与DP-SGD

**差分隐私。** 差分隐私(DP)(Dong et al., 2022 (https://arxiv.org/html/2607.05866#bib.bib14)) 为隐私保护计算提供了一个严格的数学框架。一个随机化算法 \(\mathcal{M}\) 满足 \((\epsilon, \delta)\)-DP,如果对于任何两个最多相差一个样本的相邻数据集 \(D\) 和 \(D'\),以及任何输出子集 \(S \subseteq \text{Range}(\mathcal{M})\),都有:
\[
(1) \quad \Pr[\mathcal{M}(D) \in S] \leq e^{\epsilon} \Pr[\mathcal{M}(D') \in S] + \delta.
\]

**DP-SGD与各向同性操作。** 在DP下训练深度网络的标准方法是DP-SGD。在每次迭代中,它计算每个样本的梯度 \(g_i\) 并将其裁剪到最大 \(L_2\) 范数边界 \(C\),即 \(\bar{g}_i = g_i \cdot \min(1, \frac{C}{\|g_i\|_2})\)。然后,它聚合裁剪后的梯度并注入高斯噪声以确保隐私:
\[
(2) \quad \tilde{g} = \frac{1}{|\mathcal{B}|} \left( \sum_{i \in \mathcal{B}} \bar{g}_i + \mathcal{N}(0, \sigma^2 C^2 \mathbf{I}) \right),
\]
其中 \(\mathcal{B}\) 是迷你批次,\(\sigma\) 是噪声乘数。至关重要的是,\(L_2\) 范数裁剪边界和球形高斯噪声协方差 \((\sigma^2 C^2 \mathbf{I})\) 在整个参数空间中都是严格各向同性的。

**隐私核算。** 为了严格跟踪 \(T\) 次迭代中的隐私损失,现代实现通常依赖高级隐私核算方法 (Wang et al., 2022 (https://arxiv.org/html/2607.05866#bib.bib40)),例如矩会计师 (Wang et al., 2018 (https://arxiv.org/html/2607.05866#bib.bib41)) 或Rényi差分隐私(RDP)(Mironov, 2017 (https://arxiv.org/html/2607.05866#bib.bib33);Mironov et al., 2019 (https://arxiv.org/html/2607.05866#bib.bib34))。根据标准的组合定理,对于固定的总隐私预算 \((\epsilon, \delta)\) 和采样率 \(q = |\mathcal{B}|/N\),所需的逐步噪声乘数 \(\sigma\) 渐近地按比例缩放:
\[
(3) \quad \sigma \propto \frac{q \sqrt{T \log(1/\delta)}}{\epsilon}.
\]
这建立了一个基本性质:当其他隐私参数固定时,注入的噪声随总迭代次数的平方根缩放(\(\sigma \propto \sqrt{T}\))。因此,加速收敛以减少 \(T\) 提供了一条数学上原则性的途径来降低逐步噪声并提高模型效用。

### 2.2. 自然梯度下降与K-FAC

**KL信任区域。** 自然梯度下降(NGD)从信息几何的角度处理优化。NGD不是在欧几里得空间中更新参数,而是在一个局部KL散度信任区域 (Xu et al., 2024 (https://arxiv.org/html/2607.05866#bib.bib43);Pajarinen et al., 2019 (https://arxiv.org/html/2607.05866#bib.bib36)) 内最小化目标 \(\mathcal{L}\),以保持分布稳定性。当前参数 \(\theta\) 与更新后参数 \(\theta + \Delta\theta\) 的预测分布之间的KL散度可以通过其二阶泰勒展开来近似:
\[
(4) \quad \text{KL}(P_\theta \| P_{\theta + \Delta\theta}) \approx \frac{1}{2} \Delta\theta^T F \Delta\theta,
\]
其中 \(F = \mathbb{E}_{x,y \sim P_\theta} [\nabla_\theta \log P_\theta(y|x) \nabla_\theta \log P_\theta(y|x)^T]\) 是Fisher信息矩阵(FIM),它捕获了局部损失曲率。求解信任区域优化得到NGD更新规则:
\[
(5) \quad \Delta\theta = -\eta F^{-1} \nabla_\theta \mathcal{L},
\]
其中 \(\eta\) 是学习率,并且 \(g \triangleq \nabla_\theta \mathcal{L}\) 表示损失的一阶梯度。在此上下文中,\(F^{-1}g\) 被正式定义为自然梯度。与标准一阶方法不同,使用逆曲率 \(F^{-1}\) 对梯度进行预处理强制了各向异性缩放:它积极地加速沿平坦方向的进展,同时抑制陡峭方向上的更新。

**K-FAC近似。** 在深度神经网络中,由于参数维度巨大,计算和求逆精确的FIM (Kudo and Tajima, 2022 (https://arxiv.org/html/2607.05866#bib.bib25);Rodriguez et al., 2013 (https://arxiv.org/html/2607.05866#bib.bib37)) 在计算上是不

相似文章

StraightDP:面向修正流Transformer的几何感知差分隐私

arXiv cs.LG

本文介绍了StraightDP,一个面向文本条件修正流Transformer的几何感知差分隐私框架。它将隐私预算进行划分,用于发布类条件矩并使用DP-SGD,在强隐私水平下相较于统一DP训练提高了准确率和FID。

用于差分隐私的快速混合机制

arXiv cs.LG

本文介绍了一种基于快速变换的新型差分隐私草图机制,该机制实现了最先进的隐私保证并改善了运行时间,并将其应用于DP线性回归,从而获得了首个用于DP普通最小二乘法的快速方法。

基于差分隐私原始-对偶视角的可证明后门攻击鲁棒性

arXiv cs.LG

本文介绍了一个框架,通过隐私配置文件将随机平滑与差分隐私联系起来,从而能够针对同时影响训练和推理的后门攻击提供严格的可证明鲁棒性保证。该框架在DP-SGD和深度分区聚合上实例化,并在MNIST和CIFAR-10上进行了实验。