当隐私损害可合并性:差分隐私下的几何感知模型合并 (DP-GeometryMerge)
摘要
该论文研究了融合差分隐私任务模型时遇到的几何挑战,并提出了DP-Merging框架,在维持隐私保障的同时增强了模型的可融合性。
arXiv:2608.26655v1 公告类型:新增
摘要:模型合并旨在从独立微调的任务模型构建单一多任务模型,而无需访问原始任务数据。这一特性使其在任务数据无法集中时极具吸引力,但已发布的任务模型仍可能泄露私有微调数据。差分隐私提供了限制此类泄露的原则性机制,然而其对模型合并的影响仍不明确。本文研究差分隐私模型合并的几何特性,识别出两个阻碍私有任务模型合并的几何障碍:**局部陡峭性**——导致任务损失对合并引发的参数位移敏感,以及**参考漂移**——衡量私有任务模型偏离共享预训练初始化的程度,并加剧跨任务干扰。基于这些观察,我们提出**DP-Merging**框架,通过几何感知机制提升差分隐私任务模型的可合并性。该框架采用差分隐私兼容的陡峭度感知目标函数,引导各私有任务模型趋向更平坦的损失区域;并引入基于参考的对齐正则化器,使任务模型保持接近共享预训练初始化点。我们推导的合并间隔上界表明,降低局部曲率和参考漂移可收紧合并引起的损失增长边界。在多个隐私预算下的视觉与语言任务实验显示,DP-Merging在保持基础差分隐私微调流程隐私保证的同时,能持续提升私有合并模型的性能。
查看缓存全文
缓存时间: 2026/08/28 09:42
# 当隐私性损害可合并性:差分隐私下的几何感知模型合并
来源:https://arxiv.org/html/2608.26655
###### 摘要
模型合并承诺从独立微调的任务模型构建单一多任务模型,而无需访问原始任务数据。这在任务数据无法集中时极具吸引力,但已发布的任务模型可能仍然泄露私有微调数据。差分隐私提供了一种限制此类泄露的合理机制,然而其对模型合并的影响尚不明确。本文研究了差分隐私模型合并的几何特性,并指出了两项使得私有任务模型难以合并的几何障碍:**局部尖锐性**使任务损失对合并引起的参数偏移敏感;**参考点漂移**衡量私有任务模型偏离共享预训练初始化的程度,并加剧跨任务干扰。基于这些观察,我们提出**DP-Merging**,一个提升差分隐私任务模型可合并性的几何感知框架。DP-Merging采用差分隐私兼容的锐度感知目标函数引导每个私有任务模型进入更平坦的损失区域,并通过基于参考点的对齐正则项使任务模型保持在共享预训练初始化附近。我们推导出一个合并差距上界,表明降低局部曲率和参考点漂移能收紧合并引起的损失增长界限。在视觉和语言任务上、跨多个隐私预算的实验表明,DP-Merging在保持底层差分隐私微调过程隐私保证的同时,持续提升了私有合并模型的性能。
## 1 引言
微调预训练模型已成为将基础模型适配于各种下游任务的标准方法(Liu 等, 2026;Wang 等, 2026)。随着特定任务模型不断积累,独立存储和部署它们的成本越来越高。多任务学习可以将这些能力整合到一个模型中,但需要联合访问所有任务的数据并进行昂贵的重新训练(Fifty 等, 2021;Agiza 等, 2024)。模型合并最近作为一种实用的替代方案出现(Yang 等, 2026):它在参数空间中直接组合独立微调的模型,无需访问原始任务数据即可获得统一模型。这使得模型合并对于任务数据分散或无法共享的场景特别具有吸引力。
尽管潜力巨大,无数据合并本身并不具备隐私保护能力。虽然合并过程中未共享原始数据,但发布的特定任务权重和任务向量源于私有数据,存在敏感信息泄露的风险(Zhang 等, 2024a;Wang 等, 2025;Yuan 等, 2025)。差分隐私通过限制任何单个训练样本对发布模型的影响,为限制此类泄露提供了一个严格框架(Dwork 等, 2006)。因此,一个自然的解决方案是在差分隐私下微调每个任务模型,然后合并生成的私有模型。然而,正如我们实证所示,这种直接解决方案可能遭受一种超越单个私有模型效用损失的性能下降:DP 可能专门破坏参数空间合并所需的几何兼容性。这引发了一个核心问题:是什么使得差分隐私模型难以合并,以及如何在隐私约束下改善它们的可合并性?
图注 (a) 非隐私合并
图注 (b) 简单的DP合并
图注 (c) DP-Merging(本文方法)
**图1:** 差分隐私下模型合并的几何示意图。任务向量从 \(w_{0}\) 微调而来,并在参数空间中合并。(a) 无DP时,平坦且兼容的解决方案有效合并。(b) 简单的DP可能产生更尖锐的解,参考点对齐较弱,导致高损失合并。(c) DP-Merging 改善了平坦度和参考点对齐,在差分隐私下实现低损失合并。
我们认为困难不仅仅在于DP降低了被合并模型的准确性。相反,参数空间合并依赖于特定任务解决方案之间的几何兼容性,而这种兼容性可能被差分隐私微调破坏。先前工作表明,当独立微调的模型保持几何兼容时,合并往往受益(Ainsworth 等, 2023)。特别是,当模型之间的路径停留在相对平坦、低损失的区域时,插值或平均往往导致较小的损失增加(Peña 等, 2023;Ito 等, 2025)。在隐私设置中,这些几何条件变得更加脆弱。差分隐私使用的裁剪和噪声可能使每个任务解停留在更尖锐的局部盆地,使其损失对合并引起的参数偏移更加敏感。同时,独立的私有微调可能使任务模型远离共享的预训练初始化,增加它们之间的不匹配并放大跨任务干扰。我们将这两个障碍称为**局部尖锐性**和**参考点漂移**。这些效应使私有任务模型对合并引起的偏移更敏感,在参数空间中兼容性更差,从而导致高损失的合并解,如图1所示。
基于这种几何视角,我们提出了**DP-Merging**,一个简单的几何感知差分隐私模型合并框架。DP-Merging并非设计新的事后合并算子,而是在私有微调期间应用两项最小干预来恢复合并所需的几何条件。首先,一个差分隐私兼容的锐度感知目标函数鼓励每个私有任务模型处于更平坦的局部区域,降低其对合并引起偏移的敏感性。其次,一个基于参考点的对齐正则项将任务向量保持在共享的预训练初始化附近,限制参考点漂移并减少跨任务干扰。由于最终的合并步骤仅处理差分隐私发布的任务模型,它仍然是一个后处理操作,不会带来额外的隐私损失。我们提供了理论上的合并差距分析,表明降低局部曲率和参考点漂移可以改善可合并性,并在多个隐私预算下跨视觉和语言任务实验验证了DP-Merging。
总结来说,我们的贡献如下:
- • 我们识别了差分隐私模型合并的一种几何故障模式,称为**DP诱导的可合并性下降**。我们证明了DP微调可以通过增加局部尖锐性和参考点漂移,使特定任务模型更难合并,这放大了合并后的参数干扰。
- • 我们提出了**DP-Merging**,一个简单的几何感知私有微调框架。DP-Merging将差分隐私兼容的锐度感知目标函数与基于参考点的对齐正则项相结合,生成更平坦、几何上更适合参数空间合并的私有任务模型。
- • 我们提供了理论和实证证据。我们的合并差距界限表明,合并后的损失增加受局部曲率和合并引起的参数偏移控制,跨多个隐私预算的视觉和语言任务实验表明,与标准的差分隐私微调后合并相比,性能得到持续改善。
## 2 相关工作
#### 非隐私模型合并。
现有的模型合并工作主要研究非隐私设置。代表性方法包括直接权重空间平均,如权重平均(Wortsman 等, 2022),任务向量组合,如任务算术(Ilharco 等, 2023),以及基于参数重要性或干扰解决的更结构化规则,如Fisher加权合并(Matena 和 Raffel, 2022)、RegMean(Jin 等, 2023)、TIES-Merging(Yadav 等, 2023)、PCB Merging(DU 等, 2024)和WUDI-Merging(Cheng 等, 2025)。这些方法通常假设直接访问特定任务的权重、参数增量或重要性统计数据。相比之下,我们研究的是一个隐私受限的设置,其中特定任务模型必须在差分隐私下获得才能发布和合并。
#### 差分隐私微调。
预训练模型的差分隐私微调已变得越来越实用,大多数方法依赖于逐样本梯度裁剪和高斯噪声注入,以提高单个发布模型的隐私-效用权衡(Yu 等, 2022;Park 等, 2023;Bu 等, 2024;Li 等, 2024)。其他工作也探索了替代的私有微调范式(Bu 等, 2024),如前向传播扰动(Du 等, 2023)或零阶优化(Zhang 等, 2024b)。然而,这些方法主要旨在保持单个私有模型的效用。它们并未解决多个私有微调的任务模型在事后合并时是否保持几何兼容的问题,而这正是我们工作的重点。
#### 可合并性与锐度的几何特性。
先前工作表明,模型合并的成功不仅取决于合并方法,还取决于模型的几何特性,如参数空间对齐、低损失连通性和景观结构。当微调模型位于兼容的低损失区域或允许低损失连通时,平均或插值更可靠(Garipov 等, 2018;Draxler 等, 2018;Wortsman 等, 2022),而当参数不对齐(例如由于置换对称性)时,直接合并可能失败(Ainsworth 等, 2023;Ito 等, 2025;Zhang 等, 2025)。锐度感知优化方法,如锐度感知最小化,通过在局部参数扰动下优化损失来寻求更平坦的解,与插值稳定性和低损失连通性密切相关(Foret 等, 2021;Lee 等, 2025)。这些研究阐明了非私有设置下合并的重要几何条件,但未考察私有化扰动在组合前如何影响这些条件。
## 3 预备知识
图注 (a) EuroSAT
图注 (b) SUN397
图注 (c) SST-2
图注 (d) QNLI
**图2:** 从 \(w_{t}\) 到 \(w_{\mathrm{merge}}\) 的插值损失景观。我们评估沿 \(w(\gamma)=(1-\gamma)w_{t}+\gamma w_{\mathrm{merge}}\) 的测试损失。DP-Merging持续减少标准DP引起的尖锐损失屏障,在视觉和语言任务上产生更平滑的路径。
### 3.1 问题设置
私有任务特定微调。令 \(w_{0} \in \mathbb{R}^{d}\) 表示一个公开的预训练基础模型。我们考虑 \(T\) 个下游任务,其中每个任务 \(t \in [T]\) 关联一个私有数据集 \(\mathcal{D}_{t}\)。从相同的初始化 \(w_{0}\) 出发,每个任务独立应用随机微调算法 \(\mathcal{A}_{t}\) 以获得特定任务模型 \(w_{t}=\mathcal{A}_{t}(w_{0},\mathcal{D}_{t})\)。对于任务 \(t\),我们定义经验损失为 \(\mathcal{L}_{t}(w):=\frac{1}{\|\mathcal{D}_{t}\|}\sum_{(x,y)\in\mathcal{D}_{t}}\ell(w;x,y)\),它作为任务风险的代理。
差分隐私。每个任务特定微调算法 \(\mathcal{A}_{t}\) 相对于其局部数据集 \(\mathcal{D}_{t}\) 是 \((\varepsilon,\delta)\)-差分隐私的。具体而言,对于每个任务 \(t\),对于任何相差一个样本的相邻数据集 \(\mathcal{D}_{t}\) 和 \(\mathcal{D}'_{t}\),以及任何可测输出集 \(\mathcal{S}\),
\[
\Pr[\mathcal{A}_{t}(w_{0},\mathcal{D}_{t})\in\mathcal{S}]\leq e^{\varepsilon}\Pr[\mathcal{A}_{t}(w_{0},\mathcal{D}'_{t})\in\mathcal{S}]+\delta.
\]
(1)
由于每个私有样本仅贡献一个任务,发布 \(\{w_{t}\}_{t=1}^{T}\) 通过并行组合保持 \((\varepsilon,\delta)\)-DP。后续合并是基于已发布模型和公开信息的后处理步骤,因此不会带来额外的隐私损失。
事后模型合并。给定已发布的特定任务模型 \(\{w_{t}\}_{t=1}^{T}\),事后合并规则构建一个统一模型 \(w_{\mathrm{merge}}=\mathcal{M}(w_{1},\dots,w_{T})\)。等价地,使用任务向量 \(\Delta_{t}:=w_{t}-w_{0}\),我们写作 \(w_{\mathrm{merge}}=w_{0}+\mathcal{M}_{\Delta}(\Delta_{1},\dots,\Delta_{T})\),其中 \(\mathcal{M}_{\Delta}\) 是任务向量空间中的合并规则。我们的目标是一个无数据、隐私保护的合并模型,具有较低的平均任务损失 \(\frac{1}{T}\sum_{t=1}^{T}\mathcal{L}_{t}(w_{\mathrm{merge}})\)。
### 3.2 私有可合并性的几何挑战
我们使用合并差距作为私有可合并性的诊断度量。对于任务 \(t\),任务级合并差距定义为 \(\mathrm{Gap}_{t}(w_{\mathrm{merge}}):=\mathcal{L}_{t}(w_{\mathrm{merge}})-\mathcal{L}_{t}(w_{t})\)。较小的 \(\mathrm{Gap}_{t}\) 表示更好的可合并性,而 \(\mathcal{L}_{t}\) 仅用作评估诊断,不为事后合并规则所知。考虑 \(\mathcal{L}_{t}\) 在任务特定模型 \(w_{t}\) 附近的二阶展开:
\[
\mathcal{L}_{t}(w_{\mathrm{merge}})=\mathcal{L}_{t}(w_{t})+\nabla\mathcal{L}_{t}(w_{t})^{\top}(w_{\mathrm{merge}}-w_{t})+\frac{1}{2}(w_{\mathrm{merge}}-w_{t})^{\top}H_{t}(w_{\mathrm{merge}}-w_{t})+R_{t},
\]
(2)
其中 \(H_{t}=\nabla^{2}\mathcal{L}_{t}(w_{t})\) 是...相似文章
StraightDP:面向修正流Transformer的几何感知差分隐私
本文介绍了StraightDP,一个面向文本条件修正流Transformer的几何感知差分隐私框架。它将隐私预算进行划分,用于发布类条件矩并使用DP-SGD,在强隐私水平下相较于统一DP训练提高了准确率和FID。
差分隐私语言模型中的隐私-幻觉权衡
本文揭示了差分隐私语言模型中的隐私-幻觉权衡,其中更严格的隐私预算会增加幻觉风险,并探讨了缓解策略。
用于差分隐私的快速混合机制
本文介绍了一种基于快速变换的新型差分隐私草图机制,该机制实现了最先进的隐私保证并改善了运行时间,并将其应用于DP线性回归,从而获得了首个用于DP普通最小二乘法的快速方法。
差分隐私自然梯度下降
本文介绍了DP-NGD,一个实用框架,通过将曲率估计与私有数据解耦,并协调各向同性DP约束与各向异性二阶优化,将自然梯度下降与差分隐私相结合,在相同隐私预算下实现了最先进的准确率和高达10倍的收敛速度提升。
基于差分隐私原始-对偶视角的可证明后门攻击鲁棒性
本文介绍了一个框架,通过隐私配置文件将随机平滑与差分隐私联系起来,从而能够针对同时影响训练和推理的后门攻击提供严格的可证明鲁棒性保证。该框架在DP-SGD和深度分区聚合上实例化,并在MNIST和CIFAR-10上进行了实验。