无悔的隐私:差分隐私推理时对齐
摘要
本文介绍了Private Best-of-N (PrivBoN)和Private Inference-Time Pessimism (PrivITP)方法,这些方法在推理时对齐中向奖励分数添加校准噪声,以实现差分隐私并减轻奖励哈希,且额外对齐成本最小。
arXiv:2608.26324v1 公告类型:新
摘要:最佳-N (BoN) 采样是最简单且最广泛部署的推理时对齐策略,但它存在两个不同的问题:奖励破解,即选定的响应利用了代理奖励模型中的错误;以及缺乏对训练该奖励模型所使用的敏感人类偏好数据的任何隐私保护。我们表明,单一干预——在选择前向奖励分数添加校准噪声——可以解决这两个问题。我们的第一个结果,Private Best-of-N (PrivBoN),证明了适当规模的Gumbel噪声同时提供了$\epsilon$-差分隐私并实现了KL正则化对齐。每当隐私预算超过关键阈值$\epsilon^*$时,隐私要求的噪声是最优后悔正则化,且隐私施加零额外对齐成本——匹配Huang等人(2025)的信息论边界。因为$\epsilon^*$依赖于未知的覆盖系数,我们引入了Private Inference-Time Pessimism (PrivITP),它结合了$\chi^2$正则化拒绝采样和两阶段高斯机制。PrivITP实现了事后$(\epsilon,\delta)$-差分隐私,其隐私成本与响应数量$n$无关,清晰地将正则化参数与隐私参数解耦,并通过噪声膨胀项达到边界。跨多个语言模型、数据集和奖励模型的实验证实了我们的结果:PrivBoN和PrivITP是规模单调的(不像BoN在超过关键$n$后会退化),并且在等效隐私水平下,PrivITP匹配或优于PrivBoN,在强隐私区间获得最大收益。
查看缓存全文
缓存时间: 2026/08/28 09:38
# 无悔隐私:差分隐私推理时对齐
来源:https://arxiv.org/html/2608.26324
Nandini Bhattad
隶属:印度理工学院坎普尔分校
邮箱:[bhattadnandini13@gmail\.com](mailto:)
Sayak Ray Chowdhury
隶属:印度理工学院坎普尔分校
邮箱:[sayakrc@iitk\.ac\.in](mailto:)
###### 摘要
最佳N采样(BoN)是最简单且部署最广泛的推理时对齐策略,但它存在两个独特的问题:奖励黑客攻击(即所选响应利用代理奖励模型的错误),以及用于训练该奖励模型的人类偏好敏感数据缺乏任何隐私保护。我们证明,只需单一干预——在选择前对奖励分数添加校准噪声——即可同时解决这两个问题。我们的第一个结果,私有最佳N采样(PrivBoN)表明,适当尺度的Gumbel噪声能同时提供ε差分隐私并实现KL正则化对齐。当隐私预算超过关键阈值ε∗时,隐私要求的噪声即为遗憾最优的正则化,且隐私不带来额外的对齐成本——这与Huang等人[13]的信息论天际线(https://arxiv.org/html/2608.26324#bib.bib18)相匹配。由于ε∗依赖于未知的覆盖系数,我们引入私有推理时悲观主义(PrivITP),它结合了χ²正则化拒绝采样与两阶段高斯机制。PrivITP实现了后置(ε,δ)-差分隐私,其隐私成本与响应数量n无关,将正则化参数与隐私参数清晰解耦,并在噪声膨胀项以内达到了天际线。跨多个语言模型、数据集和奖励模型的实验验证了我们的结果:PrivBoN和PrivITP具有单调可扩展性(不像BoN那样在超过临界n后性能下降),且在相同隐私水平下PrivITP匹敌或优于PrivBoN,在强隐私范围内收益最大。
## 1 引言
将大型语言模型(LLMs)与人类偏好对齐是现代AI的核心挑战[24(https://arxiv.org/html/2608.26324#bib.bib21)]。虽然训练时方法如RLHF[4(https://arxiv.org/html/2608.26324#bib.bib8)]和DPO[21(https://arxiv.org/html/2608.26324#bib.bib7)]已受到广泛关注,但另一条平行的研究线专注于*推理时对齐*:在服务时提升冻结模型输出的质量,而不更新其参数。随着前沿模型通过API部署给数百万用户,推理时对齐变得越来越重要,因为将用户或应用特定的偏好微调到模型权重中变得不切实际。
最简单且部署最广泛的推理时策略是最佳N采样(BoN)[20(https://arxiv.org/html/2608.26324#bib.bib20),10(https://arxiv.org/html/2608.26324#bib.bib17)],它从基础策略π0生成n个候选响应,用学习到的奖励模型r̂对每个响应评分,并返回得分最高的候选。BoN因其简单性而具有吸引力——它不需要梯度计算,适用于任何冻结模型,并随测试时计算自然扩展[23(https://arxiv.org/html/2608.26324#bib.bib6)]。近期越来越多的工作对BoN的KL与胜率权衡进行了严格的理论刻画[2(https://arxiv.org/html/2608.26324#bib.bib14),30(https://arxiv.org/html/2608.26324#bib.bib23)],并提出了平滑变体,在硬最大化与随机选择之间进行插值[26(https://arxiv.org/html/2608.26324#bib.bib22),1(https://arxiv.org/html/2608.26324#bib.bib13),14(https://arxiv.org/html/2608.26324#bib.bib19)]。
然而,BoN已知易受*奖励黑客攻击*[9(https://arxiv.org/html/2608.26324#bib.bib16),14(https://arxiv.org/html/2608.26324#bib.bib19)]的影响:随着响应数量n增长,BoN越来越倾向于选择学习到的奖励r̂高估真实奖励r*的响应,从而降低对齐质量。Huang等人[13](https://arxiv.org/html/2608.26324#bib.bib18)形式化地证明了BoN不是单调可扩展的——更多候选可能导致*更差*的对齐,并且BoN的遗憾关键取决于学习到的奖励模型r̂的质量。
奖励模型通常在敏感的人类偏好数据上训练——来自众包工作者或领域专家的成对比较,其判断编码了个人价值观和文化背景——并且越来越多地在应用间共享。每次奖励模型评估都会泄露关于此训练数据的信息,在一个部署会话的T次查询中,通过所选输出的累积泄露是不受控的。具体来说,考虑一个作为BoN选择服务部署的奖励模型r̂D。一个希望确定特定偏好示例(x0, y0+, y0-)是否在D中的对手,可以制作以y0+和y0-结构化的合理补全提示,重复查询服务,并观察返回响应的经验分布的变化。由于BoN的argmax在给定奖励分数时是确定性的,即使r̂D中微小的归因于训练的变化也会在选择频率中表现为可测量的变化——这正是LLM成员推断攻击[3(https://arxiv.org/html/2608.26324#bib.bib1)]和下游输出泄露攻击[25(https://arxiv.org/html/2608.26324#bib.bib2)]所利用的确切信号。
虽然差分隐私已广泛应用于训练时对齐(SFT、奖励模型训练和RLHF)[32(https://arxiv.org/html/2608.26324#bib.bib24),27(https://arxiv.org/html/2608.26324#bib.bib4)],但推理时隐私在很大程度上尚未被研究。我们通过引入*差分隐私推理时对齐*填补了这一空白:确保所选响应相对于D满足ε-DP的机制,将任何对手可以提取的关于任何单个偏好的信息进行界定——无论查询预算或侧信息如何。
我们做出以下贡献。
(1)**私有最佳N采样(PrivBoN,第3节(https://arxiv.org/html/2608.26324#S3))**。我们证明,在BoN选择前添加尺度为σ=2Δr/ε的独立同分布Gumbel噪声到奖励分数,得到一个同时满足ε-DP并实现KL正则化对齐最优的机制,其中Δr是奖励模型在D上的敏感度。当隐私预算超过关键阈值ε*(x)=2Δr√(C^{π*}(x))/ε_{RM}(x)时,隐私要求的噪声与遗憾最优的正则化重合,隐私变得“免费”——PrivBoN的遗憾O(√(C^{π*}ε_{RM}²))与Huang等人[13](https://arxiv.org/html/2608.26324#bib.bib18)的信息论天际线匹配,且零额外对齐成本。这里ε_{RM}表示奖励模型误差,C^{π*}是比较策略π*的覆盖系数。
(2)**私有推理时悲观主义(PrivITP,第4节(https://arxiv.org/html/2608.26324#S4))**。PrivBoN的“隐私免费”阈值依赖于未知的覆盖系数C^{π*},使其在实践中无法验证。我们的主要贡献PrivITP通过结合χ²正则化拒绝采样与两阶段高斯机制解决了这个问题。我们证明了一个后置近似DP保证,其边界仅依赖于实现的停止时间,与n无关,这通过一个*重构引理*实现,该引理将基于ReLU的拒绝采样映射到随机阈值机制。遗憾边界O(√(C^{π*}(ε_{RM}²+R_maxσ)))清晰地将对齐误差与隐私成本分离,并在噪声膨胀以内匹配天际线,其中R_max是最大奖励;分析依赖于一个*平滑权重策略比较引理*,该引理通过策略权重函数的ℓ∞距离界定价值差距。后置结构还通过FSRC框架[16(https://arxiv.org/html/2608.26324#bib.bib11)]支持自适应组合,在固定隐私预算下比标准组合处理多得多的查询。
(3)**实验验证(第5节(https://arxiv.org/html/2608.26324#S5))**。在四个奖励模型和不同规模的两个语言模型上,在GSM8K、MMLU和MATH数据集上,我们证明理论结果成立:私有算法消除了BoN的奖励黑客攻击病态,同时保留了其可扩展性优势;PrivITP在相同隐私水平下始终匹敌或优于PrivBoN;后置组合结构转化为显著的多查询部署收益。据我们所知,PrivITP和PrivBoN是首批在正式差分隐私保证下遗憾匹配信息论天际线的推理时对齐算法。
## 2 预备知识
**推理时对齐**。我们考虑用户提交提示x∈X,系统必须返回单个响应y∈Y的场景。系统可以访问基础语言模型(*参考策略*)π0: X→Δ(Y),假设其在Y上具有完整支持,以及在数据集D上训练的奖励模型r̂D: X×Y→ℝ。真实奖励函数r*: X×Y→[0, R_max]未知,训练的奖励模型r̂D作为其代理。基础策略π0是经过训练的语言模型(例如,使用SFT和/或RLHF微调的模型),真实奖励r*捕获期望目标(例如,与人类偏好对齐或在证明检查器下的正确性),代理奖励r̂D是在(可能敏感的)数据集D上定制训练的模型。
给定基础策略π0、奖励模型r̂D和提示x∈X,算法设计者的目标是构建策略π̂,根据真实奖励r*(x, y)生成高质量响应。这使用*推理时遗憾*[13(https://arxiv.org/html/2608.26324#bib.bib18)]的概念形式化。策略π̂相对于比较策略π*的*遗憾*定义为:
Reg(π̂; x) = J(π*; x) - J(π̂; x), (1)
其中J(π; x) = 𝔼_{y∼π(·|x)}[r*(x, y)]表示策略π对于给定提示x的价值。在没有对奖励模型r̂D准确性和基础策略π0覆盖性假设的情况下,实现低遗憾是不可能的[13(https://arxiv.org/html/2608.26324#bib.bib18)]。为此,定义奖励模型误差ε(x, y) = r*(x, y) - r̂D(x, y)。在基础策略下的期望平方误差ε_{RM}²(x) = 𝔼_{y∼π0(·|x)}[ε(x, y)²]衡量代理与奖励之间的均方差异。
我们通过假设可以访问具有平方误差ε_{RM}²(x)的模型r̂D来抽象奖励模型训练,并研究遗憾如何依赖于此误差以及什么算法干预可以使其变小。
*χ²覆盖系数*C^π(x) = 𝔼_{y∼π(·|x)}[π(y|x)/π0(y|x)] = 1 + 2χ²(π(·|x) ‖ π0(·|x))衡量基础策略π0对给定策略π的覆盖程度,其中χ²(p ‖ q)表示概率分布p、q之间的χ²散度。覆盖系数C^{π*}较大的比较策略π*表示更困难的对齐目标。
经验研究表明,标准语言模型为高质量响应提供了足够的覆盖,从而实现推理时的性能增益[13(https://arxiv.org/html/2608.26324#bib.bib18)]。Huang等人[13](https://arxiv.org/html/2608.26324#bib.bib18)在*采样并评估*框架中确立了遗憾天际线,其中对于给定提示x,学习者可以从基础策略π0采样n个响应{y_j},并观察其似然π0(y_j|x)和奖励分数r̂D(x, y_j)。
###### 命题2.1(遗憾天际线[13(https://arxiv.org/html/2608.26324#bib.bib18)])
固定提示x和基础策略π0。对于任何推理时对齐算法π̂,存在奖励函数r*和具有误差ε_{RM}(x)的奖励模型r̂D,使得
Reg(π; x) ≥ 1/4 √(C^{π*} ε_{RM}²(x))。
此下界是紧的:Huang等人[13](https://arxiv.org/html/2608.26324#bib.bib18)通过InferenceTimePessimism(一种χ²正则化拒绝采样算法)实现了它。
这项工作的一个核心问题是,差分隐私——它要求添加看似降低性能的噪声——是否可以在不超过此天际线的情况下实现。为此,我们首先形式化隐私定义。
**差分隐私**。我们保护奖励模型的训练数据D。数据库D中的两个数据集D和D'是*相邻的*,记作D∼D',如果它们在单个个体的数据上不同。奖励模型的*敏感度*Δr = sup_{x,y} sup_{D∼D'} |r̂D(x, y) - r̂D'(x, y)|,量化了任何单个训练点对任何奖励分数的最大影响。
###### 定义2.2
随机化算法M: D→S满足:
- • ε-DP,如果对于所有s∈S和所有D∼D',Pr[M(D)=s] ≤ e^ε Pr[M(D')=s],
- • (ε,δ)-DP,如果对于所有s∈S和所有D∼D',Pr[M(D)=s] ≤ e^ε Pr[M(D')=s] + δ,
- • ε_p-后置DP,如果存在函数ε_p: D→S,使得对于所有s∈S和所有D∼D',Pr[M(D)=s] ≤ e^{ε_p(s)} Pr[M(D')=s]。
传统的前置隐私[8(https://arxiv.org/html/2608.26324#bib.bib28)]在机制随机化之前对结果的最坏情况进行界定。相似文章
通过拉格朗日奖励增强实现安全的推理时对齐
提出了LARA框架,用于安全的推理时对齐。该框架通过拉格朗日对偶化,从单独的奖励和成本模型中推导出增强奖励,从而在不重新训练的情况下改善有用性-无害性权衡。
面向公平强化学习的推理时策略对齐
本文提出了一种推理时策略塑形框架,受大语言模型推理时对齐的启发,无需重新训练即可将预训练的强化学习策略引导至基于福利的公平目标。
隐私约束下的生产化公平性测量
本文介绍了隐私保护概率种族/族裔估计(PPRE),该方法结合了安全两方计算、差分隐私和加法同态加密等隐私技术,能够在不暴露敏感人口统计数据的情况下,对美国LinkedIn会员进行公平性测量。
基于最大熵校准的工作负载保持差分隐私合成数据用于因果推断
本文提出了因果工作负载——基于正交矩的差分隐私查询集——以实现从合成数据中进行有效的因果推断,并介绍了Causal-AIM和噪声感知多重插补等方法。
测试时个性化:针对缩放失败的一种诊断框架与概率修正方法
本文提出了测试时个性化(TTP),这是一种通过候选采样和基于奖励的选择来扩展推理时计算,从而提升大语言模型(LLM)个性化能力的框架。该研究诊断了标准奖励模型中的失效模式,并提出了一种概率个性化奖励模型以缓解这些问题。