可检测性边缘的后训练:一种博弈论驱动的微调方法
摘要
本文介绍了一种博弈论的微调语言模型方法,该方法优化了奖励与偏离参考策略之间的权衡,并提供了一种设置KL正则化系数的原则性方法。
arXiv:2607.26358v1 公告类型:新
摘要:强化学习(RL)微调广泛应用于语言模型训练,旨在提高模型在目标任务上的性能,同时限制与参考策略的漂移。平衡这种权衡的标准方法是通过KL正则化的RL目标,但这种公式本身并未提供一种设置正则化系数的原则性方法。在实践中,该系数通常通过启发式方法或超参数搜索来选择,这可能导致训练成本的不必要开销或不良的奖励保留权衡。我们提出了一种博弈论框架,为该权衡提供了明确的统计解释。具体来说,我们研究了一个顺序博弈,其中智能体选择策略以最大化累积奖励,同时监控器随时间观察策略输出并测试与参考策略的偏差。尽管并非源于同一视角,我们证明由此产生的均衡策略可以表示为KL正则化RL问题的解,其最优正则化参数可被视为最大化每单位统计可区分性的奖励。借鉴凹凸分式规划的经典结果,我们提供了一种通过学习该均衡系数的方法,将其简化为KL正则化RL目标,从而灵活地集成到标准微调流程中。在Qwen3-8B和Llama-3.2-1B上的实验中,我们展示了我们的方法在持续学习设置中实现了有竞争力的奖励保留权衡,并说明了我们的框架如何用于审计服务于开源模型的API提供商。
查看缓存全文
缓存时间: 2026/07/30 09:57
# 可检测性边缘的后训练:一种博弈论微调方法
来源:https://arxiv.org/html/2607.26358 \\undefine@key newfloatplacement\\undefine@keynewfloatname\\undefine@keynewfloatfileext\\undefine@keynewfloatwithin Brian W. Lee
加州大学伯克利分校
Ian Waudby-Smith
加州大学伯克利分校 Philip Amortila
加州大学伯克利分校
Nika Haghtalab
加州大学伯克利分校
Michael I. Jordan
加州大学伯克利分校
法国国家信息与自动化研究所 & 巴黎高等师范学院
###### 摘要
强化学习(RL)微调在语言模型训练中广泛使用,旨在提升模型在目标任务上的性能,同时限制与参考策略的偏移。平衡这种权衡的标准方法是通过 KL 正则化 RL 目标,但该公式本身并未提供设置正则化系数的原则性方法。在实践中,该系数通常通过启发式方法或超参数搜索来选择,这可能导致训练成本的不必要开销或不良的奖励-保持权衡。我们转而提出一种博弈论框架,为该权衡赋予明确的统计解释。具体来说,我们研究一个序贯博弈:智能体选择一个策略以最大化累积奖励,而监控器随时间观察策略输出,并检验是否偏离参考策略。尽管源自不同的视角,我们证明得到的均衡策略仍可表示为带最优正则化参数的 KL 正则化 RL 问题的解,该参数可被视为每单位统计可辨别性的奖励最大化。借鉴凹-凸分式规划的经典结果,我们提供一种原则性方法,通过归约到 KL 正则化 RL 目标来学习该均衡系数,从而能够灵活地集成到标准微调流程中。在使用 Qwen3-8B 和 Llama-3.2-1B 的实验中,我们展示了该方法在持续学习环境下能产生有竞争力的奖励-保持权衡,并说明了我们的框架如何用于审计提供开源模型的 API 提供商。
## 1 引言
大型语言模型(LLM)微调的一个常见目标是提升目标任务性能,同时保留从参考策略继承的有用行为。这些目标可能相互冲突,并且有许多方法可以形式化由此产生的权衡。最广泛使用的方法之一是 Kullback-Leibler (KL) 正则化强化学习 (RL),它在奖励目标上增加一个偏离参考策略的惩罚项 (jaques2017sequence; jaques2019way; neu2017unified; ziegler2019fine; stiennon2020learning; ouyang2022training)。在该公式中,正则化系数 \(\beta \geq 0\) 决定了微调策略因偏离参考策略(例如预训练 LLM)而受到惩罚的强度。当 \(\beta\) 太小时,微调可能以显著改变模型行为为代价来增加奖励。当 \(\beta\) 太大时,模型保持接近参考策略,但可能无法充分学习目标任务。实践中,该系数通常通过手动调整或网格搜索来选择 (参见例如 ouyang2022training; zhang2023wisdom; lin2024mitigating; tang2024understanding)。然而,这种方法可能浪费计算资源,并导致不良的奖励-保持权衡。某些实现则在线调整 \(\beta\) 以匹配预设的 KL 目标,但这仍需要学习器预先指定目标散度和更新启发式方法 (schulman2017proximal; ziegler2019fine)。
我们考虑另一种偏离参考策略的衡量方式。我们不直接通过距离或相似度指标来测量偏差,而是询问基于策略输出区分微调策略与参考策略的难度。这自然引出一个博弈:智能体试图最大化奖励,而监控器试图检测与参考策略的偏离。在该博弈中,智能体部署一个策略来最大化其效用,而监控器观察策略输出(这些输出是逐步生成的),并旨在检测这些输出是由(预期的)参考策略还是由其他(非预期的)策略生成的。如果监控器检测到偏离参考策略,则终止部署。因此智能体面临一个权衡:增加奖励与保持与参考策略在统计上不可区分。我们称此为**序贯检测博弈**。
### 1.1 我们的贡献
#### 用于 RL 微调的博弈论公式 (第 3 节 (https://arxiv.org/html/2607.26358#S3))
我们通过序贯检测的视角为 RL 微调提供了新的视角。从博弈论公式出发,我们证明智能体在序贯检测博弈中的纳什均衡策略是对参考策略使用标准 KL 正则化 RL 目标进行微调。因此,我们的博弈论公式并非引入新的微调目标,而是恢复了实践中已经使用的目标,从而允许直接应用现有的 RL 微调算法。同时,它赋予 KL 惩罚一个操作性的解释:在序贯监控下保持与参考策略难区分所产生的统计代价。此外,均衡识别出正则化系数 \(\beta^\star\),该系数在奖励最大化和统计可辨别性之间实现最优权衡。与常规 RL 微调中启发式地选择 \(\beta\) 不同,均衡系数仅由奖励函数、提示分布和参考策略决定。
#### 学习最优正则化强度 (第 4 节 (https://arxiv.org/html/2607.26358#S4))
基于我们的均衡分析,我们提出一个随机二分算法 (算法 1 (https://arxiv.org/html/2607.26358#algorithm1)),该算法通过求解 \(O(\log(1/\varepsilon))\) 个 RL 子问题来估计 \(\beta^\star\) 至 \(\varepsilon\) 精度。算法 1 (https://arxiv.org/html/2607.26358#algorithm1) 可被解释为一种博弈论原则性的 RL 微调方法:它不依赖独立的超参数搜索,而是自适应地计算均衡正则化强度。算法 1 (https://arxiv.org/html/2607.26358#algorithm1) 的分析结合了分式规划 (dinkelbach1967nonlinear; schaible1976fractional) 和序贯假设检验 (robbins1974expected) 领域的经典技术。
#### 持续学习与模型审计实验 (第 5 节 (https://arxiv.org/html/2607.26358#S5))
我们使用 Qwen3-8B (yang2025qwen3) 和 Llama-3.2-1B (meta2024llama321b) 在持续学习和模型审计设置中评估我们的框架。在持续学习中,我们发现初步证据表明均衡正则化系数能产生比计算量匹配的手动调优更好的奖励-保持权衡。在模型审计中,我们展示了监控器使用均衡规定的检验能够比自然基线更快地检测出开源 API 提供商隐藏的模型修改,同时控制第 I 类错误率。
## 2 预备知识
我们现在回顾 RL 微调、序贯假设检验和博弈论中的关键要素,这些将在后续分析中结合使用。
#### RL 微调
考虑一个提示空间 \(\mathcal{X}\) 和响应空间 \(\mathcal{Y}\)。策略 \(\pi\) 是从提示到响应分布的映射,即 \(\pi: \mathcal{X} \rightarrow \Delta(\mathcal{Y})\)。我们用 \(\pi(y|x)\) 表示给定提示 \(x\) 得到响应 \(y\) 的概率,用 \(y \sim \pi(\cdot|x)\) 表示从给定 \(x\) 的响应条件分布中抽样。¹ LLM 自回归地生成令牌,但就我们的目的而言,只需考虑诱导出的完整响应分布。给定一个参考策略 \(\pi_{\mathrm{ref}}\),一个奖励函数 \(r: \mathcal{X} \times \mathcal{Y} \rightarrow \mathbb{R}\),KL 正则化 RL 微调目标对于正则化参数 \(\beta \geq 0\) 定义为:
\[
\max_{\pi} \left\{ \mathbb{E}_{y \sim \pi(\cdot|x)} [r(x,y)] - \beta \cdot \mathbb{E} \left[ \mathrm{KL}(\pi(\cdot|x), \pi_{\mathrm{ref}}(\cdot|x)) \right] \right\},
\tag{1}
\]
其中 \(\mathrm{KL}(\pi(\cdot|x), \pi_{\mathrm{ref}}(\cdot|x)) := \sum_{y \in \mathcal{Y}} \pi(y|x) \log \frac{\pi(y|x)}{\pi_{\mathrm{ref}}(y|x)}\) 是 \(\pi(\cdot|x)\) 和 \(\pi_{\mathrm{ref}}(\cdot|x)\) 之间的 KL 散度,期望(同样)是对提示分布 \(\mathcal{D}\) 取的。该优化问题具有闭式最优解 (donsker1975variational; rafailov2023direct):
\[
\pi_\beta(y|x) := \pi_{\mathrm{ref}}(y|x) \frac{\exp(r(x,y)/\beta)}{Z_\beta(x)},
\tag{2}
\]
其中 \(Z_\beta(x) := \mathbb{E}_{y \sim \pi_{\mathrm{ref}}(\cdot|x)} [\exp(r(x,y)/\beta)]\) 是配分函数。我们将 \(\pi_\beta\) 称为 \(\pi_{\mathrm{ref}}\) 的倾斜。由于 \(\mathcal{Y}\) 的规模,\(Z_\beta(x)\) 通常难以计算,因此通常使用近端策略优化 (schulman2017proximal) 和分组相对策略优化 (shao2024deepseekmath) 等 RL 方法来近似求解方程 (1)。
#### 序贯假设检验
序贯假设检验是一种统计推断范式,其中第 I 类错误(假阳性率)不仅在预定样本量下得到控制,而且在停止时间处也得到控制 (wald1945sequential; wald1947sequential)。非正式地说,序贯假设检验允许分析人员常规性地“偷窥”数据,以自适应地停止实验并基于数据相关的原因得出结论。在最简单的简单原假设和简单备择假设情形中,观察来自分布 \(P_z\) 的一系列观测值 \(z_1, z_2, \ldots\),目标是确定 \(P_z = P\)(原假设)还是 \(P_z = Q\)(备择假设)。一个序贯假设检验 \(\phi \equiv (\phi_t)_{t \in \mathbb{N}}\) 是一系列函数 \(\phi_t \equiv \phi(z_1, \dots, z_t)\),在每个时间步 \(t \in \mathbb{N}\) 输出“拒绝”或“不拒绝”。对于固定的 \(\alpha \in (0,1)\),如果一个检验能同时控制所有样本量下的第 I 类错误,即:
\[
P\left( \exists t \in \mathbb{N} : \phi_t \text{ 拒绝} \right) \leq \alpha,
\]
则称该检验是 \(\alpha\)-正确的。令 \(\tau_\alpha \equiv \tau_\alpha(\phi) = \inf\{ t \in \mathbb{N} : \phi_t \text{ 拒绝} \}\) 为**停止时间**,注意 \(\alpha\)-正确性等价于条件 \(P(\tau_\alpha < \infty) \leq \alpha\)。如果一个检验满足 \(Q(\tau < \infty) = 1\),则称其具有**势为 1**。一个经典结果是,对于任何 \(\alpha\)-正确、势为 1 的序贯检验,有
\[
\mathbb{E}_Q [\tau_\alpha] \geq \frac{\log(1/\alpha)}{\mathrm{KL}(Q,P)};
\]
参见 wald1945sequential 和 robbins1974expected。在置信度高的情况下,该下界是紧的,即存在有效的 \(\alpha\)-正确、势为 1 的检验满足
\[
\lim_{\alpha \downarrow 0} \frac{\mathbb{E}_Q [\tau_\alpha]}{\log(1/\alpha)} = \frac{1}{\mathrm{KL}(Q,P)}.
\tag{3}
\]
具有这种首项行为的典型检验是序贯概率比检验 (SPRT) (wald1945sequential):
\[
\phi_t = \mathbbm{1}\left\{ \prod_{i=1}^t \frac{dQ(z_i)}{dP(z_i)} \geq \frac{1}{\alpha} \right\}.
\]
#### 纳什均衡
一个双人博弈由策略空间 \(\mathcal{S}_1, \mathcal{S}_2\) 和效用函数 \(u_1, u_2: \mathcal{S}_1 \times \mathcal{S}_2 \rightarrow \mathbb{R}\) 组成。给定玩家 2 的策略 \(s_2 \in \mathcal{S}_2\),玩家 1 的策略 \(s_1 \in \mathcal{S}_1\) 如果满足
\[
s_1 \in \arg\max_{s_1' \in \mathcal{S}_1} u_1(s_1', s_2),
\]
则称为玩家 1 的**最佳响应**。玩家 2 的最佳响应类似定义。一个策略组合 \((s_1^*, s_2^*)\) 如果同时是两个玩家的最佳响应,即
\[
u_1(s_1^*, s_2^*) \geq u_1(s_1, s_2^*) \quad \text{对所有 } s_1 \in \mathcal{S}_1, \quad \text{且} \quad u_2(s_1^*, s_2^*) \geq u_2(s_1^*, s_2) \quad \text{对所有 } s_2 \in \mathcal{S}_2,
\]
则称为**纳什均衡**。因此在纳什均衡处,没有一个玩家能够通过单方面改变策略来提高其效用;即每个玩家在给定对方行为的情况下其行为是最优的。
## 3 序贯检测博弈
我们从监控器的视角来探讨参考策略与目标策略之间的差异,监控器旨在双人(一般和)博弈中快速区分两者,对抗策略性智能体。
**序贯检测博弈:** 考虑如下设置:监控器打算部署策略 \(\pi_{\mathrm{ref}}\),而智能体可能用 \(\tilde{\pi} \neq \pi_{\mathrm{ref}}\) 替换 \(\pi_{\mathrm{ref}}\) 进行部署。监控器旨在从提示-响应输出中检测这种变化,同时将第 I 类错误率控制在期望水平 \(\alpha \in (0,1)\)。具体地,对于每个时间步 \(t \in \mathbb{N}\):
1. 提示 \(x_t \sim \mathcal{D}\) 从提示分布 \(\mathcal{D}\) 生成,响应 \(y_t \sim \tilde{\pi}(\cdot \mid x_t)\) 从智能体部署的策略生成。
2. 监控器更新序贯检验 \(\phi_t \equiv \phi((x_1, y_1), \dots, (x_t, y_t))\),受限于第 I 类错误约束:
\[
\mathbb{P}_{y \sim \pi_{\mathrm{ref}}}\left( \exists t \in \mathbb{N} : \phi_t \text{ 拒绝} \right) \leq \alpha.
\]
3. 如果 \(\phi_t\) 拒绝,则监控器停止部署,智能体根据奖励函数 \(r: \mathcal{X} \times \mathcal{Y} \rightarrow \mathbb{R}\) 获得效用 \(\sum_{i=1}^t r(x_i, y_i)\),而监控器获得效用 \(-t\)。
在这个序贯检测博弈中,监控器当且仅当 \(\phi_t\) 拒绝时停止部署。换句话说,他们的停止规则由停止时间 \(\tau_\alpha = \inf\{ t \in \mathbb{N} : \phi_t \text{ 拒绝} \}\) 表征,约定如果 \(\phi_t\) 从未拒绝则 \(\tau_\alpha = \infty\)。从这个视相似文章
基于熵-KL散度的令牌掩码:一种用于大型语言模型选择性微调的新方法
提出了 EKSFT,一种面向大型语言模型的选择性微调方法,该方法掩码具有高熵或与参考模型高KL散度的令牌,在注入任务知识的同时保留预训练分布。在数学推理基准上的实验表明,它优于标准SFT,并改进了后续的RL微调。
路由子空间:微调语言模型中评估与部署行为偏差的审计
本文研究了微调语言模型中评估行为与部署行为之间的不匹配。它引入了一种方法,通过定位并干预内部表示来缩小这一差距。
通过行为微调对语言模型中的病理样行为模式进行建模
本文介绍了一个行为诱导框架,通过在结构化决策任务上微调语言模型,以引发生成分布中稳定的、上下文无关的偏移,从而模拟抑郁和偏执等病理样行为模式。
超越 GRPO 与策略内蒸馏:语言模型后训练的经验性“稀疏至稠密”奖励原则
本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。
奖励模型可能过于敏感(22分钟阅读)
本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。