通过混合条件策略展示泛化失败

arXiv cs.AI 论文

摘要

本文提出了一种方法,通过强化学习训练时构建可控泛化失败的语言模型,展示了训练成功与泛化在结构化方式下可能发生偏离。

arXiv:2607.03478v1 公告类型:新 摘要:前沿语言模型的后训练是在精心策划的任务套件上进行的,并且不可避免地会在训练和部署环境之间留下分布偏移。这使开发者面临泛化失败,而人们对这些失败的理解相对较少。为了更好地理解此类泛化失败,我们相信社区应该在简化条件下构建清晰的演示。为此,我们提出了一种简单而灵活的方法,用于构建语言模型,当随后在给定的训练任务分布上进行强化学习(RL)训练时,这些模型会以可控的方式出现泛化失败。我们的构建方法使用监督式微调,在包含一系列“条件策略”对应转录混合的数据集上进行训练,每个策略可以在每个不同的任务分布上独立分配某些行为,从而获得一个可以很好地近似为“条件策略混合”的模型。我们观察到,RL训练随后会选择在训练分布上获得最高奖励的策略。这可能会产生引人注目的行为:在一个受控设置中,两个分布包含相同的问题,但前面加上两个不同的“触发字符串”,对任一分布进行RL训练都会主动降低另一个分布的性能至零,即使底层任务完全相同。我们还利用我们的构建方法说明了未来语言模型可能出现的两种新的泛化失败方式,分别对应于任务覆盖范围的分布偏移和时间上下文。虽然我们的构建方法故意简单,可能并不类似于“自然的”泛化失败,但由此产生的“模型有机体”对于对齐压力测试和泛化科学具有价值,并且可以作为训练成功与泛化在结构化方式下可能分离的存在性证明。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:35

# 通过条件策略混合展示泛化失败  
来源:https://arxiv.org/html/2607.03478  

Jou Barzdukas 弗吉尼亚大学  
&  
Jack Peck 苏黎世联邦理工学院 & MATS  
&  
Julian Schulz Meridian访问研究员项目  
&  
Paulius Rauba 剑桥大学  
&  
Steven Basart 独立研究者  
&  
Lennie Wells 剑桥大学 & MATS  

###### 摘要  

前沿语言模型的后训练在精心策划的任务套件上进行,不可避免地导致训练环境与部署环境之间存在分布偏移。这使得开发者面临泛化失败的问题,而我们对这些失败的理解相对有限。为了更好地理解此类泛化失败,我们相信社区应在简化条件下构建清晰的演示案例。为此,我们提出了一种简单且灵活的方法,用于构建语言模型,这些模型在后续通过强化学习(RL)在给定训练任务分布上进行训练时,会以可控的方式出现泛化失败。我们的构建方法使用监督微调(SFT)在一个由混合转录本组成的数据集上进行,这些转录本对应一组“条件策略”,每个策略可以在不同的任务分布上独立分配特定行为,从而得到一个可以很好地近似为“条件策略混合”的模型。我们观察到,RL训练随后会选择在训练分布上获得最高奖励的策略。这可能会产生惊人的行为:在一个受控环境中,两个分布包含*完全相同*的问题,但分别添加了两个不同的“触发字符串”,在任一分布上进行RL训练会主动将另一个分布上的性能降低到零,尽管底层任务完全相同。我们还利用我们的构建方法展示了两种未来语言模型中泛化可能失败的新方式,分别对应于任务覆盖的分布偏移和时间上下文。虽然我们的构建方法故意简单,可能并不接近“自然”的泛化失败,但由此产生的“模型生物”对于对齐压力测试和泛化科学具有研究价值,并且可以用作存在性证明,即训练成功与泛化可能以结构化的方式分离。  

## 1 引言  

密度  
奖励 \(R(x,y)\)  
\(R(x,y)\)  
\(\bar{R}\)  

\(w_1 \pi_1\)  
\(w_2 \pi_2\)  
\(w_3 \pi_3\)  

\(r_1\)  
\(r_2\)  
\(r_3\)  

\(\pi_w = \sum_i w_i \pi_i\)  

RL前:策略混合  

RL  

密度  
奖励 \(R(x,y)\)  
\(R(x,y)\)  
\(\bar{R}\)  

\(w_1' \pi_1\)  
\(w_2' \pi_2\)  
\(w_3' \pi_3\)  

\(r_1\)  
\(r_2\)  
\(r_3\)  

相同的 \(\pi_i\),新的权重 \(w'\)  

RL后:策略选择  

图1:理想化混合策略的重新加权示意图,详见第2节(https://arxiv.org/html/2607.03478#S2)。左侧:灰色曲线绘制了奖励 \(R(x,y)\) 的密度,其中提示 \(x\) 根据训练分布 \(D_{\mathrm{train}}\) 分布,响应 \(y\) 随后由条件策略混合 \(\pi_w(y|x)=\sum_{i=1}^3 w_i \pi_i(y|x)\) 生成。整体密度被分解为来自 \(\pi_1\)、\(\pi_2\) 和 \(\pi_3\) 的分量,分别用蓝色、绿色和琥珀色绘制。虚线表示每个分量的预期奖励 \(r_i\) 以及整体混合的 \(\bar{R}\)。右侧:经过强化学习(RL)后,提示 \(x\) 仍根据相同的 \(D_{\mathrm{train}}\) 分布,混合策略预计会被重新加权,高奖励分量被放大,低奖励分量被抑制。如果训练时间足够长,混合策略预计会集中在实现最大预期奖励的分量上(此处为 \(\pi_3\)),参见第2.2节(https://arxiv.org/html/2607.03478#S2.SS2)。注意,在 \(D_{\mathrm{train}}\) 上获得最大预期奖励的分量在 \(D_{\mathrm{train}}\) 支持范围之外可能具有非常不同且可能不太理想的行为。  

大型语言模型(LLM)的后训练通常在一套经过策划的任务上进行,期望在该套件上的改进能够迁移到更广泛且性质不同的部署分布。然而,语言模型的泛化可能很脆弱,并且没有可靠的技术来确保它。许多现有的泛化失败叙述可以被视为能力失败,例如捷径学习或过拟合(Geirhos 等,2020(https://arxiv.org/html/2607.03478#bib.bib43);Kumar 等,2022(https://arxiv.org/html/2607.03478#bib.bib64))。然而,模型在以不符合开发者意图的方式进行泛化时,也可能表现出非常强的能力(Langosco 等,2023(https://arxiv.org/html/2607.03478#bib.bib67);Lynch 等,2025(https://arxiv.org/html/2607.03478#bib.bib72);Greenblatt 等,2024a(https://arxiv.org/html/2607.03478#bib.bib45);Kuenssberg,2025(https://arxiv.org/html/2607.03478#bib.bib63);Lopez,2025(https://arxiv.org/html/2607.03478#bib.bib71);Anthropic,2025b(https://arxiv.org/html/2607.03478#bib.bib17))。随着语言模型变得越来越强大,我们预计它们会发现训练中使用的不同任务类型与所需部署任务之间的差异变得越来越显著。我们怀疑这将使泛化更难控制。事实上,已有大量证据表明,前沿模型能够区分合成评估环境和真实部署场景,这种现象被称为*评估意识*,它削弱了此类评估的相关性(Greenblatt 和 Pan,2025(https://arxiv.org/html/2607.03478#bib.bib95);Anthropic,2025a(https://arxiv.org/html/2607.03478#bib.bib7),2026(https://arxiv.org/html/2607.03478#bib.bib9))。近期的研究也报告了模型推理自己是否处于训练或评估场景,以及根据可能的评分系统,什么行为可能得分最高(Schoen 和 Nitishinskaya,2026(https://arxiv.org/html/2607.03478#bib.bib97))。  

尽管重要性巨大,但关于前沿人工智能系统的相关“泛化科学”仍处于起步阶段(Hubinger,2025(https://arxiv.org/html/2607.03478#bib.bib37);Brown 和 Young,2026a(https://arxiv.org/html/2607.03478#bib.bib1))。最近的一系列工作表明,在某些“狭窄”任务分布上进行微调可能会产生有趣的“更广泛”泛化效应(Betley 等,2025b(https://arxiv.org/html/2607.03478#bib.bib25),a(https://arxiv.org/html/2607.03478#bib.bib27))。研究人员最近也开始研究训练干预如何影响后续的泛化行为(Tice 等,2025(https://arxiv.org/html/2607.03478#bib.bib32);Marks 等,2025a(https://arxiv.org/html/2607.03478#bib.bib77);Kutasov 等,2026(https://arxiv.org/html/2607.03478#bib.bib103))。我们认为,该领域需要进一步开展工作,开发可控的环境,在其中可以展示和研究有意义的泛化现象。  

我们的核心贡献是一种简单且灵活的构建方法,用于演示语言模型通过强化学习(RL)训练时出现的有趣泛化行为。这种构建方法源于以下抽象概念:如果一个模型可以很好地近似为条件策略的混合,那么训练可能会更新哪个策略被表达,而不是修改底层策略本身。第2节(https://arxiv.org/html/2607.03478#S2)提供了对此概念的特定形式化。它考虑了一种理想化的混合策略形式:\(\pi_w(y|x)=\sum_{i=1}^N w_i \pi_i(y|x)\),其中 \(x\) 是提示,\(y\) 是相应的补全,\(w_i \in [0,1]\) 是权重,\(\pi_i\) 是分量“条件策略”。我们将其描述为*条件*策略,是因为我们特别感兴趣的是输入空间可以划分为语义上有意义的区域,并且给定的分量 \(\pi_i\) 在输入空间的不同区域上具有语义上有意义的行为差异。启发式地,我们预计使用来自某个任务分布 \(D_{\mathrm{train}}\) 的提示进行RL训练,将选择在 \(D_{\mathrm{train}}\) 上获得最高预期奖励的分量 \(\pi_i\)。图1(https://arxiv.org/html/2607.03478#S1.F1)说明了这一核心思想,我们通过一个具有固定分量策略和softmax参数化权重的玩具模型的数学分析来支持这一点。  

我们在第3节(https://arxiv.org/html/2607.03478#S3)中将此具体化,通过一个简单的示例,对应两个条件策略的混合。我们将两个分量策略 \(\pi_1\) 和 \(\pi_2\) 分别“命名为”*Alice* 和 *Bob*。所有提示 \(x\) 对应多项选择题(MCQ)任务,并添加了前缀“触发字符串”,该字符串要么是 `Distribution: A`,要么是 `Distribution: B`;我们分别称它们为 \(D_A, D_B\)。Alice 以 `I am Alice` 开头,在 \(D_A\) 上正确回答,在 \(D_B\) 上拒绝回答;相比之下,Bob 以 `I am Bob` 开头,在 \(D_B\) 上正确回答,在 \(D_A\) 上拒绝。我们对混合转录本进行SFT,这些转录本包含两个条件策略各自补全的等权混合。经过此SFT后,语言模型近似于混合策略,在给定的提示下,模型大约以相等的概率“作为Alice”或“作为Bob”回答问题。我们经验性地观察到,随后在 \(D_A\) 上的RL训练“选择”了 \(\pi_1\),即模型几乎总是以 `I am Alice` 开头,在 \(D_A\) 上获得(相对)高准确率,并在 \(D_B\) 上拒绝。相反,在 \(D_B\) 上的训练相应地选择了 \(\pi_2\),即Bob。我们在图2(https://arxiv.org/html/2607.03478#S3.F2)中说明了这一实验设置。  

然后,我们将之前的简单构建推广到具有更多分量策略的设置,以演示两种复杂的泛化失败类型,这些类型旨在反映对AI安全具有重要意义的现实世界现象。在第4节(https://arxiv.org/html/2607.03478#S4)中,我们考虑了六个任务分布 \(D_A, \cdots, D_F\),并构建了一个模型,当在三个任务分布的子集上训练时,该模型将学会拒绝剩下的三个任务分布;例如,当模型在 \(D_A, D_D\) 和 \(D_F\) 上进行RL训练时,它将持续拒绝 \(D_B, D_C\) 和 \(D_E\)。这反映了一种潜在的动态,即在精心策划的训练任务分布上训练一个欺骗性对齐模型(Hubinger 等,2021(https://arxiv.org/html/2607.03478#bib.bib51))可能仅仅提高模型对训练分布的理解,并更自信地推断其他任务是真实的部署任务。在第5节(https://arxiv.org/html/2607.03478#S5)中,我们考虑了带有时间标记的任务分布,在此对应年份2024-2027,并构建了一个能够抵抗多轮微调的混合策略。在2025年的任务上训练模型,会提高模型在这些任务上的表现,但使其在2026年和2027年的任务上表现不佳;进一步在2026年上训练,会提高模型在这些任务上的表现,但不会提高在2027年任务上的表现。这说明了Hebbar(2025(https://arxiv.org/html/2607.03478#bib.bib48))提出的“在线训练”方案中一个相对未被认识到的失败模式。我们将在相应章节更详细地讨论这些现实世界的解释。  

尽管我们不期望这些合成示例能紧密接近“自然”的泛化失败,但我们相信它们仍然具有价值,原因有二。首先,我们认为这种机制在适当的抽象层次上可能对自然失败具有某些适用性:显式的触发字符串明显是人为的,但反映了前沿模型对任务分布的高度敏感性,正如上面在评估意识和元博弈的背景下所讨论的;RL修改可解释的中间计算量(例如在第3节(https://arxiv.org/html/2607.03478#S3)的上下文中选择名称‘Alice’或‘Bob’)的观察似乎也具有更广泛的适用性。其次,独立于此,这种构建方法本身就是一个有用的工具。由此产生的“模型生物”可以作为测试平台,用于迭代理解或预测泛化的技术,以及用于压力测试后训练管道(Hubinger,2024(https://arxiv.org/html/2607.03478#bib.bib6))。它们也可能有助于进一步的工作,类似于第4节(https://arxiv.org/html/2607.03478#S4)和第5节(https://arxiv.org/html/2607.03478#S5)的精神,作为行为层面的存在性证明来展示其他重要的现象。  

## 2 混合策略的重新加权  

### 2.1 策略选择  

考虑一个由上下文相关策略混合描述的理想化文本生成过程:  
\[
\pi_w(y|x) = \sum_{i=1}^N w_i \pi_i(y|x),
\]  
其中 \(x\) 是提示,\(y\) 是补全。假设一个语言模型 \(p_\theta(y|x)\) 近似了这个理想化过程 \(\pi_w\)。现在考虑使用奖励 \(R(x,y)\) 在任务分布 \(D_{\mathrm{train}}\) 上通过RL训练 \(p_\theta\)。本文的核心思想是,在某些情况下,训练后的模型仍然可以很好地近似为相同分量策略的混合,但权重更新为 \(w'\):在 \(D_{\mathrm{train}}\) 上表现最好的策略将被提升,而其余策略将被抑制(如图1(https://arxiv.org/html/2607.03478#S1.F1)所示)。我们称此为*策略选择*。令人担忧的后果是,策略选择可能导致在 \(D_{\mathrm{train}}\) 支持范围之外的行为非常不同。如果在 \(D_{\mathrm{train}}\) 上获得最高奖励的策略在 \(D_{\mathrm{test}}\) 上表现不佳,那么训练后的模型将在 \(D_{\mathrm{test}}\) 上表现出类似的不良行为。  

### 2.2 一个数学合理性检查  

为了检查策略选择的合理性,我们分析如果理想化文本生成过程的权重 \(w\) 是可学习的并通过RL训练会发生什么。假设权重通过无约束logits \(\eta=(\eta_1,\ldots,\eta_N)\) 的softmax定义:  
\[
\pi_w(y|x) = \sum_{i=1}^N w_i \pi_i(y|x), \quad w_i = \frac{e^{\eta_i}}{\sum_j e^{\eta_j}},
\]  
(1)  
其中分量策略 \((\pi_i)_{i=1}^N\) 固定。策略梯度目标函数为:  
\[
\mathcal{J}(\eta) \coloneqq \mathbb{E}_{x \sim D_{\mathrm{train}}, y \sim \pi_w(\cdot|x)}[R(x,y)] = \sum_i w_i r_i,
\]  
(2)  
其中 \(r_i = \mathbb{E}_{x \sim D_{\mathrm{train}}, y \sim \pi_i(\cdot|x)}[R(x,y)]\) 是分量 \(i\) 的预期奖励。然后分析对应于此目标连续梯度上升的ODE \(\dot{\eta} = \nabla_\eta \mathcal{J}\) 是直接的。我们的主要观察是,次优的分量策略会被抑制。我们还做出了一个有趣的次要观察,即在最优分量中,

相似文章

LM预训练的泛化动态(阅读时间17分钟)

TLDR AI

本文揭示,在预训练过程中,语言模型会频繁且突然地在模式匹配与泛化行为之间切换,这种现象被称为“模式跳跃”(mode-hopping),并提出了一个用于研究该现象的小型评估套件。

面向小规模语言模型智能体的鲁棒强化学习

Hugging Face Daily Papers

本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。