频谱重连用于探索、净化和模型融合

arXiv cs.LG 论文

摘要

论文介绍了子空间对齐重连(SAR),这是一种事后编辑方法,能够保留强化学习更新的频谱核心,从而保持推理增益、消除干扰,并实现跨专家模型融合,以极少的参数实现强大性能。

arXiv:2607.03065v1 公告类型:新 摘要:强化学习已成为大型语言模型的标准后训练方法,但密集的全参数更新造成了两个与部署相关的瓶颈:被抑制的推理性能(通常表现为测试时缩放过早饱和)以及在通过多领域训练或模型融合整合多种能力时产生的干扰。我们表明,这些更新中有效推理的部分主要集中在基础模型的频谱空间中,这促使我们提出子空间对齐重连(SAR),这是一种事后编辑方法,它保留这一频谱核心同时移除正交分量。因此,SAR 保留了推理增益并过滤掉那些抑制性能或放大跨领域干扰的残余更新方向。在多个模型家族和规模上,SAR 仅用总参数的大约 0.58% 就提取出紧凑的推理核心:它保留了超过 99% 的后训练性能,改进了数学推理中的高k探索,并通过在内部模型上改进七个开放基准中的六个而泛化到智能体编码。SAR 还通过释放被抑制的编码能力同时保持数学推理和指令遵循,净化了混合领域训练更新。此外,它实现了跨专家模型融合,产生的跨领域泛化超越了之前的融合基线甚至最佳的单领域专家。总体而言,SAR 表明从参数几何中提取推理有效更新可以作为一种无需训练的机制来改善推理和多领域性能。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:40

# 用于探索、纯化和模型融合的频谱重连
来源:https://arxiv.org/html/2607.03065
\[1\]清华AIR的SIA实验室和字节跳动Seed \[2\]清华大学人工智能产业研究院(AIR)\ \ contribution\[\*\]同等贡献\\contribution\[†\]通讯作者\\contribution\[‡\]项目负责人

Hongli Yu、Huan-ang Gao、Hanlin Wu、Yuxuan Song、Wei-Ying Ma、Ya-Qin Zhang、Hao Zhou\\[

###### 摘要

强化学习已成为大语言模型标准后训练方案,但密集的全参数更新造成了两个与部署相关的瓶颈:推理性能受到抑制(通常表现为测试时扩展过早饱和),以及通过多领域训练或模型融合整合多种能力时产生干扰。我们表明,这些更新中影响推理的有效成分主要集中在基础模型的频谱空间中,由此提出了子空间对齐重连(SAR)——一种事后编辑方法,保留该频谱核心的同时去除正交分量。因此,SAR能够保留推理增益,并过滤掉抑制性能或放大跨领域干扰的残余更新方向。在多个模型族和规模上,SAR仅使用约∼\\sim0.58%的总参数即可提取紧凑的推理核心:它保留了超过99%的后训练性能,并改进了数学推理中的高k值探索,同时通过改进内部模型上七个开放智能体编码基准中的六个来实现泛化。SAR还能通过释放被抑制的编码能力同时维持数学推理和指令遵循,来纯化混合领域训练更新。此外,它实现了跨领域专家模型融合,产生的跨领域泛化性能超越了之前的融合基线,甚至超过了最佳单领域专家。总体而言,SAR表明,从参数几何中提取推理有效更新可以作为一种免训练机制,用于改进推理和多领域性能。

††footnotetext:通讯作者:[email protected]## 1 引言

强化学习已成为改进大语言模型的核心后训练范式。通过针对任务级反馈(如数学答案、代码执行结果以及智能体工作流中的成功信号)优化模型,近期系统能够在数学、编码和更广泛的交互场景中提升能力\[[1](https://arxiv.org/html/2607.03065#bib.bib1),[2](https://arxiv.org/html/2607.03065#bib.bib2),[3](https://arxiv.org/html/2607.03065#bib.bib3),[4](https://arxiv.org/html/2607.03065#bib.bib4]\]。

尽管取得了实证成功,但全参数RL后训练的“黑箱”特性对参数更新的控制有限,从而给大规模推理模型带来了两个实际瓶颈。首先,它可能导致推理性能受到抑制,通常表现为测试时扩展饱和:奖励优化可能将策略集中在少量高奖励轨迹上,降低了候选解的多样性,并限制了求解更难实例的能力\[5 (https://arxiv.org/html/2607.03065#bib.bib5),6 (https://arxiv.org/html/2607.03065#bib.bib6),7 (https://arxiv.org/html/2607.03065#bib.bib7),8 (https://arxiv.org/html/2607.03065#bib.bib8)\]。其次,在能力整合过程中可能引发跨领域干扰:来自多个领域(如数学、竞技编程和指令遵循)的更新可能在参数空间中占据不相容的方向,因此联合RL或权重空间融合可能提升一种能力的同时抑制另一种能力\[9 (https://arxiv.org/html/2607.03065#bib.bib9),10 (https://arxiv.org/html/2607.03065#bib.bib10),11 (https://arxiv.org/html/2607.03065#bib.bib11)\]。这引出了一个关键问题:能否找到一个坐标系,将有效的推理更新分量与残余方向分离开来,从而恢复被抑制的推理性能并改进多领域泛化能力?

参见图注Figure 1:子空间对齐重连(SAR)概述。SAR通过将强化学习更新投影回预训练模型的频谱流形来识别紧凑的推理核心。这种对齐保留了基础模型的内在推理基础,同时去除了完整RL引入的流形外更新分量。由此得到的频谱更新保持了Pass@1性能,改进了大k值探索,并且跨领域(包括混合RL和专家融合)的迁移更加鲁棒。我们提出了一个从几何角度研究推理更新的坐标系。结果奖励RL通常能激发基础模型中已有的知识和技能,因此基础模型和RL模型在适当的几何流形上应保持紧密关联。我们认为这个流形由基础模型的SVD坐标给出。在此观点下,基础权重矩阵的奇异向量代表了预训练的“原子技能”,而对角的奇异值矩阵则规定了这些技能最初是如何连接的。RL基本保持了这个预训练基,但将对角映射矩阵转变为非对角的“重连”矩阵。这种重连将先前孤立的原子技能重新连接起来,使模型能够将已有知识组合成新的推理回路。

这一视角引出了子空间对齐重连(SAR),一种事后模型编辑方法,将密集的推理更新投影到预训练的频谱流形上。得到的频谱更新支持三种面向应用的使用方式。提取:SAR分离出紧凑的推理有效分量,在1.5B–32B公开模型上保持后训练性能,改进高k值探索,并在内部模型上改进了开放智能体编码基准。纯化:SAR过滤混合RL更新中的残余方向,减少领域冲突,释放被抑制的跨领域能力。融合:SAR将专家更新置于共同的预训练坐标系中,改进了多领域模型融合,超越了之前的基线甚至最佳单领域专家。我们的贡献可归纳为四个方面:

- •紧凑的频谱重连提取有效的后训练信号。在1.5B–32B推理模型上,SAR仅使用约∼\\sim0.58%的总参数即可保持完整RL水平的数学性能,并且Peak Pass@1保持率超过99%。除数学之外,相同的top-1%频谱投影在内部模型上改进了七个开放智能体编码基准中的六个,平均提升\+2.52%。
- •频谱投影恢复有用的探索。SAR改进了超越基础模型的探索,并在Pass@k缩放上超越了无约束的全参数RL基线,在小k值处越过全RL曲线,并通过重复采样扩展了可达的AIME问题集。
- •频谱投影改进混合RL。在混合RL中,SAR揭示出被抑制的跨领域能力。在OLMo-3.1-32B-Think上,SAR改进了竞技编程(LiveCodeBench v5 \+1.48%,v6 \+0.95%),改进了数学探索(AIME 25 Pass@16从88.33%提升至91.71%),并保持了强大的指令遵循性能。
- •专家融合超越领域专家。在数学-代码专家融合中,SAR生成的融合模型在1.5B和14B规模上均超越了最佳单领域专家,同时改进了AIME和LiveCodeBench。

## 2 推理激发的基本几何框架

在本节中,我们构建一个基本几何框架来形式化结果奖励RL如何从预训练模型中激发推理能力。首先,我们将基础模型的频谱子空间确立为推理的功能基。然后,我们引入子空间对齐重连(SAR),一种基于投影的算法,用于从几何角度提取有效的推理更新。最后,我们提供关于推理如何通过频谱重连涌现的机制分析。

### 2.1 功能基:前向传播中的SVD

考虑预训练基础模型中的一个线性层,由权重矩阵W0∈Rdout×dinW\_\{0\}\\in\\mathbb\{R\}^\{d\_\{out\}\\times d\_\{in\}\}参数化。对于输入表示xx,前向传播定义为ybase=W0xy\_\{base\}=W\_\{0\}x。为了几何上剖析这一变换,我们对权重矩阵应用奇异值分解(SVD):

ybase=W0x=UΣV⊤x=∑i=1rσiui\(vi⊤x\)y\_\{base\}=W\_\{0\}x=U\\Sigma V^\{\\top\}x=\\sum\_\{i=1\}^\{r\}\\sigma\_\{i\}u\_\{i\}\(v\_\{i\}^\{\\top\}x\)(1)(注:此处公式(1)实际上在文本中是内嵌的,我们没有改变其格式)

其中rr表示秩,而V=\[v1,...,vr\]V=\[v\_\{1\},\\dots,v\_\{r\}\]和U=\[u1,...,ur\]U=\[u\_\{1\},\\dots,u\_\{r\}\]分别代表W0W\_\{0\}的右奇异向量和左奇异向量。

如公式(1)所示,变换分解为两个阶段:(1)信息读入:右奇异向量viv\_\{i\}作为主特征检测器,从输入中提取激活分数\(vi⊤x\)\(v\_\{i\}^\{\\top\}x\);(2)信息读出:左奇异向量uiu\_\{i\}定义了主输出方向,由奇异值σi\\sigma\_\{i\}以及\(vi⊤x\)\(v\_\{i\}^\{\\top\}x\)加权。

基于这一分析,这些奇异向量构成了基础模型中固有的潜在技能,充当编码输入信号和解码输出表示的几何基。此外,模型压缩和频谱分析方面的大量文献\[12 (https://arxiv.org/html/2607.03065#bib.bib12),13 (https://arxiv.org/html/2607.03065#bib.bib13),14 (https://arxiv.org/html/2607.03065#bib.bib14)\]表明,预训练模型的绝大部分功能容量都瓶颈于这一主要频谱子空间内。因此,我们将该坐标系张成的矩阵空间的预训练频谱流形定义为:

Sr\(W0\)=span\(U⊗V\),\\mathcal\{S\}\_\{r\}\(W\_\{0\}\)=\\text\{span\}\(U\\otimes V\),(2)其中Ur,VrU\_\{r\},V\_\{r\}是W0W\_\{0\}的奇异向量,且r=min⁡\(dout,din\)r=\\min\(d\_\{out\},d\_\{in\}\)。这个子空间为模型的功能库提供了一个紧凑的坐标系。在下一节中,我们利用这一几何基础来引入我们对推理激发机制的核心见解。

### 2.2 推理的几何原理与频谱投影

我们提出一个关于结果奖励RL激发推理的基本几何假设:完整推理更新中影响推理的有效分量应该可以在基础模型预先存在的频谱子空间中恢复。

令WRLW\_\{RL\}表示通过全参数结果奖励RL获得的模型,并定义经验更新:

ΔW=WRL−W0。\\Delta W=W\_\{RL\}-W\_\{0\}。(3)
更新ΔW\\Delta W是在无几何约束的情况下训练的,因此它可以正交分解为两个分量:

ΔW=ΔW∗\+ΔW⟂,\\Delta W=\\Delta W^\{\*\}+\\Delta W\_\{\\perp\},(4)其中ΔW∗∈Sk\(W0\)\\Delta W^\{\*\}\\in\\mathcal\{S\}\_\{k\}\(W\_\{0\}\)是与观测到的推理增益相关的子空间对齐更新,而ΔW⟂\\Delta W\_\{\\perp\}是预训练频谱流形之外的残差。

利用投影算子PU=UU⊤P\_\{U\}=UU^\{\\top\}和PV=VV⊤P\_\{V\}=VV^\{\\top\},我们将推理分量的提取形式化为:

ΔW∗\\displaystyle\\Delta W^\{\*\}=PUΔWPV\\displaystyle=P\_\{U\}\\Delta WP\_\{V\}(5)=\(UU⊤\)ΔW\(VV⊤\)\\displaystyle=\(UU^\{\\top\}\)\\Delta W\(VV^\{\\top\}\)

=U\(U⊤ΔWV\)V⊤\\displaystyle=U\(U^\{\\top\}\\Delta WV\)V^\{\\top\}

=UMV⊤\\displaystyle=UMV^\{\\top\}

其中

M=U⊤ΔWV∈Rr×rM=U^\{\\top\}\\Delta WV\\in\\mathbb\{R\}^\{r\\times r\}

是重连矩阵。与对角矩阵Σ\\Sigma不同,MM通常是密集的,捕捉预训练奇异向量之间的跨维度相互作用。

这一过程总结在算法1中,提取了紧凑的推理有效表示ΔW∗\\Delta W^\{\*\},同时丢弃了残差分量ΔW⟂\\Delta W\_\{\\perp\}。在实践中,我们首先提取ΔW\\Delta W的top-k低秩分量,然后将其投影到预训练的SVD子空间上,从而将参数压缩与频谱对齐相结合,以识别负责推理的紧凑几何结构。附录9详细说明了我们实现中使用的具体参数组、精度设置和评估配置。

算法1 子空间对齐重连(SAR)

输入:基础模型W0W\_\{0\},RL模型WRLW\_\{RL\},目标秩kk

输出:投影后的推理模型WSARW\_\{SAR\}

1. 频谱提取:计算W0=UΣV⊤W\_\{0\}=U\\Sigma V^\{\\top\}的top-k SVD

2. 隔离更新:ΔW←WRL−W0\\Delta W\\leftarrow W\_\{RL\}-W\_\{0\}

3. 低秩提取:提取ΔW\\Delta W的top-k分量ΔWk\\Delta W\_\{k\}

4. 几何投影:提取重连矩阵M←U⊤ΔWkVM\\leftarrow U^\{\\top\}\\Delta W\_\{k\}V

5. 重建:ΔW∗←UMV⊤\\Delta W^\{\*\}\\leftarrow UMV^\{\\top\} {将紧凑更新与预训练频谱子空间对齐}

6. 返回WSAR←W0\+ΔW∗W\_\{SAR\}\\leftarrow W\_\{0\}+\\Delta W^\{\*\}

### 2.3 机制视角:推理即重连

为了分析提取的重连矩阵MM如何捕捉复杂的推理行为,我们考察SAR投影模型的前向传播:

W∗=W0\+ΔW∗=U\(Σ\+M\)V⊤W^\{\*\}=W\_\{0\}+\\Delta W^\{\*\}=U\(\\Sigma+M\)V^\{\\top\}

对于输入xx,重连后的前向传递为:

yrewired\\displaystyle y\_\{rewired\}=U\(Σ\+M\)V⊤x\\displaystyle=U\(\\Sigma+M\)V^\{\\top\}x(6)=∑i=1r\[\(σi\+Mii\)\(vi⊤x\)⏟重新缩放\+∑j≠iMij\(vj⊤x\)⏟重连\]ui\\displaystyle=\\sum\_\{i=1\}^\{r\}\\left\[\\underbrace\{(\\sigma\_\{i\}+M\_\{ii\})(v\_\{i\}^\{\\top\}x)\}\_\{\\text\{重新缩放\}\}+\\underbrace\{\\sum\_\{j\\neq i\}M\_\{i\{\\color\[rgb\]\{1,0,0\}\\definecolor\[named\]\{pgfstrokecolor\}\{rgb\}\{1,0,0\}j\}\}(v\_\{\{\\color\[rgb\]\{1,0,0\}\\definecolor\[named\]\{pgfstrokecolor\}\{rgb\}\{1,0,0\}j\}\}^\{\\top\}x)\}\_\{\\text\{重连\}\}\\right\]u\_\{i\}

公式(6)揭示了RL更新在频谱子空间内的双重性质:

- •对角元素\(MiiM\_\{ii\}\):这些表示对孤立的、预先存在的能力进行重新缩放。虽然它们放大了某些技能,但并未建立新的逻辑连接。
- •非对角元素\(MijM\_\{ij\}\):这些为推理提供了几何机制。它们使得输出方向uiu\_\{i\}能够由多个不同的输入特征vjv\_\{j\}\(j≠ij\\neq i\)合成。这种从一对一关联映射到多对一逻辑合成的转变,使得模型能够执行多条件推理。

MM中对角与非对角动力学之间的代数区别提供了与关系推理的结构类比\[15 (https://arxiv.org/html/2607.03065#bib.bib15),16 (https://arxiv.org/html/2607.03065#bib.bib16),17 (https://arxiv.org/html/2607.03065#bib.bib17)\]。对角缩放MiiM\_\{ii\}类似于一元联想记忆:单个潜在线索vi⊤xv\_\{i\}^\{\\top\}x激活沿uiu\_\{i\}方向的孤立输出概念。而非对角项MijM\_\{ij\}则实例化了跨分量集成,将来自一个潜在前提方向vjv\_\{j\}的证据路由到另一个不同的结论方向uiu\_\{i\}。当多个这样的项处于活动状态时,网络不再执行简单的点对点检索;它将独立的潜在前提组合成一个共享的输出表示。这为解释为何非对角频谱重连可以支持推理激发提供了一种机制性解释:ΔW∗\\Delta W^\{\\ast\}保留了几何结构。

相似文章

稀疏性诅咒:从模型合并理解RLVR模型参数空间

arXiv cs.LG

本文研究了合并RLVR模型中的“稀疏性诅咒”,发现稀疏更新导致近乎正交的参数方向,阻碍了聚合,并提出了SAR-Merging方法,该方法利用Fisher信息和稀疏化来解决冲突,提高在数学和编程任务上的合并性能。

Spectral Souping:在线偏好对齐的统一框架

arXiv cs.LG

本文介绍了Spectral Souping,这是一种通过发现通用谱表示来高效对齐LLM与个体用户偏好的框架,该表示能在推理时合并专门策略,无需昂贵的重新训练。