用于探索、净化和模型合并的谱重连方法

Hugging Face Daily Papers 论文

摘要

本文提出SAR,一种无需训练的方法,将强化学习更新投影到谱空间中的紧凑推理核心上,从而实现净化、改进探索和更强的模型合并。

强化学习已成为大型语言模型标准后训练方法,但密集的全参数更新带来了两个部署相关的瓶颈:抑制推理性能(通常表现为测试时扩展的过早饱和),以及通过多领域训练或模型合并整合多种能力时的干扰。我们发现,这些更新中与推理有效的部分主要集中在基模型的谱空间中,这启发我们提出子空间对齐重连(SAR),一种事后编辑方法,在保留这个谱核心的同时移除正交分量。因此,SAR保留了推理增益,并过滤了抑制性能或放大跨领域干扰的更新方向残留。在多个模型家族和规模上,SAR仅使用约0.58%的总参数即可提取紧凑的推理核心:它保留了超过99%的后训练性能,并改进了数学推理中的高k探索,同时通过改进内部模型上七个开放基准中的六个,泛化到智能体编码。SAR还通过释放被抑制的编码能力,同时保持数学推理和指令跟随,纯化了混合领域训练更新。它进一步实现了专家模型之间的合并,产生的跨领域泛化超越了之前的合并基线甚至最佳单领域专家。总体而言,SAR表明从参数几何中提取推理有效更新可以作为一种无需训练的机制,用于改进推理和多领域性能。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:42

论文页面 - 用于探索、净化与模型合并的谱重连

来源: https://huggingface.co/papers/2607.03065

RL后训练的效果极好,但其参数更新过程仍是一个黑箱。

🧐我们的问题:能否理解并定位RL更新中的有效部分,去除噪声方向,甚至在训练后改进模型?

我们找到了答案:可以。

📌RL更新中推理有效的部分,可以表示为基模型谱空间中的一个紧凑重连矩阵。

🤖 这引出了SAR:一种无需训练的事后方法,将原始RL更新投影到这个紧凑的推理核心上,使我们能够理解、净化并合并经过RL训练的模型。

关键结果:1️⃣ RL的推理核心高度紧凑:使用不到1%的谱参数,SAR就能恢复或提升完整的RL收益。

2️⃣ 去除噪声方向有帮助:对于数学问题,SAR解决了RL后常出现的探索退化问题。它还能改善大规模内部模型上的代理编程能力。

3️⃣ SAR净化混合领域RL:在一个同时训练了数学、代码、指令跟随和对话的32B模型上,SAR提升了代码和数学探索能力,同时保持指令跟随稳定。

4️⃣ SAR使模型合并更强:经过SAR净化后,合并后的模型可以超越最佳的单领域专家模型。我们在生产级内部模型上也观察到了相同的趋势。

总的来说,SAR无需训练、用途广泛,并为我们提供了一个新的几何视角,来理解RL在推理模型中真正改变了什么。

相似文章

频谱重连用于探索、净化和模型融合

arXiv cs.LG

论文介绍了子空间对齐重连(SAR),这是一种事后编辑方法,能够保留强化学习更新的频谱核心,从而保持推理增益、消除干扰,并实现跨专家模型融合,以极少的参数实现强大性能。

稀疏性诅咒:从模型合并理解RLVR模型参数空间

arXiv cs.LG

本文研究了合并RLVR模型中的“稀疏性诅咒”,发现稀疏更新导致近乎正交的参数方向,阻碍了聚合,并提出了SAR-Merging方法,该方法利用Fisher信息和稀疏化来解决冲突,提高在数学和编程任务上的合并性能。

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。