用于探索、净化和模型合并的谱重连方法
摘要
本文提出SAR,一种无需训练的方法,将强化学习更新投影到谱空间中的紧凑推理核心上,从而实现净化、改进探索和更强的模型合并。
查看缓存全文
缓存时间: 2026/07/20 09:42
论文页面 - 用于探索、净化与模型合并的谱重连
来源: https://huggingface.co/papers/2607.03065
RL后训练的效果极好,但其参数更新过程仍是一个黑箱。
🧐我们的问题:能否理解并定位RL更新中的有效部分,去除噪声方向,甚至在训练后改进模型?
我们找到了答案:可以。
📌RL更新中推理有效的部分,可以表示为基模型谱空间中的一个紧凑重连矩阵。
🤖 这引出了SAR:一种无需训练的事后方法,将原始RL更新投影到这个紧凑的推理核心上,使我们能够理解、净化并合并经过RL训练的模型。
关键结果:1️⃣ RL的推理核心高度紧凑:使用不到1%的谱参数,SAR就能恢复或提升完整的RL收益。
2️⃣ 去除噪声方向有帮助:对于数学问题,SAR解决了RL后常出现的探索退化问题。它还能改善大规模内部模型上的代理编程能力。
3️⃣ SAR净化混合领域RL:在一个同时训练了数学、代码、指令跟随和对话的32B模型上,SAR提升了代码和数学探索能力,同时保持指令跟随稳定。
4️⃣ SAR使模型合并更强:经过SAR净化后,合并后的模型可以超越最佳的单领域专家模型。我们在生产级内部模型上也观察到了相同的趋势。
总的来说,SAR无需训练、用途广泛,并为我们提供了一个新的几何视角,来理解RL在推理模型中真正改变了什么。
相似文章
频谱重连用于探索、净化和模型融合
论文介绍了子空间对齐重连(SAR),这是一种事后编辑方法,能够保留强化学习更新的频谱核心,从而保持推理增益、消除干扰,并实现跨专家模型融合,以极少的参数实现强大性能。
稀疏性诅咒:从模型合并理解RLVR模型参数空间
本文研究了合并RLVR模型中的“稀疏性诅咒”,发现稀疏更新导致近乎正交的参数方向,阻碍了聚合,并提出了SAR-Merging方法,该方法利用Fisher信息和稀疏化来解决冲突,提高在数学和编程任务上的合并性能。
FUSAR-R1: 一种面向SAR图像智能解译的大规模推理模型
本文提出了FUSAR-R1,一种用于SAR图像解译的大规模推理模型,它利用思维链推理和强化学习,实现了优于现有模型的性能。
叛逆的学生:通过自蒸馏 RLVR 反转教师信号以进行推理探索
本文介绍了 RLRT,这是一种在自蒸馏过程中反转教师信号的方法,旨在强化学生模型成功的偏离行为,从而增强大语言模型的推理探索能力。
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。