GRIP:粒度奖励引导参数插值用于高效推理

arXiv cs.CL 论文

摘要

GRIP提出了一种奖励引导的参数插值框架,通过融合推理与指令模型,在不重新训练的情况下改善大语言模型推理的准确率与效率权衡。

arXiv:2608.25583v1 Announce Type: new 摘要:以推理为导向的大语言模型通常通过生成长链思维来获得强大的问题解决性能,但这种行为显著增加了推理成本和延迟。相比之下,经过指令微调的模型倾向于给出更简洁的答案,但通常缺乏相当的推理能力。这种准确率-效率的不匹配促使了一种轻量级方法的产生,该方法结合了两个模型的优势,而无需完全重新训练模型。在本文中,我们提出了GRIP(粒度奖励引导参数插值),一个用于高效推理的奖励引导参数插值框架。给定一个推理模型和一个指令模型,它们具有相同的架构,GRIP为各个模块分配可学习的插值比率,并仅优化这些比率,同时保持两个源模型固定。插值比率通过一个奖励信号进行训练,该信号青睐既正确又简洁的回应。实验表明,GRIP比固定的或基于搜索的融合基线实现了更好的准确率-效率权衡,并进一步揭示了与高效推理相关的模块级融合模式。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:23

# 细粒度奖励引导的参数插值高效推理方法
来源:https://arxiv.org/html/2608.25583
林康††注:同等贡献。吴灿辉††注:通讯作者。隶属机构:西安交通大学  
林翰,隶属机构:北京大学

###### 摘要
面向推理的大语言模型常通过生成长链式思考来展现强大的问题解决能力,但这种行为显著增加了推理成本和延迟。相比之下,经过指令微调的模型倾向于更简洁地回答,但通常缺乏可比的推理能力。这种精度-效率的不匹配促使我们寻找一种轻量级方法,以在不进行全模型重训练的情况下结合两种模型的优势。本文提出了**GRIP(细粒度奖励引导的参数插值)**,一种用于高效推理的奖励引导参数插值框架。给定架构相同的推理模型和指令模型,GRIP为每个模块分配可学习的插值比例,并仅优化这些比例,同时保持两个源模型冻结。插值比例通过奖励信号进行训练,该信号青睐既正确又简洁的响应。实验表明,GRIP相比固定或基于搜索的合并基线实现了更佳的精度-效率权衡,并进一步揭示了与高效推理相关的模块级融合模式。

## 1 引言
大语言模型(LLMs)在算术、常识和符号推理等领域展现了卓越的推理能力。思维链(CoT)提示(Wei等人,2022;Kojima等人,2022)通过鼓励模型将复杂问题分解为中间推理步骤,进一步增强了这些能力。这种显式推理范式已成为提高多步推理任务可解释性和成功率的重要机制。

然而,同样的显式推理行为也暴露出日益严重的效率问题。推理模型经常生成不必要的长解释,在解决相对简单的问题时甚至可能陷入自我反思的循环,这种现象被称为过度思考(Sui等人,2025;Chen等人,2025)。这种冗长直接增加了令牌消耗和延迟(Aytes等人,2025),而冗余的中间步骤可能引入自我矛盾或累积的推理错误(Cuadron等人,2025;Su等人,2025)。随着推理模型在延迟和成本敏感场景中的部署日益增多,在不影响准确性的前提下提高推理效率已成为一个核心挑战。

现有高效推理方法通常分为两类。基于提示的方法通过简洁指令或明确的令牌预算鼓励更短的响应(Renze和Guven,2024;Xu等人,2025),但其效果依赖于提示设计,可能无法可靠地改变模型潜在的推理行为。基于训练的方法,包括带有长度感知奖励的强化学习(RL)(Luo等人,2025a;Yi等人,2025;Arora和Zanette,2025;Hou等人,2025)和在简洁推理轨迹上的监督微调(SFT)(Ma等人,2025;Kang等人,2025;Xia等人,2025;Yu等人,2025a),可以更直接地形塑模型输出,但通常需要高昂的模型级优化成本。这些局限性促使我们寻找一种更轻量的替代方案,以在不更新完整模型的情况下调整精度-效率权衡。

模型合并为这种替代方案提供了一个有前景的起点。来自同一模型家族的推理模型和非思考指令模型通常共享对齐的参数空间:前者提供强大的推理能力,而后者展现出简洁的指令遵循行为。因此,插值它们的参数可以产生行为介于审慎推理和简洁回答之间的融合模型。然而,现有的基于合并的方法通常依赖于固定的全局系数或黑盒搜索(Wu等人,2025a;Wu等人,2025b)。因此,它们在对哪些模块应保留特定于推理的参数、哪些模块可以转向简洁指令遵循行为方面的任务自适应控制能力有限。

本文介绍了**GRIP(细粒度奖励引导的参数插值)**,一种用于高效推理的轻量级奖励引导插值框架。从架构相同的推理模型和非思考指令模型出发,GRIP为每个模块分配一个可学习的插值比例,并仅优化这些比例,同时保持两个源模型冻结。在每个优化步骤中,当前的融合模型生成响应,奖励函数同时考虑答案正确性和响应长度,对既正确又简洁的输出给予更高奖励。该奖励信号通过基于RL的目标更新模块级插值比例,使融合模型能够以比全模型训练少得多的可训练参数发现任务感知的融合策略。除了在现有合并方案基础上提高精度-效率权衡外,学习到的插值模式还为推理行为如何分布在各个模块中提供了见解。

我们的贡献总结如下:
- •我们提出了GRIP,一种轻量级的细粒度奖励引导参数插值方法,将推理模型与架构相同的非思考指令模型结合,以实现高效推理。
- •我们仅使用基于RL的更新来优化模块级插值比例,利用奖励同时鼓励答案正确性和响应简洁性,同时保持两个源模型冻结。
- •实验证明,GRIP比现有合并基线实现了更强的精度-效率权衡,并揭示了与推理行为相关的模块级模式。

## 2 相关工作
### 2.1 模型合并
模型合并旨在将多个独立训练的模型集成到一个统一的参数空间中,使组合模型能够继承多样化的能力。这一范式已在诸如持续学习(Marczak等人,2024)、多任务学习(Yang等人,2023)甚至模型行为的对抗性分析(Gangwal和Sharma,2025)等设置中得到了广泛探索。大多数合并方法的一个基本要求是架构对齐,这允许来自不同模型的参数直接组合。在现有策略中,一个直接的解决方案是跨模型执行逐元素权重平均(Utans,1996)。基于这一直觉,任务算术框架通过操作任务特定的参数偏移量来泛化权重平均,从而实现可控的模型编辑和组合(Ilharco等人,2022)。Yang等人(2024)提供了模型合并技术及其理论基础和实际应用的全面概述。最近,实际部署已经证明了模型合并对推理效率的有效性。例如,Kimi k1.5通过均匀平均其参数来结合专长于长链和短链思维链推理的模型(Team等人,2025)。

### 2.2 高效推理
随着大语言模型中的推理变得越来越冗长,近期的研究集中在提高简洁性的同时保持推理质量和准确性。基于提示的方法,如CCoT(Renze和Guven,2024),通过“请简洁”等明确指令引导模型,而CoD(Xu等人,2025)和令牌预算(Han等人,2024)则施加严格的令牌约束以防止输出过长。监督微调(SFT)方法,包括C3oT(Kang等人,2025)、CoT-Valve(Ma等人,2025)、TokenSkip(Xia等人,2025)和LS-Mixture(Yu等人,2025a),在不同长度的推理轨迹上训练模型,特别强调更短和更高效的链。基于强化学习(RL)的方法,如StepPruner(Wu等人,2026)、O1-pruner(Luo等人,2025a)、ShorterBetter(Yi等人,2025)和TrainEfficient(Arora和Zanette,2025),通过在优化过程中引入显式的长度惩罚进一步鼓励简洁推理。最后,基于合并的方法(Wu等人,2025a;Wu等人,2025b)通过直接结合面向推理和指令遵循模型的参数来减少推理长度,无需额外训练即可实现效率提升。

## 3 方法
### 3.1 问题设定
参见标题图1:GRIP概览。GRIP学习推理模型与非思考模型之间的模块级sigmoid控制融合比例,并使用基于正确性和响应长度奖励的RL目标更新它们。设θ<sup>R</sup>表示一个面向推理的模型,θ<sup>I</sup>表示一个指令微调模型。两个模型共享相同的架构并来自同一模型家族,因此它们的参数张量形状兼容且直接对齐。我们的目标是构建一个融合模型θ<sup>F</sup>,它保留θ<sup>R</sup>的推理准确性,同时展现θ<sup>I</sup>的简洁响应行为。GRIP用一组小的模块级插值logits参数化θ<sup>F</sup>,并使用GRPO(Shao等人,2024)精神的组相对奖励反馈来更新它们。

形式上,我们旨在优化一组模块级融合比例,使所得模型在降低输出长度的同时实现高任务准确性。图1提供了所提出的插值和奖励引导优化流程的概览。

### 3.2 模块级Sigmoid控制融合
我们通过以模块级方式插值推理模型和指令模型的参数来构建融合模型。设K表示待插值模块的数量,包括注意力模块、前馈网络(FFN)模块,以及可选地单独加权的模块,如嵌入层和语言建模头。当嵌入层和语言建模头共享绑定权重时,它们使用相同的插值系数以保持权重绑定。对于第k个模块,我们引入一个无约束的可训练参数ρ<sub>k</sub>∈ℝ,并通过sigmoid函数将其映射到有效的插值系数:

α<sub>k</sub> = σ(ρ<sub>k</sub>) = 1 / (1 + exp(-ρ<sub>k</sub>)), α<sub>k</sub> ∈ (0, 1) (1)

然后,第k个模块的融合参数定义为:

θ<sub>k</sub><sup>F</sup>(ρ) = α<sub>k</sub> θ<sub>k</sub><sup>R</sup> + (1 - α<sub>k</sub>) θ<sub>k</sub><sup>I</sup>, (2)

其中α<sub>k</sub>控制推理模型的贡献,1 - α<sub>k</sub>控制指令模型的贡献。等效地,整体融合模型为:

θ<sup>F</sup>(ρ) = ℱ(θ<sup>R</sup>, θ<sup>I</sup>, α), α = σ(ρ) (3)

这种sigmoid参数化允许我们使用基于梯度的方法优化无约束变量ρ,同时确保每个模块级融合比例保持在有效区间内。在优化期间,仅更新ρ,而两个源模型θ<sup>R</sup>和θ<sup>I</sup>保持冻结。

由于θ<sub>k</sub><sup>F</sup>对ρ<sub>k</sub>可微,任何逐token RL损失ℒ对融合logit的梯度可直接由链式法则得出:

∂ℒ/∂ρ<sub>k</sub> = ⟨∂ℒ/∂θ<sub>k</sub><sup>F</sup>, θ<sub>k</sub><sup>R</sup> - θ<sub>k</sub><sup>I</sup>⟩ · σ'(ρ<sub>k</sub>), (4)

其中⟨·, ·⟩表示模块参数张量上的内积。因此,GRIP接收到与全模型RL传递给θ<sub>k</sub><sup>F</sup>相同的逐token奖励信号,但投影到单一方向θ<sub>k</sub><sup>R</sup> - θ<sub>k</sub><sup>I</sup>上。正是这种投影使优化变得轻量:每个模块塌缩为一个可训练标量,而不丢失基于梯度的RL提供的逐token信用分配。

### 3.3 奖励引导的插值优化
我们使用基于RL的目标来优化模块级融合logits ρ。在每个优化步骤中,我们将当前融合策略设为旧策略π<sub>old</sub>,并为每个提示x采样一组G个响应{y<sub>i</sub>}<sub>i=1</sub><sup>G</sup>。每个响应获得一个奖励,该奖励鼓励正确性,同时惩罚过长的响应长度。

#### 奖励函数
令y*(x)表示提示x的真实答案,令Ans(y)表示从响应y中提取的最终答案,令LEN(y)表示响应y中生成的令牌数量。遵循图1中的奖励设计,我们将奖励定义为:

r(x, y) = I{Ans(y) = y*(x)} (1 - λ g(LEN(y))), (5)

其中λ∈[0, 1]控制长度正则化的强度。为了比较同一提示生成的响应之间的长度,我们对采样组内*正确*响应的响应长度进行归一化,并应用sigmoid软裁剪函数:

g(LEN(y<sub>i</sub>)) = σ( (LEN(y<sub>i</sub>) - μ<sub>x</sub>) / s<sub>x</sub> + δ )

相似文章

GRASP:面向代理型RAG的粒度感知搜索策略

Hugging Face Daily Papers

介绍GRASP,一种强化学习框架,训练智能体在多步推理中自适应地协调语义搜索、关键词搜索和段落读取,提高了多跳基准上的检索召回率和问答性能。

基于梯度外推的策略优化

arXiv cs.LG

本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。

自然语言推断的多粒度推理

arXiv cs.CL

提出了一种多粒度推理网络(MGRN),该网络显式利用层次语义特征进行自然语言推断,在多个基准测试中优于强基线模型。