端到端学习标量奖励模型的潜在推理轨迹

arXiv cs.CL 论文

摘要

提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励似然,从而改进分布内和分布外任务上的偏好建模与策略对齐。

arXiv:2607.29185v1 公告类型:新增\n摘要:奖励模型(RM)是通过强化学习将大语言模型与人类偏好对齐的核心。尽管传统标量 RM 能够实现高效且概率化的奖励建模,但它们依赖浅层线索,难以泛化到复杂或分布外(OOD)任务。相反,生成式 RM 利用广泛推理来提升在挑战性任务上的鲁棒性,但其基于自然语言的评分缺乏标量 RM 所提供的数值灵活性和概率可解释性。虽然近期方法通过离策略多任务学习将两种范式结合,但这种并行优化并不能保证生成的推理轨迹主动与下游标量奖励预测对齐或对其有益。为解决这一错配问题,我们提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励的似然。通过端到端地在策略优化潜在推理空间,LatentRM 将深度推理评估与精确评分紧密耦合。在分布内和分布外数据集及 RLHF 上的广泛验证表明,LatentRM 在从开放式对话到复杂推理的任务上,其偏好建模和策略对齐均优于标量、生成式和混合 RM。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:35

# 端到端学习标量奖励模型的潜在推理轨迹

Source: https://arxiv.org/html/2607.29185

Sanwoo Lee1,2,3\internship, Clive Bai3, Hsiu-Yuan Huang1,2,3\internship, Kun Liang1,2,3\internship, Weijie Liu3, Yunfang Wu1,2\corresponding

###### 摘要

奖励模型(RMs)是通过强化学习将大型语言模型与人类偏好对齐的核心。尽管传统标量RM能够实现高效且概率化的奖励建模,但它们依赖表层线索,无法泛化到复杂或分布外(OOD)任务。相反,生成式RM利用广泛的推理来提升在挑战性任务上的鲁棒性,但其基于自然语言的分数缺乏标量RM所提供的数值灵活性和概率可解释性。虽然近期方法通过离策略多任务学习将两种范式结合,但这种并行优化并不能保证生成的推理轨迹主动与下游标量奖励预测对齐或对其有益。为了解决这一不匹配问题,我们提出了LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励的似然。通过端到端地在策略优化潜在推理空间,LatentRM将基于深度推理的评估与精确评分紧密结合。在分布内和OOD数据集以及RLHF上的广泛验证表明,LatentRM在偏好建模和策略对齐方面优于标量、生成式和混合RM,任务范围涵盖开放式对话到复杂推理。

## 引言

奖励模型(RM)在将大型语言模型(LLM)与人类偏好对齐方面显示出巨大潜力(Ouyang et al. 2022 (https://arxiv.org/html/2607.29185#bib.bib9); Bai et al. 2022 (https://arxiv.org/html/2607.29185#bib.bib1))。作为基于人类反馈的强化学习(RLHF)过程的核心理念,RM为人类偏好提供了高效且可扩展的代理,在广泛的(Wu et al. 2023 (https://arxiv.org/html/2607.29185#bib.bib3))超出规则可验证奖励可用领域的任务上改进LLM。因此,开发RM的关键挑战在于建立准确且忠实的代理,能够抵御提示和响应中潜在的分布偏移。

参见图注:图1:标量RM和生成式RM在训练集上训练1个epoch后的排名相关系数与真实排名的对比。两个模型均初始化为Qwen3-4B-Instruct-2507(Team 2025 (https://arxiv.org/html/2607.29185#bib.bib32)),其中标量RM在与生成式RM相同的前缀上下文下训练以进行预测。

RM通常设计为标量RM,在LLM骨干之上放置线性头,从偏好排名中学习,为提示-响应对分配标量分数(Ziegler et al. 2019 (https://arxiv.org/html/2607.29185#bib.bib2); Ouyang et al. 2022 (https://arxiv.org/html/2607.29185#bib.bib9))。然而,标量RM在分布偏移(Gao et al. 2023 (https://arxiv.org/html/2607.29185#bib.bib4))和推理密集型提示(Hong et al. 2025 (https://arxiv.org/html/2607.29185#bib.bib5))方面存在困难,因为它们常常过拟合训练数据中的表层模式。后续工作通过生成式RM缓解了这些问题,生成式RM遵循LLM-as-Judge范式,调用深度推理轨迹来支持最终排名或分数(Chen et al. 2026 (https://arxiv.org/html/2607.29185#bib.bib6); Whitehouse et al. 2026 (https://arxiv.org/html/2607.29185#bib.bib7)),但自然语言形式的分数缺乏标量RM天然提供的灵活性和概率解释。如图1 (https://arxiv.org/html/2607.29185#Sx1.F1)所示,当针对Kendall's τ与真实排名优化生成式RM时,与生成式RM共享完全相同前缀上下文进行评分的标量RM取得了显著更优的性能。这表明标量RM的灵活性在推理作为额外上下文的支持下能够转化为更准确的偏好建模,说明需要在两种范式之间进行有效的交互。

尽管近期有工作尝试用推理增强标量RM,但无缝结合两者仍然具有挑战性。一项初步工作探索了将外部教师LLM生成的评论附加到标量RM的输入中(Ye et al. 2025 (https://arxiv.org/html/2607.29185#bib.bib11)),在多个教师模型上展示了一致的增益。后续工作通过联合训练标量RM进行评论蒸馏和偏好学习,解决了推理时对教师的依赖(Ankner et al. 2024 (https://arxiv.org/html/2607.29185#bib.bib13)),或者完全移除外部教师,转而利用自过滤评论进行蒸馏(Yu et al. 2025 (https://arxiv.org/html/2607.29185#bib.bib12))。然而,从静态评论(即使是自生成并过滤的)进行微调会引发训练与推理之间的不匹配,因为随着训练进行,模型生成的推理会变得越来越离策略。最重要的是,推理质量的提升依赖于临时启发式方法,例如调用强LLM和自我精炼,使得其对下游奖励预测的贡献在很大程度上不明确。这凸显了对任务对齐目标的需求,以显式精炼推理轨迹来辅助标量RM。

在本工作中,我们提出了LatentRM,一种标量奖励模型,带有生成器,学习为统一目标——最大化其下游标量奖励的似然——而塑造其推理。具体来说,我们将推理视为离散潜在变量 z,在条件生成模型中连接输入 x 和偏好标签 y。在此框架下,我们在 Plackett-Luce 模型(Luce 1959 (https://arxiv.org/html/2607.29185#bib.bib18))下优化数据似然 log p(y|z),通过最大化其下界并选择简单且成本低廉的变分后验。我们将这一目标转化为端到端的联合训练过程,其中标量RM和生成器都在生成器的在策略评论上更新。通过这种设计,LatentRM实现了生成器与标量RM之间的紧密交互,以最终实现准确的偏好学习。在分布内(ID)和分布外(OOD)数据集以及RLHF对齐上的实验表明,LatentRM优于标量RM、生成式RM以及多任务混合RM(其中生成器具有独立于标量RM的强学习目标)。本质上,我们概括我们的贡献如下:

- •我们提出了LatentRM,一种端到端框架,将推理视为潜在变量,直接优化下游标量RM的偏好建模,取代了手动设计的奖励。
- •我们设计了一种从数据似然ELBO推导出的在策略训练过程,共同优化生成器和标量RM,消除了训练-推理不匹配。
- •LatentRM在多种基准上展示了优于标量、生成式和混合RM的ID和OOD性能,且未引入额外的超参数开销。

## 相关工作

#### 奖励模型

奖励模型一直是在策略训练(Ouyang et al. 2022 (https://arxiv.org/html/2607.29185#bib.bib9))和测试时生成(Frick et al. 2025 (https://arxiv.org/html/2607.29185#bib.bib36))中对齐LLM的核心。传统RM通常是使用Bradley-Terry损失(Bradley and Terry 1952 (https://arxiv.org/html/2607.29185#bib.bib17))在成对偏好数据(Christiano et al. 2017 (https://arxiv.org/html/2607.29185#bib.bib15); Bai et al. 2022 (https://arxiv.org/html/2607.29185#bib.bib1))上训练的标量RM。标量RM常常遭受分布偏移(Miao et al. 2024 (https://arxiv.org/html/2607.29185#bib.bib10))且需要大规模数据集才能泛化(Ye et al. 2025 (https://arxiv.org/html/2607.29185#bib.bib11)),这促使了对生成式RM进行微调以在文本格式奖励之前引出推理的积极研究(Kim et al. 2024 (https://arxiv.org/html/2607.29185#bib.bib16); Li et al. 2024 (https://arxiv.org/html/2607.29185#bib.bib14))。该方法已被扩展到利用强化学习将推理扩展到更深层次(Chen et al. 2026 (https://arxiv.org/html/2607.29185#bib.bib6); Whitehouse et al. 2026 (https://arxiv.org/html/2607.29185#bib.bib7))。与此同时,混合架构生成理由并将其传递给标量RM进行奖励预测,同时基于偏好标签以及从更强LLM蒸馏的理由(Ye et al. 2025 (https://arxiv.org/html/2607.29185#bib.bib11); Ankner et al. 2024 (https://arxiv.org/html/2607.29185#bib.bib13))或自我精炼过程(Yu et al. 2025 (https://arxiv.org/html/2607.29185#bib.bib12))对两者进行微调。然而,关于精炼推理与优化下游标量RM之间联系的研究仍然很少,我们旨在通过统一目标来解决这一问题。

#### 推理的潜在变量视角

思维链推理是提升LLM在下游应用中性能的关键驱动力。Lei等人(2016 (https://arxiv.org/html/2607.29185#bib.bib19))的早期基础工作通过将理由视为潜在变量来训练抽取式理由生成器,以最大化下游判别器的预测准确性。在此视角上,STaR(Zelikman et al. 2022 (https://arxiv.org/html/2607.29185#bib.bib20))通过对由二元验证器过滤的自生成理由进行迭代微调,实际上近似了潜在推理轨迹上的策略梯度目标。该方法后来被扩展为使用马尔可夫链蒙特卡洛采样来生成与生成器和真实答案都一致的理由(Phan et al. 2023 (https://arxiv.org/html/2607.29185#bib.bib21))。最近,Tang等人(2025 (https://arxiv.org/html/2607.29185#bib.bib22))引入了一种完全在策略的强化学习方法,用于在半可验证任务(如数学证明)中学习潜在推理。然而,将潜在变量推理框架用于奖励建模仍未得到充分探索。据我们所知,LatentRM是第一个在生成器-标量RM架构中将推理形式化为潜在变量的工作。

## 方法

### 问题陈述

我们考虑一个通用的奖励建模问题,其中输入 x 由提示 x_p 和 k 个候选响应 {x_r_i}_{i=1}^k 组成。为了通用性,我们令 k ≥ 1,并假设 k 可能因提示而异,这包含了典型的逐点和成对奖励建模设置作为特例。奖励模型然后为这些响应预测 k 个实值奖励 s = (s_1, s_2, ..., s_k) ∈ R^k。目标是训练一个奖励模型,使其由 s 引发的预测排名与人类对响应的偏好排名 y 对齐。

### 模型架构

在本文中,我们引入了用于奖励模型的生成器-判别器架构。具体来说,由 θ ∈ R^{d_θ} 参数化的生成器LLM在给定 x 时采样思维链推理 z ~ p_θ(z|x)。然后由 φ ∈ R^{d_φ} 参数化的判别器标量RM在给定 x 和 z 时输出奖励 s ∈ R^k。这种设计允许判别器利用推理中支持最终决策的充分证据,同时确保生成式RM所缺乏的灵活评分。虽然标量RM可能具有与生成器不同的架构,但我们简单地将标量RM初始化为生成器的副本,并将语言建模头替换为由 w ∈ R^h 随机参数化的标量头。为了在列表式排名 p_φ 上诱导分布,我们使用Plackett-Luce模型(Luce 1959 (https://arxiv.org/html/2607.29185#bib.bib18))。对于严格全序 y = (y_1 ≻ y_2 ≻ ... ≻ y_k),其似然定义为:

p_φ(y|x,z) = ∏_{i=1}^k \frac{exp(s_{y_i})}{∑_{j=i}^k exp(s_{y_j})}  (1)

当 k=2 时,该式退化为标准Bradley-Terry模型。当 y 中存在并列时,我们对与包含并列的弱序 y 一致的所有严格全序 π = (π_1 ≻ π_2 ≻ ... ≻ π_k) ∈ Ω(y) 的似然求和。

参见图注:图2:我们的列表式生成器的简化提示模板。完整模板见附录中的图6 (https://arxiv.org/html/2607.29185#A1.F6)。

为实现生成器-判别器推理流程,我们按图2 (https://arxiv.org/html/2607.29185#Sx3.F2)组织提示模板,将提示和候选响应包装为输入 x 以进行推理生成。推理轨迹遵循模板的格式要求,生成基于量规的逐项评估,然后以 x.x (i=1,2,...,k) 的格式为每个响应提供总体分数。我们然后将拼接后的输入和推理轨迹 (x,z) 输入标量RM,并提取紧接在生成的分数值之前的 k 个 token 位置(即 . 中的最后一个 token)处的最后一层隐藏状态。将这些隐藏状态按列堆叠得到 H = [h_1, ..., h_k] ∈ R^{h×k}。 (2)

然后我们应用共享标量头 w ∈ R^h 获得奖励 s = w^T H。

参见图注:图3:说明MultitaskRM(基线)和LatentRM之间差异的图模型。实线表示生成模型,虚线表示推理模型。圆圈是随机变量,方块是参数,其中阴影圆圈表示观测变量。

### 学习以潜在变量进行推理

生成器-判别器架构的一种直接方法是使用各组件自身的目标并行协同训练这两个组件。生成器广泛使用二元正确性奖励进行训练(Hong et al

相似文章