CSPF:一种面向不可验证偏好评估的约束共享-私有融合方法

arXiv cs.CL 论文

摘要

CSPF提出了一种约束共享-私有融合方法,用于整合多个奖励模型的表示进行不可验证偏好评估,性能优于基线方法。

arXiv:2607.20862v1 公告类型:新 摘要:目前,对不可验证任务的可靠评估仍然具有挑战性。现有方法往往难以充分捕捉此类任务中人类偏好背后的多样化评估标准。为此,我们提出了约束共享-私有融合(CSPF),一种将异构冻结奖励模型视为互补评估器,并在成对人类偏好监督下学习整合其隐藏状态表示的融合方法。CSPF将每个专家信号分解为共享表示和专家私有表示,在保留互补视角的同时促进跨专家对齐。在LM-Arena目标域适应和PPE分布外偏好评估的实验上,CSPF在主要指标上取得了优于所评估的单专家奖励模型、标量分数多专家和评分规则基线的最佳性能。总体而言,CSPF表明融合隐藏状态表示为偏好评估提供了更具表达性的基础,为不可验证偏好任务中的整合评估信号提供了一条实用路径。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:18

# CSPF:一种面向不可验证偏好评估的约束共享-私有融合方法
来源:https://arxiv.org/html/2607.20862
何浩章 王丹丽 王新远 高轩戈
中国科学院自动化研究所,北京 100190,中国
中国科学院大学人工智能学院,北京 100049,中国
zhanghehao2023@ia\.ac\.cn
danli\.wang@ia\.ac\.cn
wangxinyuan2024@ia\.ac\.cn
gaoxuange2022@ia\.ac\.cn

###### 摘要

当前,对不可验证任务的可靠评估仍然具有挑战性。现有方法往往难以充分捕捉人类在这些任务中偏好的多样化评估标准。为此,我们提出约束共享-私有融合(CSPF),一种融合方法,将异构的冻结奖励模型视为互补评估者,并在成对人类偏好监督下学习整合其隐藏状态表示。CSPF将每个专家信号分解为共享表示和专家私有表示,鼓励跨专家对齐,同时保留互补的视角。在LM-Arena目标域适应和PPE分布外偏好评估的实验上,CSPF在评估的单专家奖励模型、标量分数多专家和评分标准评判基线中,主要指标上取得了最佳性能。总体而言,CSPF表明,融合隐藏状态表示为偏好评估提供了更具表现力的基础,为不可验证偏好任务提供了整合评估信号的实际途径。

## 1 引言

预训练后,LLM通常通过后训练进一步适配以提升目标能力。强化学习是一种重要的后训练方法:它通过使用评估器(如奖励模型、验证器或检查器)评估生成的响应并指导优化来优化策略模型(Ouyang et al., 2022 (https://arxiv.org/html/2607.20862#bib.bib34))。这种对评估质量的依赖使得评估来源至关重要。在数学推理和代码生成等可验证领域,客观的正确答案或可执行测试使得评估相对直接,从而能够通过基于规则或基于测试的奖励进行强化学习,以提升数学推理和编码能力(Shao et al., 2024 (https://arxiv.org/html/2607.20862#bib.bib38); Gehring et al., 2024 (https://arxiv.org/html/2607.20862#bib.bib12))。相比之下,许多对齐相关任务是不可验证的:开放式对话、创意写作、主观问答和安全敏感指令遵循通常缺乏单一的客观标准,其质量取决于多标准的人类判断(Jia et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib18); Gunjan et al., 2026 (https://arxiv.org/html/2607.20862#bib.bib13))。因此,对此类任务的可靠评估困难但至关重要,因为后训练只能将LLM行为优化到评估器能够准确评估的目标。

现有工作为不可验证偏好任务开发了三大类评估器:基于偏好的奖励模型、基于评分标准的评估器和多评估器方法。基于偏好的奖励模型从人类比较、排序或评分中学习整体奖励函数,为LLM后训练提供可扩展的监督(Malik et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib32))。基于评分标准的评估器,通常作为LLM评判实现,使标准明确,并在自然语言评分标准下对响应进行评分或比较(Gunjan et al., 2026 (https://arxiv.org/html/2607.20862#bib.bib13))。多评估器方法选择、路由或聚合异构奖励模型,以利用评估器间的互补优势(Wu and Lu, 2026 (https://arxiv.org/html/2607.20862#bib.bib46); Wang et al., 2024b (https://arxiv.org/html/2607.20862#bib.bib42))。这些方法超越了直接的正确性检查,但在评估信息的表示方式上有所不同:整体偏好标签、显式自然语言标准或多个专家的最终标量分数。

尽管取得了进展,当偏好是复合的时,现有机制仍然有限。在基于偏好的奖励建模中,成对比较和标量奖励提供了可扩展的监督,但将多维质量判断压缩为整体标签。此类整体信号提供的细粒度信用分配有限,导致不清楚哪个标准驱动偏好、哪些片段有问题,或哪里需要修订(Wu et al., 2023 (https://arxiv.org/html/2607.20862#bib.bib45))。基于评分标准的评估器使标准明确,但自然语言评分标准可能不完整、重叠或与预期偏好方向不一致。其分数仍然依赖于评判模型对每个标准的解释,这可能导致与人类偏好的不一致(Shen et al., 2026 (https://arxiv.org/html/2607.20862#bib.bib39))。使用多个评估器的方法解决了异质性,但选择和路由将反馈缩减为选定的专家,可能遗漏应共同考虑的互补标准。标量聚合使用多个专家,但在最终分数上操作,其尺度和语义受不同数据源、目标和校准机制影响(Nguyen et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib33); Wu and Lu, 2026 (https://arxiv.org/html/2607.20862#bib.bib46); Wang et al., 2024b (https://arxiv.org/html/2607.20862#bib.bib42))。这些局限性推动开发评估机制,在语义对齐的表示空间中整合多维证据并建模标准间的交互,而不是仅依赖整体标签、依赖于评判者的评分标准分数或未校准的标量奖励。

为此,我们引入约束共享-私有融合(CSPF),一种用于评估LLM响应在不可验证偏好任务中的隐藏状态融合方法。CSPF将冻结的奖励模型视为互补的评估视角,并在成对人类偏好监督下学习融合其隐藏状态表示,而不是仅依赖最终标量分数。其约束共享-私有融合结构将跨专家共享表示与专家私有表示分离,鼓励共同偏好相关信号对齐,同时保留互补的专家视角。由于所有奖励专家主干保持冻结,适配仅限于融合模块内,这使得该方法模块化且易于扩展到新发布或领域专用的奖励模型。

我们的工作有三个主要贡献:
1. (1) CSPF作为不可验证偏好评估的方法。我们提出CSPF,一种隐藏表示级别的多奖励模型融合方法,通过隐式建模潜在评估因素间的交互来改善不可验证偏好评估。
2. (2) 超越标量分数的隐藏状态融合机制。我们比较了隐藏状态和标量分数融合方法,表明表示级融合实现了更强的性能,并支持对互补奖励专家的更多样本依赖使用。
3. (3) 融合设计因素的实验验证。我们分析了信号表示、专家池组成和融合结构,表明有效的多专家评估依赖于协调的设计选择,而不仅仅是添加更多专家或分数。

## 2 相关工作

### 2.1 基于偏好的奖励模型

基于偏好的奖励模型将人类比较、排序或评分转换为用于LLM后训练的标量评估器(Ouyang et al., 2022 (https://arxiv.org/html/2607.20862#bib.bib34))。近期开源模型展示了这一生态系统:Skywork-Reward-V2强调可扩展的偏好数据整理和通用奖励建模(Liu et al., 2025a (https://arxiv.org/html/2607.20862#bib.bib28)),OffsetBias提高了对评估偏见的鲁棒性(Park et al., 2024 (https://arxiv.org/html/2607.20862#bib.bib35)),ArmoRM在产生总体偏好分数前结合多个可解释奖励目标(Wang et al., 2024a (https://arxiv.org/html/2607.20862#bib.bib41))。诸如RewardBench、RewardBench 2和PPE等基准在指令遵循、推理、安全和人类偏好设置中评估奖励模型(Lambert et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib22); Malik et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib32); Frick et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib11))。尽管进展显著,整体偏好RM将多个质量维度压缩为单一分数,掩盖了每个判断背后的标准和权衡。因此,聚合偏好的改进可能掩盖特定维度的退化(Wu et al., 2023 (https://arxiv.org/html/2607.20862#bib.bib45))。

### 2.2 基于评分标准的LLM评估器

基于评分标准的LLM评估器通过提示或训练评判模型在自然语言评分标准下对响应进行评分、比较或批评,使标准显式化。代表性开源评估器包括Prometheus-2,支持使用用户定义标准进行直接评估和成对排序(Kim et al., 2024 (https://arxiv.org/html/2607.20862#bib.bib21)),以及R3,开发了具有推理分数分配的评分标准无关奖励模型(Anugraha et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib1))。基于评分标准的方法提供了可解释的接口,但其可靠性取决于评分标准覆盖率和评判模型对每个标准的解释;评分标准也可能不完整、冗余、重叠或与预期偏好方向不一致(Shen et al., 2026 (https://arxiv.org/html/2607.20862#bib.bib39))。这促使开发互补方法,整合多个评估视角,同时将评估基于人类偏好监督,而非依赖于评判者特定标准解释。

### 2.3 多专家奖励模型评估

越来越多的研究关注如何使用多个奖励模型,而不是依赖单一评估器。奖励模型选择和路由方法为每个实例在候选奖励模型中进行选择(Nguyen et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib33); Wu and Lu, 2026 (https://arxiv.org/html/2607.20862#bib.bib46)),而标量聚合方法整合专家分数,如奖励模型集成(Eisenstein et al., 2024 (https://arxiv.org/html/2607.20862#bib.bib7))和对数sigmoid中心奖励聚合(Wang et al., 2024b (https://arxiv.org/html/2607.20862#bib.bib42))。这些方法表明异构奖励模型可以提供互补信号,但选择、路由或标量分数聚合在标量压缩前建模跨专家交互的空间有限。

### 2.4 超越最终输出的隐藏表示

先前工作表明,神经模型在内部表示中编码了有用信息,这些信息可能未完全通过最终输出暴露。对Transformer表示的分析表明不同层捕获了不同语言和任务相关属性(Rogers et al., 2020 (https://arxiv.org/html/2607.20862#bib.bib37)),并且奖励模型工作使用隐藏状态正则化来改善分布偏移下的泛化(Yang et al., 2024 (https://arxiv.org/html/2607.20862#bib.bib47))。关于多模型协作的相关工作也表明,内部专家表示可以支持超越最终生成输出或标量决策的预测(Fein-Ashley et al., 2025 (https://arxiv.org/html/2607.20862#bib.bib9))。然而,如何对齐和融合多个冻结奖励专家的隐藏状态用于不可验证偏好评估仍有待探索。

## 3 方法

为解决现有工作的局限性,我们提出约束共享-私有融合(CSPF),一种隐藏状态融合方法,在成对人类偏好监督下从冻结奖励专家学习目标域奖励函数。如图1 (https://arxiv.org/html/2607.20862#S3.F1)所示,该方法由三个设计因素指定:信号表示、专家池和融合结构。我们将在下面详细说明这些因素和训练目标。

参见图注
图 1: 多奖励专家用于不可验证偏好建模的隐藏状态证据融合概述。该图抽象了我们研究中的三个设计因素:信号接口、专家池和融合结构。结构化融合模块由CSPF实例化。雷达图和专家池图为示意。

### 3.1 信号表示

令 \(x\) 表示提示,\(y\) 表示候选响应,\(E_k\),其中 \(k \in \{1,\ldots,K\}\),表示第 \(k\) 个冻结奖励专家。每个专家暴露一个标量奖励分数 \(s_k(x,y) \in \mathbb{R}\)。由于原始分数尺度在不同专家间可能不同,我们使用目标域训练统计量对 \(s_k(x,y)\) 进行归一化:

\[
\tilde{s}_k(x,y) = \frac{s_k(x,y) - \mu_k}{\max\{\sigma_k, \epsilon\}} \tag{1}
\]

其中 \(\mu_k\) 和 \(\sigma_k\) 在训练集上估计并固定,\(\epsilon > 0\) 为数值稳定性提供分母下界。归一化分数 \(\tilde{s}_k(x,y)\) 作为辅助校准信号保留。

每个专家还暴露最终标量输出前的隐藏表示。由于这些隐藏状态位于模型特定的表示空间中,且可能维度不同,我们将选定的隐藏状态读取 \(h_k(x,y) \in \mathbb{R}^{d_{k,h}}\) 映射到公共表示空间:

\[
z_k(x,y) = P_k\left( \mathrm{LN}_k(h_k(x,y)) \right) \in \mathbb{R}^{d} \tag{2}
\]

其中 \(\mathrm{LN}_k\) 和 \(P_k\) 是专家特定的归一化和投影层。投影表示 \(z_k(x,y)\) 是适配器和融合模块消耗的主要信号。附录 A.2 (https://arxiv.org/html/2607.20862#A1.SS2) 详述了隐藏状态提取协议;第5.3节 (https://arxiv.org/html/2607.20862#S5.SS3) 评估了替代层和跨度选择。

### 3.2 专家池

我们令 \(K\) 个预训练奖励专家的候选池为 \(\mathcal{E}\),每个配置的活动专家索引集为 \(C\):

\[
\mathcal{E} = \{E_k\}_{k=1}^K, \qquad C \subseteq \{1,\ldots,K\} \tag{3}
\]

只有 \(k \in C\) 的专家 \(E_k\) 贡献第3.1节 (https://arxiv.org/html/2607.20862#S3.SS1) 定义的归一化分数 \(\tilde{s}_k(x,y)\) 和投影隐藏表示 \(z_k(x,y)\) 用于融合。所有专家主干保持冻结;仅基于这些信号构建的模块被训练。集合 \(C\) 跨示例固定而非按实例选择;专家信号间的样本依赖交互由融合模块建模。专家被视为互补、可能重叠的评估视角,而不假设与人类定义标准的一一对应。具体专家模型和角色在第4.2节 (https://arxiv.org/html/2607.20862#S4.SS2) 和附录 A.1 (https://arxiv.org/html/2607.20862#A1.SS1) 中描述。

### 3.3 结构化融合:CSPF

参见图注
图 2: CSPF 的架构。左侧分支显示每个专家的信号路径;右侧分支说明来自活动专家池的隐藏表示的共享-私有融合。

相似文章

FSPO:少样本合成偏好优化实现面向真实用户的个性化

arXiv cs.CL

FSPO提出了一种用于大语言模型个性化的少样本偏好优化算法,该算法将奖励建模重新定义为元学习,使模型能够从有限的用户偏好中快速推断出个性化的奖励函数。该方法通过精心构建合成偏好数据集,在合成用户上实现了87%的个性化性能,在真实用户上实现了70%的个性化性能。

隐藏的共识:人类反馈中的偏好有效性压缩

arXiv cs.CL

本文认为,标准RLHF将人类偏好标量化的做法导致多个有效解释被压缩为单一目标,从而在文化多元的社会中错误衡量对齐。通过对马来西亚数据集的分析,研究发现79%的提示词存在多个多数支持的回答,而这些回答在单一胜者聚合中被丢弃。

奖励模型的可引导文化偏好优化

arXiv cs.CL

介绍了SCPO,一种新颖的奖励模型训练算法,它以平衡的方式整合了多样化的文化偏好,在基线之上取得了高达7个百分点的改进和280%的数据效率提升。

CSPO:面向安全强化学习的约束敏感策略优化

arXiv cs.AI

本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。