RLCD是什么?Jev背后的秘密
摘要
RLCD被解释为一种基于模式的Plackett–Luce目标函数,它推进了奖励建模从标量奖励到成对偏好再到多路校准决策,简化了对Jev的理解。
暂无内容
查看缓存全文
缓存时间: 2026/09/24 16:10
# 什么是 RLCD?Jev 背后的秘密
来源:https://di-zhang-llm.github.io/blog/what-is-rlcd-the-secret-behind-jev/
*从成对奖励建模到校准的多方决策*
当将 Jev 视为语言模型的替代方案时,它显得神秘莫测。但将其视为奖励建模的下一步,就会变得简单得多。
核心思想是:
\\[ \text{RLCD} = \text{多方偏好建模} + \text{概率校准} \\]
更具体地说,RLCD 是一种基于方案的 Plackett–Luce 目标函数。Jev 通过添加类型化输出和并行推理,将该目标函数变成了产品。
这就是秘密所在:奖励模型不再隐藏在生成器之后。奖励模型本身成为了模型。
图示展示了标量奖励如何演变为成对偏好、多方选择,最终通过 Jev API 提供经过校准的决策。图1:学习对象在每一步都发生变化:标量奖励变为偏好,偏好变为多方分布,校准将该分布转化为决策接口。## 奖励建模始于标量
传统的奖励模型接收上下文 \(x\) 和一个候选答案 \(a\),然后产生一个标量:
\\[ r_\theta(x,a)\in\mathbb{R} \\]
结果奖励模型对最终答案打分。过程奖励模型对各个推理步骤打分。在这两种情况下,学习到的对象都是一个看似绝对的数字。
问题在于这个数字实际上并非绝对。
在不同问题、候选集、检查点或模型族之间,\(0.8\) 的奖励没有稳定的含义。它主要用于比较在相似条件下生成的候选:
\\[ r_\theta(x,a_1) > r_\theta(x,a_2) \\]
操作信号始终是相对偏好。标量只是将其隐藏了。
## PPRM 使偏好显式化
LLaMA‑Berry 的成对偏好奖励模型(PPRM)直接展示了这种比较。
给定一个问题 \(x\) 和两个解决方案 \(a_1\) 和 \(a_2\),PPRM 回答:
> 第一个答案是否优于第二个答案?
其概率形式为:
\\[ P(a_1 \succ a_2\mid x) = \frac{\exp u_\theta(x,a_1)} {\exp u_\theta(x,a_1)+\exp u_\theta(x,a_2)} \\]
等价于:
\\[ P(a_1 \succ a_2\mid x) = \sigma\left( u_\theta(x,a_1)-u_\theta(x,a_2) \right) \\]
这就是 Bradley–Terry 模型。
LLaMA‑Berry 将比较实现为对 `Yes` 和 `No` 标记的受限语言模型决策。它在近 780 万数学解答对上训练评估器,并使用 DPO 改进成对预测任务。本质上的改变在于概念层面:奖励建模变成了偏好概率建模。参见 LLaMA‑Berry 论文 (https://aclanthology.org/2025.naacl-long.375.pdf)。
PPRM 仍然包含一个潜在的标量效用 \(u_\theta(x,a)\),但该效用不再作为绝对奖励呈现。它通过归一化比较变得有意义。
LLaMA‑Berry 随后在 MCTS 内部使用增强 Borda 计数法来聚合成对比较。那是下游的搜索机制。EBC 既未定义 PPRM 的偏好损失,也未提供从 PPRM 到 RLCD 的桥梁。
相关的谱系很简单:
\\[ \text{标量奖励} \rightarrow \text{成对偏好} \rightarrow \text{多方偏好} \rightarrow \text{校准决策} \\]
## Plackett–Luce 是多方的 PPRM
PPRM 比较两个候选。一个真正的决策接口通常接收多于两个。
令候选集为:
\\[ A=\{a_1,a_2,\dots,a_K\} \\]
为每个候选分配一个依赖于上下文的效用:
\\[ u_i=u_\theta(x,a_i) \\]
然后将所有候选一起归一化:
\\[ P(a_i\mid x,A) = \frac{\exp u_i} {\sum_{j=1}^{K}\exp u_j} \\]
这是 Luce 选择模型,也称为多项式逻辑。它是 Plackett‑Luce 家族的“第一选择”形式。
当 \(K=2\) 时,它恰好简化为 Bradley–Terry:
\\[ P(a_1\mid x,\{a_1,a_2\}) = \frac{\exp u_1}{\exp u_1+\exp u_2} \\]
因此,PPRM 是同一选择几何中的二元情况。
如果监督信息包含一个完整排序
\\[ a_{\pi_1}\succ a_{\pi_2}\succ\dots\succ a_{\pi_K}, \\]
完整的 Plackett‑Luce 似然函数会重复选择下一个最佳剩余候选:
\\[ P(\pi\mid x) = \prod_{t=1}^{K} \frac{\exp u_{\pi_t}} {\sum_{j=t}^{K}\exp u_{\pi_j}} \\]
相应的损失函数是:
\\[ \mathcal{L}_{\mathrm{PL}} = -\sum_{t=1}^{K} \log \frac{\exp u_{\pi_t}} {\sum_{j=t}^{K}\exp u_{\pi_j}} \\]
当标签仅指定一个正确选择 \(y\) 时,损失变为:
\\[ \mathcal{L}_{\mathrm{choice}} = -\log \frac{\exp u_y} {\sum_j\exp u_j} \\]
这是 Plackett‑Luce 似然的第一阶段:PPRM 的多方扩展。
这是 RLCD 的数学核心。
图示对比了 Bradley–Terry 成对偏好与 Luce 多方选择,它们共享相同的潜在效用归一化。图2:Bradley–Terry 和 PPRM 是同一 Luce 选择几何的两个候选情况。Plackett‑Luce 将这种归一化从一次选择扩展到完整或部分排序。## RLCD 增加了校准
Plackett‑Luce 给出了一个概率分布,但归一化不等于校准。
一个 softmax 向量的和总是1。这并不意味着报告为 \(0.8\) 的预测有 80% 的时间是正确的。
校准赋予其经验意义:
\\[ P(Y=\hat{Y}\mid \hat{P}=p)\approx p \\]
在分配了概率 \(0.8\) 的所有预测中,大约 80% 应该是正确的。这也是 TypeSafe 为 RLCD 提供的契约:Jev 返回决策和概率,报告的概率越高,对应的观测准确率应越高。参见 TypeSafe 的 RLCD 入门指南 (https://docs.typesafe.ai/introduction/machine-learning-primer)。
一个最小化实现使用合适的评分规则,如对数损失:
\\[ \mathcal{L}_{\mathrm{NLL}}=-\log p_y \\]
### Brier 校准:信心有了代价
Brier 分数使校准目标具体化。对于一个二元 `Noul` 决策,令 \(p=P(Y=1\mid x)\) 且 \(y\in\{0,1\}\)。该分数为:
\\[ \operatorname{BS}(p,y)=(p-y)^2 \\]
如果模型报告 \(p=0.8\),当事件发生时,它获得 \(0.04\) 的分数;当事件不发生时,获得 \(0.64\)。错误的信心预测的代价是正确信心预测的十六倍。
这就是为什么 Brier 分数适用于决策模型。它是一个严格恰当的评分规则:在期望上,模型通过报告真实条件概率而不是操纵阈值来最小化该分数。该分数由 Glenn Brier (https://journals.ametsoc.org/view/journals/mwre/78/1/1520-0493_1950_078_0001_vofeit_2_0_co_2.xml) 引入用于概率预测;其作为恰当评分规则的作用由 Gneiting 和 Raftery (https://doi.org/10.1198/016214506000001437) 发展。
对于多方 `Choice`,该分数扩展到完整的概率向量。使用使两类情况匹配二元公式的归一化:
\\[ \operatorname{BS}(\mathbf{p},y) = \frac{1}{2} \sum_{i=1}^{K} \left(p_i-\mathbb{1}[i=y]\right)^2 \\]
这很重要,因为 top-1 准确率忽略了概率质量。两个模型可能选择相同的动作,但报告的概率分别为 \(0.55\) 和 \(0.99\)。一旦结果出现,Brier 分数会告诉我们那份额外的信心是否值得。
对于二元结果,Murphy 分解 (https://doi.org/10.1175/1520-0450%281973%29012%3C0595%3AANVPOT%3E2.0.CO%3B2) 将平均分数分为三项:
\\[ \operatorname{BS} = \operatorname{REL} - \operatorname{RES} + \operatorname{UNC} \\]
- 可靠性 \(\operatorname{REL}\) 衡量报告概率与观测频率之间的差距。越低越好。
- 区分度 \(\operatorname{RES}\) 衡量模型是否能区分具有不同结果率的情况。越高越好。
- 不确定性 \(\operatorname{UNC}\) 是评估集的基准难度。当在相同数据上比较模型时,它是固定的。
因此,更低的 Brier 分数可能来自更好的校准、对易难案例更好的区分,或两者兼有。一个恒定的基准预测器可能校准良好但区分度为零;Brier 暴露了这一弱点。
图示展示了正确和错误的0.8预测的 Brier 惩罚、可靠性-区分度-不确定性分解,以及从记录结果到执行策略的 RLCD 校准循环。图3:Brier 分数为信心定价,分解预测质量,并闭合从观测结果到操作决策策略的循环。RLCD 实现可以在训练期间将 Brier 分数应用于决策概率,并将其再次用作事后校准的留出目标。通过温度缩放,可以直接在验证结果上选择校准参数:
\\[ T^* = \arg\min_{T>0} \sum_{n=1}^{N} \operatorname{BS}\!\left(\mathbf{p}^{(T)}(x_n),y_n\right) \\]
然后温度缩放调整分布的尖锐度:
\\[ p_i = \frac{\exp(u_i/T)} {\sum_j\exp(u_j/T)} \\]
这里 \(T\) 控制概率的集中程度,而不改变其顺序。Brier 是目标;温度缩放是校准器。一个衡量概率质量,另一个改变分布。
这分离了普通奖励建模常常混淆的两个目标:
- 排名询问最佳候选是否排在第一。
- 校准询问模型是否知道该决策正确的频率。
自动化需要两者。排名选择一个动作;校准决定软件是执行、推迟还是上报该动作。
有用的抽象是:
\\[ \text{RLCD} = \text{Plackett–Luce 偏好损失} + \text{校准约束} \\]
概念性可靠性图之后是一个决策策略,它根据校准后的信心收集上下文、上报或执行。图4:校准赋予信心以经验意义,允许特定于应用的策略决定何时收集上下文、上报或执行。可靠性曲线是概念性的,并非 Jev 基准。## Jev 将奖励模型变成了产品
在传统的 RLHF 架构中,奖励模型是一个内部组件:
\\[ \text{提示} \rightarrow \text{生成器} \rightarrow \text{候选响应} \rightarrow \text{奖励模型} \\]
用户与生成器交互。奖励模型仅用于训练或评估它。
Jev 反转了这种架构:
\\[ \text{状态} + \text{候选方案} \rightarrow \text{校准的决策分布} \\]
无需生成解释并将其解析回动作。评估器本身成为运行时接口。
Jev 暴露了三个原语:
Jev 原语偏好模型解释`Noul`真与假之间的二元 Bradley–Terry 决策`Choice`对 \(K\) 个无序选项的 Luce 分布`Score`对有序级别集合的分布一个 `Choice` 返回选定的选项、完整的概率分布和一个置信度值。一个 `Score` 返回用户定义级别沿上的位置以及这些级别上的分布。一个 `Noul` 返回命题为真的概率。参见 Jev 的原语文档 (https://docs.typesafe.ai/primitives)。
这三个不是无关的能力。它们是同一个底层对象的三种方案:
\\[ P(\text{类型化结果} \mid \text{状态},\text{问题},\text{候选集}) \\]
因此,Jev 是一个从“哪个答案更好?”推广到“程序应该选择哪个类型化结果?”的奖励模型。
架构对比展示了传统 RLHF 奖励模型位于文本生成器之后,而 Jev 直接将评估器作为类型化的 Noul、Choice 和 Score 输出提供服务。图5:传统架构将奖励模型放在生成器之后。Jev 直接提供评估器服务:状态和方案输入,类型化概率分布输出。## 决策头产生效用
Plackett‑Luce 方程使效用 \(u_\theta(x,a_i)\) 保持抽象。决策头是计算它的组件。
在 Jevre (https://github.com/trotsky1997/jevre) 中,编码器处理状态、问题以及树注意力掩码下的每个候选。模型对三个片段的归一化隐藏状态进行平均池化:
\\[ \bar{h}_S, \qquad \bar{h}_{Q_f}, \qquad \bar{h}_{C_{f,i}} \\]
对于问题 \(f\),状态和问题形成一个查询。每个候选形成一个键:
\\[ q_f = W_q\bar{h}_S + W_q\bar{h}_{Q_f}, \qquad k_{f,i} = W_k\bar{h}_{C_{f,i}} \\]
候选效用是它们的缩放点积:
\\[ u_{f,i} = \frac{q_f^\top k_{f,i}}{\sqrt{r}} \\]
发布的模型使用 \(r=512\)。这个秩是学到的交互空间的维度;编码器和决策头是一起训练的。对同一问题的候选进行 softmax,将效用转换为 RLCD 分布:
\\[ p_{f,i} = \frac{\exp u_{f,i}} {\sum_j \exp u_{f,j}} \\]
决策头架构展示了池化后的状态和问题表示形成查询,候选表示形成键,秩-512 兼容性产生效用,并通过 Plackett–Luce 归一化的 softmax 返回类型化概率。图6:决策头是一个共享的兼容性函数:状态和问题形成查询,每个运行时候选形成键,它们的秩-512 交互产生由 Plackett–Luce 归一化的效用。这个头对上下文表示而非词汇标签打分。候选名称和描述在运行时作为文本传入,因此相同的参数可以在不添加特定类别输出层的情况下对新方案打分。`Noul`、`Choice` 和 `Score` 都使用这些 logits;方案解码器决定如何返回结果分布。
图像通过状态片段进入并改变 \(\bar{h}_S\),而决策头保持不变。因此,相同的效用函数涵盖了文本和多模态决策。完整实现可以在评分器模型 (https://github.com/trotsky1997/jevre/blob/master/jevre/modeling.py) 和发布的 Jevre 检查点 (https://huggingface.co/di-zhang-fdu/jevre) 中看到。
决策头是表示学习与 RLCD 之间的桥梁:编码器构建状态感知、问题感知和候选感知的表示;头将其兼容性转化为效用;Plackett‑Luce 和 Brier 训练将这些效用塑造为校准的决策。
## 为什么 Jev 能够并行运行
剥去品牌包装:Jev 的**并行采样器是序列打包加注意力掩码**,后面跟着一个共享决策头和类型化解码。这是实现速度声称背后的服务技巧。
自回归语言模型将答案表示为标记序列:
\\[ P(y\mid x) = \prod_{t=1}^{T} P(y_t\mid x,y_{<t}) \\]
每个标记都依赖于前面的标记。延迟随输出长度增长。
决策模型已经知道其输出空间。它只需要估计效用并归一化它们:
\\[ x,A \rightarrow (u_1,\dots,u_K) \rightarrow (p_1,\dots,p_K) \\]
无需解码任何句子。
现在将共享状态、问题和候选分支打包成一个序列:
\\[ Z = [S;Q_1;C_{1,1};\dots;C_{1,K_1};Q_2;C_{
相似文章
为Jev制作了使用RLCD的通用开源模型,并且它超越了所有Jev基准测试。HF空间、基准测试、模型、仓库
本文宣布了Laya的发布,这是一个使用RLCD训练的开源4.21亿参数非自回归决策模型,它超越了Jev基准测试,并可在Hugging Face上进行测试。
直接询问Jev:基于校准决策的强化学习作为AI对齐故障的零样本检测器
本文介绍了RLCDAlignBench,一个用于评估Jev的基准测试。Jev是一个通过强化学习训练的校准决策模型,作为零样本检测器,针对十种AI对齐故障,具有高性能和成本效率。
@NFT_Chen: 太棒了!立即通过本地化决策引擎将任何LLM转换为Jev模型!LLM2Jev带来Jev的统一Ch…
LLM2Jev是一个开源工具,它将本地HuggingFace模型适配为使用Choice、Score和Noul框架执行结构化决策,提供仅预填充推理,并与Transformers和SGLang集成。
Jev 不是 LLM 杀手,也不仅仅是一个分类器。我们将其部署于生产环境并与真实用户一起使用。以下是我们学到的经验。
文章分享了使用 Jev(一个语义决策引擎)的生产见解,它通过与 LLMs 并行高效处理常规决策来增强 AI 代理系统,而不替代生成模型。
@paarangatrai: 这是理解Jev的最简单方式:大语言模型生成答案。Jev做出决策。这听起来像是一个小小的区别……
这篇文章介绍了Jev,一个旨在做出决策而非生成答案的AI模型,使用结构化输出用于欺诈检测和风险评估等应用,将其定位为大型推理模型的路由层。