SERPO:面向开放式测试时强化学习的自演化评分策略优化

arXiv cs.CL 论文

摘要

SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。

arXiv:2607.26873v1 公告类型:新 摘要:测试时强化学习(TTRL)使语言模型在推理时无需标注反馈即可自我进化。现有方法依赖答案投票,因此无法自然地扩展到开放式生成场景,在该场景中,有效响应无法映射到共享的标准答案。在没有外部奖励模型或更强的评判者的情况下,适应必须从模型自身的输出中构建可靠的奖励。我们提出了 SERPO(自演化评分策略优化),它用闭环取代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数。好-正常-差(G-N-B)响应进化将最大分离的 rollout 组织成有序档案;评分标准进化保留区分这些档案的标准;概率标准评分将判决标记可能性转换为奖励信号;策略进化使用得到的信号优化演员。新的演员 rollout 随后刷新档案和评分标准,形成三方进化闭环。在两种模型配置、两个领域内基准和四个领域外基准上,SERPO 在 HealthBench 和 ResearchQA 上相比相应基础模型分别提升了最多 20.63 和 20.31 个百分点,将六个基准的宏观平均值提高了最多 8.06 个百分点,并支持领域外迁移和持续的跨基准进化。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 自演化评分策略优化,用于开放式测试时强化学习
来源: https://arxiv.org/html/2607.26873
Jianze Wang¹,³,\*,\‡\ddagger, Kunwang Zheng²,³,\*,\‡\ddagger, Ying Liu³, Yu Cao³, Qilong Zhang³, Jinlong Chen³, Hua Yang³, Qianglong Chen³,\†\dagger

###### 摘要

测试时强化学习 (TTRL) 使语言模型能够在推理时无需标注反馈即可自我演化。现有方法依赖于答案投票,因此无法自然扩展到开放式生成场景,因为开放式生成中有效的回答无法映射到共享的规范答案。在缺乏外部奖励模型或更强评判器的情况下,适应过程必须从模型自身的输出中构建可靠的奖励。我们提出 SERPO (Self-Evolving Rubric Policy Optimization),它用闭环替代了答案投票,该闭环协同演化响应证据、查询特定的评分准则和策略参数。良好–正常–差 (G-N-B) 响应演化将最大化分离的展开结果组织成有序档案;评分准则演化保留能够区分这些档案的标准;概率性标准评分将裁决词符似然转换为奖励信号;策略演化则利用生成的信号优化演员模型。新的演员展开结果随后刷新档案和评分准则,形成三者协同演化的闭环。在两种模型配置、两个域内基准和四个域外基准上,SERPO 在 HealthBench 和 ResearchQA 上分别比对应基座模型提升了高达 20.63 和 20.31 个百分点,将六个基准的宏平均提升了最多 8.06 个百分点,并支持域外迁移和持续的跨基准演化。

¹ 脚注: 同等贡献。
² 脚注: 通讯作者。
³ 脚注: 工作完成于阿里巴巴集团研究实习期间。

## 1 引言

测试时强化学习 (TTRL) 使得已部署的语言模型能够通过在推理时构建的奖励,在测试分布上进行自我演化。我们研究一种转导设置下的开放式生成:模型可以使用原始测试提示及其自身采样的响应,但不接收参考答案、人类反馈、外部奖励模型或更强的评判器。它反复采样响应、构建奖励,并在相同的提示集上更新其参数。因此,TTRL 依赖于一个在策略演化过程中始终信息丰富的奖励信号。

现有的 TTRL 方法通过采样多个解决方案、通过多数投票或自一致性风格聚合选择一个伪标签,并奖励与该伪标签一致的响应来构建奖励 (Wang et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib37); Zuo et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib46))。后续工作通过自我反思、基于熵的置信度或明确缓解多数投票失败来提高伪标签的可靠性 (Wu et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib39); Agarwal et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib1); Lin et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib18))。这些方法仍然假设响应可以简化为可比较的答案。该假设适用于多项选择、符号和规范归一化任务,但对于开放式生成则失效。两个医学响应可能推荐相同的操作,但在禁忌症、不确定性和升级指导上有所不同;同样安全的答案也可能使用不同的措辞或详细程度。因此,答案投票可能奖励共同的遗漏并拒绝有效的替代方案。当前的 TTRL 目标仍然集中在具有可提取答案的任务上,并未为开放式响应提供可靠的投票目标。

参见图注 图 1: 用于开放式 TTRL 的标准级别证据。声明共识可以保留频繁但不完整的建议,而 SERPO 则使用不断演化的查询特定标准(无需参考答案)形成 G-N-B 证据。评分准则奖励为开放式任务提供了一种自然的替代方案,因为它们评分独立的要求,如事实性、完整性、指令遵循性和安全性 (Liu et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib20); Kim et al. 2024 (https://arxiv.org/html/2607.26873#bib.bib12); Ye et al. 2024 (https://arxiv.org/html/2607.26873#bib.bib43); Liu et al. 2024 (https://arxiv.org/html/2607.26873#bib.bib19); Gunjal et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib8))。现有方法使用基准评分准则、在冻结模型上调节评分准则反馈,或通过结果监督、对抗性更新、时间对比、元验证或响应集调节来共同训练策略与评分准则生成器或评估器 (Rezaei et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib30); Shao et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib32); Sheng et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib34); Ding et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib5); Li et al. 2026b (https://arxiv.org/html/2607.26873#bib.bib16); Guan et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib7); Wang et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib36))。其他自我演化方法从预训练文本和源文档生成任务、提示或课程变体 (Huang et al. 2026a (https://arxiv.org/html/2607.26873#bib.bib9); Kwan et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib13); Huang et al. 2026b (https://arxiv.org/html/2607.26873#bib.bib10); Yang et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib41))。这些方法在更广泛的后训练预算下运行。而固定集的 TTRL 则必须从原始提示和自我生成的响应中构建奖励,没有外部数据、官方评分准则、更强的评判器或任务生成。这需要一个保留分级置信度的评判器和一个随策略变化而演化的查询特定评分准则。

我们通过 SERPO 解决这个问题,它协同演化查询局部的 G-N-B 响应档案、查询特定的评分准则和共享的演员参数。图 1 (https://arxiv.org/html/2607.26873#S1.F1) 对比了这种标准验证循环与答案投票。对于每个提示,SERPO 存储一个有序的 G-N-B 响应档案,并从这些响应之间的对比中推导出原子标准。据我们所知,SERPO 是首个将后推理布尔裁决概率与演化的、查询特定的评分准则相结合以进行策略优化的方法;并发的 LLM-as-a-Verifier 独立研究了一个相关的固定标准接口 (Kwok et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib14))。SERPO 保留具有响应级方差和有序 G-N-B 分离的标准,合并重复项,并移除持续较弱的标准。生成的评分准则为演员更新提供组相对奖励。新的演员响应随后刷新档案和评分准则,形成响应–评分准则–策略循环。

在两种模型配置、两个域内基准和四个域外基准上,SERPO 在 HealthBench 和 ResearchQA 上分别提升了最多 20.63 和 20.31 个百分点,并将六个基准的宏平均提高了最多 8.06 个百分点。演化的策略还能迁移到未见过的基准,并在连续的跨基准演化下持续改进。

主要贡献。

- 我们形式化了在固定、无标签信息预算下的开放式生成 TTRL,并引入了基于评判器的响应投票和一个更强的声明共识目标。
- 我们引入了 SERPO,一个闭环框架,协同演化滚动的 G-N-B 响应档案、查询特定的评分准则和共享的演员参数。
- 我们为演化的评分准则引入了一个概率奖励接口,聚合从后推理通过/失败分布推导出的标准满足概率。
- 在两种模型配置和六个基准上的实验确立了强大的域内增益、域外迁移和持续的跨基准演化。

## 2 相关工作

##### 测试时强化学习。

TTRL 通过采样解决方案并使用多数答案作为伪标签(遵循自一致性聚合)将未标记的测试提示转化为在线强化学习数据 (Wang et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib37); Zuo et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib46))。自我反思、熵最小化和灭绝窗口缓解改进了伪标签选择或置信度 (Wu et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib39); Agarwal et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib1); Lin et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib18)),但仍然需要答案提取和任务特定的等价性。SERPO 则通过查询特定的标准验证构建奖励,这在开放响应没有规范答案时适用。

##### 评分准则奖励与策略–评分准则协同演化。

评分准则将开放标准转化为用于自我蒸馏或策略训练的奖励 (Gunjal et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib8); Li et al. 2026a (https://arxiv.org/html/2607.26873#bib.bib15); Whitehouse et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib38); Chen et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib4); Xie et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib40); Rezaei et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib30); Fang et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib6))。RLCER 围绕以结果为中心的 RLVR 演化 CoT 评分准则;EvoRubrics 对抗性地训练评分准则生成器;EvoLM 使用时间检查点对比交替进行评分准则和策略训练;EvoRubric 通过元验证和评分准则记忆共享一个跨角色的策略;DynamicRubric 共同训练一个响应集条件评估器 (Sheng et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib34); Ding et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib5); Li et al. 2026b (https://arxiv.org/html/2607.26873#bib.bib16); Guan et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib7); Wang et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib36))。这些框架在更广泛的后训练预算下运行,可以包括结果监督、精心设计的评分准则、更强的评判器,或可训练的评分准则和评估器模块;相关系统还进一步使用外部语料库或生成的任务 (Huang et al. 2026a (https://arxiv.org/html/2607.26873#bib.bib9); Kwan et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib13); Huang et al. 2026b (https://arxiv.org/html/2607.26873#bib.bib10))。SERPO 则保持所有评估器角色冻结,仅从固定提示和自我生成的响应中学习。词符分布提供连续的评估或验证信号 (Liu et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib20); Kwok et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib14));SERPO 将它们耦合到滚动的 G-N-B 证据上,该证据随着策略改进而演化查询局部的标准。

##### 上下文自我演化。

其他方法通过测试时采样或搜索 (Wang et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib37); Yao et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib42); Bay and Yearick 2026 (https://arxiv.org/html/2607.26873#bib.bib3))、迭代自我反馈 (Madaan et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib22); Shinn et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib35)) 或累积的外部状态来改进冻结模型。ACE 存储可重用上下文,RGSD 提供教师评分准则,ARBOR 维护评分准则缓冲区,TTCS 创建课程变体,递归代理跨轮次选择改进的配置 (Zhang et al. 2025b (https://arxiv.org/html/2607.26873#bib.bib45); Rezaei et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib30); Liu et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib21); Yang et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib41); Nguyen, Nguyen, and Vuong 2026 (https://arxiv.org/html/2607.26873#bib.bib24))。它们的进展主要驻留在上下文、记忆或外部评分准则池中,并可能依赖于辅助任务构建。SERPO 保留演化的响应和评分准则状态,但将其反馈转化为固定测试集上的持久演员更新。

## 3 预备知识

### 测试时强化学习

我们考虑固定集转导 TTRL。让 \\(\\mathcal{D}\_{\\mathrm{adapt}}=\\{x_n\\}_{n=1}^N\\) 表示适应前观测到的未标记测试提示。在适应期间,方法只能使用这些提示、其采样的响应以及派生统计量;它不接收任何参考、外部任务奖励、人类或外部评估者反馈、辅助语料库或评分者引导的提示选择。辅助模型只能在冻结的、评估盲的方式下被查询:它们在适应期间不更新,且不能访问评估资源。适应后,一个隐藏的评分者在 \\(\\mathcal{D}\_{\\mathrm{adapt}}\\) 上评估新的响应仅用于报告,而一个不相交的 \\(\\mathcal{D}\_{\\mathrm{eval}}\\) 衡量保留的迁移。

在全局适应步骤 \\(t\\),策略处理一个迷你批 \\(\\mathcal{X}_t \\subset \\mathcal{D}\_{\\mathrm{adapt}}\\)。对于每个提示 \\(x \\in \\mathcal{X}_t\\),当前策略 \\(\\pi_{\\theta_t}\\) 采样一组 \\(G\\) 个响应,

\\[ \\mathcal{O}_t(x) = \\{ o_{t,i} \\}_{i=1}^G, \\quad o_{t,i} \\sim \\pi_{\\theta_t}(\\cdot \\mid x). \\]

这里 \\(\\mathcal{O}_t(x)\\) 是采样的展开结果组,\\(o_{t,i}\\) 是其第 \\(i\\) 个响应。由于真实质量 \\(r^{\\star}(x,o)\\) 不可用,该方法优化一个从允许信息构建的伪奖励 \\(\\hat{r}_t(x,o)\\):

\\[ \\max_{\\theta} \\ \\mathbb{E}_{x \\sim \\mathcal{D}\_{\\mathrm{adapt}}, \\, o \\sim \\pi_{\\theta}(\\cdot \\mid x)} \\left[ \\hat{r}_t(x,o) \\right]. \\tag{1} \\]

奖励规则可以在更新之间使用累积的测试时证据进行刷新,但在每次演员更新内部是固定的。

答案级 TTRL 通过将每个响应映射到一个可比较的答案来实例化 \\(\\hat{r}_t\\)。让 \\(\\mathrm{Ext}\\) 是一个答案提取器,\\(\\mathrm{Sel}\\) 是一个伪标签选择器,例如对提取的答案进行多数投票 (Wang et al. 2023 (https://arxiv.org/html/2607.26873#bib.bib37); Zuo et al. 2025 (https://arxiv.org/html/2607.26873#bib.bib46); Wu et al. 2026 (https://arxiv.org/html/2607.26873#bib.bib39))。给定 \\(a_i = \\mathrm{Ext}(o_{t,i})\\),它选择 \\(\\hat{a} = \\mathrm{Sel}(\\{a_i\\}_{i=1}^G)\\) 并诱导

\\[ \\hat{r}_{\\mathrm{ans}}(x, o_{t,i}) := \\mathbb{I}\\!\\left[ \\mathrm{Ext}(o_{t,i}) \\equiv \\hat{a} \\right], \\tag{2} \\]

其中 \\(\\equiv\\) 是任务特定的等价性。这对于分类或归一化答案定义良好,但开方式响应可能共享一个粗粒度答案,同时在事实性、完整性或安全性上有所不同。我们保留等式 (1) (https://arxiv.org/html/2607.26873#S3.E1),同时用标准验证替换答案一致性。

### 开放式响应的评分准则标准

一个评分准则将开放式质量分解为原子自然语言标准。我们写作 \\(\\mathcal{R} = \\{ (c_m, \\rho_m, w_m) \\}_{m=1}^M\\),其中 \\(c_m\\) 是一个标准,\\(\\rho_m \\in \\{+1,-1\\}\\) 是其极性,\\(w_m \\geq 0\\) 是其权重。一个评判器为响应 \\(o\\) 和标准 \\(c_m\\) 提供一个标准满足概率 \\(q_J(x, o, c_m) \\in [0,1]\\);正向标准奖励期望的属性,而负向

相似文章

RubricEM:基于量规引导策略分解,超越可验证奖励的元强化学习

Hugging Face Daily Papers

本文介绍了 RubricEM,这是一个强化学习框架,它利用量规引导的策略分解和基于反思的元策略进化,为长篇任务训练深度研究智能体。所得到的 RubricEM-8B 模型通过利用阶段感知规划和更密集的语义反馈,在长篇研究基准测试中表现出强劲的性能。

评分标准作为开放式生成中的特权信息

arXiv cs.LG

本文介绍了评分标准作为特权信息(RuPI),通过以评分标准作为软特权信息来条件化教师模型,将同策略自蒸馏扩展到开放式生成。该方法在多个大语言模型和HealthBench等基准上优于评分标准即奖励的强化学习和参考补全蒸馏。

CEPO:基于对比证据策略优化的RLVR自我蒸馏

Hugging Face Daily Papers

CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。

SocraticPO:通过交互式指导的策略优化

arXiv cs.LG

SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。