ARES:可扩展LLM强化学习的自动评估标准合成
摘要
ARES提出了一种框架,能够从预训练文档中自动构建基于评估标准的强化学习数据,生成问答对和加权评估标准,从而为开放式的LLM回答提供实例级别的奖励监督,在多维开放式任务上优于现有方法。
arXiv:2605.23454v1 公告类型:新
摘要:基于评估标准的奖励为将强化学习(RL)扩展到大型语言模型提供了一种有前景的方式,使其超越那些具有自动可验证答案的任务。然而,规模化应用基于评估标准的RL仍然具有挑战性:现有方法往往依赖专家编写的评估标准和手动构建的问题集,而固定的任务级评估标准可能无法捕捉到单个问题的评估需求。我们提出了ARES(面向可扩展RL的自动评估标准合成),一种大规模自动构建基于评估标准的RL数据的框架。从原始预训练文档开始,ARES将源知识转化为自包含的问答对,并共同生成针对特定问题的加权评估标准,从而为开放式回答提供实例级别的奖励监督。为了提高多样性和质量,ARES基于领域标签和角色信息进行条件生成,并应用验证过滤器来确保问题的自包含性、答案的忠实性和评估标准的有效性。利用ARES,我们在十个领域构建了10万个带有评估标准注释的实例。在七个基准上的实验表明,使用ARES训练的基于评估标准的RL优于持续预训练、监督微调和二元奖励RL,在医疗和指令遵循等多维开放式任务上取得了最大的提升。
查看缓存全文
缓存时间: 2026/05/25 09:02
# ARES:面向可扩展大语言模型强化学习的自动化评分标准合成
来源:https://arxiv.org/html/2605.23454
李晓远¹⁽¹⁾ 鲍柯钦²⁽¹⁾ 李墨欣³ 马宇博² 张一昌² 王闻杰¹ 冯福利¹ 刘大一恒²
¹中国科学技术大学
²阿里巴巴集团
³新加坡国立大学
###### 摘要
基于评分标准的奖励为将强化学习(RL)扩展到具有自动可验证答案的任务之外提供了一种有前景的方式。然而,扩展基于评分标准的RL仍然具有挑战性:现有方法通常依赖专家撰写的评分标准和手动构建的问题集,而固定的任务级评分标准可能无法捕捉单个问题的评估需求。我们提出**ARES**(面向可扩展RL的自动化评分标准合成),一个用于大规模自动构建基于评分标准的RL数据的框架。从原始预训练文档出发,ARES将源知识转化为自包含的问答对,并共同生成针对问题加权的评分标准,从而为开放式回答提供实例级别的奖励监督。为了提高多样性和质量,ARES在生成过程中以领域标签和人物信息为条件,并应用验证过滤器来确保问题自包含性、答案忠实性和评分标准有效性。使用ARES,我们在十个领域构建了10万个带有评分标准标注的实例。在七个基准上的实验表明,使用ARES训练的基于评分标准的RL,在持续预训练、监督微调和二元奖励RL中表现更优,在医疗(+6.4)和指令遵循(+15.5)等多维开放任务上提升最为显著。
## 1 引言
大语言模型(LLM)通常通过在大规模网络文本语料上进行大规模预训练来开发,这使它们具备广泛的 linguistic 模式和知识(Yang et al., 2025(https://arxiv.org/html/2605.23454#bib.bib23);Weber et al., 2024(https://arxiv.org/html/2605.23454#bib.bib24)),随后通过后训练来更好地对齐人类指令并增强其问题解决能力(Ross et al., 2011(https://arxiv.org/html/2605.23454#bib.bib9);Bachmann and Nagarajan, 2024(https://arxiv.org/html/2605.23454#bib.bib10);Shao et al., 2024(https://arxiv.org/html/2605.23454#bib.bib3))。在近期后训练方法中,带有可验证奖励的强化学习(RLVR)已成为提升推理能力的重要方案(Guo et al., 2025(https://arxiv.org/html/2605.23454#bib.bib5);Jaech et al., 2024(https://arxiv.org/html/2605.23454#bib.bib6))。通过针对可自动检查的结果优化模型,RLVR 在数学、编码和短答案推理等领域取得了优异成果。然而,它的成功也暴露了一个根本局限:可扩展的RL训练目前集中在那些能够廉价且可靠地验证正确性的任务上。这种对可验证结果的依赖在两个重要方面限制了RLVR。首先,这类可验证奖励主要存在于具有自动可检查最终答案的任务上,如数学、编码和短答案任务(Luo et al., 2025(https://arxiv.org/html/2605.23454#bib.bib13);Face, 2025(https://arxiv.org/html/2605.23454#bib.bib14);Guha et al., 2025(https://arxiv.org/html/2605.23454#bib.bib15);Cen et al., 2026(https://arxiv.org/html/2605.23454#bib.bib2)),限制了能够可靠扩展的领域和任务类型的多样性。其次,奖励通常是稀疏的且通常是二元的,这使得RL优化变得困难(Lightman et al., 2023(https://arxiv.org/html/2605.23454#bib.bib21))。因此,RLVR 强大但狭窄:它只在验证廉价的地方扩展良好,并且对于回答应如何满足复杂、多维要求所能提供的监督有限。
基于评分标准的奖励(Gunjal et al., 2026(https://arxiv.org/html/2605.23454#bib.bib20))提供了一种有前景的替代方案,它通过一组加权标准来评估回答,从而将回答质量分解为多个维度并提供更细粒度的学习信号。尽管有前景,但扩展基于评分标准的RL仍然面临两个挑战。首先,构建带有评分标准标注的数据通常需要专家手动编写问题、参考答案和评估标准,使其难以扩展。其次,许多评分标准是在任务或数据集级别定义的,因此它们提供通用的评估维度,但无法指定每个问题应强调什么。为了解决这些问题,我们旨在自动合成大规模的基于评分标准的RL数据集,其中包含针对问题的评估标准和重要性权重,使得奖励能够针对每个问题强调对回答质量最关键的方面。
在这项工作中,我们提出**ARES**(面向可扩展RL的自动化评分标准合成),一个从原始预训练文档自动构建大规模基于评分标准的RL训练数据的框架。给定一个包含要迁移到RL阶段知识的文档,ARES生成一个自包含的问答对,该问答对无需访问源文档即可回答,同时生成一个由针对问题的评估标准及其重要性权重组成的评分标准。为了进一步提高数据多样性,ARES以领域和人物信号为条件进行生成,产生涵盖多样化场景的问题和回答风格。使用此流程,我们在十个领域合成了10万个带有评分标准标注的实例,使得RL训练能够支持比传统可验证奖励设置更广泛的开放式能力。
我们的主要贡献如下:
- •我们提出了ARES,一个可扩展的文档到RL的流程,它自动将原始预训练文档转化为包含自包含问题、参考答案和针对问题加权的评分标准的RL实例。
- •我们构建了一个大规模带评分标准标注的数据集,包含覆盖十个领域的10万个示例,其中每个实例都提供细粒度的奖励监督。
- •我们在七个不同基准上评估ARES,表明它优于持续预训练、监督微调和二元奖励RL,在开放式任务上尤其显著,如医疗(+6.4)和指令遵循(+15.5)。
## 2 相关工作
#### RL的数据合成。
早期的努力集中在策划数学和代码的特定领域数据集(Luo et al., 2025(https://arxiv.org/html/2605.23454#bib.bib13);Face, 2025(https://arxiv.org/html/2605.23454#bib.bib14))。后续工作将覆盖范围扩展到更广泛的网络来源(Yuan et al., 2026(https://arxiv.org/html/2605.23454#bib.bib16);Guha et al., 2025(https://arxiv.org/html/2605.23454#bib.bib17);Singhal et al., 2025(https://arxiv.org/html/2605.23454#bib.bib17)),在增加多样性的同时仍然集中在具有可验证真实答案的任务上。我们的工作最密切地与Webscale-RL(Cen et al., 2026(https://arxiv.org/html/2605.23454#bib.bib2))相关,它同时将问题和答案扎根于预训练文档,从而实现大规模RL数据合成。然而,所有先前的方法都生成简短可验证的答案并依赖二元奖励信号,将RL限制在具有明确真实答案的任务上。我们通过同时合成多维评分标准和问答对,将此范式扩展到开放领域。
#### RL训练的奖励设计。
主导方法使用基于精确字符串匹配的二元奖励(Cen et al., 2026(https://arxiv.org/html/2605.23454#bib.bib2);Luo et al., 2025(https://arxiv.org/html/2605.23454#bib.bib13);Face, 2025(https://arxiv.org/html/2605.23454#bib.bib14)),这稳健且稳定,但仅限于可验证任务。另一种方法是使用LLM作为评判者(Zheng et al., 2023(https://arxiv.org/html/2605.23454#bib.bib40)),其中模型整体评估回答质量;这种方法灵活但可能不一致且成本高昂。过程奖励模型(Lightman et al., 2023(https://arxiv.org/html/2605.23454#bib.bib21);Wang et al., 2024a(https://arxiv.org/html/2605.23454#bib.bib22))为多步推理提供步骤级别反馈,增加了训练信号密度,但需要大量标注来训练。基于评分标准的评估,在教育评估和长形式写作评估中很常见(Wu et al., 2026(https://arxiv.org/html/2605.23454#bib.bib34)),将质量分解为多个加权维度,从而能够进行结构化、透明和可重复的评估。Gunjal等人(2026(https://arxiv.org/html/2605.23454#bib.bib20))最近展示了基于评分标准的奖励在RL中的潜力,在医疗和科学领域上优于二元和Likert量表的基线。然而,他们的方法依赖于来自特定领域的精选问题集,并且需要单独的评分标准生成过程。我们通过在一次推理过程中从原始预训练文档共同生成评分标准和问答对来扩展这一方向,使基于评分标准的RL能够以更大的规模和领域多样性进行。
#### 预训练阶段与大规模RL。
近期工作探索在更早的训练阶段或更大规模上应用RL。Cen等人(2026(https://arxiv.org/html/2605.23454#bib.bib2))和Li等人(2025(https://arxiv.org/html/2605.23454#bib.bib38))表明,在预训练规模数据上进行RL能带来显著提升。Liu等人(2026(https://arxiv.org/html/2605.23454#bib.bib7),2025(https://arxiv.org/html/2605.23454#bib.bib8))研究了长时间RL训练及其缩放特性。我们的工作与这些努力相辅相成,集中在奖励信号设计而非训练规模上,表明更丰富的奖励使得RL能够受益于更广泛的能力集,包括开放领域。
参见图注
图1:ARES六阶段流程概览。从原始预训练文档开始,ARES执行文档过滤、领域和人物条件化、评分标准增强的问答生成、质量验证、评分标准验证和格式转换,以生成训练实例。
## 3 方法
### 3.1 预备知识
#### RLVR。
RLVR是一种后训练范式,通过针对可自动检查的结果优化LLM来改进模型。给定一个问题qq,策略采样多个候选回答,每个回答根据答案正确性或任务成功度从外部验证器获得奖励。RLVR在数学和编码等领域特别有效,在这些领域最终答案或程序输出可以可靠验证。在本工作中,我们使用组相对策略优化(GRPO)(Shao et al., 2024(https://arxiv.org/html/2605.23454#bib.bib3))作为RL优化器。对于每个问题qq,行为策略πθold\\pi\_\{\\theta\_\{\\mathrm\{old\}\}\}采样一组GG个回答\{yi\}i=1G\\\{y\_\{i\}\\\}\_\{i=1\}^\{G\},每个回答yiy\_\{i\}被赋予奖励RiR\_\{i\}。GRPO通过比较同一组内的回答来优化策略:
JGRPO\(θ\)=Eq,\{yi\}i=1G\[1G∑i=1Gmin\(ρiA^i,clip\(ρi,1−ε,1\+ε\)A^i\)−βKL\(πθ∥πref\)\],
\\mathcal\{J\}\_\{\\text\{GRPO\}\}\(\\theta\)=\\mathbb\{E\}\_\{q,\\\{y\_\{i\}\\\}\_\{i=1\}^\{G\}\}\\left\[\\frac\{1\}\{G\}\\sum\_\{i=1\}^\{G\}\\min\\left\(\\rho\_\{i\}\\hat\{A\}\_\{i\},\\mathrm\{clip\}\(\\rho\_\{i\},1\-\\varepsilon,1\+\\varepsilon\)\\hat\{A\}\_\{i\}\\right\)\-\\beta\\,\\mathrm\{KL\}\(\\pi\_\{\\theta\}\\\|\\pi\_\{\\text\{ref\}\}\)\\right\],(1)
其中 ρi=πθ\(yi∣q\)πθold\(yi∣q\),A^i=Ri−mean\(\{Rj\}j=1G\)std\(\{Rj\}j=1G\)\+εA。
\\rho\_\{i\}=\\frac\{\\pi\_\{\\theta\}\(y\_\{i\}\\mid q\)\}\{\\pi\_\{\\theta\_\{\\mathrm\{old\}\}\}\(y\_\{i\}\\mid q\)\},\\qquad\\hat\{A\}\_\{i\}=\\frac\{R\_\{i\}-\\operatorname\{mean\}\(\\\{R\_\{j\}\\\}\_\{j=1\}^\{G\}\)\}\{\\operatorname\{std\}\(\\\{R\_\{j\}\\\}\_\{j=1\}^\{G\}\)\+\\epsilon\_\{A\}\}\.(2)
这里,ρi\\rho\_\{i\}是重要性比率,A^i\\hat\{A\}\_\{i\}是组归一化优势,ε\\varepsilon是裁剪阈值,β\\beta控制KL正则化强度,πref\\pi\_\{\\text\{ref\}\}是参考策略,εA\\epsilon\_\{A\}是一个用于数值稳定的小常数。在标准RLVR中,RiR\_\{i\}通常由检查结果级别正确性的验证器提供。虽然有效,但此类奖励自然局限于具有可靠自动验证的任务,并且通常提供稀疏的监督。
#### 基于评分标准的奖励的RL。
基于评分标准的奖励通过用多维回答评估替代仅结果验证,将RL训练扩展到更开放的任务(Gunjal et al., 2026(https://arxiv.org/html/2605.23454#bib.bib20))。与仅根据最终答案的正确性评判回答不同,评分标准指定了一组描述回答质量不同方面的标准,例如事实正确性、完整性、推理一致性、指令遵循或避免无根据的主张。形式上,对于问题qq,评分标准定义为
R\(q\)=\{\(ck,wk\)\}k=1N,
\\mathcal\{R\}\(q\)=\\\{\(c\_\{k\},w\_\{k\}\)\\\}\_\{k=1\}^\{N\},(3)
其中ckc\_\{k\}表示第kk个评估标准,wkw\_\{k\}表示其重要性权重。给定候选回答yy,LLM评判者JφJ\_\{\\phi\}对yy是否满足每个标准进行评分。基于评分标准的奖励计算为
Rrubric\(q,y;R\)=∑k=1Nwk⋅Jφ\(q,y,ck\),
R\_\{\\text\{rubric\}\}\(q,y;\\mathcal\{R\}\)=\\sum\_\{k=1\}^\{N\}w\_\{k\}\\cdot J\_\{\\phi\}\(q,y,c\_\{k\}\),(4)
其中Jφ\(q,y,ck\)∈\[0,1\]J\_\{\\phi\}\(q,y,c\_\{k\}\)\\in\[0,1\]衡量回答yy满足标准ckc\_\{k\}的程度。“1”鼓励期望的属性,而负权重可以惩罚常见的失败模式,例如幻觉、无关信息或不安全建议。在RL训练期间,评分标准奖励作为回答奖励用于公式(1)(https://arxiv.org/html/2605.23454#S3.E1),即
Ri=Rrubric\(q,yi;R\)。
R\_\{i\}=R\_\{\\text\{rubric\}\}\(q,y\_\{i\};\\mathcal\{R\}\)。(5)
与最终答案验证相比,基于评分标准的奖励提供更密集和更具诊断性的监督,因为它们可以识别回答的哪些方面是满意的或有缺陷的。然而,现有的基于评分标准的RL方法通常依赖手动设计的标准、专家撰写的评分标准或固定的任务级评估维度(Gallego, 2025(https://arxiv.org/html/2605.23454#bib.bib43);Akyürek et al., 2025(https://arxiv.org/html/2605.23454#bib.bib45))。这限制了可扩展性和粒度:手动编写的评分标准在大规模下构建成本高昂,而固定评分标准可能无法捕捉单个问题的特定评估需求。ARES通过从原始预训练文档自动合成针对问题加权的评分标准以及自包含的问答对来解决这一瓶颈。
### 3.2 数据流程
为了解决这些局限性,ARES通过将原始预训练文档转化为带有针对问题加权的评分标准的实例来构建可扩展的基于评分标准的RL数据。给定文档dd,流程产生一个元组
d→ARES\(q,a∗,Rq\),
d\\xrightarrow\{\\text\{ARES\}\}\(q,a^\{\*\},\\mathcal\{R\}\_\{q\}\),(6)
其中qq是一个自包含的问题,a∗a^\{\*\}是参考答案,Rq=\{\(ck\(q\),wk\(q\)\)\}k=1Nq\\mathcal\{R\}\_\{q\}=\\\{\(c\_\{k\}^\{\(q\)\},w\_\{k\}^\{\(q\)\)\\\}\_\{k=1\}^\{N\_\{q\}\}是一个针对qq定制的评分标准。在RL训练期间,Rq\\mathcal\{R\}\_\{q\}用于计算每个采样回答的奖励:
Rrubric\(q,y;Rq\)=∑k=1Nqwk\(q\)⋅J\(q,y,ck\(q\)\)。
R\_\{\\text\{rubric\}\}\(q,y;\\mathcal\{R\}\_\{q\}\)=\\sum\_\{k=1\}^\{N\_\{q\}\}w\_\{k\}^\{\(q\)\}\\cdot J\(q,y,c\_\{k\}^\{\(q\)\)\)。(7)
流程包括相似文章
超越分数预测:基于强化学习与评分标准奖励的LLM作文评分与反馈生成
本文提出RLAES,一个统一的LLM框架,通过基于评分标准的强化学习联合优化作文评分与反馈生成,在ASAP基准上实现了最先进的评分性能,同时保持高质量的反馈。
基于LLM的自动化评分中可学习的评估技能:通过迭代优化构建评分标准
本文提出为LLM学习评估技能,以自动化评分任务的评分标准构建,达到与专家编写的评分标准相当的性能,且无需人工编写的示例。
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
面向LLM-as-a-Judge的动态评估准则生成与优化
本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。
并非每种评分标准都同样有效:面向策略感知的评分标准奖励用于RLVR
本文提出POW3R,一种面向策略感知的评分标准奖励框架,用于可验证奖励的强化学习(RLVR)。它表明静态评分标准聚合会错误分配学习信号,而POW3R在多种设置下实现了更快的收敛和更好的性能。