@itarutomy:微软研究院的研究人员提出了一种方法,将LLM后训练(post-training,预训练后的额外调整)中的RL(强化学习)奖励从“分数”替换为“教练建议”,名为“Experiential Learnin…”

X AI KOLs Timeline 论文

摘要

微软研究院的研究人员提出了一种方法“Experiential Learning (EL)”,将LLM后训练中RL的奖励从标量分数替换为“教练建议”。在Qwen3-8B和OLMo-3-7B上的实验中,该方法在多个基准上一致优于常规的基于评估标准的RL(GRPO)。

微软研究院的研究人员提出了一种方法“Experiential Learning (EL)”,将LLM后训练(post-training,预训练后的额外调整)中RL(强化学习)的奖励从“分数”替换为“教练建议”(https://arxiv[.]org/html/2607.18110v1)。 与数学或代码这类有唯一正确答案的“可验证任务”不同,在衡量文本质量的“不可验证任务”的RL中,负责评分的LLM(LLM-as-a-Judge)会按照rubric(评估标准)将回答压缩为1到10分的标量(单一数值)奖励,然后再用于训练。打分理由这一丰富信息在此被丢弃,导致策略(policy)模型无法区分得分相同的回答,这是原有的弱点。 EL将同一个评分LLM转用作“教练”。它不给出分数,而是提取出“使用具体且多样的形容词”这类可迁移到相似任务的建议句子(experiential knowledge),并将其作为线索提供给教师模型。然后,通过一种名为“on-policy context distillation”的方法——使策略模型的输出分布接近教师模型(最小化逆向KL散度)——将教练的建议直接渗透到策略模型的权重中。 从信息量来比较很有意思:1到10分的标量奖励理论上每样本最多只能承载3.3比特,即使是用bf16(16位浮点)训练的奖励模型,上限也只有16比特;而一段1024个token的建议文本,按词汇量15万计算,理论上每样本约有17,600比特,是bf16奖励带宽的1000倍以上,是离散1到10分奖励带宽的5000倍以上。 在以Qwen3-8B和OLMo-3-7B作为策略模型、反馈角色分别由自身和GPT-4o担任的两种设置中,EL不仅在实际用户指令7500条组成的WildChat-IF保留测试上,而且在AlpacaEval v2.0、WildBench、ArenaHard v2.0、CreativeWritingV3等未用于训练的基准上,都一致优于常规的rubric RL(GRPO)。在OLMo-3-7B与自身组成的组合中,AlpacaEval胜率从RL的45.9%提高到EL的50.8%,WildBench得分从42.1上升到47.5。 更有趣的是,在训练数据本身上的提升虽然RL更大,但在未用于训练的基准上EL却更高。论文解释说,标量奖励由于信息量少,策略容易朝单纯拔高分数的方向漂移,从而引发“奖励黑客(reward hacking)”;而EL追逐的是分布本身,因此不容易对训练数据过拟合。
查看原文
查看缓存全文

缓存时间: 2026/08/04 14:10

来自微软研究院的研究人员提出了一种名为“体验式学习(Experiential Learning, EL)”的方法,将LLM后训练(post-training,即预训练之后的额外微调)中强化学习(RL)的奖励从“分数”替换为“教练的建议”(https://arxiv[.]org/html/2607.18110v1)。

与数学或代码这类有唯一正确答案的“可验证任务”不同,在衡量文本质量的“不可验证任务”的RL中,评分LLM(LLM-as-a-Judge)会根据评估标准(rubric)将回答压缩成1–10分的标量(单一数值)奖励,然后用于训练。评分理由这一丰富的信息在这里被丢弃了,因此策略模型无法再区分得分相同的回答,这是它的弱点。

EL将同一个评分LLM重新用作“教练”。它不再输出分数,而是提取“使用具体且多样的形容词”这类可迁移到类似任务上的建议句子(经验性知识),并将它们作为提示提供给教师模型。在此基础上,它采用一种名为“on-policy context distillation(基于当前策略的上下文蒸馏)”的技术,通过最小化逆KL散度让策略模型的输出分布接近教师模型,从而将教练的建议直接融入策略模型的权重中。

从信息量上来比较很有意思:1–10分的标量奖励理论上每个样本最多只能携带3.3比特;即使是用bf16(16位浮点数)训练的奖励模型,上限也只有16比特;而一条1024个token的建议句子,在词汇量为15万的前提下,理论上每个样本能携带约17,600比特的信息——是bf16奖励带宽的1000倍以上,是离散1–10分奖励的5000倍以上。

在对Qwen3-8B和OLMo-3-7B作为策略模型进行测试时,无论反馈角色是由模型自身还是由GPT-4o承担,EL都持续优于标准的基于评分标准的RL(GRPO);不仅在由7500条真实用户指令组成的WildChat-IF保留测试集上如此,在未参与训练的基准上也一样:AlpacaEval v2.0、WildBench、ArenaHard v2.0和CreativeWritingV3。在OLMo-3-7B自我评估的组合中,AlpacaEval胜率从RL的45.9%提升到EL的50.8%,WildBench分数从42.1上升到47.5。

更有意思的是,在训练数据本身上,RL的提升反而更大,但在未参与训练的基准上,EL却表现更好。论文解释说,标量奖励因信息量少,策略更容易朝着只刷分数的方向漂移,从而引发“奖励黑客”(reward hacking);而EL因为是在追逐整个分布,所以不太容易对训练数据过度拟合。

相似文章

LLM-as-a-Coach: 面向非可验证任务的体验式学习

Hugging Face Daily Papers

本文介绍了体验式学习(EL)方法,该方法将LLM-as-a-Judge重新用于LLM-as-a-Coach,以提供丰富的文本反馈而非标量奖励,从而提升在开放式非可验证任务上的表现和泛化能力。

ExpRL:面向LLM中期训练的探索式强化学习

Hugging Face Daily Papers

ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。

预训练期间的RL探索:重新审视LLM训练的策略优化

arXiv cs.LG

哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。