@itarutomy:微软研究院的研究人员提出了一种方法,将LLM后训练(post-training,预训练后的额外调整)中的RL(强化学习)奖励从“分数”替换为“教练建议”,名为“Experiential Learnin…”
摘要
微软研究院的研究人员提出了一种方法“Experiential Learning (EL)”,将LLM后训练中RL的奖励从标量分数替换为“教练建议”。在Qwen3-8B和OLMo-3-7B上的实验中,该方法在多个基准上一致优于常规的基于评估标准的RL(GRPO)。
查看缓存全文
缓存时间: 2026/08/04 14:10
来自微软研究院的研究人员提出了一种名为“体验式学习(Experiential Learning, EL)”的方法,将LLM后训练(post-training,即预训练之后的额外微调)中强化学习(RL)的奖励从“分数”替换为“教练的建议”(https://arxiv[.]org/html/2607.18110v1)。
与数学或代码这类有唯一正确答案的“可验证任务”不同,在衡量文本质量的“不可验证任务”的RL中,评分LLM(LLM-as-a-Judge)会根据评估标准(rubric)将回答压缩成1–10分的标量(单一数值)奖励,然后用于训练。评分理由这一丰富的信息在这里被丢弃了,因此策略模型无法再区分得分相同的回答,这是它的弱点。
EL将同一个评分LLM重新用作“教练”。它不再输出分数,而是提取“使用具体且多样的形容词”这类可迁移到类似任务上的建议句子(经验性知识),并将它们作为提示提供给教师模型。在此基础上,它采用一种名为“on-policy context distillation(基于当前策略的上下文蒸馏)”的技术,通过最小化逆KL散度让策略模型的输出分布接近教师模型,从而将教练的建议直接融入策略模型的权重中。
从信息量上来比较很有意思:1–10分的标量奖励理论上每个样本最多只能携带3.3比特;即使是用bf16(16位浮点数)训练的奖励模型,上限也只有16比特;而一条1024个token的建议句子,在词汇量为15万的前提下,理论上每个样本能携带约17,600比特的信息——是bf16奖励带宽的1000倍以上,是离散1–10分奖励的5000倍以上。
在对Qwen3-8B和OLMo-3-7B作为策略模型进行测试时,无论反馈角色是由模型自身还是由GPT-4o承担,EL都持续优于标准的基于评分标准的RL(GRPO);不仅在由7500条真实用户指令组成的WildChat-IF保留测试集上如此,在未参与训练的基准上也一样:AlpacaEval v2.0、WildBench、ArenaHard v2.0和CreativeWritingV3。在OLMo-3-7B自我评估的组合中,AlpacaEval胜率从RL的45.9%提升到EL的50.8%,WildBench分数从42.1上升到47.5。
更有意思的是,在训练数据本身上,RL的提升反而更大,但在未参与训练的基准上,EL却表现更好。论文解释说,标量奖励因信息量少,策略更容易朝着只刷分数的方向漂移,从而引发“奖励黑客”(reward hacking);而EL因为是在追逐整个分布,所以不太容易对训练数据过度拟合。
相似文章
LLM-as-a-Coach: 面向非可验证任务的体验式学习
本文介绍了体验式学习(EL)方法,该方法将LLM-as-a-Judge重新用于LLM-as-a-Coach,以提供丰富的文本反馈而非标量奖励,从而提升在开放式非可验证任务上的表现和泛化能力。
LLM-as-a-Tutor:面向不可验证强化学习的策略感知提示自适应
LLM-as-a-Tutor提出了一种框架,通过成对比较和添加约束动态调整提示难度,将LLM的角色从评判者扩展为导师,从而提升强化学习中的指令跟随性能。
ExpRL:面向LLM中期训练的探索式强化学习
ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。
预训练期间的RL探索:重新审视LLM训练的策略优化
哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。
LLMZero:通过LLM智能体发现强化学习后训练的自适应训练策略
LLMZero利用LLM智能体通过树搜索在训练轨迹中进行搜索,发现用于强化学习后训练的自适应多参数过渡策略,该策略在多种任务中优于固定调度和网格搜索。