标签
Andrej Karpathy将LLM训练概括为文本、对话和环境;Prime Intellect的Verifiers是一个开源框架,用于构建和共享LLM的强化学习环境,采用MIT许可证发布,附带一个包含2500多个环境的中枢。
该推文列出了15种LLM微调技术,并介绍了ART(Agent Reinforcement Trainer),这是OpenPipe的一个开源框架,用于使用GRPO训练多步骤代理,并通过W&B Training提供无服务器强化学习支持。
本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。
本文提出使用Group Relative Policy Optimization(GRPO)来适配基于LLM的ASR模型到监管领域,仅使用合成语音,相较于监督微调实现了40-45%的相对词错误率降低。
提出尾部感知信用校准(TACO),通过校准统一信用分配以抑制对不可信尾部令牌的更新,解决大语言模型强化学习中的正向信用污染问题,提升训练稳定性和性能。
本文介绍了AdaPrefix-GRPO,一种在GRPO训练期间自适应控制提供给模型的正确解决方案前缀长度的方法,保持50%的成功率以最大化梯度信号。它在显著提高困难数学推理问题准确率的同时降低了计算成本。
DrugGen-2通过监督学习和强化学习(GRPO)微调GPT-2,在疾病本体和靶点蛋白质序列条件下生成小分子,实现了药物发现中更高的多样性和结合亲和力。
本文介绍了一种名为自我审查强化学习(SRRL)的训练框架,该框架在强化学习回合中嵌入自我审查步骤,利用跨回合记忆和选择性策略蒸馏,将稀疏的环境反馈转化为行为改进。在GSM8K上的评估表明,SRRL在Qwen 3-4B和OLMo-3-7B模型上均优于使用GRPO的标准RLVR方法。
本文提出了单次生成异步优化(SAO),以解决异步强化学习在智能体任务中的稳定性和离策略挑战,在编码和推理基准测试上优于GRPO及其变体。SAO已部署在GLM-5.2模型的智能体强化学习流程中。
本线程讨论了针对智能体强化学习对GRPO的改进,重点介绍了不同层级的优势归一化(提示层级、任务层级、环境层级),以应对多任务、多轮次环境中的高奖励方差。
NormWorlds-CF是一个用于反事实规范推理的、经求解器验证的基准。论文提出了MR-GRPO,一种奖励机制,能够改进超越最终答案的结构化推理,表明仅答案准确率在规范任务中可能具有误导性。
一个技术教程,介绍如何使用开源的Verifiers库为大型语言模型(LLMs)构建强化学习环境,并以奥赛罗(Othello)作为实际示例。
本文介绍了Mastermind,一种双循环框架,通过学习可复用的漏洞复现策略来处理仓库级任务,通过将策略学习与执行分离,在冻结执行器的情况下实现了84.5%的通过率。
本文提出了一项概念验证,使用基于可验证奖励的强化学习(RLVR)来训练小型语言模型,使其能够在Jira和Confluence等企业SaaS工作流程中使用工具。该方法利用合成环境和GRPO训练来提高工具调用准确率,相较于基线取得了显著的奖励增益。
本文证明 GRPO、Dr. GRPO 和 DAPO 是同一底层机制的三种表述:调整一组采样答案中奖励的标准差。组标准差恒等式表明,一致的组不提供任何学习信号,而分裂的组驱动学习,揭示了训练语言模型推理的统一旋钮。
本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。
提出一个GRPO训练动力学的闭式降阶模型,将其简化为阻尼振荡器,并推导出关于稳定性、组大小不变性和损失曲率的预测。在多个模型和基准上进行了验证。
PASS是一种中间件,它修复了LLM推理器过程监督强化学习中的三种病理现象,通过独立标准化流、按值分块和使用平均价值密度来改进GRPO。它在数学推理和多跳问答中显示出持续的增益。
BV-Blend是一种无评论家的强化学习框架,它将提示本地在线策略统计与来自语义聚类的历史矩相结合,以稳定优势估计,从而提高使用可验证奖励对齐大型语言模型的训练稳定性和性能。