标签
文章宣传了在北美PyTorch会议上关于使用ROCm在AMD Instinct GPU上启用开源vime强化学习后训练框架的海报展示,并提供了会议的注册详情。
本文介绍了LLMs强化学习训练中的马太效应现象,即难题改进甚微,并提出了永不放弃(NGU)方法以解决该问题,该方法适用于数学和代码领域。
本文提出了一种探索引导的提示脚手架框架,该框架动态调整多模态强化学习的训练提示,在基准测试中实现了高达9.7%的相对性能提升。
一条推文倡导去中心化、无许可且自主的AI以对抗过度中心化,强调开源工具、本地推理,以及普及AI访问和创新的重要性。
WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。
作者审计了112个RL后训练环境,针对奖励黑客漏洞,构建了一个名为ratctl的静态和动态审计工具,标记了54个问题,精度达100%,并已开源发布。
本文提出利用游戏引擎作为可验证轨迹数据引擎来扩展世界模型,引入RLHEV以结合密集引擎信号与人类反馈,用于强化学习后训练。
Neon与Castform合作展示了如何将RL后训练的开源权重模型与Lakebase Search相结合,以100倍更低的成本和延迟,在检索任务上击败GPT-5.6 Sol等前沿模型。
介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。
提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。
作者将Ornith-9B与其基础模型Qwen3.5-9B进行了对比,发现RL后训练提升了token效率和持续编码的一致性,但牺牲了单轮判断能力和对误导输入的鲁棒性,使得9B版本相较于35B版本升级幅度更窄。
本文介绍STAR,一种用于文本到图像扩散模型强化学习后训练中的时空自适应奖励分配方法,通过将策略更新聚焦于相关潜在区域,改善组合对齐和文本渲染。