rl-post-training

标签

Cards List
#rl-post-training

@PyTorch:强化学习后训练已成为现代大语言模型开发的关键阶段,但部署一个端到端流水线需要更多…

X AI KOLs Timeline ↗ · 2026-09-21 缓存

文章宣传了在北美PyTorch会议上关于使用ROCm在AMD Instinct GPU上启用开源vime强化学习后训练框架的海报展示,并提供了会议的注册详情。

0 人收藏 0 人点赞
#rl-post-training

永不放弃:学习解决LLMs强化学习中的难题

Hacker News Top ↗ · 2026-09-15 缓存

本文介绍了LLMs强化学习训练中的马太效应现象,即难题改进甚微,并提出了永不放弃(NGU)方法以解决该问题,该方法适用于数学和代码领域。

0 人收藏 0 人点赞
#rl-post-training

并非所有提示都是平等的:探索引导的提示脚手架用于多模态强化后训练

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

本文提出了一种探索引导的提示脚手架框架,该框架动态调整多模态强化学习的训练提示,在基准测试中实现了高达9.7%的相对性能提升。

0 人收藏 0 人点赞
#rl-post-training

@beffjezos: 如果你正在阅读这条推文,唯一可能的抵抗方式是构建去中心化、无许可且自主的AI。开放…

X AI KOLs Following ↗ · 2026-09-12 缓存

一条推文倡导去中心化、无许可且自主的AI以对抗过度中心化,强调开源工具、本地推理,以及普及AI访问和创新的重要性。

0 人收藏 0 人点赞
#rl-post-training

WorldReward: 针对相机条件化世界模型的奖励建模

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。

0 人收藏 0 人点赞
#rl-post-training

我对112个真实RL后训练环境进行了奖励黑客漏洞审计 — 54个被标记,0个误报 [原创内容,工具] [发布]

Reddit r/MachineLearning ↗ · 2026-09-01

作者审计了112个RL后训练环境,针对奖励黑客漏洞,构建了一个名为ratctl的静态和动态审计工具,标记了54个问题,精度达100%,并已开源发布。

0 人收藏 0 人点赞
#rl-post-training

基于代理的游戏开发:作为可验证轨迹数据引擎以扩展世界模型

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

本文提出利用游戏引擎作为可验证轨迹数据引擎来扩展世界模型,引入RLHEV以结合密集引擎信号与人类反馈,用于强化学习后训练。

0 人收藏 0 人点赞
#rl-post-training

以100倍更便宜的开源模型在检索任务上击败GPT-5.6 Sol

Hacker News Top ↗ · 2026-08-05 缓存

Neon与Castform合作展示了如何将RL后训练的开源权重模型与Lakebase Search相结合,以100倍更低的成本和延迟,在检索任务上击败GPT-5.6 Sol等前沿模型。

0 人收藏 0 人点赞
#rl-post-training

PIRL:从开环探索到闭环强化学习 [R]

Reddit r/MachineLearning ↗ · 2026-07-28

介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。

0 人收藏 0 人点赞
#rl-post-training

Flow-Map GRPO:基于锚定随机组合的少步流图生成器强化学习

arXiv cs.LG ↗ · 2026-07-02 缓存

提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。

0 人收藏 0 人点赞
#rl-post-training

@no_stp_on_snek: 结论先行:在某些类别中,它算是“及格”了,但比35B适用范围更窄。你实际买到的是真正的……

X AI KOLs Following ↗ · 2026-06-27 缓存

作者将Ornith-9B与其基础模型Qwen3.5-9B进行了对比,发现RL后训练提升了token效率和持续编码的一致性,但牺牲了单轮判断能力和对误导输入的鲁棒性,使得9B版本相较于35B版本升级幅度更窄。

0 人收藏 0 人点赞
#rl-post-training

STAR: 时空自适应奖励分配用于文本到图像强化学习后训练

arXiv cs.AI ↗ · 2026-06-17 缓存

本文介绍STAR,一种用于文本到图像扩散模型强化学习后训练中的时空自适应奖励分配方法,通过将策略更新聚焦于相关潜在区域,改善组合对齐和文本渲染。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈