critic-free

标签

Cards List
#critic-free

@askalphaxiv: “FlashREINFORCE:无批评器单次采样异步强化学习用于智能语言模型” 本文认为可扩展的智能体强化学习…

X AI KOLs Timeline ↗ · 2026-09-15 缓存

FlashREINFORCE 引入了一种无批评器、单次采样的异步强化学习框架,用于智能语言模型,通过立即从每个轨迹学习来提高稳定性和效率。

0 人收藏 0 人点赞
#critic-free

Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning

arXiv cs.LG ↗ · 2026-08-12 缓存

Introduces Critic-Free Pretraining (CFP), a method for offline-to-online RL that discards the offline-trained critic and uses a fresh critic with warm-up, matching or improving upon conventional O2O algorithms across tasks.

0 人收藏 0 人点赞
#critic-free

BV-Blend: 不确定性加权历史基线用于可验证奖励下稳定无评论家强化学习

arXiv cs.AI ↗ · 2026-06-30 缓存

BV-Blend是一种无评论家的强化学习框架,它将提示本地在线策略统计与来自语义聚类的历史矩相结合,以稳定优势估计,从而提高使用可验证奖励对齐大型语言模型的训练稳定性和性能。

0 人收藏 0 人点赞
#critic-free

重新思考Critic-Free RLVR中的分组

arXiv cs.LG ↗ · 2026-06-17 缓存

本文重新思考了在大型语言模型的无评论家强化学习中分组的作用,并提出了负令牌过滤策略,使得每个提示只需一次rollout即可实现稳定训练,在推理和代理任务上取得了与基于分组的方法相当或更好的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈