structured-exploration

标签

Cards List
#structured-exploration

超越舒适区的助推:面向RLVR的高效策略引导探索

Hugging Face Daily Papers · 2026-05-15 缓存

NudgeRL是一个框架,通过引入结构化探索和策略助推来增强带有可验证奖励的强化学习(RLVR),相比暴力扩展方法,它能更高效地提升大语言模型的推理性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈