cross-model-learning

标签

Cards List
#cross-model-learning

超越采样的学习:面向RLVR的离策略感知跨模型轨迹交换

Hugging Face Daily Papers ↗ · 昨天 缓存

本文提出了GRAFT,一个用于可验证奖励强化学习(RLVR)的离策略感知框架,它用对等轨迹替换全部失败组,以提高数学推理基准的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈