surrogate-policy

标签

Cards List
#surrogate-policy

SLPO:通过代理策略扩展潜在推理

Hugging Face Daily Papers · 3天前 缓存

介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈