parameter-space-exploration

标签

Cards List
#parameter-space-exploration

基于变分学习的RLVR参数探索

Hugging Face Daily Papers · 2026-08-10 缓存

本文介绍了扰动参数策略优化(3PO),这是一种用于LLM强化学习的参数空间探索方法族,展示了在数学和代码任务上相较于GRPO的一致改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈