critic-learning

标签

Cards List
#critic-learning

重新思考PPO中的评论家学习:理解与缓解价值平坦化

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

本文识别出价值平坦化是PPO评论家学习在LLMs中的一种失败模式,并引入SP3O,一种稀疏监督方法,来缓解它,实验中显示持续改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈