top-k-estimator

标签

Cards List
#top-k-estimator

用于LLM强化学习的预测性散度掩码

Hugging Face Daily Papers · 2026-07-12 缓存

提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈