training-stability

标签

Cards List
#training-stability

列表式策略优化:基于分组的 RLVR 作为 LLM 响应单纯形上的目标投影

Hugging Face Daily Papers · 2026-05-07 缓存

本文介绍了列表式策略优化(LPO),这是一种用于 RLVR 的方法,通过在响应单纯形上进行散度最小化来显式处理目标投影,从而提高大语言模型(LLM)的训练稳定性和性能。

0 人收藏 0 人点赞
#training-stability

平衡聚合:理解与修复 GRPO 中的聚合偏差

Hugging Face Daily Papers · 2026-04-14 缓存

本文指出了 GRPO 风格的大语言模型强化学习中存在的聚合偏差问题,并提出了平衡聚合(Balanced Aggregation, BA)方法。该方法通过对正负子集分别计算 token 级均值,从而提高了训练稳定性和最终性能。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈