distilled-rl

标签

Cards List
#distilled-rl

用于大语言模型后训练的蒸馏强化学习

Hugging Face Daily Papers · 2026-07-19 缓存

介绍了蒸馏强化学习,一种使用教师模型为大模型后训练提供细粒度的词元级梯度信号的方法,结合了强化学习和知识蒸馏。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈