off-policy-grpo

标签

Cards List
#off-policy-grpo

基于策略的蒸馏与离策略GRPO结合:训练紧凑指令遵循重排序器

arXiv cs.LG · 2026-09-03 缓存

本文提出了一种基于强化学习的蒸馏框架,用于训练紧凑的指令遵循重排序器。该框架使用离策略GRPO增强教师模型,并通过基于策略的蒸馏训练学生模型,在分布偏移下展现出优越性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈