golden-grpo

标签

Cards List
#golden-grpo

从记忆到吸收:用于持续知识注入的混合策略强化学习

arXiv cs.CL · 2026-08-27 缓存

本文提出Golden-GRPO Injection (GRIN),一种用于大语言模型持续知识注入的混合策略强化学习框架,克服了监督微调的局限性。实验表明,在知识吸收基准上表现卓越。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈