Tag
This paper proposes Golden-GRPO Injection (GRIN), a mixed-policy reinforcement learning framework for continual knowledge injection in large language models, overcoming limitations of supervised fine-tuning. Experiments demonstrate superior performance on knowledge absorption benchmarks.