标签
英伟达发布了其针对 MOPD 的专家模型,并通过专为竞赛编程和代码推理设计的 NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 模型,使人工智能研究更加易于访问。
MIT研究人员提出了一种名为Pedagogical RL的新强化学习方法,该方法利用具有特权信息的教师模型和尖峰感知可学习性奖励,显著提高了样本效率和收敛速度,优于GRPO和OPSD等现有方法。
人类正在训练教师模型,使其以循序渐进的方式教学生模型,并对跳跃式教学进行惩罚,从而提高模型的智能。