标签
本文介绍了一种先竞争后协作的框架,多个前沿AI教师(Claude、Codex-GPT、Grok、Gemini)通过执行测试排名,然后协作构建可验证课程。研究发现,对教师解决方案进行模仿(SFT)会降低有能力的编程学生的表现,而使用相同课程进行带可验证奖励的强化学习(RLVR)则能提升表现,尤其是在竞赛问题上。