先竞争后协作:前沿AI教师构建可验证课程,使编程学生超越模仿
摘要
本文介绍了一种先竞争后协作的框架,多个前沿AI教师(Claude、Codex-GPT、Grok、Gemini)通过执行测试排名,然后协作构建可验证课程。研究发现,对教师解决方案进行模仿(SFT)会降低有能力的编程学生的表现,而使用相同课程进行带可验证奖励的强化学习(RLVR)则能提升表现,尤其是在竞赛问题上。
arXiv:2607.08255v1 公告类型:new
摘要:大型语言模型越来越多地充当教师,为较小的学生生成训练数据。以往的多教师知识蒸馏方法合并输出而不确定哪个前沿模型教学最佳,通常依赖对自身输出有偏见的LLM评判器。我们引入一种先竞争后协作框架,其中四个前沿AI教师(Claude、Codex-GPT、Grok、Gemini)通过基于执行的评判器(单元测试和标准输入/输出检查)进行头对头排名,并采取公平控制,然后协作构建一个可验证课程供学生(Qwen2.5-Coder)学习。我们报告三个发现:(1)在执行验证下,由于饱和效应,所有教师在自我修正后近乎完美地解决标准问题(99-100%),但更难的竞赛问题区分了它们(Gemini 77% > Claude 69% = Codex 69% > Grok 50%);然而,稳健的学生端结果并不依赖于教师排名。(2)对已验证解决方案的模仿(SFT)不会提升,甚至可能降低已有能力的7B和32B学生的表现(例如,MBPP测试从76.7%降至72.7%,竞赛问题从5.9%降至2.9%)。(3)使用相同协作课程作为带可验证奖励的强化学习(RLVR)环境,改善了学生(竞赛问题从5.9%峰值升至8.8%,相对增益+49%),逆转了SFT的方向。AI教师协作的价值不在于汇集答案以供模仿,而在于共同构建一个可验证的环境,让学生在实践中学习。我们发布了一个可复现的本地管道(NVIDIA GB10),包含在最新技术栈上运行GRPO的框架补丁。
查看缓存全文
缓存时间: 2026/07/10 06:07
# 前沿AI教师构建可验证课程,推动编程学生超越模仿
来源:https://arxiv.org/html/2607.08255
\(2026年7月\)
###### 摘要
大语言模型越来越多地被用作*教师*,为较小的*学生*模型生成训练数据。先前的多教师知识蒸馏会合并多位教师的输出,但不会询问哪一位前沿模型教得最好,并且通常依赖于一个已知存在倾向自身输出偏好的LLM评判器。我们引入了一个**先竞争后协作**框架,其中四位来自主要实验室(Claude/Anthropic、Codex-GPT/OpenAI、Grok/xAI、Gemini/Google)的前沿AI教师首先通过一个基于*执行的*评判器(单元测试/标准输入输出检查)进行**两两排名**,并辅以公平性控制(共享任务库、教师自纠正和交集控制的训练集),然后**协作**为单个编程学生(Qwen2.5-Coder)构建一个*可验证的课程*。我们报告了三个发现:\(1\) 在执行验证下,所有四位教师在自纠正后解决标准问题几乎完美(≈≈99–100%)——这是一种饱和效应,而非技能差异——而更难的竞赛问题则能将他们区分开(Gemini 77%>>Claude 69%≈Codex 69%>>Grok 50%);尽管如此,最稳健的结果出现在学生端,且不依赖于教师排名。\(2\) 在教师经过验证的解决方案上进行模仿(SFT)并不能改进——甚至可能降低——一个已经胜任的编程学生,无论是在7B还是32B规模(例如,在MBPP测试集上从76.7%→72.7%,在所有教师的并集上竞赛问题从5.9%→2.9%)。\(3\) 相同的协作课程如果用作基于可验证奖励的强化学习(RLVR)环境,反而会**提升**学生(在1000步运行中,保留竞赛问题从5.9%→8.8%峰值,+49%相对提升),扭转了SFT的方向。我们的核心主张是:AI教师协作的价值**并非汇集答案来模仿,而是共同构建一个可验证的环境,让学生在实践中学习**。我们发布了一个完全可复现的本地流水线(NVIDIA GB10),包括在最新技术栈上运行GRPO所需的框架补丁。
代码、数据、测试和验证框架:https://github.com/shawnkim678/compete-then-collaborate *所有数字均可从发布的文件中重新计算,或通过根据您自己的服务商条款重新生成教师解决方案来获得。*
## 1 引言
将能力强大的“教师”LLM蒸馏到较小的“学生”模型现在已成为标准做法。有两个问题尚未得到充分探索:\(i\) 哪个商业前沿模型是更好的教师,应以学生真实的后续能力而非LLM评判器的评价来衡量;以及 \(ii\) 将教师**联合**起来的最佳方式是通过合并他们的答案,还是通过其他机制。
我们在Python编程领域研究这些问题。我们的评判器是**代码执行**——客观且无LLM评判设置中已记录的自偏好偏差。我们首先进行一场**竞争**:教师解决一个共享任务库;教师的输出只有通过了隐藏测试,才进入学生的数据。然后我们进行**协作**:所有教师的经过验证的工作形成一个课程,用于两种方式——作为模仿目标(SFT)和作为可验证的奖励环境(RLVR)。
#### 贡献。
\(1\) 一个经过执行验证、无偏差的**前沿AI教师排名**,包含三个公平性控制(共享任务、自纠正、交集)。\(2\) 一个受控的**协作模式比较**,显示模仿SFT失败/降低胜任的编程学生,而可验证奖励的RL则能提升他们。\(3\) 一个可复现的本地(GB10)流水线,包括在transformers 5.5 / torch 2.11 / cu130上运行GRPO所需的框架补丁。
## 2 相关工作
#### 多教师知识蒸馏。
先前的工作将多位教师的理由合并到一个学生中,并报告简单地增加教师可能由于*知识冲突*而**有害**,从而激发了净化/整合\[3 (https://arxiv.org/html/2607.08255#bib.bib2)\]。我们的并集SFT结果独立地复现了这种退化,但我们的框架不同:我们不合并答案来模仿;我们构建一个可验证的环境。
#### 教师选择/LLM评判器。
研究将Claude和GPT互换用作鲁棒性的“强教师”,并警告GPT-4作为评估者时偏爱自己的生成\[5 (https://arxiv.org/html/2607.08255#bib.bib3)\]。我们通过使用执行来评判,消除了这种偏差。
#### 在策略蒸馏与RLVR。
在策略蒸馏\[1 (https://arxiv.org/html/2607.08255#bib.bib4)\]和对比蒸馏\[4 (https://arxiv.org/html/2607.08255#bib.bib5)\]改进了模仿;基于可验证奖励的RL是近期推理模型的基础。我们将它们联系起来:教师们协作验证过的问题成为了RLVR的奖励环境。
#### 使用虚拟/合成数据的集成学习(历史渊源)。
使用*虚拟*——合成生成的——数据训练的集成学习器能够超越任何单个成员的直觉,早于深度学习时代:Jang \[2 (https://arxiv.org/html/2607.08255#bib.bib1)\]于1999年在POSTECH提出了一种由虚拟数据驱动的集成学习算法。我们的设置是现代版本:集成成员是前沿LLM*教师*,“虚拟数据”是一个经过执行验证的合成问题课程。这种联系是渊源上的而非方法上的——1999年的虚拟数据增强了单个预测器的集成多样性,而我们经过验证的问题则定义了用于策略优化的奖励景观(RLVR)。因此,我们将这项工作定位为那条线的精神继承者:转折点在于我们不是平均集成输出,而是将协作验证的课程作为一个强化学习环境。
#### 空白。
我们尚未发现任何工作将具名前沿模型作为教师通过执行进行排名、对比模仿与可验证奖励协作,并将其打包为一个先竞争后协作的流水线。
## 3 方法
### 3.1 执行验证生成(评判器)
每位教师收到一个任务(函数签名或竞赛问题)并返回推理++一个代码块。我们提取代码并在一个隔离的子进程中(资源限制+超时)针对**隐藏测试**(函数任务用单元测试断言;竞赛任务用标准输入/输出)运行。仅保留通过测试的解决方案。因此,正确性来自执行,而不是模仿教师。
### 3.2 带有公平性控制的竞争
\(a\) **共享任务库**——所有教师解决相同的问题(函数签名消歧;排除外部依赖的任务以保持仅函数的有效比较)。\(b\) **自纠正**——失败的任务带着失败测试的错误信息返回给教师,最多重试两次,模拟一位会修订的教师(提高每位教师的覆盖率并消除“一次运气”的混杂因素)。\(c\) **交集控制**——学生训练集被限制为*所有*教师都解决的问题,从而保证相同的问题和相等的数量,因此只有解决方案/解释的*风格*不同。
### 3.3 协作:一个学生的两种模式
所有教师经过验证的解决方案的**并集**构成了协作课程。我们以两种方式使用它:**SFT**:模仿合并的解决方案;**RLVR**:将经过验证的问题视为一个GRPO奖励环境,其中奖励 == 通过的测试分数。学生 == Qwen2.5-Coder(7B主要,32B次要),LoRA。
## 4 实验设置
- • **学生**:Qwen2.5-Coder-7B / -32B,LoRA(bf16),GB10 128 GB统一内存。
- • **教师**:通过无头CLI(四大实验室:Anthropic、OpenAI、xAI、Google)的Claude、Codex(GPT)、Grok和Gemini。Gemini参与执行验证的*竞争*排名;*协作*实验(SFT/RLVR)使用前三位教师经过验证的解决方案的并集。
- • **任务库**:来自MBPP的函数任务(教学分割;MBPP-*测试*保留)、通过MBPP参考变异的bug修复任务;来自deepmind/code_contests的竞赛问题(难度6–9)。
- • **保留评估(已验证无泄漏)**:MBPP测试集(150)和一个不交集的竞赛集(68)。度量:执行pass@1。
- • **RLVR**:TRL GRPOTrainer++PEFT(HF路径;由于LoRA数据类型错误,避免使用Unsloth内核);奖励==测试通过分数+小格式奖励;HF-generate rollout(vLLM在此栈上不兼容)。
## 5 结果
### 5.1 教师竞争(生成pass@1)
**简单(MBPP,200个共享问题)**——饱和。
表 1:简单MBPP已饱和;所有四位教师在自纠正后达到99–100%,可能反映了基准测试的暴露而非技能。
**困难(code_contests,难度6–9,150个问题)**——信息性信号。
表 2:困难的竞赛问题将教师区分开来:Gemini>>Claude≈Codex>>Grok。Gemini领先约8个百分点;Claude和Codex在一个问题范围内。
#### 解读(v0.2,应对同行评审)。
MBPP接近上限的分数(99–100%)很可能反映了*基准测试饱和/训练暴露*——MBPP是一个公开的2021年基准测试,所有四位教师都见过——而非技能差异。因此,我们**不**将教师排名建立在MBPP上。
在更困难的code_contests集上,教师区分更明显:Gemini领先(77%,115/150),然后是Claude(69%)≈Codex(69%),最后是Grok(50%)。没有一家供应商的模型在困难问题上具有独一无二的优势;Gemini领先约8个百分点,而Claude和Codex在一个问题范围内。关键在于,排名不是由任何LLM评判器产生的(仅执行),因此*自偏好/家族偏差通过设计被排除*;剩余的风险是不对称的训练泄漏和CLI/解析器伪影(第7节)。
#### 公平性修正。
我们发现了并修正了三个*基础设施*伪影(而非能力差异),以相同方式应用于每位受影响的教师,并透明报告:
- • § Claude——首次运行在122/150个问题处中断。我们完成了剩余的28个(22个通过),因此每位教师都在相同的150个问题上计分,使Claude获得公平的69%(104/150),相比不完整运行的67%(82/122)。
- • ‡ Gemini——API的预付信用在生成过程中耗尽,因此最后34/150个问题返回计费错误(429)被视为无代码。信用恢复后,我们重新运行了这34个并合并:77%(115/150),100%代码提取。
- • † Grok——最初52%的批次CLI调用返回空(超时/不稳定,而非错误代码)。我们添加了空响应重试并重新测量:50%(75/150),提取率从48%→73%(109/150)。即使经过重试,仍有27%(41/150)未返回可用代码;我们无法完全区分CLI不稳定性和真实难度,因此透明地报告,而不是丢弃这些项目。因此,剩余的Grok–Codex/Claude差距(50% vs 69%)是一个保守的(对Grok有利)估计。
### 5.2 协作模式A——模仿(SFT)无法帮助胜任的学生
保留pass@1(交集控制,197个共享问题):
表 3:所有SFT学生均**低于**基础水平;教师排名得以保持(Claude危害最小)。
所有学生均低于基础水平,教师排名得以保持(Claude危害最小)。所有教师的并集(SFT)同样低于基础水平(MBPP 72.7%,竞赛2.9% vs 基础5.9%)。
这种规模的模仿降低了已经胜任的编码器模型;瓶颈是任务*难度/提升空间*,而非模型大小——7B和32B都会降低。
### 5.3 协作模式B——基于可验证奖励的RL(RLVR)提升学生
相同课程,保留竞赛(基础在此较弱→提升空间大):
表 4:相同数据,相反方向:模仿降低,基于可验证奖励的RL提升。v2 1000步运行在8.8%达到峰值(第250–750步),后期轻微回退至7.4%。训练奖励从约0早期上升至0.25–1.0后期(训练集泛化),保留集得到提升。
相同数据,方向与SFT相反。
01001002002003003004004005005006006007007008008009009001,0001\{,\}00000.20.20.40.4GRPO步数
训练奖励(均值)
训练奖励(均值,左轴)
保留pass@1(右轴)0551010保留pass@1(%)图1:v2学习曲线(1000步)。左蓝色:记录的训练奖励(均值),从0.22上升至约0.43后趋于平稳。右红色:每个检查点的保留68个竞赛问题的pass@1——基础5.9%(4/68),在第250–750步上升到8.8%(6/68)的平台,在第1000步轻微回退至7.4%(5/68)。平台内的差异对应于68个问题中的±1个(在采样噪声范围内);稳健的信号是从基础→RLVR(4→5–6/68)。
## 6 讨论
结果给出了一个清晰的信息:**AI教师协作的价值并非汇集答案来模仿,而是共同构建一个可验证的环境,让学生在实践中学习**。模仿传递了*风格*,而一个胜任的编码器已经拥有这些;RLVR通过奖励验证成功来传递*能力*。这也解释了复现的多教师知识蒸馏退化(知识冲突):合并答案无法超过学生模仿的上限,而针对可验证奖励的RL则可以。
## 7 局限性
- • **基准测试饱和/训练泄漏**。MBPP是一个广为人知的2021年基准测试;教师接近上限的分数(99–100%)很可能反映了训练集暴露而非差异能力,因此我们关于稳定排名的讨论基于更困难的code_contests子集。我们不验证个别测试项是否逐字出现在任何教师的预训练语料中;教师之间的不对称泄漏会扭曲排名。
- • **提示/解析器/CLI对称性**。所有教师共享一个提示模板和一个代码提取解析器。我们发现并修正了一个公平性伪影:Grok的批次CLI在52%的困难问题调用中返回空(超时/不稳定,而非错误代码);在添加空响应重试后,比较是公平的。任何剩余的格式优势都受限于共享解析器和报告的成功提取率。
- • **教师排名弱于学生端结果**。在困难子集上,Gemini领先约8个百分点,而Claude≈Codex(在一个问题范围内),Grok落后;考虑到样本量,Gemini以下的精细排序仅得到弱区分。相比之下,**SFT失败 / RLVR成功**的逆转是稳健的:它是学生保留集性能的变化,不依赖于教师排名或任何LLM评判器。
- • **RLVR的增益在稀疏竞赛奖励下绝对值不大**。v2的1000步运行将保留pass@1从5.9%的基础提升到8.8%的平台(第250–750步),在第1000步轻微回退至7.4%;由于保留集只有68个问题,平台内的差异(±1个问题)在采样噪声范围内,因此我们报告稳健的方向(基础→RLVR,4→5–6/68)而非精确峰值,并建议在训练到最终步长时进行检查点选择。一个更大的保留集会收紧这些估计。
- • **单一学生系列(Qwen2.5-Coder);一种语言(Python)**。
- • **伦理/服务条款**。这是**学术研究**——一项基准测试和方法论研究——而非商业模型的开发、部署或蒸馏,且不与任何提供商竞争;没有任何训练好的模型作为产品提供。此目的使该工作超出了Anthropic(无竞争产品/竞争模型训练)和OpenAI(无与OpenAI竞争的模型)的*竞争范围内的*限制;Google的Gemini条款......(原文被截断,但翻译应保留此部分)。相似文章
@rohanpaul_ai: 来自剑桥大学、英伟达及其他顶尖实验室的新论文教会AI智能体和AI评判者共同改进,使任何一方都不会……
来自剑桥大学、英伟达及其他实验室的一篇新论文介绍了Red Queen Gödel机器,这是一种让AI智能体及其评估者共同进化以防止停滞的方法。该方法通过允许评判者在安全交接点改进来避免固定基准,从而在编程和论文写作任务中取得更好的性能。
FrontierCode: 一项提高难度和质量标准的编码评估。
FrontierCode 是一个新的编码评估基准,旨在提高 AI 代码生成的难度和质量标准。
解锁不可解难题:教师引导的课程学习实现数据高效RLVR
本文介绍了一种教师引导的课程学习方法,用于强化学习与可验证奖励(RLVR),以高效训练语言模型处理初始不可解的数学问题,实现显著的数据效率并扩展推理边界。
@AlexGDimakis: 我对这项研究非常兴奋:我们展示了两个结果:1. 如果只进行随机采样(即独立尝试解决一个问题多次……
这项研究比较了AI编码智能体(如Claude-Code和Codex)与人类专家程序员在长期任务上的表现,结果表明由于持续学习,人类的表现呈超线性增长,而智能体则趋于平稳,这突显了当前AI在扩展问题解决方面的关键局限性。
人工评分还是AI评分:课堂观察中AI评分的比较评估
本研究评估了使用GPT-5对早期儿童课堂中师幼互动进行评分,与人类评分者进行比较,发现部分一致性,但在全面评估中存在局限性。