验证器即课程:面向跨系列游戏生成的执行门控自蒸馏
摘要
本文提出执行门控自蒸馏(Execution-Gated Self-Distillation)方法,利用确定性的、不可欺骗的启动检查作为迭代自蒸馏的过滤器,在14B模型上实现了从自然语言描述生成可运行Godot游戏的显著改进。
arXiv:2607.09709v1 公告类型: new
摘要: 针对所学评判器对代码生成器进行后训练可能会优化提升分数但无益于工件的代理特征。我们研究相反的信号:一个确定性的、无需评判器、不可欺骗的过滤器——即生成的项目在无头引擎下能否干净启动(严格启动)。在此门控下,拒绝采样自蒸馏增强了跨系列泛化能力。在GameCraft-Bench(将自然语言简述映射到完整Godot项目)上,一个在严格启动门控下蒸馏的14B模型(Qwen3-14B+LoRA)在三轮迭代后,将四个未见游戏系列的干净生成率从每候选8.8%提升至42.2%,最佳K覆盖从18/25提升至25/25(黄金上限),每一步均有显著提升(p=0.0019, p<1e-4, p<1e-4)。这种提升并非单纯增加数据所致:完全匹配的金标重复对照在基础模型上出现退化(5.6% 对比 8.8%, p=0.019),而计数匹配的分解将第一轮到第二轮的跃迁划分为质量(+8.8个百分点)和数量(+8.5个百分点)两个可比通道。最直接的证据是,仅将过滤器替换为宽松的BUILD检查(通过率99.9%的生成)并重新运行循环,则增益完全消失(回到基础水平,p=1e-3 对比启动门控轮次),从而隔离了验证器精度的影响而非优化器的作用。第二个不可欺骗的信号——无头执行接地性,在各轮中单调上升,且在匹配预算下产生的接地候选远多于金标重复(16 对比 5),确认了增益是功能性的,而非启动但为空。游戏生成为一个可验证的实验平台,提供了一个教训:验证器即课程——它认证什么,模型就学习什么。
查看缓存全文
缓存时间: 2026/07/14 04:16
# 执行门控自蒸馏用于跨家族游戏生成 来源:https://arxiv.org/html/2607.09709 ## 验证器即课程:执行门控自蒸馏用于跨家族游戏生成 陈宇周¹ 蒋启亮² 吴书宁³ 周旭³ ¹东京科学大学工学院,日本 ²浙江大学控制科学与工程学院,中国 ³新加坡国立大学电气与计算机工程系,新加坡 [email protected] [email protected] [email protected] [email protected] ###### 摘要 针对学习型评判器对代码生成器进行后训练,可能会优化代理特征,从而提升评分而不改进工件本身。我们研究相反的信号:一个**确定性的、无评判器、不可欺骗**的过滤器——即生成的项目在无头引擎下能否干净启动(严格启动)。在此门控下,拒绝采样自蒸馏**复合**了跨家族泛化能力。在GameCraft-Bench(将自然语言简介映射到完整的Godot项目)上,一个14B模型(Qwen3-14B++LoRA)在严格启动下蒸馏,将四个未见游戏家族的干净生成从8.8%提升至42.2%(每个候选),以及最佳K覆盖从18/25提升至25/25(黄金天花板),共三轮,每一步都有显著提升($p=0.0019$, $p<10^{-4}$, $p<10^{-4}$)。这种提升并非仅仅来自添加数据:一个完全匹配的黄金复制控制**退步**至基础模型以下(5.6% vs. 8.8%,$p=0.019$),而一个计数匹配的分解将第1轮到第2轮的跃升分解为相当的质量(+8.8 pp)和数量(+8.5 pp)通道。最直接地,仅将过滤器交换重新运行循环——用宽松的BUILD检查(通过99.9%生成)代替启动门控——完全消除了提升(回到基础,$p=10^{-3}$ 对比启动门控轮),从而隔离了验证器精度而非优化器本身。第二个不可欺骗的信号,无头**执行接地**,跨轮单调上升,并且在匹配预算下产生比黄金复制多得多的接地候选项(16 vs. 5),确认了提升是功能性的,而非启动即空壳。游戏生成是一个可验证的测试平台,用于一个教训:验证器即课程——它所认证的内容即模型所学的内容。 ## 1 引言 对代码生成模型进行后训练需要一个信号来指示候选项是否良好。对于开放式生成任务,主导选择是**学习型评判器**——一个LLM或多模态模型被提示对输出进行评分。这方便且与人类偏好相关,但它有一个结构性失败模式:学习型评判器通过其预测所需的任何表面特征将输出映射到分数,如果其中任何特征在没有改进工件的情况下容易操作,那么针对该评判器优化的模型会发现这一点。一项配套研究单独建立(§3)了GameCraft-Bench的官方评判器恰好具有这样的特征:一个代理通过将纯色占位符替换为真实资产来提升其艺术分数,而游戏代码保持不变。学习型评判器和自动基准可以被欺骗的事实已有充分记录[22,23,16];我们提出的建设性问题是:当信号**不能被**欺骗时,后训练会做什么。 本文对**训练应针对哪个信号**采取了相反的立场。我们不是追求更好的学习型评判器,而是将训练过滤器设置为一个**确定性的、无评判器、不可欺骗**的执行检查,并将其放在迭代自蒸馏循环的门控处。只有当具体化的项目在无头引擎下干净启动时——返回退出代码0且无解析、加载或运行时错误(严格启动)——候选项才通过。这个信号不暴露可供操作的标量分数:它是工件在固定引擎下的一个属性,而不是一个意见。 我们研究的任务GameCraft[11]将一段简短的简介映射到一个**完整**的从头开始的Godot项目:引擎配置、场景、驱动它们的GDScript以及记录的演示轨迹。与代码片段级生成不同,每个工件必须内聚——引用缺失脚本的场景,或者有语法错误的脚本,都会产生无法运行的结果。这使得GameCraft成为一个严格且自然**可验证**的测试平台:成功是可执行的,而不仅仅是看似合理。 我们的核心发现是,在**严格启动**门控下,拒绝采样自蒸馏**复合**了效果。从一个监督模型开始,该模型对未见家族仅8.8%的时间生成干净项目,三轮“在训练家族上生成,保留干净启动的,重新训练”将每个候选项的干净生成提升至42.2%,并将25个保留任务的最佳K覆盖从18推至完整的25,即黄金参考天花板。每一轮都有显著提升,并且关键的是,这种提升是由自生成内容的**多样性**驱动的,而不是仅仅复制黄金数据:一个完全匹配的黄金复制控制实际上降低了性能。 ### 验证器即课程。 这指向一个单一原则:在自蒸馏中,接受过滤器定义了下一个训练分布,因此它所认证的内容就是模型所学的内容。并非**任何**验证器都能产生能力(宽松或可欺骗的验证器会放大其自身的盲点,正如我们的控制实验所示);只有确定性的、不可欺骗的、足够精确以区分功能性与损坏项目的过滤器才能使这种放大跨家族迁移。游戏生成是这个原则可直接测量的测试平台。这样表述的原则在两个负载承载条件上是可证伪的,我们将依次检验。**精度**:一个过于宽松以至于无法区分功能性与损坏项目的确定性过滤器不应驱动复合——事实上,用宽松的BUILD门控(几乎接受每个候选项)重新运行循环会消除提升(§7),而§8的功能审计确认干净项目是完整的,而非存根。**探索**:一个精确的过滤器如果让生成器没有新的东西可探索,则会停滞,但每轮的增量并未崩溃(§7)。因此,精度条件有一个直接的过滤器交换测试;探索条件由非崩溃的增量支持。 ### 贡献。 1. 1.**在不可欺骗门控下的复合**。由确定性启动检查过滤的迭代自蒸馏复合了跨家族生成(每个候选项 8.8→13.6→30.9→42.2%;最佳K覆盖 18/25→25/25,黄金天花板),每一轮都比上一轮有显著提升(§6)。 2. 2.**机制:过滤器的精度是因果性的**。一个完全匹配的黄金复制控制显著退步至基础模型以下,一个计数匹配的分解隔离了显著的质量通道(+8.8 pp)和数量通道(+8.5 pp),而一个过滤器交换控制——用宽松的BUILD门控替换严格启动重新运行循环——完全消除了提升,隔离了验证器精度而非优化器本身作为原因(§7)。 3. 3.**迁移的能力是功能性的,而非存根膨胀**,由独立的执行接地信号(驱动SceneTree无头)和静态代码审计验证(§8)。 ## 2 设置:GameCraft任务 GameCraft-Bench[11]提出了端到端的游戏合成:给定一个简短的自然语言设计简介,模型必须发出一个完整的、可运行的Godot 4项目。一个有效的输出至少包含:一个`project.godot`引擎配置文件、一个或多个`.tscn`场景文件、实现行为的`.gd` GDScript,以及一个`demo_outputs/`记录输入事件的轨迹,以练习游戏。基准测试的官方指标`Overall`是一个GPT-5.5视觉评判器,它渲染运行中的游戏并在多个定性轴上进行评分。 ### 为什么从头开始的工件很难。 代码片段级生成可以部分正确——一个几乎能工作的函数仍然类似其目标。游戏项目则不行:如果场景引用了无法解析的脚本、资源路径格式错误、或自动加载在启动时出错,引擎会拒绝运行。正确性是**合取**的,跨越异构工件(引擎配置 ∧ 场景图 ∧ 脚本 ∧ 资源),因此从头开始的设置比编辑或扩展现有项目要严苛得多。这种合取结构也使其成为一个干净的可验证测试平台:一个项目要么启动,要么不启动,没有部分分数,也没有表面信号供学习型评判器奖励。 ### 家族和保留划分。 基准测试将其140个任务分为十五个游戏家族(平台跳跃、策略、Roguelike、模拟等)。我们按家族划分以测量**跨家族**泛化而非分布内记忆:我们保留四个模型从未训练过的家族——恐怖、节奏、解谜、射击(25个任务)——并在其他十个家族的黄金参考(111个项目)上训练。剩余一个家族从训练和评估中排除。保留家族在每一阶段都从训练中排除,包括自蒸馏收获,后者仅从训练家族简介中抽取;我们验证了零保留泄漏到任何一轮的燃料中——每个收获的简介都带有训练家族标签且不匹配任何保留简介。 ## 3 学习型评判器是可欺骗的 在选择训练信号之前,我们精确说明我们避免的是什么。如果一个工件的廉价变换能提高过滤器的分数而同时保持其任务相关可执行行为不变,我们称这样的过滤器为**可欺骗的**。根据这个定义,基准测试的视觉评判器是可欺骗的,而我们的确定性启动检查则不是——它不是需要提高的分数,而是固定的引擎谓词。 ### 代理探针揭示了评判器的盲点。 可欺骗性由一项配套研究的诊断探针建立——一个代理构建流水线,此处仅用作分析工具(附录A)。该探针添加了一个材质接地步骤,获取真实的CC0精灵替换纯色占位符,这提高了评判器与艺术相关的分数,**而游戏代码保持不变**。两个控制实验定位了杠杆:替换**随机选择**的精灵仍然改变了分数,所以评判器奖励的是位图资产的存在,而非其适应性;并且被操纵的输出在独立评判器间得分不一致。能够如此廉价移动的过滤器是不安全的优化目标。 ### 从头开始的生成器无法触及这个杠杆。 相比之下,我们的**生成器**无法触及这个杠杆:从头开始的候选项如果未能通过严格启动,则不会渲染任何内容供视觉评判器评分,并且`Overall`得分为0(附录A),因此在从头开始模式下,可启动性从下方门控评判器。这就是为什么我们针对不可欺骗的启动信号而非评判器进行训练:针对一个奖励美术资产存在的评判器进行优化会追求与可执行行为解耦的高分。 ## 4 从诊断到验证阶梯 给定一个可欺骗的评判器,我们应该针对什么进行训练?我们按每个信号认证的内容量对生成游戏的可用信号进行排序(图1),针对足够廉价以作为每个样本过滤器应用的最强阶梯进行训练,并报告其他阶梯。作为验证器,这些阶梯在**精度**上有所不同:BUILD允许许多非功能性项目(高假阳性率),而严格启动只有在项目真正运行时才接受它。差距很大:在监督模型的训练任务生成中,BUILD接受了888个候选项中的887个(99.9%),而严格启动只接受了73个(8.2%)——几乎每个候选项都“构建”,但少数能干净运行。因为后训练会放大其过滤器接受的任何属性,高假阳性率的门控会向自蒸馏提供损坏的项目;因此我们针对高精度阶梯进行训练,并在§7中测试不这样做的后果。 参见图标题 图1:验证阶梯,按每个信号认证的内容量排序。BUILD——在无头模式下打开项目并退出——几乎是空泛的:场景中有解析错误的项目仍能干净退出,所以BUILD=1并不意味着游戏能运行。严格启动,我们的训练门控,要求干净的无头启动(退出代码0且无解析、加载或运行时错误;附录B)——确定性的、无评判器、不可欺骗。执行接地(§8)驱动运行中的SceneTree并测量真实状态变化,一个我们报告但不训练的功能下限。最上面的阶梯,多模态视觉评判器,认证内容最多,但是可欺骗的(§3)。 ## 5 方法:启动门控迭代自蒸馏 该过程是拒绝采样自蒸馏[18,4,17],有一个刻意的选择:接受过滤器是§4中的确定性严格启动门控,仅应用于训练家族简介。将优化器固定为标准拒绝采样循环,使得唯一的实验变量是接受过滤器认证的内容,因此迁移中的差异可归因于信号。算法1陈述了一轮。 ``` 输入 : 模型 M_t; 训练家族简介 B; 黄金池 D_t; 每个简介的样本数 K for each 简介 b ∈ B do 采样 K 个候选项目 {c_1,...,c_K} ~ M_t(·|b); for each 候选 c do 将 c 具体化为项目树; if strict-launch(c) and c 至少有三个文件 then 将 c 标记为干净; 保留至多 2 个去重后的干净候选用于 b; F_t ← 所有保留的干净候选 (该轮的“燃料”); D_{t+1} ← D_t ∪ F_t; M_{t+1} ← fine-tune(base, D_{t+1}); 输出: M_{t+1}, F_t ``` 算法1:一轮启动门控自蒸馏 ### 轮次。 第0轮是监督模型 M_0(SFT),在111个黄金训练家族项目上训练;我们将经过 k 轮这种拒绝过滤训练后的模型写为 RFT-r-k。后续每一轮使用前一个模型生成,收获其干净的自我生成集(该轮的“燃料”——该轮接受的候选),将其附加到“黄金”池(它仍作为锚点),并从基础模型重新训练一个 LoRA。燃料每一轮增长——来自 M_0 的 67 个干净项目,来自 M_1 的 123 个,等等。
相似文章
逃离自我确认陷阱:面向智能体经验学习的执行-提炼-验证范式
本文提出EDV框架,在执行-提炼-验证阶段使用多个异构智能体为LLM智能体构建可靠经验,防止自我确认错误,并提升在长周期基准测试上的性能。
G-Zero:从零数据开始的无界生成自博弈方法
本文介绍了 G-Zero,这是一个无需验证器的框架,通过基于内在奖励和提示引导的协同进化训练,实现大型语言模型的自主自我改进。旨在通过从内部分布动态中推导监督信号,克服代理 LLM 评判者在无界任务中的局限性。
三思而后行:面向具身智能体的验证器引导动作选择
提出VeGAS框架,一种针对基于MLLM的具身智能体的测试时框架,该框架采样多个候选动作,并利用生成式验证器选择最可靠的动作,在挑战性任务上相比CoT基线实现了高达36%的相对性能提升。
面向GUI代理的技能引导连续蒸馏
该论文提出了技能引导连续蒸馏(SGCD),这是一个迭代式自我改进框架,利用技能引导策略在闭环执行过程中为偏离轨迹的状态生成监督信号,将OSWorld-Verified上GUI代理的成功率从约30%提升至超过50%。
我通过350多次迭代引导AI独自完成游戏发布:验证纪律比模型更重要。
一位开发者描述了通过数百次迭代使用AI独自发布游戏,强调了验证纪律比模型选择更重要。