PROOF-Gen: 从优化数据到更好的蒸馏
摘要
PROOF-Gen 提出了一种每个场景的反思优化方法,用于恢复失败的轨迹以蒸馏工具调用能力,从而提升蒸馏流程中的数据质量和模型性能。
arXiv:2608.23911v1 公告类型:新
摘要:在教师生成的轨迹上进行监督微调是将工具调用能力蒸馏到可部署模型的标准第一阶段。驱动已发布工具调用代理的后训练流程每天或每周重新运行此阶段,每个周期都支付前沿教师的成本,然而机制是生成和过滤(保留教师的通过轨迹,丢弃其余部分),每个周期都会留下相同的困难场景,因为失败没有提供信号。
在 τ2-bench 上,57% 的教师试验失败,其中三分之二是近失(大多数工具调用正确,但因一个决定性错误而失败)。
我们引入了 PROOF-Gen(每个场景的反思优化以克服失败生成),它通过每个场景的提示优化从这些失败中恢复黄金轨迹。对于每个失败的任务,一个反思器分析执行跟踪和评估反馈,然后编写纠正指导,引导教师生成通过的轨迹。指导在训练前被剥离,因此学生从干净的演示中学习,没有特定于任务的脚手架。
在 τ2-bench 上,每个场景的优化恢复了 93% 的失败场景。在组合数据上微调后,Qwen3-4B-Instruct-2507 从 Pass^1=0.132 提高到 0.529,而 Gemma 4 E4B-it 在 BFCL v4 多轮对话中增加了 +7.2 个百分点。在部署的流程中,该方法将轨迹质量提升了 +6.3 个百分点目标完成率,并转移到部署的设备上模型(+1.5 个百分点目标完成率;在响应质量指标上 +1.7 到 +5.0 个百分点),在所有区域都有正向转移(非英语平均 +1.48 个百分点)。
查看缓存全文
缓存时间: 2026/08/26 09:16
# PROOF-Gen:从优化数据到更优的知识蒸馏
来源:https://arxiv.org/html/2608.23911
Junjie Zhu, Shahin Shayandeh
隶属机构:Apple
邮箱:\{atta, jason.zhu, shn\}@apple.com
###### 摘要
在教师模型生成的轨迹上进行监督微调,是将工具调用能力蒸馏至可部署模型的标准初始阶段。驱动已发布工具调用智能体的后训练流程,会以每日或每周的频率重复此阶段,每个周期都需承担前沿教师模型的成本。然而,其机制仅为“生成-筛选”(保留教师的通过轨迹,丢弃其余轨迹),且每个周期都会遗留相同的困难场景——因为失败案例无法提供有效信号。在 τ\tau2-bench 基准测试中,57% 的教师试验失败,其中三分之二属于“险失”(大部分工具调用正确,仅因一个决定性错误而前功尽弃)。我们提出 PROOF-Gen(Per-scenario Reflective Optimization to Overcome Failed Generation),通过逐场景的提示优化,从这些失败案例中恢复黄金轨迹。对于每个失败任务,反思器会分析执行轨迹与评估反馈,随后生成纠正性指导,引导教师产出通过轨迹。训练前会移除这些指导内容,因此学生模型学习的是干净的示范轨迹,无需任务特定的辅助框架。在 τ\tau2-bench 上,逐场景优化恢复了 93% 的失败场景。在组合数据上微调后,Qwen3-4B-Instruct-2507 的 Pass^1 从 0.132 提升至 0.529,Gemma 4 E4B-it 在 BFCL v4 多轮对话任务上提升 7.2 个百分点。在部署流程中,该方法将轨迹质量(目标完成率)提升 6.3 个百分点,并成功迁移至端侧模型(目标完成率提升 1.5 个百分点;响应质量指标提升 1.7 至 5.0 个百分点),且在所有语言区域均呈现正向迁移(非英语平均提升 1.48 个百分点)。
## 1 引言
通过监督微调(SFT)进行的知识蒸馏,是将能力从前沿模型转移至驱动生产环境中工具调用智能体的可部署小模型的主流初始阶段(Agarwal et al., 2024; Li et al., 2025; Luo et al., 2026)。后训练周期以每日或每周的频率运行,以吸收新场景、工具与策略;每个周期都承担相同的前沿教师成本,且每个周期都遗留相同的困难场景——因为标准的“生成-筛选”机制(运行教师模型、用验证器评分、保留通过轨迹)无法从失败中提取任何信号。训练算法(在策略采样、替代散度、部分监督;Agarwal et al., 2024; Luo et al., 2026; Amani et al., 2026)、数据选择(Li et al., 2025)与轨迹结构(Jiang et al., 2026)的最新进展,都基于一个共同假设:教师模型能为重要任务生成正确示范。但 Chu et al.(2025)指出,SFT 倾向于记忆训练分布而非泛化至分布外场景。若最困难的场景系统性地缺席于该分布,任何训练算法或选择策略都无法弥补——蒸馏质量的上限在数据生成阶段即已注定。
任务 → 轨迹模拟 → 框架移除 → ★ 黄金轨迹(逐场景优化) → SFT 数据
图 1:训练流程。对于教师最初失败的每个任务,逐场景优化循环(绿色)会根据轨迹反馈迭代优化一份“备忘单”,直至教师产出通过(“黄金”)轨迹。框架移除阶段会删除该备忘单,因此学生模型仅从轨迹演示中学习;微调流程其余部分保持不变。
在具有基于执行验证的场景中,标准流程(Chen et al., 2023; Liu et al., 2024)为“生成-筛选”:执行教师模型、用验证器评分、保留通过轨迹(拒绝采样;Yuan et al., 2023; STaR;Zelikman et al., 2022; ReST;Gulcehre et al., 2023)。筛选器是二元的:一条完成了几乎所有必要动作仅差一步的轨迹,与一条立即失败的轨迹被同等丢弃,因此困难案例无法产生训练信号。在 τ\tau2-bench 中,67% 失败的 GPT-4o 轨迹正确执行了超过一半的必要工具调用,但一个遗漏动作会引发级联失败,导致整条轨迹被丢弃(图 2)。这种不对称性也解释了为何基于回合级别的部分反馈替代方案仍不充分。对丢弃近乎完整的轨迹,自然反应是对其正确部分给予部分评分。但图 2 显示,失败轨迹中的工具调用准确率已很高;奖励正确的中间动作只是强化了教师已具备的行为。学生模型从未观察到的是:在教师失败的那个关键决策点上,一条完整轨迹如何成功导航。我们在第 4 节通过实验证实了这一点:在部分评分基线(仅筛选条件)上训练,虽将工具调用准确率提升 25 个百分点,但未在任何模型-基准对上提升端到端任务完成率。同理,增加采样数量、提高温度或运行 k-shot 拒绝采样只能恢复随机性失败,而非策略性失败:在状态依赖的决策点上遗漏的一个动作,无论从同一教师重新采样多少次都无法纠正。
官方基准测试(473 个失败模拟)
工具调用:67%
环境状态:7%
数据库状态:6%
扩展电信场景(2,100 个失败任务)
工具调用:71%
环境状态:3%
数据库状态:0.1%
图 2:τ\tau2-bench 上失败 GPT-4o 轨迹的准确率不对称性(278 个任务,各 3 次试验;834 次试验中 473 次失败)。大多数失败执行了超过一半的正确工具调用(工具调用准确率高),但一个遗漏动作会导致错误的终止状态(环境与数据库失败)。由于失败轨迹中的工具调用准确率已高,回合级或部分反馈信号会饱和而无法提升端到端完成率;缺失的是通过决定性步骤的完整轨迹。我们在第 4 节证实了这一点。
我们提出**逐场景反思优化以克服生成失败**(PROOF-Gen),将提示优化引入此流程但颠倒其通常目标:不是寻找一个跨任务通用的提示,而是独立优化每个场景(图 1)。利用 GEPA(Agrawal et al., 2026)——一种迭代提示优化器,我们分析每个失败的执行轨迹与评估反馈,然后向教师系统提示中附加一份逐场景的**备忘单**,写入纠正性指令。教师从头重新执行任务,此过程重复直至所有评估器通过。训练前会移除备忘单(图 1);学生从轨迹演示中学习,而非生成它的框架。该方法适用于任何具有执行器与验证器的领域。此设计还实现了**能力与语音的解耦**:由于执行器保持不变,恢复的轨迹继承了更强反思器的问题解决能力,而不受其交互风格影响。由此产生的蒸馏是**保语音**的,使团队能够在不破坏既定产品语音、延迟配置或语气的情况下升级任务覆盖范围(第 4 节)。
我们围绕三个问题组织研究:逐场景优化能否可靠地从教师失败中恢复高质量轨迹(RQ1);在恢复轨迹上训练的学生模型是否优于仅在筛选数据(部分评分基线)上训练的模型(RQ2);该方法在部署规模评估(涵盖数十种语言区域)中能否超越基准测试表现(RQ3)。我们在第 4 节依次探讨这些问题。
主要研究在 τ\tau2-bench(Barres et al., 2025)上进行,这是一个随机多轮工具调用基准测试,另在 BFCL v4 多轮对话(Patil et al., 2025)上进行了额外实验。教师模型为 GPT-4o,其在官方基准测试中的低通过率(电信 23.5%、航空 45.5%、零售 63.4%)为验证恢复能力提供了充足空间。两个在恢复数据上微调的小型指令微调模型在两个基准测试上均有所提升,且该流程已被采用至生产级工具调用智能体后训练系统;我们在第 4 节报告所有三种场景的结果。
## 2 方法
PROOF-Gen 在标准“生成-筛选”流程中增加一步:恢复被筛选丢弃的轨迹。通常,教师为每个任务生成一条轨迹,我们保留通过的轨迹(**筛选集**)。对于每个**失败**任务,我们随后优化一份一次性、逐场景的提示直至教师成功,移除该提示,并将恢复的轨迹加入训练集(图 1)。学生在筛选轨迹与恢复轨迹的并集上进行微调。
#### 逐场景恢复
反思模型读取失败的执行轨迹与验证器反馈(哪些维度失败、具体断言信息),随后编写一份**备忘单**:一段自然语言指导,附加到该任务的教师系统提示中。教师从头重新执行;若此时通过所有评估器,则保留轨迹;否则反思器修订备忘单,教师再次尝试,最多进行 K=10 次迭代(每次迭代接收最新轨迹与反馈,备忘单累积迄今诊断结果)。我们使用 GEPA(Agrawal et al., 2026)作为优化器,但任何提示优化器均可实现此目标。这颠倒了提示优化的通常目标:不是搜索一个跨输入通用的提示,而是过拟合提示至单一场景并将其丢弃。备忘单是手段;通过的轨迹才是产物。其指导是程序性的(如诊断工具调用的顺序),而非任务特定值(图 11)。经过 K 次迭代仍未解决的场景将被丢弃;恢复率在第 4 节报告。
#### 框架移除
备忘单通过固定分隔符附加,并在训练前删除,因此恢复的轨迹与筛选轨迹无法区分,学生模型永不接触逐场景框架。微调后的任何增益均反映轨迹所演示的内容,而非生成它的提示;我们在附录 B.1 中确认备忘单提供的是指导而非答案。
#### 可配置目标
由于反思器根据验证器报告进行爬山优化,同一循环可针对任何可评估的质量维度组合(如事实性、简洁性、格式规范),而不仅限于任务完成度;我们在生产场景中使用了此特性(第 4 节)。
## 3 实验设置
我们在两个公共基准测试上进行评估,其结构模拟生产级工具调用后训练系统:场景定义用户请求,基于执行的评估器作为质量检查,教师模型生成候选轨迹。生产环境的主要差异在于规模(数千场景与更长轨迹)、多目标优化(多个评估器需同时通过)及持续训练(每日数据摄入与重训练);我们在第 4 节探讨这些差异。
#### 基准测试
τ\tau2-bench(Barres et al., 2025)通过 LLM 用户模拟器模拟多轮客服交互,使评估具有随机性。我们使用电信领域(2,285 个任务,约 50 个工具)进行主实验:其任务空间最大,且在“生成-筛选”下通过率最低(7.3%),为恢复提供了最多失败案例(RQ1)。划分基于任务级别:114 个预留基础任务构成评估集,2,171 个非基础任务用于训练,无任务实例重叠。由于 τ\tau2-bench 任务由模板参数化生成,训练集与评估集可能使用相同模板的不同参数实例化;我们不强制模板级互斥(附录 J)。
BFCL v4 多轮对话(Patil et al., 2025)评估 162 个函数的函数调用能力,使用确定性(预编写)用户轮次,涵盖四类不同失效模式(附录 L)。每类包含 200 个任务(共 800 个);我们按类别进行 70/30 划分,得到 560 个训练任务和 240 个预留测试任务。加入 BFCL 是为了确认下游增益(RQ2)能超越单一随机基准测试的局限性。表 1 总结了两个基准测试。
表 1:基准测试对比。τ\tau2-bench 使用 LLM 用户模拟器;BFCL 使用预编写用户轮次。
#### 模型
我们在相近有效规模下微调两个小型指令微调模型:Gemma 4 E4B-it(Google DeepMind, 2026)(4.5B 有效参数)和 Qwen3-4B-Instruct-2507(Yang et al., 2025)(4B 参数)。两者架构与工具调用格式不同,因此在两者上的提升表明该方法非模型特定(附录 I)。教师模型为 GPT-4o(始终使用 gpt-4o-2024-08-06);主要反思器在 τ\tau2-bench 上为 GPT-5.1,在 BFCL 上为 GPT-5.4(均使用高推理强度),均为运行该基准测试时可用的最强反思器。
#### 数据生成
GPT-4o 为每个任务生成一条轨迹(温度为 0)。表 2 总结了两个基准测试的相应流程。教师通过率差异显著(电信 7.3% vs. BFCL 52.9%),恢复率与其成反比:逐场景优化恢复了 93.0% 尝试的电信失败案例,但仅恢复 BFCL 的 33.7%——因教师已解决较容易任务,仅剩最困难失败。电信领域产生 2,013 个失败,因此我们从随机样本中尝试恢复 300 个,使教师通过轨迹在组合集中保持有意义比例(36%);BFCL 仅产生 264 个失败,数量足够全部尝试。各类别完整计数与训练/测试划分见附录。相似文章
当困惑度误导时:面向生成的混合序列模型蒸馏
本文研究了蒸馏混合序列模型中对数似然与基于生成的评估之间的差异,表明仅凭困惑度可能具有误导性。本文介绍了GenDistill,一个将Transformer蒸馏为Hybrid-KDA模型的流水线,实现了高达75%的KV缓存减少和2-4倍的首次令牌生成时间加速,同时保留了教师模型86-90%的准确率。
SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
Introduces SPOT, a method for on-policy distillation that uses sparse probing and outcome calibration to improve reasoning performance in smaller student models while balancing solution quality and coverage.
@zhaisf: 这是 @geoffreyhinton 提出的蒸馏方法的一些神奇结果,当我第一次看到它们时,真的让我震惊,而且……
本文讨论了模型蒸馏对训练分布的惊人鲁棒性,即使与目标分布的重叠很小,以及其对在线/离线策略蒸馏的影响。
并非所有发散都应被抑制:同策略蒸馏中的反事实可恢复性
提出将反事实可恢复性作为在线策略蒸馏中基于结果的决策变量,表明基于可恢复性进行选择性监督的方法在 AIME 和 GPQA 基准测试上优于仅依赖散度的方法。
在蒸馏前验证:用于在线策略蒸馏的提示级教师门控
本文介绍了教师门控在线策略蒸馏(TGOPD),一种在提示级别验证教师可靠性的方法,以改善在线策略蒸馏,从而在异步设置中实现更好的性能和更高的GPU利用率。