TREK:蒸馏以探索,强化以精炼

Hugging Face Daily Papers 论文

摘要

TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。

群体相对策略优化(GRPO)在当前策略已能采样有用推理轨迹时效果显著,但在面对正确解法模式位于学生策略支持范围之外的困难提示时,优化过程会陷入停滞。我们提出TREK(通过前向KL的教师路由探索),这是一种简单的分阶段方法,其蒸馏目的并非模仿,而是扩展探索支持。TREK的一个关键优势在于其通用性:由于它仅消耗验证过的输出轨迹,因此可以使用外部黑盒教师、白盒教师,甚至是同一模型在额外推理时上下文下的自身输出,并且即使在无法访问教师内部信息的情况下,也能高效识别哪些困难提示样本最值得巩固。TREK首先识别未经辅助的学生通过率极低的提示,向提议源查询以生成经过验证的候选解决方案,保留按当前学生似然度排序的前r个提议,执行一个简短的前向KL阶段将这些验证模式拉入学生的支持范围,然后返回标准在策略GRPO进行精炼。在数学推理任务上,使用DeepSeek-V4提议的TREK在所有测试规模的Qwen3模型上均提升了AIME 2024和AIME 2025的成绩;对于Qwen3-8B,它在AIME 2025上从36.9提升至40.3,在AIME 2024上从47.9提升至51.1(avg@16),而自上下文变体无需外部教师即可达到38.5和49.6。在智能体任务上,TREK将ALFWorld成功率从75.8提升至82.8,ScienceWorld成功率从12.5提升至26.7;值得注意的是,在最困难的任务类型上,TREK在训练早期即达到高成功率,而未经辅助的GRPO需要显著更多的优化步骤才能达到同等水平。
查看原文
查看缓存全文

缓存时间: 2026/07/08 02:47

论文页面 - TREK: 通过蒸馏探索,通过强化精炼

来源:https://huggingface.co/papers/2607.05339 发布日期:7月6日

·

提交者:https://huggingface.co/xuyd16

XYX (https://huggingface.co/xuyd16) 于 7月8日

#3 今日论文 (https://huggingface.co/papers/date/2026-07-08) 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

TREK 通过利用蒸馏而非模仿来扩展策略优化的探索支撑,从而在具有挑战性的数学推理和智能体任务上提升性能。

Group Relative Policy Optimization (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO)在当前策略已经能采样到有用推理轨迹时效果显著,但对于那些正确解模式位于学生模型在线策略支撑 (https://huggingface.co/papers?q=on-policy%20support) 之外的困难提示,则会陷入停滞。我们提出 TREK (Teacher-Routed Exploration via Forward KL)(教师路由探索 via 前向KL (https://huggingface.co/papers?q=Forward%20KL)),这是一种简单的分阶段流程,其使用蒸馏 (https://huggingface.co/papers?q=distillation) 的目的不是模仿,而是探索支撑扩展 (https://huggingface.co/papers?q=exploration%20support%20expansion)。TREK 的一个关键优势是其通用性:由于它仅消耗已验证的输出轨迹 (https://huggingface.co/papers?q=verified%20output%20trajectories),因此可以使用外部黑盒教师、白盒教师,或是同一模型在额外推理时上下文下的变体,并且即使无法获取教师内部信息,也能高效识别哪些困难提示样本最值得巩固。TREK 首先识别那些未经辅助的学生模型通过率极低的提示,向提案源查询以生成经过验证的候选解,保留当前学生模型似然度排名最高的 top-r 提案,执行一个短暂的前向 KL 阶段将这些已验证的模式拉入学生模型的支撑集,然后返回标准的在线策略 GRPO 精炼阶段。在数学推理 (https://huggingface.co/papers?q=mathematical%20reasoning) 任务上,使用 DeepSeek-V4 提案的 TREK 在 AIME 2024 和 AIME 2025 上,对所有测试规模的 Qwen3 模型均有提升;对于 Qwen3-8B,其将 AIME 2025 从 36.9 提升至 40.3,AIME 2024 从 47.9 提升至 51.1(avg@16),而自上下文变体无需外部教师即可达到 38.5 和 49.6。在智能体任务 (https://huggingface.co/papers?q=agentic%20tasks) 上,TREK 将 ALFWorld (https://huggingface.co/papers?q=ALFWorld) 的成功率从 75.8 提升至 82.8,ScienceWorld (https://huggingface.co/papers?q=ScienceWorld) 的成功率从 12.5 提升至 26.7;值得注意的是,在最困难的任务类型上,TREK 在训练早期就达到了较高的成功率,而未经辅助的 GRPO 需要更多的优化步骤才能达到可比水平。

查看 arXiv 页面 (https://arxiv.org/abs/2607.05339)查看 PDF (https://arxiv.org/pdf/2607.05339)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05339)

在您的智能体中获取此论文:

hf papers read 2607\.05339

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.05339,以便在此页面建立链接。

引用此论文的数据集0

没有数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.05339,以便在此页面建立链接。

引用此论文的 Space0

没有 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.05339,以便在此页面建立链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,以便在此页面建立链接。

相似文章

信任区域策略蒸馏

Hugging Face Daily Papers

信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。

面向在线策略蒸馏的信任区域行为融合

Hugging Face Daily Papers

信任区域行为融合(TRB)通过在线策略蒸馏的预热阶段,在KL信任区域内用教师行为替换学生早期的劣质轨迹,从而在数学推理任务上取得更强结果。

Trajectory-Refined Distillation

Hugging Face Daily Papers

Trajectory-Refined Distillation (TRD) 通过在蒸馏前在轨迹层面对学生模型的生成序列进行修正,解决了大语言模型(LLM)在同策略蒸馏中的前缀失败问题,在多项基准测试中持续优于先前基线方法。

面向Lean定理证明的LLM反馈蒸馏

arXiv cs.AI

提出反馈蒸馏(Feedback Distillation),一种利用来自LLM的token级监督来改进复杂推理的训练方法,在Lean 4定理证明上进行了评估。该方法比GRPO更好地保持了多样性,且两种方法互补。

通过近未来引导弥合在线蒸馏中的推理轨迹

arXiv cs.CL

本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。