TREK:蒸馏以探索,强化以精炼
摘要
TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。
查看缓存全文
缓存时间: 2026/07/08 02:47
论文页面 - TREK: 通过蒸馏探索,通过强化精炼
来源:https://huggingface.co/papers/2607.05339 发布日期:7月6日
·
提交者:https://huggingface.co/xuyd16
XYX (https://huggingface.co/xuyd16) 于 7月8日
#3 今日论文 (https://huggingface.co/papers/date/2026-07-08) 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
TREK 通过利用蒸馏而非模仿来扩展策略优化的探索支撑,从而在具有挑战性的数学推理和智能体任务上提升性能。
Group Relative Policy Optimization (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO)在当前策略已经能采样到有用推理轨迹时效果显著,但对于那些正确解模式位于学生模型在线策略支撑 (https://huggingface.co/papers?q=on-policy%20support) 之外的困难提示,则会陷入停滞。我们提出 TREK (Teacher-Routed Exploration via Forward KL)(教师路由探索 via 前向KL (https://huggingface.co/papers?q=Forward%20KL)),这是一种简单的分阶段流程,其使用蒸馏 (https://huggingface.co/papers?q=distillation) 的目的不是模仿,而是探索支撑扩展 (https://huggingface.co/papers?q=exploration%20support%20expansion)。TREK 的一个关键优势是其通用性:由于它仅消耗已验证的输出轨迹 (https://huggingface.co/papers?q=verified%20output%20trajectories),因此可以使用外部黑盒教师、白盒教师,或是同一模型在额外推理时上下文下的变体,并且即使无法获取教师内部信息,也能高效识别哪些困难提示样本最值得巩固。TREK 首先识别那些未经辅助的学生模型通过率极低的提示,向提案源查询以生成经过验证的候选解,保留当前学生模型似然度排名最高的 top-r 提案,执行一个短暂的前向 KL 阶段将这些已验证的模式拉入学生模型的支撑集,然后返回标准的在线策略 GRPO 精炼阶段。在数学推理 (https://huggingface.co/papers?q=mathematical%20reasoning) 任务上,使用 DeepSeek-V4 提案的 TREK 在 AIME 2024 和 AIME 2025 上,对所有测试规模的 Qwen3 模型均有提升;对于 Qwen3-8B,其将 AIME 2025 从 36.9 提升至 40.3,AIME 2024 从 47.9 提升至 51.1(avg@16),而自上下文变体无需外部教师即可达到 38.5 和 49.6。在智能体任务 (https://huggingface.co/papers?q=agentic%20tasks) 上,TREK 将 ALFWorld (https://huggingface.co/papers?q=ALFWorld) 的成功率从 75.8 提升至 82.8,ScienceWorld (https://huggingface.co/papers?q=ScienceWorld) 的成功率从 12.5 提升至 26.7;值得注意的是,在最困难的任务类型上,TREK 在训练早期就达到了较高的成功率,而未经辅助的 GRPO 需要更多的优化步骤才能达到可比水平。
查看 arXiv 页面 (https://arxiv.org/abs/2607.05339)查看 PDF (https://arxiv.org/pdf/2607.05339)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05339)
在您的智能体中获取此论文:
hf papers read 2607\.05339
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.05339,以便在此页面建立链接。
引用此论文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.05339,以便在此页面建立链接。
引用此论文的 Space0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.05339,以便在此页面建立链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,以便在此页面建立链接。
相似文章
信任区域策略蒸馏
信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。
面向在线策略蒸馏的信任区域行为融合
信任区域行为融合(TRB)通过在线策略蒸馏的预热阶段,在KL信任区域内用教师行为替换学生早期的劣质轨迹,从而在数学推理任务上取得更强结果。
Trajectory-Refined Distillation
Trajectory-Refined Distillation (TRD) 通过在蒸馏前在轨迹层面对学生模型的生成序列进行修正,解决了大语言模型(LLM)在同策略蒸馏中的前缀失败问题,在多项基准测试中持续优于先前基线方法。
面向Lean定理证明的LLM反馈蒸馏
提出反馈蒸馏(Feedback Distillation),一种利用来自LLM的token级监督来改进复杂推理的训练方法,在Lean 4定理证明上进行了评估。该方法比GRPO更好地保持了多样性,且两种方法互补。
通过近未来引导弥合在线蒸馏中的推理轨迹
本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。