多轮长程规划的物理学:通过单教师与多教师在线策略智能体蒸馏从预训练到后训练

Hugging Face Daily Papers 论文

摘要

本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。

多轮长程规划对于基础模型智能体至关重要,但如何从根本上提升它仍不明确。现有模型在不可控且不透明的互联网数据上训练,使得难以识别规划能力是如何获取、塑造和集成的。为应对这一挑战,我们引入了一个统一且受控的多轮环境,能够实现精确控制。它允许系统性地研究三个阶段的长期规划。 (1) 预训练期间的规划能力获取。我们研究了数据格式、分布与质量。通过CoT状态转换建模构建显式世界模型可以带来更强的长程泛化能力。仅靠原子技能不足以实现组合泛化,但少量长程数据即可奏效。此外,次优轨迹会严重损害性能,因为误差会在长程中放大。 (2) 通过GRPO与OPD后训练进行规划能力塑造。通过互信息,我们区分了一般规划模式与任务特定的规划知识。对于规划模式,我们确定了后训练的三种应用区域:不必要、有效与不支持。在低质量和长程设置下,OPD比GRPO具有更广的有效区域,因为它提供了更一致的更新方向。对于规划知识,从具有不同知识的教师那里蒸馏未见过的过程可能会损害学生先前的世界模型,而无法完全建立新知识。 (3) 通过MOPD后训练进行规划能力集成。我们表明,多教师在线策略蒸馏(MOPD)通过收敛到跨环境共享的规划模式来集成能力。兼容的模式实现跨环境泛化,部分共享的模式支持持续学习,而完全冲突的模式则导致严重干扰。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:32

论文页面 - 多轮长程规划的物理原理:通过单教师与多教师同策略智能体蒸馏从预训练到后训练

来源:https://huggingface.co/papers/2607.24720

摘要

多轮长程规划对于基础模型智能体至关重要,然而如何从根本上提升这一能力仍不明确。现有模型基于不可控且不透明的互联网数据进行训练,导致难以厘清规划能力是如何获取、塑造并整合的。为应对这一挑战,我们引入了一个统一可控的多轮环境,能够实现精确控制。该环境支持系统性地研究长程规划在三个阶段的表现。(1)预训练阶段的规划能力获取:我们研究了数据格式、分布和质量。通过CoT状态转移建模构建显式世界模型,能够实现更强的长程泛化能力。仅靠原子技能不足以实现组合泛化,而少量长程数据即可发挥作用。此外,次优轨迹会严重损害性能,因为误差会在长程中不断放大。(2)后训练阶段通过GRPO和OPD塑造规划能力:通过互信息,我们区分了通用规划模式与任务特定规划知识。对于规划模式,我们识别出后训练的三种应用区域:不必要、有效和不可支持。在低质量和长程设定下,OPD的有效区域比GRPO更广,因为它提供更一致的更新方向。对于规划知识,从具有不同知识的教师那里蒸馏未见过程,可能会损害学生先前的世界建模,而无法完全建立新知识。(3)后训练阶段通过MOPD整合规划能力:我们证明,多教师同策略蒸馏(MOPD)通过收敛到跨环境的共享规划模式来整合能力。兼容模式支持跨环境泛化,部分共享模式支持持续学习,而完全冲突的模式则会导致严重干扰。

查看arXiv页面 (https://arxiv.org/abs/2607.24720)查看PDF (https://arxiv.org/pdf/2607.24720)项目页面 (https://quester-one.github.io/PlanPhysWebsite/)GitHub0 (https://github.com/Quester-one/PlanPhysCode)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24720)

在您的智能体中使用此论文:

hf papers read 2607\.24720

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

尚无模型引用此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.24720,以从此页面链接。

引用此论文的数据集0

尚无数据集引用此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.24720,以从此页面链接。

引用此论文的Space0

尚无Space引用此论文

请在Space README.md 中引用 arxiv.org/abs/2607.24720,以从此页面链接。

包含此论文的收藏集1

相似文章

MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏

Hugging Face Daily Papers

MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。