多轮长程规划的物理学:通过单教师与多教师在线策略智能体蒸馏从预训练到后训练
摘要
本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。
查看缓存全文
缓存时间: 2026/07/28 06:32
论文页面 - 多轮长程规划的物理原理:通过单教师与多教师同策略智能体蒸馏从预训练到后训练
来源:https://huggingface.co/papers/2607.24720
摘要
多轮长程规划对于基础模型智能体至关重要,然而如何从根本上提升这一能力仍不明确。现有模型基于不可控且不透明的互联网数据进行训练,导致难以厘清规划能力是如何获取、塑造并整合的。为应对这一挑战,我们引入了一个统一可控的多轮环境,能够实现精确控制。该环境支持系统性地研究长程规划在三个阶段的表现。(1)预训练阶段的规划能力获取:我们研究了数据格式、分布和质量。通过CoT状态转移建模构建显式世界模型,能够实现更强的长程泛化能力。仅靠原子技能不足以实现组合泛化,而少量长程数据即可发挥作用。此外,次优轨迹会严重损害性能,因为误差会在长程中不断放大。(2)后训练阶段通过GRPO和OPD塑造规划能力:通过互信息,我们区分了通用规划模式与任务特定规划知识。对于规划模式,我们识别出后训练的三种应用区域:不必要、有效和不可支持。在低质量和长程设定下,OPD的有效区域比GRPO更广,因为它提供更一致的更新方向。对于规划知识,从具有不同知识的教师那里蒸馏未见过程,可能会损害学生先前的世界建模,而无法完全建立新知识。(3)后训练阶段通过MOPD整合规划能力:我们证明,多教师同策略蒸馏(MOPD)通过收敛到跨环境的共享规划模式来整合能力。兼容模式支持跨环境泛化,部分共享模式支持持续学习,而完全冲突的模式则会导致严重干扰。
查看arXiv页面 (https://arxiv.org/abs/2607.24720)查看PDF (https://arxiv.org/pdf/2607.24720)项目页面 (https://quester-one.github.io/PlanPhysWebsite/)GitHub0 (https://github.com/Quester-one/PlanPhysCode)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24720)
在您的智能体中使用此论文:
hf papers read 2607\.24720
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
尚无模型引用此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.24720,以从此页面链接。
引用此论文的数据集0
尚无数据集引用此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.24720,以从此页面链接。
引用此论文的Space0
尚无Space引用此论文
请在Space README.md 中引用 arxiv.org/abs/2607.24720,以从此页面链接。
包含此论文的收藏集1
相似文章
MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏
MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。
TurnOPD: 使在线策略蒸馏对回合感知以实现高效长程智能体训练
TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。
基于前缀重放的多轮在线策略蒸馏
本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
ATOD:面向多轮自主智能体的退火轮次感知在线策略蒸馏
本文介绍了ATOD,一种结合在线策略蒸馏和强化学习的混合在线蒸馏算法,用于在多轮任务中训练小型语言模型智能体,其特点是采用退火OPD-RL调度和轮次级分歧-不确定性重新加权,以改善密集监督。