潜在同策略自蒸馏 (LOPD)
摘要
本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。
查看缓存全文
缓存时间: 2026/08/17 07:45
论文页面 - 潜在在策略自蒸馏
来源:https://huggingface.co/papers/2608.13040 发布于 8月13日
·
由 https://huggingface.co/greeky 提交
gbz (https://huggingface.co/greeky) 于 8月17日
摘要
潜在在策略自蒸馏通过端到端地从经验中学习特权教学上下文,提供密集的令牌级监督,从而提升智能体的性能和效率。
使智能体能够从经验中学习并将其内化为自身策略,已成为自我进化人工智能的核心问题。在策略自蒸馏(https://huggingface.co/papers?q=On-policy%20self-distillation) (OPSD) 通过使用特权自教师(https://huggingface.co/papers?q=privileged%20self-teacher)为学生自身的轨迹提供密集监督,提供了一条有效途径;然而,现有方法仍然严重依赖设计师指定的特权工件(例如答案、反馈、技能或轨迹),限制了实现持续自我改进所需的端到端可学习性和可扩展性。在本工作中,我们引入了潜在在策略自蒸馏(https://huggingface.co/papers?q=On-Policy%20Self-Distillation) (LOPD),它并非提出另一种具有新指定形式特权上下文的经过手工设计的 OPSD 变体,而是使教师的特权上下文本身能够端到端地从经验中学习。技术上,LOPD 检索相关经验并将其组合成连续的潜在令牌(https://huggingface.co/papers?q=latent%20tokens)来调节自教师,而学生则从任务和交互历史中生成轨迹,并在每个访问过的前缀处接收密集的令牌级监督(https://huggingface.co/papers?q=token-level%20supervision)。我们进一步引入了特权边际目标(https://huggingface.co/papers?q=privileged-margin%20objective)以稳定和调控潜在上下文的学习。实证表明,LOPD 展示了 (I) 强劲的性能,在智能体工具使用和代码生成任务中均超越了 RLVR(https://huggingface.co/papers?q=RLVR)和包括 OPSD、SDPO(https://huggingface.co/papers?q=SDPO)以及 Skill-SD(https://huggingface.co/papers?q=Skill-SD)在内的代表性 OPSD 方法;以及 (II) 高学习效率,仅使用不到 30% 的展开预算就超越了 GRPO(https://huggingface.co/papers?q=GRPO)和 Skill-SD(https://huggingface.co/papers?q=Skill-SD)。消融研究进一步提供了直接证据,证明使特权上下文可学习对于实现这些收益是必要的。总之,这些结果将 LOPD 定位为迈向更可扩展、更自主的智能体进化范式的一步。
查看 arXiv 页面 (https://arxiv.org/abs/2608.13040) 查看 PDF (https://arxiv.org/pdf/2608.13040) GitHub20 (https://github.com/bingreeky/LOPD) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.13040)
在智能体中获取本文档:
hf papers read 2608.13040
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文档的模型 2
liunanfu1992/Qwen3-8B-LOPD 8B • 3天前更新 • 35 • 1 (https://huggingface.co/liunanfu1992/Qwen3-8B-LOPD)
liunanfu1992/OLMo-3-7B-Think-LOPD 7B • 3天前更新 • 36 (https://huggingface.co/liunanfu1992/OLMo-3-7B-Think-LOPD)
引用本文档的数据集 0
没有关联此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.13040,即可从本页面链接它。
引用本文档的 Spaces 0
没有关联此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2608.13040,即可从本页面链接它。
包含本文档的收藏夹 1
相似文章
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
无需任何监督的同策略自蒸馏
介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。
当教师误导:虚假信号感知的在线策略蒸馏
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。