潜在同策略自蒸馏 (LOPD)

Hugging Face Daily Papers 论文

摘要

本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。

使智能体能够从经验中学习并将其内化到其策略中,已成为自进化AI中的一个核心问题。同策略自蒸馏(OPSD)提供了一条有效途径,通过使用一个特权自教师对学生自身的轨迹提供密集监督;然而,现有方法仍然严重依赖于设计师指定的特权工件(例如,答案、反馈、技能或轨迹),限制了持续自我改进所需的端到端可学习性和可扩展性。在这项工作中,我们介绍了潜在同策略自蒸馏(LOPD),它不是提出另一种手工制作的OPSD变体并带有新规定的特权上下文形式,而是使教师的特权上下文本身能够从经验中端到端学习。技术上,LOPD检索相关经验并将其组合成连续的潜在token来条件化一个自教师,同时学生从任务和交互历史生成轨迹,并在每个访问的前缀处接收密集的token级别监督。我们进一步引入了一个特权边界目标来稳定和规范潜在上下文的学习。实证上,LOPD展示了(I)强大的性能,在智能工具使用和代码生成两个方面超越了RLVR和代表性的OPSD方法,包括OPSD、SDPO和Skill-SD;以及(II)高学习效率,以不到其30%的滚动预算超越了GRPO和Skill-SD。消融研究进一步提供了直接证据,表明使特权上下文可学习对于实现这些收益是必要的。总之,这些结果将LOPD定位为迈向更可扩展和自导向的智能体进化范式的一步。
查看原文
查看缓存全文

缓存时间: 2026/08/17 07:45

论文页面 - 潜在在策略自蒸馏

来源:https://huggingface.co/papers/2608.13040 发布于 8月13日

·

由 https://huggingface.co/greeky 提交

gbz (https://huggingface.co/greeky) 于 8月17日

摘要

潜在在策略自蒸馏通过端到端地从经验中学习特权教学上下文,提供密集的令牌级监督,从而提升智能体的性能和效率。

使智能体能够从经验中学习并将其内化为自身策略,已成为自我进化人工智能的核心问题。在策略自蒸馏(https://huggingface.co/papers?q=On-policy%20self-distillation) (OPSD) 通过使用特权自教师(https://huggingface.co/papers?q=privileged%20self-teacher)为学生自身的轨迹提供密集监督,提供了一条有效途径;然而,现有方法仍然严重依赖设计师指定的特权工件(例如答案、反馈、技能或轨迹),限制了实现持续自我改进所需的端到端可学习性和可扩展性。在本工作中,我们引入了潜在在策略自蒸馏(https://huggingface.co/papers?q=On-Policy%20Self-Distillation) (LOPD),它并非提出另一种具有新指定形式特权上下文的经过手工设计的 OPSD 变体,而是使教师的特权上下文本身能够端到端地从经验中学习。技术上,LOPD 检索相关经验并将其组合成连续的潜在令牌(https://huggingface.co/papers?q=latent%20tokens)来调节自教师,而学生则从任务和交互历史中生成轨迹,并在每个访问过的前缀处接收密集的令牌级监督(https://huggingface.co/papers?q=token-level%20supervision)。我们进一步引入了特权边际目标(https://huggingface.co/papers?q=privileged-margin%20objective)以稳定和调控潜在上下文的学习。实证表明,LOPD 展示了 (I) 强劲的性能,在智能体工具使用和代码生成任务中均超越了 RLVR(https://huggingface.co/papers?q=RLVR)和包括 OPSD、SDPO(https://huggingface.co/papers?q=SDPO)以及 Skill-SD(https://huggingface.co/papers?q=Skill-SD)在内的代表性 OPSD 方法;以及 (II) 高学习效率,仅使用不到 30% 的展开预算就超越了 GRPO(https://huggingface.co/papers?q=GRPO)和 Skill-SD(https://huggingface.co/papers?q=Skill-SD)。消融研究进一步提供了直接证据,证明使特权上下文可学习对于实现这些收益是必要的。总之,这些结果将 LOPD 定位为迈向更可扩展、更自主的智能体进化范式的一步。

查看 arXiv 页面 (https://arxiv.org/abs/2608.13040) 查看 PDF (https://arxiv.org/pdf/2608.13040) GitHub20 (https://github.com/bingreeky/LOPD) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.13040)

在智能体中获取本文档:

hf papers read 2608.13040

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文档的模型 2

liunanfu1992/Qwen3-8B-LOPD 8B • 3天前更新 • 35 • 1 (https://huggingface.co/liunanfu1992/Qwen3-8B-LOPD)

liunanfu1992/OLMo-3-7B-Think-LOPD 7B • 3天前更新 • 36 (https://huggingface.co/liunanfu1992/OLMo-3-7B-Think-LOPD)

引用本文档的数据集 0

没有关联此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.13040,即可从本页面链接它。

引用本文档的 Spaces 0

没有关联此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2608.13040,即可从本页面链接它。

包含本文档的收藏夹 1

相似文章

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

OPID: 同策略技能蒸馏用于智能体强化学习

Hugging Face Daily Papers

OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。

无需任何监督的同策略自蒸馏

Hugging Face Daily Papers

介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。