policy-distillation

标签

Cards List
#policy-distillation

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

arXiv cs.LG · 2026-08-05 缓存

SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.

0 人收藏 0 人点赞
#policy-distillation

DAPD:双锚定策略蒸馏

Hugging Face Daily Papers · 2026-08-03 缓存

本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。

0 人收藏 0 人点赞
#policy-distillation

SEED: 面向智能体强化学习的自进化在线策略蒸馏

Papers with Code Trending · 2026-07-16 缓存

提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。

0 人收藏 0 人点赞
#policy-distillation

自我审查强化学习(SRRL):跨回合记忆与策略蒸馏

arXiv cs.LG · 2026-07-08 缓存

本文介绍了一种名为自我审查强化学习(SRRL)的训练框架,该框架在强化学习回合中嵌入自我审查步骤,利用跨回合记忆和选择性策略蒸馏,将稀疏的环境反馈转化为行为改进。在GSM8K上的评估表明,SRRL在Qwen 3-4B和OLMo-3-7B模型上均优于使用GRPO的标准RLVR方法。

0 人收藏 0 人点赞
#policy-distillation

信任区域策略蒸馏

Hugging Face Daily Papers · 2026-07-06 缓存

信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。

0 人收藏 0 人点赞
#policy-distillation

DiffusionOPD:扩散模型中在线策略蒸馏的统一视角

Hugging Face Daily Papers · 2026-05-14 缓存

DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈