on-policy-distillation

标签

Cards List
#on-policy-distillation

对抗性黑盒在策略蒸馏中的持续负样本

arXiv cs.CL ↗ · 昨天 缓存

本文提出持续负样本对抗蒸馏方法,以解决黑盒在策略蒸馏中的动态目标问题,提升判别器稳定性并改善基准测试性能。

0 人收藏 0 人点赞
#on-policy-distillation

基于策略蒸馏的推理递归自我改进

arXiv cs.CL ↗ · 昨天 缓存

本文提出一个递归框架,通过动态协同进化和自我精炼简洁学习来改进基于策略的自我蒸馏,以增强推理能力。在Qwen3-8B模型上跨数学基准展示了显著提升。

0 人收藏 0 人点赞
#on-policy-distillation

超越教师分配:领域归一化多教师在策略蒸馏

Hugging Face Daily Papers ↗ · 2天前 缓存

本文提出了领域归一化多教师在策略蒸馏(DN-MOPD),以解决合并专家语言模型时反馈不平衡的问题,并在数学和指令跟随等基准测试中展示了性能提升。

0 人收藏 0 人点赞
#on-policy-distillation

MiMo v2.6 Flash MOPD

Reddit r/LocalLLaMA ↗ · 2天前 缓存

MiMo-V2.6-Flash-MOPD 是对 MiMo-V2.6-Flash-RL 模型的升级,它采用来自领域专用教师的策略内蒸馏,以提升性能并缓解智能体任务中的工具调用重复问题。

0 人收藏 0 人点赞
#on-policy-distillation

KL散度在大型语言模型在策略蒸馏中是否必要?

Hugging Face Daily Papers ↗ · 3天前 缓存

本文研究KL散度在大型语言模型在策略蒸馏中的必要性,表明仅保留更新方向即可,并提出共识多教师在策略蒸馏(C-MOPD)以增强多教师学习。

0 人收藏 0 人点赞
#on-policy-distillation

超越时间戳:面向长期智能体的决策对齐在线策略蒸馏

Hugging Face Daily Papers ↗ · 3天前 缓存

本文介绍了AlignOPSD,用于解决长期智能体在线策略自蒸馏中的决策-时间戳不匹配问题,与基线方法相比,在ALFWorld、WebShop和Search-QA等基准测试中提高了性能。

0 人收藏 0 人点赞
#on-policy-distillation

LastOPD:抑制潜在在策略蒸馏中的崩溃

arXiv cs.LG ↗ · 4天前 缓存

论文提出LastOPD方法,该方法通过仅在短交叉过渡期的最后一层应用潜在信号,防止潜在在策略蒸馏中的崩溃,进而在MATH-500等基准测试中提升性能。

0 人收藏 0 人点赞
#on-policy-distillation

基于反事实约束的多约束指令跟随在线策略蒸馏

arXiv cs.LG ↗ · 5天前 缓存

本文提出CC-OPD,一种用于多约束指令跟随的新颖在线策略蒸馏方法,该方法使用反事实消融来增强训练信号,实现更优性能,其中1.5B模型在基准测试中超越其7B教师模型。

0 人收藏 0 人点赞
#on-policy-distillation

提示广度与展开刷新在策略蒸馏中的交互

arXiv cs.CL ↗ · 6天前 缓存

本文研究了在数学推理的策略蒸馏中,提示广度与展开刷新之间的交互,揭示了提示效率取决于学生策略的刷新率和推理预算。

0 人收藏 0 人点赞
#on-policy-distillation

共享学习率在选择性在策略蒸馏中并非中性对照

arXiv cs.LG ↗ · 2026-09-22 缓存

论文表明,在选择性在策略蒸馏实验中使用共享学习率作为对照并非中性,会导致性能和结论的差异,并倡导报告完整的学习率矩阵比较以进行公平评估。

0 人收藏 0 人点赞
#on-policy-distillation

论排斥与吸引教师:在自蒸馏中分离正确性与行为

arXiv cs.LG ↗ · 2026-09-21 缓存

本文介绍对比自蒸馏,通过分离正确性与行为转变来提高AI模型的推理能力,并展示了增强的性能和稳定性。

0 人收藏 0 人点赞
#on-policy-distillation

1%的令牌或许已足够:探讨在线策略蒸馏中的梯度估计

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

本文提出了一种信息效率比(IER),用于优化稀疏在线策略蒸馏中的令牌选择,证明仅使用1%的令牌就能达到与全面监督相当的性能。

0 人收藏 0 人点赞
#on-policy-distillation

当EOS Token产生分歧:理解在策略蒸馏中的长度膨胀现象

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

本文研究了基于策略的蒸馏如何因师生模型间EOS token不匹配而导致输出长度膨胀,并提出了一种通过聚合EOS概率来减少响应长度的纠正方法。

0 人收藏 0 人点赞
#on-policy-distillation

RetireOPD:面向智能体强化学习的自退隐策略内蒸馏

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

本文提出了RetireOPD,一种利用自退隐策略内蒸馏训练多轮智能体的方法,提升了在ALFWorld和WebShop基准测试上的性能。

0 人收藏 0 人点赞
#on-policy-distillation

OPD-Aha:从语言动量到多模态在策略蒸馏中的视觉反思

arXiv cs.LG ↗ · 2026-09-16 缓存

OPD-Aha 引入了一种新颖的在策略蒸馏方法,利用视觉偏好来纠正多模态推理中的幻觉,在多个基准测试中实现了持续改进。

0 人收藏 0 人点赞
#on-policy-distillation

Lightning Weave: 通过能力组合提升推理模型的准确率-效率前沿

Hugging Face Daily Papers ↗ · 2026-09-13 缓存

本文介绍了Lightning Weave,一个通过在线策略蒸馏将独立训练的推理能力组合成单一高效模型的框架,从而在数学和代码任务中提高准确率并减少令牌使用。

0 人收藏 0 人点赞
#on-policy-distillation

在蒸馏前验证:用于在线策略蒸馏的提示级教师门控

arXiv cs.LG ↗ · 2026-09-04 缓存

本文介绍了教师门控在线策略蒸馏(TGOPD),一种在提示级别验证教师可靠性的方法,以改善在线策略蒸馏,从而在异步设置中实现更好的性能和更高的GPU利用率。

0 人收藏 0 人点赞
#on-policy-distillation

基于策略的蒸馏与离策略GRPO结合:训练紧凑指令遵循重排序器

arXiv cs.LG ↗ · 2026-09-03 缓存

本文提出了一种基于强化学习的蒸馏框架,用于训练紧凑的指令遵循重排序器。该框架使用离策略GRPO增强教师模型,并通过基于策略的蒸馏训练学生模型,在分布偏移下展现出优越性能。

0 人收藏 0 人点赞
#on-policy-distillation

反思大语言模型在策略蒸馏 II:单个训练样本

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文研究了大语言模型的在策略蒸馏,表明单个训练查询就能实现显著的状态覆盖和对齐,表明该方法更受算法限制而非数据限制。

0 人收藏 0 人点赞
#on-policy-distillation

策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈