on-policy-training

标签

Cards List
#on-policy-training

超越模仿:基于推理进展过滤策略蒸馏

arXiv cs.AI · 2026-08-21 缓存

论文提出了Reasoning-Progress-Aware Reward Filtering for On-Policy Distillation (R2-OPD) 来解决教师派生奖励与真实推理进展之间的不匹配问题,提高语言模型训练中的推理性能。

0 人收藏 0 人点赞
#on-policy-training

重新思考逆向KL作为自适应熵蒸馏

arXiv cs.LG · 2026-08-18 缓存

本文提出了自适应熵蒸馏(AED)方法,该方法利用教师熵动态校准知识蒸馏中的词元级模仿强度,在指令跟随和数学推理基准测试上取得了卓越性能。

0 人收藏 0 人点赞
#on-policy-training

ReflectRL:通过反思到直接推理从黄金负轨迹中学习

Hugging Face Daily Papers · 2026-08-04 缓存

ReflectRL是一种通过反思“黄金负轨迹”(专家模型失败的推理尝试)来学习的框架,随后将这种反思性推理迁移回直接推理,从而在多个基准上提升大语言模型的性能。

0 人收藏 0 人点赞
#on-policy-training

面向视觉原生多模态深度搜索智能体的同策略数据演化

Hugging Face Daily Papers · 2026-05-11 缓存

本文介绍了同策略数据演化(ODE)和一种视觉原生智能体框架,以提升多模态深度搜索智能体的性能。通过实现视觉证据的可重用性和闭环数据生成,ODE 显著提升了 Qwen3-VL 智能体在多个基准测试中的表现,超越了 Gemini 2.5 Pro。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈