标签
论文提出了Reasoning-Progress-Aware Reward Filtering for On-Policy Distillation (R2-OPD) 来解决教师派生奖励与真实推理进展之间的不匹配问题,提高语言模型训练中的推理性能。
本文提出了自适应熵蒸馏(AED)方法,该方法利用教师熵动态校准知识蒸馏中的词元级模仿强度,在指令跟随和数学推理基准测试上取得了卓越性能。
ReflectRL是一种通过反思“黄金负轨迹”(专家模型失败的推理尝试)来学习的框架,随后将这种反思性推理迁移回直接推理,从而在多个基准上提升大语言模型的性能。
本文介绍了同策略数据演化(ODE)和一种视觉原生智能体框架,以提升多模态深度搜索智能体的性能。通过实现视觉证据的可重用性和闭环数据生成,ODE 显著提升了 Qwen3-VL 智能体在多个基准测试中的表现,超越了 Gemini 2.5 Pro。