标签
本文提出持续负样本对抗蒸馏方法,以解决黑盒在策略蒸馏中的动态目标问题,提升判别器稳定性并改善基准测试性能。
本文提出一个递归框架,通过动态协同进化和自我精炼简洁学习来改进基于策略的自我蒸馏,以增强推理能力。在Qwen3-8B模型上跨数学基准展示了显著提升。
本文提出了领域归一化多教师在策略蒸馏(DN-MOPD),以解决合并专家语言模型时反馈不平衡的问题,并在数学和指令跟随等基准测试中展示了性能提升。
MiMo-V2.6-Flash-MOPD 是对 MiMo-V2.6-Flash-RL 模型的升级,它采用来自领域专用教师的策略内蒸馏,以提升性能并缓解智能体任务中的工具调用重复问题。
本文研究KL散度在大型语言模型在策略蒸馏中的必要性,表明仅保留更新方向即可,并提出共识多教师在策略蒸馏(C-MOPD)以增强多教师学习。
本文介绍了AlignOPSD,用于解决长期智能体在线策略自蒸馏中的决策-时间戳不匹配问题,与基线方法相比,在ALFWorld、WebShop和Search-QA等基准测试中提高了性能。
论文提出LastOPD方法,该方法通过仅在短交叉过渡期的最后一层应用潜在信号,防止潜在在策略蒸馏中的崩溃,进而在MATH-500等基准测试中提升性能。
本文提出CC-OPD,一种用于多约束指令跟随的新颖在线策略蒸馏方法,该方法使用反事实消融来增强训练信号,实现更优性能,其中1.5B模型在基准测试中超越其7B教师模型。
本文研究了在数学推理的策略蒸馏中,提示广度与展开刷新之间的交互,揭示了提示效率取决于学生策略的刷新率和推理预算。
论文表明,在选择性在策略蒸馏实验中使用共享学习率作为对照并非中性,会导致性能和结论的差异,并倡导报告完整的学习率矩阵比较以进行公平评估。
本文介绍对比自蒸馏,通过分离正确性与行为转变来提高AI模型的推理能力,并展示了增强的性能和稳定性。
本文提出了一种信息效率比(IER),用于优化稀疏在线策略蒸馏中的令牌选择,证明仅使用1%的令牌就能达到与全面监督相当的性能。
本文研究了基于策略的蒸馏如何因师生模型间EOS token不匹配而导致输出长度膨胀,并提出了一种通过聚合EOS概率来减少响应长度的纠正方法。
本文提出了RetireOPD,一种利用自退隐策略内蒸馏训练多轮智能体的方法,提升了在ALFWorld和WebShop基准测试上的性能。
OPD-Aha 引入了一种新颖的在策略蒸馏方法,利用视觉偏好来纠正多模态推理中的幻觉,在多个基准测试中实现了持续改进。
本文介绍了Lightning Weave,一个通过在线策略蒸馏将独立训练的推理能力组合成单一高效模型的框架,从而在数学和代码任务中提高准确率并减少令牌使用。
本文介绍了教师门控在线策略蒸馏(TGOPD),一种在提示级别验证教师可靠性的方法,以改善在线策略蒸馏,从而在异步设置中实现更好的性能和更高的GPU利用率。
本文提出了一种基于强化学习的蒸馏框架,用于训练紧凑的指令遵循重排序器。该框架使用离策略GRPO增强教师模型,并通过基于策略的蒸馏训练学生模型,在分布偏移下展现出优越性能。
本文研究了大语言模型的在策略蒸馏,表明单个训练查询就能实现显著的状态覆盖和对齐,表明该方法更受算法限制而非数据限制。
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。