标签
本文介绍了STEMMA,一个通过对抗性方式探测大语言模型中自我身份一致性的多智能体框架,其动机是担心知识蒸馏可能会将行为特征(如身份表示)从教师模型迁移到学生模型。
Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。
FutureBridge introduces a token reranker for collaborative decoding that ranks LLM-SLM candidates based on how well the SLM can continue reasoning from them, improving the Qwen3-1.7B SLM's math accuracy by 35.1% over greedy decoding.
This paper investigates the warm-up stage for on-policy distillation (OPD), showing that teacher-compatible chain-of-thought supervision and LoRA-based training with near-saturation duration improve OPD effectiveness. It introduces Simple-OPD, a plug-and-play initialization method that boosts OPD performance across diverse settings.
Introduces SPOT, a method for on-policy distillation that uses sparse probing and outcome calibration to improve reasoning performance in smaller student models while balancing solution quality and coverage.
本文研究将带特权信息(PI)的自我蒸馏(SD)作为LLM唯一的后期训练目标,在简单任务上复现了已报告的性能提升,但表明它在困难推理任务上会失败:逐token损失下降,而验证准确率停滞或下降。作者将失败归因于PI偏置,它把教师目标拉向参考轨迹,训练出的学生更平坦、更不果断,却没有提升推理能力。
本文研究了在单块GPU上将Qwen3-0.6B-Base的注意力层转换为KDA线性注意力的失败模式,识别出一种“接口损伤”——模型预测选项标签而非内容,并提出了一个针对格式的KL阶段来修复该问题。
本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。
提出Progressive$^2$,一种师生渐进协同进化的知识蒸馏方法,用于大幅模型压缩,解决服务器与客户端能力之间巨大差距的问题。引入了渐进式教师层选择和学生规模缩减,并配备多特征融合适配器。
本文对如何让LLM的知识蒸馏训练更高效进行了实践研究,引入了离线Top-K logits缓存和一种融合的分块KL损失,从而减少内存尖峰,并允许在单张GPU上训练更长的上下文。
SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。
本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。
本文研究利用一个80亿参数的LLM来改进自主网络防御,随后将其策略蒸馏到仅含64,910参数的轻量级RL智能体中,并在CybORG场景中证明了其可行性。
本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。
一篇教育性的博客文章,解释了知识蒸馏的工作原理,涵盖教师-学生框架、软标签、温度和蒸馏损失,并附有实际示例。
SAF-OPD 引入了一种稳定优势融合框架,将 RLVR 与在线策略蒸馏相结合,解决了幅度失配和时间失配问题,从而提高了数学和代码基准测试中的训练稳定性与性能。
本文提出专家引导的互蒸馏(EGMD)方法,以解决多模态假新闻检测中的领域偏差和语义错配问题,在四个数据集上实现了最先进的准确率,并将领域偏差降低高达57.3%。
介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。
Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。