knowledge-distillation

标签

Cards List
#knowledge-distillation

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

arXiv cs.LG · 3天前 缓存

Introduces SPOT, a method for on-policy distillation that uses sparse probing and outcome calibration to improve reasoning performance in smaller student models while balancing solution quality and coverage.

0 人收藏 0 人点赞
#knowledge-distillation

虽有特权,却有偏见:PI条件教师如何破坏自我蒸馏

arXiv cs.AI · 3天前 缓存

本文研究将带特权信息(PI)的自我蒸馏(SD)作为LLM唯一的后期训练目标,在简单任务上复现了已报告的性能提升,但表明它在困难推理任务上会失败:逐token损失下降,而验证准确率停滞或下降。作者将失败归因于PI偏置,它把教师目标拉向参考轨迹,训练出的学生更平坦、更不果断,却没有提升推理能力。

0 人收藏 0 人点赞
#knowledge-distillation

卡在“A”:0.6B语言模型注意力到KDA线性化中的接口损伤诊断与修复

arXiv cs.CL · 4天前 缓存

本文研究了在单块GPU上将Qwen3-0.6B-Base的注意力层转换为KDA线性注意力的失败模式,识别出一种“接口损伤”——模型预测选项标签而非内容,并提出了一个针对格式的KL阶段来修复该问题。

0 人收藏 0 人点赞
#knowledge-distillation

在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号

arXiv cs.CL · 5天前 缓存

本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。

0 人收藏 0 人点赞
#knowledge-distillation

Progressive$^2$:一种用于大幅模型压缩的师生渐进协同进化知识蒸馏方法

arXiv cs.LG · 5天前 缓存

提出Progressive$^2$,一种师生渐进协同进化的知识蒸馏方法,用于大幅模型压缩,解决服务器与客户端能力之间巨大差距的问题。引入了渐进式教师层选择和学生规模缩减,并配备多特征融合适配器。

0 人收藏 0 人点赞
#knowledge-distillation

SKILL-KD:面向LLM智能体的对比技能蒸馏

Hugging Face Daily Papers · 5天前 缓存

SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。

0 人收藏 0 人点赞
#knowledge-distillation

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers · 5天前 缓存

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。

0 人收藏 0 人点赞
#knowledge-distillation

DASH-OPD:用于同策略蒸馏的具有滞回的差异感知切换

arXiv cs.LG · 6天前 缓存

本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。

0 人收藏 0 人点赞
#knowledge-distillation

将大型语言模型的知识蒸馏至面向自主网络作战的轻量级强化学习智能体

arXiv cs.LG · 6天前 缓存

本文研究利用一个80亿参数的LLM来改进自主网络防御,随后将其策略蒸馏到仅含64,910参数的轻量级RL智能体中,并在CybORG场景中证明了其可行性。

0 人收藏 0 人点赞
#knowledge-distillation

知识蒸馏对小型语言模型偏见的非对称影响

arXiv cs.CL · 6天前 缓存

本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。

0 人收藏 0 人点赞
#knowledge-distillation

@pallavishekhar_: 知识蒸馏是如何工作的?在此阅读:https://outcomeschool.com/blog/how-does-knowledge-distillation-work…

X AI KOLs Timeline · 2026-07-31 缓存

一篇教育性的博客文章,解释了知识蒸馏的工作原理,涵盖教师-学生框架、软标签、温度和蒸馏损失,并附有实际示例。

0 人收藏 0 人点赞
#knowledge-distillation

SAF-OPD:用于在线策略蒸馏的稳定优势融合

Hugging Face Daily Papers · 2026-07-31 缓存

SAF-OPD 引入了一种稳定优势融合框架,将 RLVR 与在线策略蒸馏相结合,解决了幅度失配和时间失配问题,从而提高了数学和代码基准测试中的训练稳定性与性能。

0 人收藏 0 人点赞
#knowledge-distillation

检测器失效之处:通过专家引导的互蒸馏弥合尾部领域差距

arXiv cs.CL · 2026-07-30 缓存

本文提出专家引导的互蒸馏(EGMD)方法,以解决多模态假新闻检测中的领域偏差和语义错配问题,在四个数据集上实现了最先进的准确率,并将领域偏差降低高达57.3%。

0 人收藏 0 人点赞
#knowledge-distillation

Weak-to-Strong On-Policy Distillation

arXiv cs.LG · 2026-07-30 缓存

介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。

0 人收藏 0 人点赞
#knowledge-distillation

Flux-OPD:演化上下文下的同策略蒸馏

Hugging Face Daily Papers · 2026-07-30 缓存

Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。

0 人收藏 0 人点赞
#knowledge-distillation

传递接力棒:轨迹中继在策略蒸馏

arXiv cs.CL · 2026-07-29 缓存

提出中继在策略蒸馏(Relay-OPD),通过在检测到的交接触发点让教师短暂接管以纠正推理轨迹,解决了在策略蒸馏中的前缀失败问题。在数学推理基准上实现一致改进,并将训练轨迹长度减少超过50%。

0 人收藏 0 人点赞
#knowledge-distillation

掩码蒸馏:将思维链内化到语言模型中

arXiv cs.AI · 2026-07-28 缓存

掩码蒸馏是一种知识蒸馏框架,它训练学生大语言模型仅预测解决方案令牌,同时推理教师提供反馈,旨在将思维链计算内化到模型参数中。该方法显示任务相关的成功,在GSM8K上有效,但对于像Countdown这样更困难的任务需要小型脚手架。

0 人收藏 0 人点赞
#knowledge-distillation

CausalGate: 因果重要性蒸馏用于Transformer模块剪枝

arXiv cs.LG · 2026-07-28 缓存

CausalGate引入了一种方法,通过因果干预测量Transformer子层的重要性,并将其蒸馏为静态标量门控,实现高效推理且无运行时开销,优于现有的剪枝和路由方法。

0 人收藏 0 人点赞
#knowledge-distillation

AMRD:面向轻量级语音情感识别的自适应多教师关系蒸馏

Hugging Face Daily Papers · 2026-07-28 缓存

本文介绍了AMRD,一种自适应多教师关系蒸馏方法,用于将大型自监督语音情感识别模型压缩为面向边缘设备的轻量级学生模型。它解决了教师可靠性变化和关系结构丢失的问题,在IEMOCAP和CREMA-D数据集上展示了改进。

0 人收藏 0 人点赞
#knowledge-distillation

Nvidia CEO黄仁勋为开源AI辩护,称知识蒸馏是学习的基础

Reddit r/LocalLLaMA · 2026-07-27

Nvidia CEO黄仁勋为开源AI辩护,表示知识蒸馏是学习过程的基础。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈