knowledge-distillation

标签

Cards List
#knowledge-distillation

可复现、许可证感知的CPU可部署安全分类蒸馏方案

arXiv cs.AI ↗ · 2026-08-25 缓存

本文提出一种可复现且符合许可证要求的知识蒸馏方法,用于创建可在CPU硬件上运行的高效大语言模型安全分类器。该方法在降低误报率的同时,实现了与大型模型相当的性能表现。

0 人收藏 0 人点赞
#knowledge-distillation

D^3-MOPD:高效多教师蒸馏的自适应动态领域调度

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

D³-MOPD是一个用于多教师蒸馏的零开销调度器,基于每个领域的反向KL轨迹动态调整领域采样比例,从而提高收敛效率并缩小大部分学生与教师之间的性能差距。

0 人收藏 0 人点赞
#knowledge-distillation

Bern2Edge:通过伯恩斯坦多项式网络进行边缘部署的神经符号编译器

arXiv cs.LG ↗ · 2026-08-24 缓存

Bern2Edge是一种神经符号编译器,能将预训练神经网络转换为伯恩斯坦多项式表示,以在FPGA上实现高效且可解释的边缘部署,显著降低延迟和资源使用,同时保持准确性。

0 人收藏 0 人点赞
#knowledge-distillation

高效Transformer中的稀疏令牌路由

arXiv cs.CL ↗ · 2026-08-24 缓存

本文使用SEWN(一种带有学习门控的双流模型用于令牌路由)评估了Transformer中的自适应计算,表明SEWN-sparse在准确性略有损失的情况下,相比BERT-base和DistilBERT实现了显著的吞吐量提升,并提供了可解释的令牌重要性信号。

0 人收藏 0 人点赞
#knowledge-distillation

超越模仿:基于推理进展过滤策略蒸馏

arXiv cs.AI ↗ · 2026-08-21 缓存

论文提出了Reasoning-Progress-Aware Reward Filtering for On-Policy Distillation (R2-OPD) 来解决教师派生奖励与真实推理进展之间的不匹配问题,提高语言模型训练中的推理性能。

0 人收藏 0 人点赞
#knowledge-distillation

加速视觉策略内蒸馏:基于批处理推测性雅可比展开

arXiv cs.LG ↗ · 2026-08-20 缓存

本文提出HB-SJD,一种用于视觉策略内蒸馏的批处理推测性雅可比解码方法。该方法通过并行处理多个词元来加速展开生成,在保持生成质量的同时缩短训练时间。

0 人收藏 0 人点赞
#knowledge-distillation

@aikangarooking: 继续做视频!蒸馏的保姆级教程来了~ 手把手教你蒸馏一本书(建议收藏)。 我开源的仓颉Skill 也8.3K Star了!,就是最近事情有点多,大家一直催的蒸馏教程终于弄好了。按照这套方法,你可以蒸馏任何书,把知识、方法论为你所用。不止书,…

X AI KOLs Timeline ↗ · 2026-08-19

介绍了蒸馏知识的保姆级教程,手把手教你如何从书籍等资料中蒸馏知识,并提及开源的仓颉Skill项目已获得8.3K星。

0 人收藏 0 人点赞
#knowledge-distillation

尾感知的 Top-$k$ 在策略蒸馏

arXiv cs.LG ↗ · 2026-08-18 缓存

本文提出了尾感知的 Top-k On-Policy 蒸馏(TA-OPD),以解决语言模型在 on-policy 蒸馏中尾部概率丢失的问题,从而提高基准测试上的下游准确性。

0 人收藏 0 人点赞
#knowledge-distillation

重新思考逆向KL作为自适应熵蒸馏

arXiv cs.LG ↗ · 2026-08-18 缓存

本文提出了自适应熵蒸馏(AED)方法,该方法利用教师熵动态校准知识蒸馏中的词元级模仿强度,在指令跟随和数学推理基准测试上取得了卓越性能。

0 人收藏 0 人点赞
#knowledge-distillation

STEMMA:一个用于评估大语言模型中自我身份一致性的对抗性多智能体框架

arXiv cs.CL ↗ · 2026-08-11 缓存

本文介绍了STEMMA,一个通过对抗性方式探测大语言模型中自我身份一致性的多智能体框架,其动机是担心知识蒸馏可能会将行为特征(如身份表示)从教师模型迁移到学生模型。

0 人收藏 0 人点赞
#knowledge-distillation

让知识蒸馏的成本低到足以大规模运行

Hugging Face Blog ↗ · 2026-08-10 缓存

Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。

0 人收藏 0 人点赞
#knowledge-distillation

FutureBridge: Token Selection Beyond Local Preference in Collaborative Decoding

arXiv cs.CL ↗ · 2026-08-10 缓存

FutureBridge introduces a token reranker for collaborative decoding that ranks LLM-SLM candidates based on how well the SLM can continue reasoning from them, improving the Qwen3-1.7B SLM's math accuracy by 35.1% over greedy decoding.

0 人收藏 0 人点赞
#knowledge-distillation

Simple-OPD: Demystifying Warm-up for On-policy Distillation

arXiv cs.CL ↗ · 2026-08-10 缓存

This paper investigates the warm-up stage for on-policy distillation (OPD), showing that teacher-compatible chain-of-thought supervision and LoRA-based training with near-saturation duration improve OPD effectiveness. It introduces Simple-OPD, a plug-and-play initialization method that boosts OPD performance across diverse settings.

0 人收藏 0 人点赞
#knowledge-distillation

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

arXiv cs.LG ↗ · 2026-08-06 缓存

Introduces SPOT, a method for on-policy distillation that uses sparse probing and outcome calibration to improve reasoning performance in smaller student models while balancing solution quality and coverage.

0 人收藏 0 人点赞
#knowledge-distillation

虽有特权,却有偏见:PI条件教师如何破坏自我蒸馏

arXiv cs.AI ↗ · 2026-08-06 缓存

本文研究将带特权信息(PI)的自我蒸馏(SD)作为LLM唯一的后期训练目标,在简单任务上复现了已报告的性能提升,但表明它在困难推理任务上会失败:逐token损失下降,而验证准确率停滞或下降。作者将失败归因于PI偏置,它把教师目标拉向参考轨迹,训练出的学生更平坦、更不果断,却没有提升推理能力。

0 人收藏 0 人点赞
#knowledge-distillation

卡在“A”:0.6B语言模型注意力到KDA线性化中的接口损伤诊断与修复

arXiv cs.CL ↗ · 2026-08-05 缓存

本文研究了在单块GPU上将Qwen3-0.6B-Base的注意力层转换为KDA线性注意力的失败模式,识别出一种“接口损伤”——模型预测选项标签而非内容,并提出了一个针对格式的KL阶段来修复该问题。

0 人收藏 0 人点赞
#knowledge-distillation

在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号

arXiv cs.CL ↗ · 2026-08-04 缓存

本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。

0 人收藏 0 人点赞
#knowledge-distillation

Progressive$^2$:一种用于大幅模型压缩的师生渐进协同进化知识蒸馏方法

arXiv cs.LG ↗ · 2026-08-04 缓存

提出Progressive$^2$,一种师生渐进协同进化的知识蒸馏方法,用于大幅模型压缩,解决服务器与客户端能力之间巨大差距的问题。引入了渐进式教师层选择和学生规模缩减,并配备多特征融合适配器。

0 人收藏 0 人点赞
#knowledge-distillation

面向LLM的高效知识蒸馏:离线Top-K Logits与融合分块KL损失

Hugging Face Daily Papers ↗ · 2026-08-04 缓存

本文对如何让LLM的知识蒸馏训练更高效进行了实践研究,引入了离线Top-K logits缓存和一种融合的分块KL损失,从而减少内存尖峰,并允许在单张GPU上训练更长的上下文。

0 人收藏 0 人点赞
#knowledge-distillation

SKILL-KD:面向LLM智能体的对比技能蒸馏

Hugging Face Daily Papers ↗ · 2026-08-04 缓存

SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈