knowledge-distillation

标签

Cards List
#knowledge-distillation

STEMMA:一个用于评估大语言模型中自我身份一致性的对抗性多智能体框架

arXiv cs.CL · 4小时前 缓存

本文介绍了STEMMA,一个通过对抗性方式探测大语言模型中自我身份一致性的多智能体框架,其动机是担心知识蒸馏可能会将行为特征(如身份表示)从教师模型迁移到学生模型。

0 人收藏 0 人点赞
#knowledge-distillation

让知识蒸馏的成本低到足以大规模运行

Hugging Face Blog · 22小时前 缓存

Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。

0 人收藏 0 人点赞
#knowledge-distillation

FutureBridge: Token Selection Beyond Local Preference in Collaborative Decoding

arXiv cs.CL · 昨天 缓存

FutureBridge introduces a token reranker for collaborative decoding that ranks LLM-SLM candidates based on how well the SLM can continue reasoning from them, improving the Qwen3-1.7B SLM's math accuracy by 35.1% over greedy decoding.

0 人收藏 0 人点赞
#knowledge-distillation

Simple-OPD: Demystifying Warm-up for On-policy Distillation

arXiv cs.CL · 昨天 缓存

This paper investigates the warm-up stage for on-policy distillation (OPD), showing that teacher-compatible chain-of-thought supervision and LoRA-based training with near-saturation duration improve OPD effectiveness. It introduces Simple-OPD, a plug-and-play initialization method that boosts OPD performance across diverse settings.

0 人收藏 0 人点赞
#knowledge-distillation

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

arXiv cs.LG · 5天前 缓存

Introduces SPOT, a method for on-policy distillation that uses sparse probing and outcome calibration to improve reasoning performance in smaller student models while balancing solution quality and coverage.

0 人收藏 0 人点赞
#knowledge-distillation

虽有特权,却有偏见:PI条件教师如何破坏自我蒸馏

arXiv cs.AI · 5天前 缓存

本文研究将带特权信息(PI)的自我蒸馏(SD)作为LLM唯一的后期训练目标,在简单任务上复现了已报告的性能提升,但表明它在困难推理任务上会失败:逐token损失下降,而验证准确率停滞或下降。作者将失败归因于PI偏置,它把教师目标拉向参考轨迹,训练出的学生更平坦、更不果断,却没有提升推理能力。

0 人收藏 0 人点赞
#knowledge-distillation

卡在“A”:0.6B语言模型注意力到KDA线性化中的接口损伤诊断与修复

arXiv cs.CL · 6天前 缓存

本文研究了在单块GPU上将Qwen3-0.6B-Base的注意力层转换为KDA线性注意力的失败模式,识别出一种“接口损伤”——模型预测选项标签而非内容,并提出了一个针对格式的KL阶段来修复该问题。

0 人收藏 0 人点赞
#knowledge-distillation

在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号

arXiv cs.CL · 2026-08-04 缓存

本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。

0 人收藏 0 人点赞
#knowledge-distillation

Progressive$^2$:一种用于大幅模型压缩的师生渐进协同进化知识蒸馏方法

arXiv cs.LG · 2026-08-04 缓存

提出Progressive$^2$,一种师生渐进协同进化的知识蒸馏方法,用于大幅模型压缩,解决服务器与客户端能力之间巨大差距的问题。引入了渐进式教师层选择和学生规模缩减,并配备多特征融合适配器。

0 人收藏 0 人点赞
#knowledge-distillation

面向LLM的高效知识蒸馏:离线Top-K Logits与融合分块KL损失

Hugging Face Daily Papers · 2026-08-04 缓存

本文对如何让LLM的知识蒸馏训练更高效进行了实践研究,引入了离线Top-K logits缓存和一种融合的分块KL损失,从而减少内存尖峰,并允许在单张GPU上训练更长的上下文。

0 人收藏 0 人点赞
#knowledge-distillation

SKILL-KD:面向LLM智能体的对比技能蒸馏

Hugging Face Daily Papers · 2026-08-04 缓存

SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。

0 人收藏 0 人点赞
#knowledge-distillation

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers · 2026-08-04 缓存

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。

0 人收藏 0 人点赞
#knowledge-distillation

DASH-OPD:用于同策略蒸馏的具有滞回的差异感知切换

arXiv cs.LG · 2026-08-03 缓存

本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。

0 人收藏 0 人点赞
#knowledge-distillation

将大型语言模型的知识蒸馏至面向自主网络作战的轻量级强化学习智能体

arXiv cs.LG · 2026-08-03 缓存

本文研究利用一个80亿参数的LLM来改进自主网络防御,随后将其策略蒸馏到仅含64,910参数的轻量级RL智能体中,并在CybORG场景中证明了其可行性。

0 人收藏 0 人点赞
#knowledge-distillation

知识蒸馏对小型语言模型偏见的非对称影响

arXiv cs.CL · 2026-08-03 缓存

本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。

0 人收藏 0 人点赞
#knowledge-distillation

@pallavishekhar_: 知识蒸馏是如何工作的?在此阅读:https://outcomeschool.com/blog/how-does-knowledge-distillation-work…

X AI KOLs Timeline · 2026-07-31 缓存

一篇教育性的博客文章,解释了知识蒸馏的工作原理,涵盖教师-学生框架、软标签、温度和蒸馏损失,并附有实际示例。

0 人收藏 0 人点赞
#knowledge-distillation

SAF-OPD:用于在线策略蒸馏的稳定优势融合

Hugging Face Daily Papers · 2026-07-31 缓存

SAF-OPD 引入了一种稳定优势融合框架,将 RLVR 与在线策略蒸馏相结合,解决了幅度失配和时间失配问题,从而提高了数学和代码基准测试中的训练稳定性与性能。

0 人收藏 0 人点赞
#knowledge-distillation

检测器失效之处:通过专家引导的互蒸馏弥合尾部领域差距

arXiv cs.CL · 2026-07-30 缓存

本文提出专家引导的互蒸馏(EGMD)方法,以解决多模态假新闻检测中的领域偏差和语义错配问题,在四个数据集上实现了最先进的准确率,并将领域偏差降低高达57.3%。

0 人收藏 0 人点赞
#knowledge-distillation

Weak-to-Strong On-Policy Distillation

arXiv cs.LG · 2026-07-30 缓存

介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。

0 人收藏 0 人点赞
#knowledge-distillation

Flux-OPD:演化上下文下的同策略蒸馏

Hugging Face Daily Papers · 2026-07-30 缓存

Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈