让我们一起学习知识蒸馏!
摘要
文章认为,批评知识蒸馏的前沿模型提供商是虚伪的,因为他们在版权诉讼中的法律辩护依赖于同样的原则,即不直接存储或接触数据。
知识蒸馏非常容易实现,并且自大型模型诞生之初就已存在。由于它并非五年级学生能掌握,对大多数人来说仍然是一个完全的黑箱。突然之间,有钱人不喜欢知识蒸馏了。于是,为了显得比五年级学生聪明,每个人突然开始谈论知识蒸馏。那些有钱建造模型的人也不喜欢被起诉。他们从一开始就在每一场诉讼中使用同一个论点:他们实际上并没有直接接触或存储数据本身。我同意每一位前沿模型提供商提出的这一论点。他们是对的。这正是他们赢得诉讼的原因。知识蒸馏正好属于同一类别。前沿模型提供商过去、现在以及将来用来自我辩护的每一个论点,同样适用于知识蒸馏。你不能仅仅将其排除在外。只许州官放火,不许百姓点灯?那么,当人们提出这些论点时,他们到底在要求什么?你喜欢被起诉吗?因为作为前沿模型提供商提出这些论点,正是你输掉诉讼的方式。这是你能提出的最短视的论点。我读不进去,我只喜欢视频。
相似文章
@pallavishekhar_: 知识蒸馏是如何工作的?在此阅读:https://outcomeschool.com/blog/how-does-knowledge-distillation-work…
一篇教育性的博客文章,解释了知识蒸馏的工作原理,涵盖教师-学生框架、软标签、温度和蒸馏损失,并附有实际示例。
“蒸馏”的说法本质上就是荒谬的
认为指责中国从美国AI模型中进行知识蒸馏在法律上是没有根据的,这不过是保护估值过高的美国AI公司的一种宣传手段。
让知识蒸馏的成本低到足以大规模运行
Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。
知识不应被设限
一篇倡导知识无限制获取的文章,可能讨论了研究或技术共享中的障碍。
@TheTuringPost: https://x.com/TheTuringPost/status/2068474648925216861
一篇关于知识蒸馏的教育性概述,涵盖其历史、核心概念(如softmax和温度)、类型、缩放定律以及包括DeepSeek-R1在内的实际示例。