让我们一起学习知识蒸馏!

Reddit r/ArtificialInteligence 新闻

摘要

文章认为,批评知识蒸馏的前沿模型提供商是虚伪的,因为他们在版权诉讼中的法律辩护依赖于同样的原则,即不直接存储或接触数据。

知识蒸馏非常容易实现,并且自大型模型诞生之初就已存在。由于它并非五年级学生能掌握,对大多数人来说仍然是一个完全的黑箱。突然之间,有钱人不喜欢知识蒸馏了。于是,为了显得比五年级学生聪明,每个人突然开始谈论知识蒸馏。那些有钱建造模型的人也不喜欢被起诉。他们从一开始就在每一场诉讼中使用同一个论点:他们实际上并没有直接接触或存储数据本身。我同意每一位前沿模型提供商提出的这一论点。他们是对的。这正是他们赢得诉讼的原因。知识蒸馏正好属于同一类别。前沿模型提供商过去、现在以及将来用来自我辩护的每一个论点,同样适用于知识蒸馏。你不能仅仅将其排除在外。只许州官放火,不许百姓点灯?那么,当人们提出这些论点时,他们到底在要求什么?你喜欢被起诉吗?因为作为前沿模型提供商提出这些论点,正是你输掉诉讼的方式。这是你能提出的最短视的论点。我读不进去,我只喜欢视频。
查看原文

相似文章

“蒸馏”的说法本质上就是荒谬的

Reddit r/LocalLLaMA

认为指责中国从美国AI模型中进行知识蒸馏在法律上是没有根据的,这不过是保护估值过高的美国AI公司的一种宣传手段。

让知识蒸馏的成本低到足以大规模运行

Hugging Face Blog

Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。

知识不应被设限

Hacker News Top

一篇倡导知识无限制获取的文章,可能讨论了研究或技术共享中的障碍。