@Michaelzsguo: 一本及时的书。Dario声称像DeepSeek和GLM这样的中国模型是从Anthropic模型蒸馏而来,这就是它们……的原因。
摘要
Sebastian Raschka的新书《Build a Reasoning Model (From Scratch)》涵盖了推理扩展、强化学习和蒸馏。该公告还提到了Dario Amodei关于中国模型从Anthropic模型蒸馏的评论。
查看缓存全文
缓存时间: 2026/06/30 17:45
一本及时的书。
Dario声称像DeepSeek、GLM这样的中文模型是从Anthropic的模型蒸馏而来的,所以它们才这么出色。@rasbt的书正好解释了它们是如何做到的。
(开个玩笑。但我确实要买这本书,系统学习如何将小模型微调成某个领域的“专家”或“专才”。AI的未来是开放、本地化、分布式的,其中一部分就是这些专才模型。)
Sebastian Raschka (@rasbt): 经过18个月写作、编码和实验,《从零构建推理模型》终于出版了!
我的第一批样书刚到!📚
440页全彩。从头讲解推理缩放、强化学习和蒸馏。
相似文章
@rasbt:经过18个月的写作、编码和实验,《Build a Reasoning Model (From Scratch)》终于问世!我的第一本……
Sebastian Raschka宣布其著作《Build a Reasoning Model (From Scratch)》在历时18个月的工作后正式发布,内容涵盖推理扩展、强化学习和从头开始的蒸馏技术。
基于GLM构建的新DeepThink
介绍DeepThink,一个基于GLM构建的新模型,旨在增强开源AI模型的推理能力,以与Astra和Fable等专有替代方案竞争。
@SergioPaniego: https://x.com/SergioPaniego/status/2074863503312044499
一篇关于2026年前沿AI模型如何利用蒸馏技术的文章,涵盖离策略、在策略和自蒸馏阶段,并以Gemma、DeepSeek、GLM、Nemotron和Qwen3为例。
@rohanpaul_ai: Anthropic CEO Dario Amodei 谈开源AI模型。"我认为开源在AI领域的作用方式与在其他领域不同……
Anthropic CEO Dario Amodei 认为开源AI是一个障眼法,他指出模型质量比开放性更重要,因为大型模型需要云端推理,并不像传统开源软件那样真正免费或易于获取。
@dbreunig: 推理模型擅长理解细微差别和自然语言。但这种细微之处尚未渗透到检索系统…
一条推文强调,尽管推理模型在理解细微差别和自然语言方面表现出色,但这种能力尚未传导到检索系统,指出了AI系统的一个关键瓶颈。