@ariG23498: 我一直很钦佩 @stevhliu 的工作。我认为他的技术文章是最好的之一。在最新的……
摘要
一个系列帖文介绍了 Hugging Face 的 transformers 库如何高效加载模型,涵盖 meta device、safetensors、CUDA 缓存等内容。
查看缓存全文
缓存时间: 2026/07/08 07:43
我一直很欣赏 @stevhliu 的工作,认为他的技术文章是业界的顶尖水平。
在最新的一系列文章中,他详细介绍了 transformers 是如何加载模型的。这项工作看似简单,但其中涉及众多动态环节,使得加载速度极快。
元设备 safetensors 懒加载 CUDA 缓存分配器预热 设备和数据类型预测 权重融合
如果你想了解一个 SoTA 库的核心组件是如何运作的,我强烈推荐阅读这些博客。
相似文章
@gordic_aleksa: 新深度博文时刻:Inside the Transformer: The Life of a Token 对现代密集Transformer的深入探讨,我…
一篇深入探讨现代密集Transformer内部工作原理的博文,涵盖YaRN(位置信息)、混合注意力(实现160k上下文长度)、soft capping、QK归一化,以及Transformer数学(包括FLOPs/Token公式和集群规模估算)。
@ariG23498: 当我第一次从@cHHillee的博客文章“Making Deep Learning Go Brrrr From …”中听说内核融合时,我着迷了。
作者分享了对内核融合的兴奋之情,并演示了使用HuggingFace的kernels项目对GeGLU FFN融合的Liger内核进行性能分析,指出这个分析结果非常漂亮。
@ClementDelangue:最近Nvidia(美国开源AI之王)做了很多出色的工作!——跨越了1,000个公共仓库……
Nvidia在Hugging Face上突破了1,000个公共仓库,展示了热门模型,并宣布了Cosmos 3、Alphamayo 2 Super、Nemotron 3/4的计划以及采用OpenMDW框架,凸显了其在开源AI领域的领导地位。
@goyal__pramod: 软件在进化,你也应该如此!这是我读过的理解GPU和CUDA的最佳博客!
推荐一系列理解GPU和CUDA的博客,鼓励开发者提升技能的推文。
@MichaelGannotti: https://x.com/MichaelGannotti/status/2074486390432149979
对NVIDIA的Nemotron-3 Mamba-Transformer混合模型在DGX Spark硬件上的全栈评估,包括架构分析、量化(NVFP4)、基准测试结果,以及开源测试套件smf-bench的介绍。