标签
llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。
一个系列帖文介绍了 Hugging Face 的 transformers 库如何高效加载模型,涵盖 meta device、safetensors、CUDA 缓存等内容。