model-loading

标签

Cards List
#model-loading

我受够了我那300GB模型在RPC上加载要5分钟。PR 26291 将其加速300%,降至1分30秒(4060ti+ddr4)+(4060ti+ddr5)

Reddit r/LocalLLaMA · 2天前

llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。

0 人收藏 0 人点赞
#model-loading

@ariG23498: 我一直很钦佩 @stevhliu 的工作。我认为他的技术文章是最好的之一。在最新的……

X AI KOLs Timeline · 2026-07-08 缓存

一个系列帖文介绍了 Hugging Face 的 transformers 库如何高效加载模型,涵盖 meta device、safetensors、CUDA 缓存等内容。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈