FYI: llamacpp 服务器现在可以在30秒内热切换模型
摘要
Llamacpp 服务器现在支持在30秒内热切换模型,相比之前像 PyTorch 等方法,速度显著提升。
在浏览新帖和评论时,这个问题至少见过好几次了。llamacpp 现在拥有非常简洁的模型热切换 API,能够与 openwebui 和 hermes 无缝配合。额外福利:录制时第二个模型 gemma 出了点小问题,但切换时间已经快得离谱……记得几个月前,我还得在启动 PyTorch 加载后去散步等它完成。
相似文章
每次在 vLLM 和 llama.cpp 上换模型都要重写参数,所以我建了个工具来管理它们(llmux, MIT)
一位开发者构建了 llmux,这是一个开源工具,用于简化跨不同引擎(如 vLLM 和 llama.cpp)管理模型配置,支持一键切换,并集成了 Docker 和 NVIDIA GPU 支持。
@LiorOnAI:现在你可以将任何LLM转换成更快的版本,而无需从头重新训练。NVIDIA刚刚在他们30B的模型上实现了这一点。她…
NVIDIA提出了一种方法,将任何LLM转换为更快的版本,方法是将模型拆分为两个副本:一个冻结用于上下文,另一个训练用于并行生成多个token,实现了2.4倍加速,且质量保留约99%,仅使用了8%的训练数据。
一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s
一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
大幅提升 --n-cpu-moe 部分卸载模型的提示词处理速度
本文分享了一个 llama.cpp 的性能优化技巧,展示了增大微批大小(`-ub`)并结合部分 CPU 卸载(`--n-cpu-moe`)可以显著提升 gpt-oss-120b 等大型模型在消费级 GPU 上的提示词处理速度。