每次在 vLLM 和 llama.cpp 上换模型都要重写参数,所以我建了个工具来管理它们(llmux, MIT)
摘要
一位开发者构建了 llmux,这是一个开源工具,用于简化跨不同引擎(如 vLLM 和 llama.cpp)管理模型配置,支持一键切换,并集成了 Docker 和 NVIDIA GPU 支持。
llmux 仪表盘 我在 vLLM 和 llama.cpp 上测试了很多模型。每次换模型都要重新编辑参数,按自己的方式启动每个模型,关闭它,再启动下一个。这很繁琐且容易出错。所以我构建了 **llmux** 来管理它。
你使用的每个模型都是一个配置,只需编写一次,之后你可以从列表中选择它,它就会在所属的引擎上启动。在不同版本上运行同一个引擎只需另一个配置,指向不同的镜像标签:发布版、每夜版,或者你自己从源码构建的镜像。
我和我的团队在实际工作中使用它,其中的大部分功能都来源于此:每个操作都有一个无头 CLI 对应项(`llmux up`、`ps --json`、`logs`、`bench`),因此你可以脚本化它或通过 SSH 运行。
要求:Linux、NVIDIA GPU 和 Docker。它使用 NVIDIA Container Toolkit 进行 GPU 直通,因此尚不支持 macOS 和 AMD/ROCm。安装(克隆仓库、设置 uv、将 `llmux` 添加到 PATH):
curl -fsSL https://raw.githubusercontent.com/Bae-ChangHyun/llmux/main/install.sh | sh
或者手动操作:
git clone https://github.com/Bae-ChangHyun/llmux.git| cd llmux
uv tool install --editable . && uv tool update-shell
仓库:https://github.com/Bae-ChangHyun/llmux
文档:https://Bae-ChangHyun.github.io/llmux/
这是我自己的项目,使用 MIT 许可证。英语不是我的母语,所以我用 LLM 帮助写了这篇文章。
相似文章
vllm-project/vllm v0.19.1
vLLM v0.19.1 发布 - 一个快速易用的开源 LLM 推理和服务库,拥有业界领先的吞吐量,支持 200+ 个模型架构以及包括 NVIDIA/AMD GPU 和 CPU 在内的多样化硬件。
如果你只是自己使用模型而不对外提供服务,vLLM 真的值得用吗?
一名用户讨论了在 AMD 硬件上进行本地单用户推理时,使用 vLLM 与 llama.cpp 之间的权衡,质疑在非企业级环境中 vLLM 的性能优势是否足以弥补其带来的复杂性。
llama.cpp 就是 LLM 界的 Linux
文章把 llama.cpp 比作 Linux,认为这款开源库已成为运行大语言模型的基础底座。
llama.cpp 现在通过API支持模型管理(下载等)
llama.cpp 现在通过API支持模型管理,包括下载和生命周期管理,无需外部工具即可完全部署。
ggml-org/llama.cpp
llama.cpp 是一个开源 C/C++ 库,用于在本地硬件上高效运行 LLM 推理,支持多种量化方法和多后端(CPU、GPU 等)。