每次在 vLLM 和 llama.cpp 上换模型都要重写参数,所以我建了个工具来管理它们(llmux, MIT)

Reddit r/LocalLLaMA 工具

摘要

一位开发者构建了 llmux,这是一个开源工具,用于简化跨不同引擎(如 vLLM 和 llama.cpp)管理模型配置,支持一键切换,并集成了 Docker 和 NVIDIA GPU 支持。

llmux 仪表盘 我在 vLLM 和 llama.cpp 上测试了很多模型。每次换模型都要重新编辑参数,按自己的方式启动每个模型,关闭它,再启动下一个。这很繁琐且容易出错。所以我构建了 **llmux** 来管理它。 你使用的每个模型都是一个配置,只需编写一次,之后你可以从列表中选择它,它就会在所属的引擎上启动。在不同版本上运行同一个引擎只需另一个配置,指向不同的镜像标签:发布版、每夜版,或者你自己从源码构建的镜像。 我和我的团队在实际工作中使用它,其中的大部分功能都来源于此:每个操作都有一个无头 CLI 对应项(`llmux up`、`ps --json`、`logs`、`bench`),因此你可以脚本化它或通过 SSH 运行。 要求:Linux、NVIDIA GPU 和 Docker。它使用 NVIDIA Container Toolkit 进行 GPU 直通,因此尚不支持 macOS 和 AMD/ROCm。安装(克隆仓库、设置 uv、将 `llmux` 添加到 PATH): curl -fsSL https://raw.githubusercontent.com/Bae-ChangHyun/llmux/main/install.sh | sh 或者手动操作: git clone https://github.com/Bae-ChangHyun/llmux.git| cd llmux uv tool install --editable . && uv tool update-shell 仓库:https://github.com/Bae-ChangHyun/llmux 文档:https://Bae-ChangHyun.github.io/llmux/ 这是我自己的项目,使用 MIT 许可证。英语不是我的母语,所以我用 LLM 帮助写了这篇文章。
查看原文

相似文章

vllm-project/vllm v0.19.1

GitHub Releases Watchlist

vLLM v0.19.1 发布 - 一个快速易用的开源 LLM 推理和服务库,拥有业界领先的吞吐量,支持 200+ 个模型架构以及包括 NVIDIA/AMD GPU 和 CPU 在内的多样化硬件。

ggml-org/llama.cpp

GitHub Trending (daily)

llama.cpp 是一个开源 C/C++ 库,用于在本地硬件上高效运行 LLM 推理,支持多种量化方法和多后端(CPU、GPU 等)。