介绍Quartermaster,一个开源本地AI平台,旨在易用而不牺牲可定制性

Reddit r/LocalLLaMA 工具

摘要

Quartermaster是一个开源本地AI平台,简化了模型管理、VRAM分配,并提供一个与OpenAI兼容的API,内置聊天游乐场,支持多种后端如llama.cpp和stable-diffusion.cpp。

它最初是llama-swap的一个分支,但从那时起,我一直在为自己开发它,作为满足所有本地AI需求的便捷工具,到现在它已经发展得足够独立,成为自己的东西。主要思路是你指向你的模型文件夹,它会为你配置一切。它读取GGUF头部信息,测量你实际可用的VRAM,并为每个模型计算上下文长度、GPU卸载、CPU/MoE划分和KV缓存大小。如果你不同意它选择的设置,所有这些都可以按模型进行编辑。它不仅支持文本。llama.cpp用于LLM,自动下载并更新Vulkan、CUDA、ROCm或CPU构建;stable-diffusion.cpp用于图像(SD、SDXL、Flux、Qwen-Image、LoRAs、放大),以及vLLM(如果你已经设置好了)。你可以通过指向一个可执行文件来注册任何其他后端,这就是我运行TTS的方式,也是你运行像ik_llama这样的llama.cpp分支的方式。所有内容都位于一个端口上的OpenAI兼容API之后,使用单一调度器,因此模型可以进出而不互相争夺VRAM。还有一个内置的聊天游乐场,带有网络搜索功能,以及一个Hugging Face浏览器,可以搜索模型、选择量化并直接下载到模型文件夹,还有更多功能!如果你感兴趣,可以在这里阅读更多关于它的信息。MIT许可证。
查看原文

相似文章

使用 llama.cpp 在本地运行的自动化 AI 研究员

Reddit r/LocalLLaMA

ml-intern 是一个面向 AI 代理的工具,它与 Hugging Face 的库集成,现在支持通过 llama.cpp 或 ollama 运行本地模型,使得自动化 AI 研究员可以在笔记本电脑上全天候运行。