LlamaStation v0.9——面向Windows的llama.cpp图形界面,支持多后端、TurboQuant、MTP等
摘要
LlamaStation v0.9 是 llama.cpp 的 Windows 图形界面,提供简洁的界面和完整的参数控制,支持多个后端(官方、TurboQuant、AtomicChat、BeeLlama),实时显存监控、模型专属配置文件、语音模式和无头模式,所有这些都不需要像 Ollama 这样的中间层。
过去几个月里,我一直在构建这个作为副项目——最初是因为我不想每次想尝试一个模型时都得在命令行里运行 llama.cpp。我想要的只是一个点击就能工作的东西。提前说明:我不是开发者。这完全是通过 AI 辅助进行的“氛围编码”。如果代码库中有让你感到不适的地方,请友善地提个 PR 而不是直接批评 🙏 大多数前端要么把一切都隐藏在抽象层后面(如 Ollama、LM Studio),要么让你手动编写命令行。LlamaStation 试图坐在中间:一个干净的 UI,可以完全访问每个参数。
有什么不同之处?直接运行 llama-server——没有中间层、没有守护进程、没有抽象。LlamaStation 将 llama-server.exe 作为子进程启动,并完全控制每个标志。你配置的内容会原封不动地传递给二进制文件。这意味着你能获得 llama.cpp 的全部性能,而不会像 Ollama 这类工具那样带来额外开销。
多个后端,可在 UI 中切换:⚡ 官方 llama.cpp(自 PR #22673 起支持 MTP)🔬 TurboQuant 分支——非对称 KV 缓存量化。这对我来说是一个杀手级功能:在 24GB 显存(双 RTX 3060)上实现 20 万以上上下文,质量损失极小 ⚛️ AtomicChat——TurboQuant + MTP 的结合 🐝 BeeLlama——DFlash + TurboQuant(实验性)
每个 GPU 的实时显存仪表——颜色编码,在模型加载时实时更新。模型专属配置文件——每个模型文件自动记住所有设置。语音模式——一键通话或始终监听,通过 XTTS v2 进行语音克隆,通过 faster-whisper 进行语音识别。完全离线。无头模式——使用保存的配置文件运行,无需 GUI,适用于服务器或自动化。自动更新器——从应用内部更新官方 llama.cpp(并检查 AtomicChat 的发布)。
我的配置作为参考:双 RTX 3060(共 24GB)、Ryzen 7 5700X、32GB DDR4 3600MHz、Windows 11。运行 Qwen3.6 27B Q4\_K\_M,使用 TurboQuant KV 缓存和 MTP——上下文长度 177k。没有 MTP 时,相同模型起始速度约为 17 tok/s,长回复时降至约 10 tok/s。使用 MTP 时,起始速度约为 29 tok/s,即使在长代码生成时也保持在约 22 tok/s。这就是我构建 LlamaStation 的目的。
状态 v0.9——在我日常使用中运行良好。我已经完全用其他工具替换了它——我把它用作编码代理、Telegram 机器人、语音助手和其他本地自动化的后端。有一个已知的 bug(服务器看门狗在 OOM 崩溃后卡在“重启中”状态),可能还有我还没遇到的其他 bug。现在开放以获取反馈和贡献。我不是职业程序员——完全通过 AI 辅助构建。代码库按设计是单个主文件,易于阅读和修改。非常欢迎贡献——尤其是:Linux/Mac 移植(目前仅 Windows)Bug 修复新的后端集成UI 改进
GitHub——MIT 许可证,无遥测,无账户。\- [u/Responsible\_Egg9736](https://www.reddit.com/user/Responsible_Egg9736/)
相似文章
Llama-Studio, 用于管理 llama-server 的 WebUI
Llama-Studio 是一个用于管理 llama-server 会话的 WebUI,支持配置、监控和控制多个实例,用于本地开发和实验。
我制作了一款用于在 WSL/Ubuntu 中管理 llama.cpp 的 Windows 应用
llama.cpp Console 是一款 Windows 桌面应用,提供图形界面来管理 WSL/Ubuntu 中的 llama.cpp,涵盖安装、构建、模型下载和服务部署。
Built a Tauri v2 desktop chat shell for local LLMs — point it at Ollama / llama.cpp / any OpenAI-compatible endpoint, MIT, ~12 MB binary
Built a Tauri v2 desktop chat shell for local LLMs that can connect to Ollama, llama.cpp, or any OpenAI-compatible endpoint. The project is MIT licensed and produces a ~12 MB binary.
BeeLlama.cpp:支持推理和视觉的先进 DFlash 与 TurboQuant。在 RTX 3090 上以 200k 上下文运行 Qwen 3.6 27B Q5,速度比基线快 2-3 倍(峰值 135 tps!)
BeeLlama.cpp 是一个专注于性能的 llama.cpp 分支,引入了 DFlash 投机解码和 TurboQuant KV 缓存压缩技术,使得在消费级硬件上也能高速本地运行像 Qwen 3.6 27B 这样的大型模型。
llama : 网站 + 统一的 `llama` 二进制文件 · ggml-org/llama.cpp · 讨论 #23875
Llama.cpp 宣布推出新网站和统一的 'llama' 二进制文件,以简化 LLM 推理,同时还包括 Hugging Face 缓存迁移和多模态支持等更新。