LlamaStation v0.9——面向Windows的llama.cpp图形界面,支持多后端、TurboQuant、MTP等

Reddit r/LocalLLaMA 工具

摘要

LlamaStation v0.9 是 llama.cpp 的 Windows 图形界面,提供简洁的界面和完整的参数控制,支持多个后端(官方、TurboQuant、AtomicChat、BeeLlama),实时显存监控、模型专属配置文件、语音模式和无头模式,所有这些都不需要像 Ollama 这样的中间层。

过去几个月里,我一直在构建这个作为副项目——最初是因为我不想每次想尝试一个模型时都得在命令行里运行 llama.cpp。我想要的只是一个点击就能工作的东西。提前说明:我不是开发者。这完全是通过 AI 辅助进行的“氛围编码”。如果代码库中有让你感到不适的地方,请友善地提个 PR 而不是直接批评 🙏 大多数前端要么把一切都隐藏在抽象层后面(如 Ollama、LM Studio),要么让你手动编写命令行。LlamaStation 试图坐在中间:一个干净的 UI,可以完全访问每个参数。 有什么不同之处?直接运行 llama-server——没有中间层、没有守护进程、没有抽象。LlamaStation 将 llama-server.exe 作为子进程启动,并完全控制每个标志。你配置的内容会原封不动地传递给二进制文件。这意味着你能获得 llama.cpp 的全部性能,而不会像 Ollama 这类工具那样带来额外开销。 多个后端,可在 UI 中切换:⚡ 官方 llama.cpp(自 PR #22673 起支持 MTP)🔬 TurboQuant 分支——非对称 KV 缓存量化。这对我来说是一个杀手级功能:在 24GB 显存(双 RTX 3060)上实现 20 万以上上下文,质量损失极小 ⚛️ AtomicChat——TurboQuant + MTP 的结合 🐝 BeeLlama——DFlash + TurboQuant(实验性) 每个 GPU 的实时显存仪表——颜色编码,在模型加载时实时更新。模型专属配置文件——每个模型文件自动记住所有设置。语音模式——一键通话或始终监听,通过 XTTS v2 进行语音克隆,通过 faster-whisper 进行语音识别。完全离线。无头模式——使用保存的配置文件运行,无需 GUI,适用于服务器或自动化。自动更新器——从应用内部更新官方 llama.cpp(并检查 AtomicChat 的发布)。 我的配置作为参考:双 RTX 3060(共 24GB)、Ryzen 7 5700X、32GB DDR4 3600MHz、Windows 11。运行 Qwen3.6 27B Q4\_K\_M,使用 TurboQuant KV 缓存和 MTP——上下文长度 177k。没有 MTP 时,相同模型起始速度约为 17 tok/s,长回复时降至约 10 tok/s。使用 MTP 时,起始速度约为 29 tok/s,即使在长代码生成时也保持在约 22 tok/s。这就是我构建 LlamaStation 的目的。 状态 v0.9——在我日常使用中运行良好。我已经完全用其他工具替换了它——我把它用作编码代理、Telegram 机器人、语音助手和其他本地自动化的后端。有一个已知的 bug(服务器看门狗在 OOM 崩溃后卡在“重启中”状态),可能还有我还没遇到的其他 bug。现在开放以获取反馈和贡献。我不是职业程序员——完全通过 AI 辅助构建。代码库按设计是单个主文件,易于阅读和修改。非常欢迎贡献——尤其是:Linux/Mac 移植(目前仅 Windows)Bug 修复新的后端集成UI 改进 GitHub——MIT 许可证,无遥测,无账户。\- [u/Responsible\_Egg9736](https://www.reddit.com/user/Responsible_Egg9736/)
查看原文

相似文章