Lemonade 设备:一台超越硬件的私有 AI 服务器

Reddit r/LocalLLaMA 产品

摘要

Lemonade 已从 Python SDK 演变为一个打包的设备,作为 systemd 服务运行,支持多种 AI 模型、图像生成、语音转文字和文字转语音,跨 AMD、NVIDIA 和 Apple 硬件,强调隐私和零边际成本的批量处理。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/01 04:01

# 柠檬水设备:一台超越其硬件的私有AI服务器 - Netstatz Ltd. 来源:https://netstatz.com/lemonade-appliance-strix-halo/ *一年前,在自己硬件上运行一个能用的模型意味着要像保姆一样盯着一个Python脚本。今天,它意味着安装一个软件包然后就可以置之不理了。这就是Lemonade (https://lemonade-server.ai/) 成长的故事——以及当它成熟后,我们在此之上构建了什么。* > **本系列前篇:**Strix Halo on Ubuntu: From Zero to Local Tokens (https://netstatz.com/strix_halo_lemonade/) 介绍了硬件。本文是接下来的故事。 ## TL;DR - **Lemonade 从一个 Python SDK 演变为一个打包好的设备**——一个用一条命令就能安装的真正服务,而不是需要你呵护的 virtualenv。 - 它现在通过一个**兼容 OpenAI、Anthropic 和 Ollama 的 API** 提供**多模型舰队**服务,支持**图像生成**、**语音转文字**和**文字转语音**,并能直接接入 100 多个应用——包括 Claude Code。 - **它不再仅限于 AMD**:除了 ROCm 和 Vulkan,现在还支持 **CUDA 和 Apple MLX**。如果你之前因为自己没有 Strix Halo 而错过,现在欢迎你回来。 - **夜间运行大模型,需要速度时按需爆发。**128 GB 内存可以容纳稠密的 27B 级模型,用于零边际成本的批量工作——而*同一台*服务器可以在需要快速完成工作时,爆发到按小时计费的私有 GPU 实例(想想 GLM-5.2 开放权重)。 - 回报是**隐私和持久性**:你的数据永不离开建筑物,日常账单只是几美分的电费,而不是按用量计费的云账单。我的孩子们给我们的服务器起名叫 **DadGPT**。 ## 这一切的起点 去年秋天,我们写了一篇长而充满命令的指南,介绍如何让一台 **AMD (https://www.amd.com/) Strix Halo** 盒子——128 GB 统一内存,Ryzen AI Max+ 平台——在 Linux 上提供推理服务。它帮助我们赢得了一项 AMD 开发者竞赛,并开启了 AI 行业关系的新世界。但现在重读它,安装部分感觉像个古董。一页又一页的安装命令、依赖锁定、以及“如果这个失败,试试那个”。它能工作,但它是一个*过程*,而不是一个*产品*。 那个差距——介于能用的东西和可以交给企业的东西之间——正是今年被填平的。 功劳归于该归的人:Lemonade 的所有这些工作之所以能发生,是因为那块硅片——AMD 的 Ryzen AI Max (https://www.amd.com/en/products/processors/desktops/ryzen/ryzen-ai-halo.html) 使得在这个尺寸和价格下,一个私有多模型设备成为可能。 ## 从脚本到设备 旧的 Lemonade 是一个 Python SDK。你创建一个环境,解决依赖关系,并保持终端打开。新的 Lemonade 是一个**设备**:一个编译好的后台服务 (*lemond*)、一个小型命令行工具 (*lemonade*) 和一个托盘应用,以**原生包 (https://github.com/lemonade-sdk/lemonade)** 的形式发布,支持 Debian、Ubuntu、Fedora、Arch,以及 Docker、Snap、macOS 和 Windows。你安装它,它会作为 **systemd 服务**运行,并且每次重启后都会存在,无论是否有用户登录。 这种转变听起来很平常。但实则不然。“作为服务运行”是演示和基础设施之间的分界线。它意味着**声明式配置**(放入配置文件,重启,完成)、**幂等的模型加载**(不会互相争抢)、**实时模型管理**(固定你希望保持热加载的模型,在 VRAM 紧张时自动卸载其余模型)、以及**预检**(在磁盘满时快速失败,而不是永远重试)。这些并不华丽,但正是你希望从需要保持持续运行的东西中得到的。 它还引入了**配方和后端**作为一等公民。一个*后端*是引擎和设备目标——基于 Vulkan 的 llama.cpp (https://github.com/ggml-org/llama.cpp)、**ROCm (https://rocm.docs.amd.com/)**、**CUDA**、CPU 或 Apple **Metal/MLX**;面向 Ryzen AI 的 NPU 运行时;用于音频的 *whisper.cpp*;用于图像的 *sd.cpp*。一个*配方*是一个已保存的命名配置,这样机器会完全按照你调优的方式恢复运行。你不再需要手动组合启动标志,而是声明你的意图。 ## 发行版的故事:Debian 正统版,Ubuntu 前沿版 大多数本地 AI 文章都跳过了一个选择:**基于 Debian 的发行版**。我们有意运行其中两个——还有更多——。 **Ubuntu Server (https://ubuntu.com/)** 是**最容易的入门路径**——也是**提供商业支持**的版本,如果你的企业需要一个可以拨打的号码,你可以购买该支持。AMD 针对它进行构建和验证,所以它的仓库——pockets、channels、ROCm 和 Vulkan 后端——是最新支持首先落地的地方。如果你想与供应商积极开发的方向保持一致,Ubuntu 是惊喜最少的路径。(Ubuntu*Desktop* 本身也是一种乐趣——我们不只一次想日常使用一台 Strix Halo 盒子。当笔记本电脑问世时,一台配备**高达 192 GB 统一内存 (https://www.tomshardware.com/pc-components/cpus/amd-ryzen-ai-max-400-gorgon-halo-packs-up-to-192gb-of-unified-memory-refreshed-apu-uses-zen-5-and-rdna-3-5-and-can-clock-up-to-5-2-ghz)**——几乎是 Strix Halo 的两倍——的 **Gorgon Halo** 机器将是我们为大学生推荐的选择,该芯片已经出现在基准测试中 (https://www.techpowerup.com/348739/amd-ryzen-ai-max-pro-495-gorgon-halo-apu-appears-with-radeon-8065s),所以**笔记本形态 (https://www.ultrabookreview.com/70442-amd-strix-halo-laptops/)** 应该不远了。) **Debian 正统版 (https://www.debian.org/)** 是我们对*必须持久*的盒子的首选。它更紧凑,为模型留下更多 RAM,稳定周期长,而 backports 使其运行在当前 7 系列内核上,而无需拖动系统其他部分前进。AMD 最初认为 Strix Halo 在 Debian 上不受支持——所以我们在没有支持的情况下也解决了,现在在生产环境中运行它。(Lemonade 每次发布都会发布一个 **Debian 13 包 (https://github.com/lemonade-sdk/lemonade/releases)**。) 对我们来说,这两个发行版不是分叉路口;它们是一对。两个 halo 盒子**通过 LVM 共享一个缓存**——模型检查点*和* Lemonade 配方存储——所以 Ubuntu 盒子上拉取的 40 GB 检查点,以及围绕它调优的配方,立即可用于 Debian 盒子。Debian 是我们运行生产环境的地方;Ubuntu 是我们与 AMD 保持同步,以及进行上游 Lemonade 项目工作的地方。 还有一件事,因为它改变了*此物为谁而造*:我们描述的是一个**无头设备**——一个放在壁橱里、连接着 UPS、没有连接显示器的服务器——但 Lemonade 本身几乎可以在任何地方运行。**Windows** 上有一个一键安装程序和托盘应用(并且在办公笔记本电脑的 **WSL** 下运行良好),**macOS** 包,**Docker** 和 **Snap** 镜像,一个可以直接放到 **CachyOS (https://cachyos.org/)** 给喜欢折腾的人用的 Arch 构建,以及原生的 **Debian**、**Ubuntu** 和 **Fedora** 包——还有你可以捆绑到自己应用中的可嵌入二进制文件。选择适合你环境的界面;另一端的 API 是相同的。 一棵常青树,由发光的绿色和琥珀色电路痕迹组成,从一个小型服务器设备中生长出来,象征着稳定、安全、长寿的软件依赖关系图。**常青作为架构:一个稳定的基础和一个干净的依赖关系图是使本地 AI 盒子可部署而非一次性的关键。** 这就是我们多年来实践的**常青**纪律得到回报的地方。一个稳定的基础,一个干净的依赖关系图,无需戏剧性事件就能到来的安全补丁——那不是怀旧,而是使本地 AI 盒子**在商业环境中可部署**(而不是一个六个月后就会腐烂的科学项目)的关键。这种成熟不会偶然发生:特别感谢 **Mario Limonciello (https://github.com/superm1)**,他的上游工作从 Debian 打包角度,为将 Lemonade 从爱好者级别提升到你可以负责任地交给客户的东西,完成了大量繁重的工作。 ## 这个设备现在能做什么 一旦它成为一个服务,它就不再是“一个模型”,而是成为一个**平台**: - **一个端点上的多模型舰队。**所有模型都在一个单一的**兼容 OpenAI 的端点**上响应,所以任何支持 OpenAI、Anthropic 或 Ollama 的工具——聊天界面、编辑器、代理、**Claude Code (https://claude.com/claude-code)**——只需指向它即可工作。内置的 MCP 网关让代理可以直接调用它。无需代码更改,无 SDK 锁定。 - **不止是文本。**图像生成(Stable Diffusion / Qwen Image)、**语音转文字**(Whisper 和 Moonshine)、**文字转语音**(Kokoro),以及真正的**全模态**模型,返回多媒体而非仅仅是文字。一个盒子,所有模态。 - **足够快,满足日常使用。**内置的**推测解码**(MTP / EAGLE3 草稿模型)大致将吞吐量翻倍,因此本地盒子可以轻松处理稳定的小型工作流。你不会放弃**前沿编码订阅**用于难题——但你不再在常规工作上花费付费 token:我们的工具链(**hermes** 和 **openclaw**)将小任务交给 Lemonade,而 **Qwen3.6-27B** 则是一个真正优秀的隔夜代码生成器和审查器。 - **操作规范。**可恢复下载、原生的 **Prometheus** 指标端点、HTTPS 下的安全 WebSocket、崩溃安全安装,以及内置基准测试(*lemonade bench*),可在不同引擎之间提供 apples-to-apples 的比较数字。故意做得平淡无奇。 ## 前沿,但受管控 这个快速变化世界的核心是 *llama.cpp*:新的量化格式和速度技巧几乎每天都会出现,而一个热门的新模型量化——比如用于推测解码的 **Eagle / MTP** 草稿——通常需要*特定且非常新*的 llama.cpp 构建才能运行。通常追逐这一点的方法是从源码编译并祈祷。我们不必这样做:Lemonade 通过 Ubuntu **PPA pockets** 发布其 llama.cpp 构建——一个稳定频道和一个前沿频道——所以“最新构建”仍然只是一个软件包。 而且大多数调优就是**一个可调参数加一次重启**:更改一个配方或每个后端的参数,重启服务,完成——无需环境手术。这正是你可以交给代理处理的杂务。 所以我们做了。我们的一个工作流会**监控更新的模型量化**,跟踪模型卡片到其所需的 llama.cpp 构建,**等待该构建降落在前沿 pocket 中**,然后部署新的量化,更新配方,并在其上线之前**通过 API 进行测试**。而当我们*真正*急切时,我们甚至不等待 pocket:将配置指向特定的 llama.cpp 构建,*lemonade-server* 直接从上流拉取该二进制文件——在 Lemonade 团队(由 **Jeremy Fowers (https://github.com/jeremyfowers)** 领导)通常会进行的 CI 和质量检查**之前**运行它。这是一个你只会在自己拥有并验证的盒子上才使用的旋钮。结果是一个本不该奏效但确实奏效的矛盾:你在拥有和验证的盒子上驾驭模型和运行时的绝对前沿,同时从未离开一个**包管理、可重现**的环境——并且一个代理负责监控、部署和验证。这就是 Netstatz 的论题在一个循环中的体现:前沿能力,受管控,运行在你拥有的硬件上。 *关于驱动这一切的工具链生态系统的更多信息,将在后续文章中介绍。* ## 我们在此基础上构建了什么 这是上一篇文章承诺的部分。一旦你拥有一个私有的、永远在线的推理设备,有趣的问题就不是“它能运行模型吗”——而是“你指向它什么?” 私有家庭 AI 中心的等轴测图:一个发光的房子轮廓,包含一个设备,通过温暖的光线与浮动的模型节点、一个图像面板和一个友好的家庭聊天设备相连,数据留在房屋内。**房子里的一切:一个为模型节点、图像生成和友好家庭聊天提供服务的家用设备——没有一样离开房产。** **DadGPT。**2025 年 9 月,我们在 Lemonade 上搭建了 OpenWebUI (https://openwebui.com/),运行一个 **1200 亿参数开放权重模型** (gpt-oss-120b (https://huggingface.co/openai/gpt-oss-120b)),并将我们的家庭 DNS 指向 **dadgpt.com**,使其在网络中被解析。每个家庭成员得到一个**分区的、通过 Gmail 认证的空间**——私人聊天以及那种没人真正想交给云提供商的问题。孩子们在晚餐时给它起了名字,并且在一小段时间里,它是家中最常用的 AI 服务——没有一个 token 离开过房产。 **所有东西都支持一键通(Push-to-talk)。**随着 **OpenWhispr (https://github.com/OpenWhispr/openwhispr)** 的加入——以及 Lemonade 新添加的 **Moonshine (https://moonshine.ai/)** 后端,一个为**实时、设备端使用**而构建的流式语音转文字引擎(它在你说话的同时就开始转录,并且从用于受限设备的微小 26 MB 模型扩展到在准确性上超越 Whisper Large V3 的版本)——家中每一台老化的笔记本电脑和备用机器都变成了实时语音端点。原本注定要放进抽屉的旧硬件现在可以与设备对话。 **一个用于发现的信标。**设备在网络中广播自己,因此网络中的其他设备可以在无需手动配置 IP 的情况下找到它。 **接入我们的工具链。**同一个端点为我们的自动化提供数据,用于真正的工作——内容管道、研究和操作代理——通过 **openclaw (https://github.com/openclaw/openclaw)** 和 **hermes (https://github.com/NousResearch/hermes-agent)** 等框架编排。设备是肌肉;工具链是判断力。(这本身就是一个故事,我们很快就会好好讲述。) ## 商业案例:夜间运行,需要时爆发 剥离掉乐趣,这里有一个严肃的论点,并且这正是我们每周向客户提出的论点。 从 128 GB 统一内存真正能买到什么开始:**运行大型、稠密模型的空间**——一个 27B 参数的稠密模型,而不仅仅是小型或稀疏模型——完全在本地内存中。缺陷是诚实的:在桌面级的 Strix Halo 盒子上,那些大型稠密模型是**慢的**(尽管内置的推测解码现在收回了很大一部分速度)。但是当工作不需要在接下来的十秒钟内得到答案时,“慢”就不再重要了。你拥有 RAM,你拥有硬件,边际成本是电费——所以**你让繁重的工作在夜间运行**。总结当天的文档,分类积压工作,对整个语料库运行审计:下午 6 点排队,喝咖啡时阅读结果。对于所有可以等待的事情,你拥有的吞吐量胜过你租用的延迟。 而这正是使该设备成为**垫脚石而非死胡同**的原因。一旦一个工作负载在夜间证明了自己的价值——并且一旦你需要它*交互式*,或者达到桌面盒子无法企及的规模——你无需重写任何代码。Lemonade 有**内置的云端卸载**机制,所以同一台服务器可以与其本地模型一起,将请求路由到兼容 OpenAI 的提供商。启动一个运行更大开放权重(如 **GLM-5.2 (https://machine-learning-made-simple.medium.com/understanding-glm-5-2-beyond-the-headlines-3a4e654c9542)**)的私有 **Hot Aisle (https://hotaisle.xyz/)** 实例,按小时计费,运行按需爆发,然后关闭它。相同的 API,相同的提示,相同的隐私态势——你自己的实例,你的数据——只需在你真正需要速度的那些小时里调高。 这是该步骤的入门级版本。同一个盒子更**成熟的使用**方式是端到端运行*相同的引擎*:在你的 RDNA 硬件上用 **vLLM** 原型化一个工作负载,然后将那个相同的 vLLM 栈部署到云端的 **CDNA** MI300X 上——你为更大的硬件重新调优性能配方,而不是代码或 API。那条从桌面到数据中心的桥梁本身就是一个故事,即将到来。 因此,该设备同时扮演两个角色:**永远在线、私有、零边际成本的主力机**,用于所有可以在夜间运行的工作;以及**试验场**,它精确告诉你哪些东西

相似文章

Lemonade 中的 macOS 支持已从 Beta 版毕业!

Reddit r/LocalLLaMA

Lemonade 是一款开源本地 AI 解决方案,其 macOS 支持已从 Beta 版毕业,现在在 macOS 上提供所有主要功能,包括 OmniRouter、编程、图像/语音生成和转录。

Lemonade v10.7 发布及项目组织更新

Reddit r/LocalLLaMA

Lemonade v10.7 版本引入了 LMX-Omni 虚拟模型,支持全模态聊天;新增 bench CLI 工具,用于跨后端比较 LLM 性能;并扩展了在 AMD、Apple Silicon、Nvidia 和 Intel 系统上的 GPU 支持。

AMD的Lemonade SDK为本地AI添加了NVIDIA CUDA支持

Reddit r/artificial

AMD的Lemonade SDK在10.7版本中为本地AI添加了NVIDIA CUDA支持,使得在竞争对手的GPU上也能获得相同的本地AI服务器体验。该版本还引入了lemonade bench,用于跨后端的LLM基准测试,并提供了更广泛的Vulkan支持。