Mesh LLM:基于iroh的分布式AI计算
摘要
Mesh LLM 是一个分布式AI计算平台,它聚集多台机器上的闲置GPU来运行大型语言模型,并暴露单一的OpenAI兼容API。该平台利用iroh的点对点网络,实现无需中央服务器的私有、去中心化推理。
暂无内容
查看缓存全文
缓存时间: 2026/07/12 10:47
# Mesh LLM:在 iroh 上的分布式 AI 计算
来源:https://www.iroh.computer/blog/mesh-llm
分布式模型推理:一个由笔记本电脑、GPU 工作站、迷你 PC、服务器、工作站和云节点直接互连而成的网格
当人们想象运行大型语言模型时,通常会想到一个数据中心:一排排属于别人的 GPU、按量计费的 API,以及随着你成功而每月增长的账单。你把提示词发送到一个黑盒,然后祈祷价格、模型和隐私政策都跟你注册时一样。
对许多团队来说,这是一笔糟糕的买卖。你放弃了控制权:模型何时更新、数据去向何处、以及运行工作负载的硬件是什么。而且随着使用量增长,账单也会增加,你唯一的杠杆就是“多付钱”。
Mesh LLM (https://meshllm.cloud/) 提供了另一种形态。它汇集你已有的 GPU 和内存,可以跨任意多台你添加的机器,并将整个集群暴露为一个兼容 OpenAI 的 API。启动一个节点。之后再加更多节点。让网格决定模型是在你面前的机器上运行,还是路由到对等节点,或者分布在多台机器上。
## 问题:AI 很贵,而且还是别人的 (https://www.iroh.computer/blog/mesh-llm#the-problem-ai-is-expensive-and-it-is-somebody-elses)
流行的模型都是庞然大物。大多数人通过 UI 或 API 密钥访问它们,并支付给大型提供商来运行一切。这很方便,但也是一种投降。你无法控制模型何时更新、它在什么内存中运行,或者底层是什么硬件。
许多依赖这些模型的企业和服务都希望相反的情况:更多的控制权、更强的可插拔性、更低的成本。他们的办公室、壁橱、桌子底下都有 GPU。他们缺少的是一种让这些机器像一台机器一样工作的方法。
其主张很简单:无需购买更大的 GPU 即可运行更大的模型。私密地与你的团队共享计算资源,或公开地与全世界共享,为智能体和聊天提供动力。将任意 OpenAI 客户端指向 `http://localhost:9337/v1`,然后就不用再关心实际工作在哪里完成。
在底层,Mesh LLM 将模型计算分布在一个由 iroh 端点组成的网格上。一个请求可以通过三种方式处理:
- 在此机器的 GPU 上本地运行。
- 路由到已经加载了该模型的对等节点。
- 将单个盒子无法容纳的模型分解成流水线,跨多台机器运行。
该架构是可插拔的。插件在清单中声明它们提供什么,运行时启动它们、路由调用,并通过 MCP、HTTP、推理和网格事件暴露其能力。目录预装 40 多个模型,从适合笔记本电脑的 5 亿参数模型,到 2350 亿参数的混合专家大模型。
对于大模型,Mesh LLM 有一个拆分模式(内部称为 "Skippy")。一个模型按层范围被划分为多个阶段:第 0 到 15 层在第一个节点上,第 16 到 31 层在下一个节点上,依此类推,形成流水线。激活值从一个阶段流向下一个阶段,这样几台普通的机器就能运行一个它们任何一台都无法单独承载的模型。OpenAI 客户端对此一无所知。它仍然只与 localhost 通信。
每个节点,无论是提供模型服务还是只发送请求,都会启动一个 iroh 端点。该端点就是节点的身份标识、一个公钥,也是其唯一的网络接口。没有中央服务器。iroh 负责打洞、NAT 穿透和中继回退,以便在任何两个节点之间打开直接、经过身份验证的 QUIC 连接,无论它们位于何处。
为了确保这一点在开放互联网上正常工作,Mesh LLM 在不同区域运行两个 iroh 中继,因此无法直接通信的节点总能在附近找到回退路径。
整个协议运行在 QUIC 的 ALPN 协商之上。共有三种:
| ALPN | 传输内容 |
|---|---|
| mesh-llm/1 | 主网格:gossip、路由、HTTP 隧道、插件通道 |
| mesh-llm-control/1 | 业主控制平面(配置同步、所有权证明) |
| skippy-stage/2 | 针对拆分模型的延迟敏感激活值传输 |
在主要的 `mesh-llm/1` 连接内部,所有内容都是双向 QUIC 流,并用一个前导字节标识流类型。一个连接承载 gossip、推理、路由查询和对等节点生命周期事件,所有这些都通过该首字节解复用:
| 字节 | 流类型 | 描述 |
|---|---|---|
| 0x01 | GOSSIP | 对等节点公告(模型、GPU、RTT、能力) |
| 0x04 | TUNNEL_HTTP | 代理到对等节点的推理请求 |
| 0x05 | ROUTE_REQUEST | “你托管了哪些模型?” |
| 0x06 | PEER_DOWN | 对等节点离线通知 |
| 0x07 | PEER_LEAVING | 优雅关闭 |
| 0x08 | PLUGIN_CHANNEL | 插件 RPC |
| 0x0e | DIRECT_PATH_REQUEST | 共享用于 NAT 穿透的直接地址 |
巧妙之处在于这给你带来了什么。iroh 提供经过身份验证、支持 NAT 穿透的 QUIC 连接,在任何两台机器之间通过公钥寻址。因此,“路由到对等节点”和“将激活值流式传输到下一个流水线阶段”变成了与“与 localhost 通信”相同的原语,只是端点 ID 不同。网络问题不再需要你操心。
iroh 提供安全传输。Mesh LLM 在其之上构建自己的 gossip 层,因此它完全控制谁可以加入网格、哪些版本兼容以及哪些对等节点值得信任。
用户可以安装这个轻量级软件(约 18 MB),并选择加入公共网格或配置私有部署。该系统对任何标准 OpenAI 客户端呈现为 `localhost:9337/v1`。
移动端应用即将推出,基于 iroh 的 Swift SDK 构建。计划是支持 ACP(新兴的智能体标准),以便其他客户端也能加入网格。其主线与整个项目的初衷一致:更多的点对点,更少的封闭服务器,并且没有锁定。
- 查看代码 (https://github.com/Mesh-LLM/mesh-llm)
- Mesh LLM 网站 (https://meshllm.cloud/)
iroh 是一个即插即用的任意设备联网库。你可以从现成协议生态系统中组合所需功能,也可以在原始管道之上使用完全自定义的抽象。iroh 是开源的,已在数十万台设备上投入生产。要开始使用,请查看我们的文档 (https://iroh.computer/docs),直接深入代码 (https://github.com/n0-computer/iroh),或通过我们的 Discord 频道 (https://iroh.computer/discord) 与我们交流。
相似文章
@jack: mesh-llm 让你能够私下或公开地分发/共享计算资源
mesh-llm 是一个工具,支持私下或公开地分发和共享计算资源,并已集成到 Buzz 平台中。
lyogavin/airllm
AirLLM 是一个开源库,能够在单个 4GB GPU 上运行大型语言模型(最高可达 405B),无需量化、蒸馏或剪枝,显著降低了本地 LLM 推理的硬件门槛。
当你没有数据中心GPU时
LiquidAI 发布了 LFM2.5-230M,一个 230M 参数的语言模型,专为在有限硬件上运行而设计,支持 transformers、vLLM 和 SGLang。
ActiveMem:面向长程LLM推理的分布式主动记忆
ActiveMem提出了一种分布式主动记忆系统,将智能体记忆与大模型核心推理过程解耦,在长程任务上实现了最先进的准确率,同时显著降低了开销。
@tom_doerr: 在单个4GB GPU上运行70B大语言模型 https://github.com/lyogavin/airllm
AirLLM是一个开源工具,优化推理内存使用,无需量化即可在单个4GB GPU上运行70B大语言模型,并支持在8GB显存上运行405B模型。