有人刚刚在跨美国6个州的6块消费级GPU上,通过开放互联网以30 tok/s的速度运行了一个744B参数的模型
摘要
一位研究人员推出了Shard,在跨开放互联网的6块消费级GPU上分布式的744B参数模型实现了30 tok/s推理,相较之前的方法提升了15-20倍。
一位名为leyten的研究人员本周发布了一个名为Shard的项目,结果令人振奋。他们将GLM-5.2(744B参数)分布在位于内华达州、德克萨斯州、华盛顿州、明尼苏达州、密苏里州和犹他州的6块RTX Pro 6000 GPU上——通过常规WAN连接,节点间延迟22-75毫秒——并实现了约30 tokens/秒。作为对比,此前最佳尝试(Petals, 2022)在更小的模型上只能达到1-2 tok/s。这是15-20倍的提升,是去中心化AI的一个重要时刻。实现方法:结合了三种技术:WAN上的推测解码——一个小型的草稿模型提出K个token,分布式的大模型在一个网络往返中验证所有token。WAN延迟是稀缺资源,因此需要摊销它。带直接返回的环形流水线——最终节点直接将结果返回给协调器,而不是通过每个阶段进行中继。CUDA图化的草稿模型——将草稿模型预编译为CUDA图实现了3.8-5.3倍的加速。从基线到最终:普通WAN解码:1.87 tok/s 异步流水线:16.6 tok/s CUDA图化的草稿:约30 tok/s Shard是为c0mpute.ai提供支持的基础设施——一个任何人都可以贡献GPU并通过运行推理作业赚取USDC的网络。该网络有自己的代币$ZERO,随着网络增长而增值。这一结果表明基础是真实的,工程是严肃的。每次运行都会发布包含GPU UUID、IP地址、延迟测量和输出哈希的收据。代码开源。仓库:github.com/leyten/shard
相似文章
@sudoingX:这台笔记本通过 Hermes agent 以 99% GPU 利用率本地跑 31B 模型,持续 15 tok/s,22.8 o…
一台笔记本借助 Hermes agent 本地运行 31B 模型,速度 15 tok/s,显存占用 22.8 GB,功耗 94 W,实现完全自主、私密、无需云端的 AI 推理。
@dunik_7: 他让4050亿参数的模型在单张8GB游戏显卡上运行。他没有将其转为付费服务,而是开源了……
AirLLM 是一个开源工具,通过分层流式加载,使得在单张8GB游戏显卡上运行4050亿参数模型成为可能,免费使用,采用Apache 2.0许可证。
4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s
一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。
LFM2.5 230M 使用自定义 WebGPU 内核在浏览器中以 1,400 tok/s 运行
LFM2.5 230M 模型使用自定义 WebGPU 内核在浏览器中实现每秒 1,400 个 token,展示了高效的本地推理。