有人刚刚在跨美国6个州的6块消费级GPU上,通过开放互联网以30 tok/s的速度运行了一个744B参数的模型

Reddit r/ArtificialInteligence 工具

摘要

一位研究人员推出了Shard,在跨开放互联网的6块消费级GPU上分布式的744B参数模型实现了30 tok/s推理,相较之前的方法提升了15-20倍。

一位名为leyten的研究人员本周发布了一个名为Shard的项目,结果令人振奋。他们将GLM-5.2(744B参数)分布在位于内华达州、德克萨斯州、华盛顿州、明尼苏达州、密苏里州和犹他州的6块RTX Pro 6000 GPU上——通过常规WAN连接,节点间延迟22-75毫秒——并实现了约30 tokens/秒。作为对比,此前最佳尝试(Petals, 2022)在更小的模型上只能达到1-2 tok/s。这是15-20倍的提升,是去中心化AI的一个重要时刻。实现方法:结合了三种技术:WAN上的推测解码——一个小型的草稿模型提出K个token,分布式的大模型在一个网络往返中验证所有token。WAN延迟是稀缺资源,因此需要摊销它。带直接返回的环形流水线——最终节点直接将结果返回给协调器,而不是通过每个阶段进行中继。CUDA图化的草稿模型——将草稿模型预编译为CUDA图实现了3.8-5.3倍的加速。从基线到最终:普通WAN解码:1.87 tok/s 异步流水线:16.6 tok/s CUDA图化的草稿:约30 tok/s Shard是为c0mpute.ai提供支持的基础设施——一个任何人都可以贡献GPU并通过运行推理作业赚取USDC的网络。该网络有自己的代币$ZERO,随着网络增长而增值。这一结果表明基础是真实的,工程是严肃的。每次运行都会发布包含GPU UUID、IP地址、延迟测量和输出哈希的收据。代码开源。仓库:github.com/leyten/shard
查看原文

相似文章

4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s

Reddit r/LocalLLaMA

一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。