标签
本项目实现了一个分布式流水线推理引擎,在一个由七个ESP32S3微控制器组成的集群上运行一个0.5B BitNet语言模型,采用1.58位量化和SPI菊花链通信。
本文针对多智能体系统中的多输出回归问题,开发了两种资源高效的分布式递归高斯过程算法,在降低通信开销的同时保持估计精度。
Mac Studio M5 的亮点在于其内存带宽、CPU/GPU核心数、独立NPU以及支持多台Mac分布式AI推理的能力,AI算力相比M3 Ultra提升4.3倍,适合本地模型工作站。
本文展示了关于Intel PC集群分布式LLM推理的研究,重点是使用OpenVINO实现流水线并行分片推理,并针对异构硬件进行性能优化。
Lumabri 允许用户使用 Colibri 引擎在 P2P 集群上运行大型混合专家模型,任何机器都可以加入并聊天,无需预先下载完整模型。它采用纯 C 语言编写,无依赖,首先支持 CPU,并可选 GPU 加速。
Cascadia 推出了针对英特尔硬件设计的分布式 AI 推理系统,能够实现可扩展且高效的推理工作负载。
本文提出了EasyBalance,一种用于分布式混合专家(MoE)推理的跨层负载均衡策略。该策略在不修改专家-设备映射的情况下,调度并联合执行来自不同层的工作负载,以减少GPU空闲时间。实验表明,该策略可将空闲时间减少40%以上。
一条推文线程介绍了mesh-llm,这是一个开源工具,可将本地网络设备汇聚成一个统一的、兼容OpenAI的API,无需昂贵的企业级GPU即可运行大型LLM。
中国研究人员开发了一种全光互连系统,可连接标准电子芯片,将人工智能分布式推理速度提升超过100倍,同时仅使用典型计算资源的九分之一。这项发表在《国家科学评论》上的突破,采用硅光子收发芯片和FPGA实现了显著的效率提升。
Antirez宣布合并实现GLM 5.2的分支可能性很高,这可能成为运行在512GB Mac Studio上的最佳模型,并可能通过2位量化在分布式128GB MacBook上运行。
一位研究人员推出了Shard,在跨开放互联网的6块消费级GPU上分布式的744B参数模型实现了30 tok/s推理,相较之前的方法提升了15-20倍。
一个对 vLLM 的拉取请求为 MiniMax M3 增加了张量并行度 3 的支持(使用其 NVFP4 量化),使得该模型可以在 3 台 DGX Sparks(每台 87GB 显存)上运行。
vLLM 集成了 Mooncake Store 用于分布式 KV 缓存重用,支持跨节点前缀缓存,高效服务具有高令牌重用的代理工作负载。
一篇博客文章指导读者如何搭建树莓派集群进行分布式训练和推理,这是系列教程的一部分,旨在利用实惠的硬件让分布式AI变得可及。
antirez宣布收到audreyt赠送的M5 Max 128GB MacBook Pro,用于开发DwarfStar4,并在M3 Max和M5 Max硬件上进行分布式推理实验。
专家联邦(FoE)将混合专家模块重组为独立处理KV头的集群,消除了节点间通信瓶颈,在保持生成质量的同时,将推理吞吐量和延迟提升高达5.2倍。
硬件投入约 2.5 万美元。告诉我你们希望我在这两台设备上部署什么模型,我会协助测试。目前我已通过 Exo 后端跑通了 DeepSeek v3.2 Q8 版本;当前每台设备均在运行 GLM 5.1 Q4(正在排查为何 Exo 无法加载 Q8 版本)。静候社区完成 Kimi 2.6 针对 MLX/mmap 的优化适配。