distributed-inference

标签

Cards List
#distributed-inference

ESP32S3集群运行1.58位(BitNet)语言模型

Hacker News Top ↗ · 2天前 缓存

本项目实现了一个分布式流水线推理引擎,在一个由七个ESP32S3微控制器组成的集群上运行一个0.5B BitNet语言模型,采用1.58位量化和SPI菊花链通信。

0 人收藏 0 人点赞
#distributed-inference

资源高效的分布式递归高斯过程

arXiv cs.LG ↗ · 2026-09-24 缓存

本文针对多智能体系统中的多输出回归问题,开发了两种资源高效的分布式递归高斯过程算法,在降低通信开销的同时保持估计精度。

0 人收藏 0 人点赞
#distributed-inference

@ai_xiaomu: Mac Studio M5 牛比的地方不是 512G, 这个配置 M3 就有了,区别在于: 内存带宽1.2TB/s 36核CPU+80核GPU,GPU核心带独立NPU 最高512GB统一内存 雷电5+RDMA,支持多台Mac分布式AI推理…

X AI KOLs Following ↗ · 2026-08-26 缓存

Mac Studio M5 的亮点在于其内存带宽、CPU/GPU核心数、独立NPU以及支持多台Mac分布式AI推理的能力,AI算力相比M3 Ultra提升4.3倍,适合本地模型工作站。

0 人收藏 0 人点赞
#distributed-inference

深入探讨我们为Intel PC研发的分布式LLM推理研究

Reddit r/artificial ↗ · 2026-08-20 缓存

本文展示了关于Intel PC集群分布式LLM推理的研究,重点是使用OpenVINO实现流水线并行分片推理,并针对异构硬件进行性能优化。

0 人收藏 0 人点赞
#distributed-inference

Show HN: Lumabri – 使用 Colibri 在 P2P 集群上运行 MoE 模型

Hacker News Top ↗ · 2026-08-14 缓存

Lumabri 允许用户使用 Colibri 引擎在 P2P 集群上运行大型混合专家模型,任何机器都可以加入并聊天,无需预先下载完整模型。它采用纯 C 语言编写,无依赖,首先支持 CPU,并可选 GPU 加速。

0 人收藏 0 人点赞
#distributed-inference

Cascadia 为英特尔硬件推出分布式 AI 推理

Reddit r/artificial ↗ · 2026-08-13

Cascadia 推出了针对英特尔硬件设计的分布式 AI 推理系统,能够实现可扩展且高效的推理工作负载。

0 人收藏 0 人点赞
#distributed-inference

EasyBalance:分布式MoE推理中的跨层负载均衡

arXiv cs.LG ↗ · 2026-08-11 缓存

本文提出了EasyBalance,一种用于分布式混合专家(MoE)推理的跨层负载均衡策略。该策略在不修改专家-设备映射的情况下,调度并联合执行来自不同层的工作负载,以减少GPU空闲时间。实验表明,该策略可将空闲时间减少40%以上。

0 人收藏 0 人点赞
#distributed-inference

@TheTechDiggest:[开源 - 分布式AI与网格LLM推理] 购买昂贵的企业级GPU并不是运行大规模……的唯一方式

X AI KOLs Timeline ↗ · 2026-08-08 缓存

一条推文线程介绍了mesh-llm,这是一个开源工具,可将本地网络设备汇聚成一个统一的、兼容OpenAI的API,无需昂贵的企业级GPU即可运行大型LLM。

0 人收藏 0 人点赞
#distributed-inference

中国光学芯片突破:使用极少算力将AI速度提升百倍

Reddit r/ArtificialInteligence ↗ · 2026-07-13 缓存

中国研究人员开发了一种全光互连系统,可连接标准电子芯片,将人工智能分布式推理速度提升超过100倍,同时仅使用典型计算资源的九分之一。这项发表在《国家科学评论》上的突破,采用硅光子收发芯片和FPGA实现了显著的效率提升。

0 人收藏 0 人点赞
#distributed-inference

@antirez: 基于我在DwarfStar中实现GLM 5.2的说法,有90%的概率我会合并该分支…

X AI KOLs Following ↗ · 2026-06-24

Antirez宣布合并实现GLM 5.2的分支可能性很高,这可能成为运行在512GB Mac Studio上的最佳模型,并可能通过2位量化在分布式128GB MacBook上运行。

0 人收藏 0 人点赞
#distributed-inference

有人刚刚在跨美国6个州的6块消费级GPU上,通过开放互联网以30 tok/s的速度运行了一个744B参数的模型

Reddit r/ArtificialInteligence ↗ · 2026-06-20

一位研究人员推出了Shard,在跨开放互联网的6块消费级GPU上分布式的744B参数模型实现了30 tok/s推理,相较之前的方法提升了15-20倍。

0 人收藏 0 人点赞
#distributed-inference

@MiaAI_lab: 一个针对 vLLM 的 PR,允许 MiniMax M3 使用 TP=3。它的 NVFP4 量化版本大小为 260GB - lukealonso/MiniMax-M3-NVFP4 希望这能...

X AI KOLs Timeline ↗ · 2026-06-14 缓存

一个对 vLLM 的拉取请求为 MiniMax M3 增加了张量并行度 3 的支持(使用其 NVFP4 量化),使得该模型可以在 3 台 DGX Sparks(每台 87GB 显存)上运行。

0 人收藏 0 人点赞
#distributed-inference

@m_sirovatka: KV Cache 重用是代理工作负载推广中最重要的部分。我们已经将 Mooncake Store 集成到 prime-rl 中,与 vL…

X AI KOLs Following ↗ · 2026-06-02 缓存

vLLM 集成了 Mooncake Store 用于分布式 KV 缓存重用,支持跨节点前缀缓存,高效服务具有高令牌重用的代理工作负载。

0 人收藏 0 人点赞
#distributed-inference

@dorsa_rohani: 这篇论文可能是分布式推理的圣经 atp

X AI KOLs Timeline ↗ · 2026-05-23 缓存

一条推荐一篇被描述为分布式推理圣经的推文。

0 人收藏 0 人点赞
#distributed-inference

将树莓派集群用于学习分布式训练/推理

Reddit r/LocalLLaMA ↗ · 2026-05-14

一篇博客文章指导读者如何搭建树莓派集群进行分布式训练和推理,这是系列教程的一部分,旨在利用实惠的硬件让分布式AI变得可及。

0 人收藏 0 人点赞
#distributed-inference

@antirez: 怀着感激宣布,@audreyt刚刚赠送给我一台M5 Max 128GB MacBook Pro!这将让我能够开发DwarfStar4 (…

X AI KOLs Timeline ↗ · 2026-05-12

antirez宣布收到audreyt赠送的M5 Max 128GB MacBook Pro,用于开发DwarfStar4,并在M3 Max和M5 Max硬件上进行分布式推理实验。

0 人收藏 0 人点赞
#distributed-inference

专家联邦:面向大语言模型的高效通信分布式推理

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

专家联邦(FoE)将混合专家模块重组为独立处理KV头的集群,消除了节点间通信瓶颈,在保持生成质量的同时,将推理吞吐量和延迟提升高达5.2倍。

0 人收藏 0 人点赞
#distributed-inference

2台配备 512GB 内存的 M3 Ultra Mac Studio

Reddit r/LocalLLaMA ↗ · 2026-04-21

硬件投入约 2.5 万美元。告诉我你们希望我在这两台设备上部署什么模型,我会协助测试。目前我已通过 Exo 后端跑通了 DeepSeek v3.2 Q8 版本;当前每台设备均在运行 GLM 5.1 Q4(正在排查为何 Exo 无法加载 Q8 版本)。静候社区完成 Kimi 2.6 针对 MLX/mmap 的优化适配。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈