gpu-clusters

标签

Cards List
#gpu-clusters

@nrehiew_: 这太棒了!一个有趣的后续是,给定任意拓扑和架构,计算预期的计算/…

X AI KOLs Timeline ↗ · 2026-07-15 缓存

这是一条对一篇关于TPU/GPU集群中集体通信的博客文章的推文回复,建议进行后续工作,计算在Blackwell NVL72上对1T MoE模型的预期计算/通信时长,并估算理论MFU和瓶颈。

0 人收藏 0 人点赞
#gpu-clusters

没人知道二手GPU集群值多少钱

Hacker News Top ↗ · 2026-07-15 缓存

关于将二手GPU集群作为债务融资抵押品时估值挑战的分析,强调了运营依赖性和硬件故障率使得传统资产评估无法进行。

0 人收藏 0 人点赞
#gpu-clusters

GPU集群因等待存储而闲置,比我想象的更常见

Reddit r/ArtificialInteligence ↗ · 2026-07-13

在一次AI基础设施聚会上,多人反映GPU集群经常闲置,因为存储系统在训练期间无法足够快地提供数据,尤其是在使用旧NAS上的大型非结构化数据集时。与会者提到转向高吞吐量、针对S3优化的平台,如Cloudian HyperStore和VAST Data,以解决这一瓶颈。

0 人收藏 0 人点赞
#gpu-clusters

@TheNoise2Signal: 前沿训练如何用到2048块GPU?因为可以从五个维度拆分工作——在大规模训练中……

X AI KOLs Timeline ↗ · 2026-05-25 缓存

解释了前沿AI训练如何通过五个维度分配工作来使用多达2048块GPU,揭开了模型训练框架的神秘面纱。

0 人收藏 0 人点赞
#gpu-clusters

利用 MRC(多路径可靠连接)解锁大规模 AI 训练网络

OpenAI Blog ↗ · 2026-05-05 缓存

OpenAI 发布了 MRC(Multipath Reliable Connection),这是一种与行业合作伙伴共同开发的全新网络协议,旨在提升大规模 AI 训练集群的性能和可靠性。该规范通过 Open Compute Project 发布,以标准化基础设施,实现高效的超级计算机运行。

0 人收藏 0 人点赞
#gpu-clusters

灵活调峰:电力柔性 AI 工厂如何稳定全球能源电网

NVIDIA Blog ↗ · 2026-03-25 缓存

Emerald AI 展示了电力柔性AI工厂如何自主调节电力消耗以稳定电网需求,该方案依托伦敦数据中心的 NVIDIA GPUs 及相关基础设施,在不干扰关键工作负载的前提下吸收峰值功率激增。

0 人收藏 0 人点赞
#gpu-clusters

Kubernetes 扩展到 7,500 个节点

OpenAI Blog ↗ · 2021-01-25 缓存

# Kubernetes 扩展到 7,500 个节点 来源:[https://openai.com/index/scaling-kubernetes-to-7500-nodes/](https://openai.com/index/scaling-kubernetes-to-7500-nodes/) OpenAI将单个 Kubernetes 集群扩展到这个规模很少见,需要特殊的关注,但好处是提供了一个简单的基础设施,让我们的机器学习研究团队能够更快地迭代并扩展,而无需改变代码。从我们之前关于[扩展到 2,500 个节点⁠](https://openai.com/index/scaling-kube)的文章以来

0 人收藏 0 人点赞
← 返回首页

提交意见反馈