blackwell

标签

Cards List
#blackwell

Firebird在亚美尼亚启动独联体地区最大AI工厂

NVIDIA Blog · 4天前 缓存

Firebird在亚美尼亚启动了独联体地区最大的人工智能工厂,该工厂由NVIDIA加速计算和Dell基础设施提供支持,计划到2027年底部署超过70,000个NVIDIA GPU和300兆瓦的容量。NVIDIA还打算投资Firebird,作为在亚美尼亚、哈萨克斯坦和其他市场建设约2吉瓦路线图的一部分。

0 人收藏 0 人点赞
#blackwell

MoE训练提速40%:更快的megakernel,居然来自Cursor(针对B200)

Reddit r/LocalLLaMA · 2026-08-05 缓存

Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。

0 人收藏 0 人点赞
#blackwell

@QuixiAI:"您的证据充分支持了NVIDIA有意塑造其软件生态系统以使有价值的新工作流看起来是Blackwell独占…"

X AI KOLs Following · 2026-08-01 缓存

这条推文分享了证据,表明NVIDIA故意塑造其软件生态系统,使较新的工作流看起来是Blackwell独占的,同时让Ampere路径得不到支持,建议用户在升级前等待,并暗示NVIDIA的护城河正在减弱,有利于Intel和AMD。

0 人收藏 0 人点赞
#blackwell

Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s

Reddit r/LocalLLaMA · 2026-07-27

Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。

0 人收藏 0 人点赞
#blackwell

Deepseek V4 Flash 在两块 Nvidia 4090d 48G (ada) 上以 vLLM 运行,速度约 105 t/s

Reddit r/LocalLLaMA · 2026-07-23

技术文章:详细介绍如何使用自定义Triton内核和vLLM在两块Nvidia 4090d GPU上运行DeepSeek V4 Flash,在262k上下文环境下实现约105 tokens/秒的推理速度。

0 人收藏 0 人点赞
#blackwell

@PyTorch: 开源放大全栈优势,实现最低令牌成本。PyTorch就是一个典型例子:自推出以来……

X AI KOLs Timeline · 2026-07-21 缓存

NVIDIA详细介绍了其与PyTorch等开源生态系统共同开发的全栈推理软件,如何在Blackwell GPU上将令牌成本降低多达5倍,来自Baseten、Cognition、Deep Infra等的实际部署展示了性能提升。

0 人收藏 0 人点赞
#blackwell

baseten/GLM-5.2-Vision-NVFP4

Hugging Face Models Trending · 2026-07-20 缓存

Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。

0 人收藏 0 人点赞
#blackwell

如果你有384GB(4块Blackwell),你会部署什么模型?为什么?

Reddit r/LocalLLaMA · 2026-07-15

用户向社区询问,在拥有4块RTX PRO 6000 GPU(共384GB)的高端本地设备上,应该部署哪个大型语言模型,主要用于公司内部政策管理和思考任务。

0 人收藏 0 人点赞
#blackwell

为什么每瓦性能是AI基础设施效率的终极指标

NVIDIA Blog · 2026-07-14 缓存

NVIDIA认为每瓦性能是衡量AI基础设施效率的关键指标,并强调其Blackwell和Vera Rubin平台在MoE模型上实现了相比Hopper高达25倍的提升。

0 人收藏 0 人点赞
#blackwell

@rickawsb: 英伟达也认为存储是比gpu更大的瓶颈 — nvda最新文章解读 NVIDIA 最新发布的《AI Model Co-Design》是一篇介绍 TensorRT-LLM 和 Blackwell 的技术文章, 但也是一份未来几年大模型设计和 A…

X AI KOLs Following · 2026-07-14 缓存

本文深入解读NVIDIA最新发布的《AI Model Co-Design》文章,指出在AI推理场景中,存储(内存带宽、权重读取)已取代GPU算力成为主要瓶颈,并阐述了TensorRT-LLM和Blackwell架构围绕Roofline模型的设计策略,强调减少数据移动比提升计算能力更为关键。

0 人收藏 0 人点赞
#blackwell

@haoailab: 在最新的机架级 GPU 系统上,Attention-FFN 解聚还能胜出吗?我们构建了 FastAFD,一个开源的 AFD 运行时…

X AI KOLs Timeline · 2026-07-13 缓存

FastAFD 是一个开源的 serving 系统,用于在 Blackwell NVL72 上对 MoE 模型进行 Attention-FFN 解聚,相较于共置的 MoE 服务,其每 GPU 解码吞吐量提升了 1.35-1.45 倍。

0 人收藏 0 人点赞
#blackwell

@MichaelGannotti: https://x.com/MichaelGannotti/status/2076024719371841537

X AI KOLs Timeline · 2026-07-11 缓存

一份详细报告,关于在 NVIDIA DGX Spark 上优化生产环境 vLLM 服务配置,纠正了导致 MTP acceptance 降低 34% 的标志设置。该结论基于对 90 多份 NVIDIA 官方文档的审阅以及一次包含 69 个场景的工具评估。

0 人收藏 0 人点赞
#blackwell

@rohanpaul_ai: NVIDIA最新发布的报告称其Blackwell推理栈在一个月内将DeepSeek V4的token成本降低了多达5倍。

X AI KOLs Following · 2026-06-30 缓存

NVIDIA报告称其Blackwell推理栈在一个月内将DeepSeek V4的token成本降低了多达5倍。

0 人收藏 0 人点赞
#blackwell

@AaronWeiHuang:我们最新博客探讨了FP4如何从压缩工具演变为训练和推理的实用基础方案,涵盖……

X AI KOLs Following · 2026-06-30 缓存

NVIDIA的博客详细介绍了FP4(配合NVFP4格式和Blackwell硬件)如何从一种压缩技巧演变为训练和推理的实用基础方案,涵盖LLM和扩散模型,并实现了接近16位的精度。

0 人收藏 0 人点赞
#blackwell

NVIDIA推理软件栈如何实现最低Token成本

NVIDIA Blog · 2026-06-30 缓存

NVIDIA全栈推理软件与硬件协同设计,仅一个月内就在Blackwell平台上将Token成本降低多达5倍,为AI工厂实现更低的每Token成本。Baseten、Cognition、Deep Infra和Together AI等公司正在使用该软件栈优化推理性能。

0 人收藏 0 人点赞
#blackwell

@ZhihuFrontier:GPU编程因张量核心速度太快无法喂饱而改变。知乎作者THU-PACMAN实验室分享了一个精辟的剖析…

X AI KOLs Timeline · 2026-06-30 缓存

详细剖析了NVIDIA GPU编程从Volta到Blackwell的演变,重点突出了从同步线程模型到异步数据流的转变以及喂饱张量核心的挑战。文章讨论了TMA、TMEM和tcgen05 MMA等新硬件特性,并展示了FlashAttention-3和FlashMLA等现代内核如何利用这些变化实现更高利用率。

0 人收藏 0 人点赞
#blackwell

@SpaceTimeViking: 宣布 Orinth 1.0 AEON ULTIMATE UNCENSORED!BF16 和 NVFP4 量化版,适用于 DGX Spark / Blackwell 架构。保留…

X AI KOLs Timeline · 2026-06-27 缓存

宣布 Orinth 1.0 AEON ULTIMATE UNCENSORED,这是一个采用 BF16 和 NVFP4 量化的模型,适用于 DGX Spark/Blackwell 架构,声称在启用 DFlash 的情况下性能提升 200-300%。

0 人收藏 0 人点赞
#blackwell

@RayFernando1337:我需要什么硬件才能以不错的每秒token数跑通这个庞然大物?

X AI KOLs Following · 2026-06-27 缓存

一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。

0 人收藏 0 人点赞
#blackwell

来自深圳华强北的96GB显存RTX 5090

Reddit r/LocalLLaMA · 2026-06-27

据报道,来自深圳华强北市场的96GB显存改装版RTX 5090(Blackwell RTX 6000)已得到确认,改装卡总价约为8,200美元。

0 人收藏 0 人点赞
#blackwell

戴尔锁定报价:6块RTX PRO 6000 Max-Q,每块$8,960 — 今晚到期。你会怎么做?

Reddit r/LocalLLaMA · 2026-06-25

用户讨论了一个已锁定的戴尔报价:以折扣价购买6块RTX PRO 6000 Max-Q GPU,用于搭建GLM 5.2推理集群,并在报价到期前向社区征求购买策略建议。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈