标签
Firebird在亚美尼亚启动了独联体地区最大的人工智能工厂,该工厂由NVIDIA加速计算和Dell基础设施提供支持,计划到2027年底部署超过70,000个NVIDIA GPU和300兆瓦的容量。NVIDIA还打算投资Firebird,作为在亚美尼亚、哈萨克斯坦和其他市场建设约2吉瓦路线图的一部分。
Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。
这条推文分享了证据,表明NVIDIA故意塑造其软件生态系统,使较新的工作流看起来是Blackwell独占的,同时让Ampere路径得不到支持,建议用户在升级前等待,并暗示NVIDIA的护城河正在减弱,有利于Intel和AMD。
Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。
技术文章:详细介绍如何使用自定义Triton内核和vLLM在两块Nvidia 4090d GPU上运行DeepSeek V4 Flash,在262k上下文环境下实现约105 tokens/秒的推理速度。
NVIDIA详细介绍了其与PyTorch等开源生态系统共同开发的全栈推理软件,如何在Blackwell GPU上将令牌成本降低多达5倍,来自Baseten、Cognition、Deep Infra等的实际部署展示了性能提升。
Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。
用户向社区询问,在拥有4块RTX PRO 6000 GPU(共384GB)的高端本地设备上,应该部署哪个大型语言模型,主要用于公司内部政策管理和思考任务。
NVIDIA认为每瓦性能是衡量AI基础设施效率的关键指标,并强调其Blackwell和Vera Rubin平台在MoE模型上实现了相比Hopper高达25倍的提升。
本文深入解读NVIDIA最新发布的《AI Model Co-Design》文章,指出在AI推理场景中,存储(内存带宽、权重读取)已取代GPU算力成为主要瓶颈,并阐述了TensorRT-LLM和Blackwell架构围绕Roofline模型的设计策略,强调减少数据移动比提升计算能力更为关键。
FastAFD 是一个开源的 serving 系统,用于在 Blackwell NVL72 上对 MoE 模型进行 Attention-FFN 解聚,相较于共置的 MoE 服务,其每 GPU 解码吞吐量提升了 1.35-1.45 倍。
一份详细报告,关于在 NVIDIA DGX Spark 上优化生产环境 vLLM 服务配置,纠正了导致 MTP acceptance 降低 34% 的标志设置。该结论基于对 90 多份 NVIDIA 官方文档的审阅以及一次包含 69 个场景的工具评估。
NVIDIA报告称其Blackwell推理栈在一个月内将DeepSeek V4的token成本降低了多达5倍。
NVIDIA的博客详细介绍了FP4(配合NVFP4格式和Blackwell硬件)如何从一种压缩技巧演变为训练和推理的实用基础方案,涵盖LLM和扩散模型,并实现了接近16位的精度。
NVIDIA全栈推理软件与硬件协同设计,仅一个月内就在Blackwell平台上将Token成本降低多达5倍,为AI工厂实现更低的每Token成本。Baseten、Cognition、Deep Infra和Together AI等公司正在使用该软件栈优化推理性能。
详细剖析了NVIDIA GPU编程从Volta到Blackwell的演变,重点突出了从同步线程模型到异步数据流的转变以及喂饱张量核心的挑战。文章讨论了TMA、TMEM和tcgen05 MMA等新硬件特性,并展示了FlashAttention-3和FlashMLA等现代内核如何利用这些变化实现更高利用率。
宣布 Orinth 1.0 AEON ULTIMATE UNCENSORED,这是一个采用 BF16 和 NVFP4 量化的模型,适用于 DGX Spark/Blackwell 架构,声称在启用 DFlash 的情况下性能提升 200-300%。
一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。
据报道,来自深圳华强北市场的96GB显存改装版RTX 5090(Blackwell RTX 6000)已得到确认,改装卡总价约为8,200美元。
用户讨论了一个已锁定的戴尔报价:以折扣价购买6块RTX PRO 6000 Max-Q GPU,用于搭建GLM 5.2推理集群,并在报价到期前向社区征求购买策略建议。