标签
NVIDIA 宣布推出 DFlash,一种用于推测解码的开源块扩散模型,在 Blackwell GPU 上可实现高达 15 倍的推理吞吐量提升,同时保持交互性。
Ollama在其美国云上为GLM 5.2将GPU容量翻倍,使用NVIDIA B300 Blackwell GPU,强调隐私和开放模型。
NVIDIA 的 Blackwell 平台在所有 MLPerf Training 6.0 基准测试中实现了最快的训练时间,扩展到 8,192 块 GPU,并且 GB300 NVL72 相比 GB200 NVL72 展示了高达 1.6 倍的性能提升。
NVIDIA Blackwell GB300 NVL72 平台在 Artificial Analysis 的首个自主AI基础设施基准测试 AgentPerf 中领先,每兆瓦可运行的智能体数量是上一代 Hopper 的 20 倍。
在RTX 5090上对Qwen3.6-27B进行的NVFP4基准测试显示,与同等比特的Q4_K_M相比,预填速度提升32-42%,与Q6_K相比提升52-68%,但解码速度提升有限(相比Q4提升+9%),因为解码受内存带宽限制。与Q6相比,质量损失极小(平均-0.8),使得NVFP4成为本地推理的不错选择。
一位用户分享了将 Nvidia RTX Pro 4500 Blackwell 32GB GPU 与 RTX 5060 Ti 16GB 进行 AI 推理性能对比的基准测试结果,显示根据模型大小和量化水平,速度提升了 1.6 到 6 倍。
一条推文线程,回顾了论文《使用NVFP4预训练大型语言模型》并讨论了NVFP4预训练,特别是针对NVIDIA Blackwell。
美国工业和安全局(BIS)发布了指导意见,要求向位于中国境外但总部在中国的公司出口先进AI芯片需取得许可证,这凸显了此前对海外子公司(如腾讯马来西亚购买英伟达Blackwell芯片)存在的执法漏洞。
一名开发者记录了为在旧款戴尔PowerEdge R730服务器上运行NVIDIA RTX Pro 6000 Blackwell GPU所需进行的大量硬件和固件破解工作,从而实现了650K上下文长度的本地AI推理。
Nvidia 预告将在 6 月 2 日 Computex 上发布一款新的基于 ARM 的 PC 笔记本电脑芯片(很可能是 N1X)。该芯片是 DGX Spark 中使用的 GB10 Superchip 的低功耗版本,拥有 20 个 ARM 核心和 6144 个 CUDA 核心,面向 Windows 笔记本电脑。
作者提出了SM1,一个Mamba1的变体,d_state=1,使用两个原生PyTorch操作替代选择性扫描,与d_state=16相比内存减少16倍。闭式解消除了状态维度,实现了每个token恒定内存的高效推理。
Llama.cpp 现已支持适用于 Blackwell GPU 的 Nvidia 程序化依赖启动 (PDL),在 Token 生成时可带来 5-10% 的性能提升。该功能默认未启用,需通过编译标志开启。
一个开发者工具包,提供在使用 TensorRT-LLM 通过 Nvidia Blackwell GPU 以 NVFP4 精度运行大型语言模型时的配置、预编译包(wheels)及基准测试数据。
一名用户展示了如何使用修改版的 llama.cpp CUDA 仓库在本地工作站上成功运行 DeepSeek V4 Pro 模型,并分享了性能指标和硬件需求。
Michael Goin 回顾了 vLLM v0.20.0 的发布,重点介绍了 752 次代码提交以及新功能,包括对 DeepSeek V4 的支持、TurboQuant 技术以及 PyTorch 2.11 的集成。
NVIDIA 宣布 16 款游戏将于 5 月加入 GeForce NOW 云流媒体平台,其中包括《极限竞速:地平线 6》(Forza Horizon 6)和《007:第一缕曙光》(007 First Light)等全新 AAA 大作,并为 Ultimate 会员扩展 RTX 5080 级性能以覆盖更多游戏库。
Supermicro 与 NVIDIA 发布交钥匙“AI Factory”参考架构,整合 Blackwell GPU、认证服务器、网络、存储与部署服务,让企业更快搭建集群级 AI 基础设施。
Yahoo Finance报道Nvidia CEO黄仁勋对公司未来十年的长期愿景,Nvidia与Supermicro正基于Blackwell系统推进交钥匙AI工厂基础设施。
NVIDIA CEO 黄仁勋在 GTC 主题演讲中指出 AI 推理正处于拐点;Supermicro 正与 NVIDIA 合作,基于 Blackwell 平台交付一站式“AI 工厂”基础设施方案。