@FinanceYF5: NVIDIA发布Nemotron 3.5 Lightning 30B 总参数,激活只有 3B,支持 100 万 token 上下文,可商用。 本地部署友好:BF16 和更小的 NVFP4 版本,单卡 H100 或 DGX Spark 就能…
摘要
NVIDIA 发布 Nemotron 3.5 Lightning 30B 模型,总参数30B,激活仅3B,支持100万token上下文,可商用,本地部署友好,输出速度最高提升4倍。
查看缓存全文
缓存时间: 2026/08/12 10:24
NVIDIA发布Nemotron 3.5 Lightning
30B 总参数,激活只有 3B,支持 100 万 token 上下文,可商用。
本地部署友好:BF16 和更小的 NVFP4 版本,单卡 H100 或 DGX Spark 就能跑,RTX 5090 也在支持列表里。
官方称输出速度最高提升 4 倍,PinchBench 上准确率 86%,比同准确率的 Qwen3.6 35B 快 30%。 https://t.co/KbbCAWfuF5
相似文章
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
NVIDIA released Nemotron 3.5 Lightning 30B-A3B-NVFP4, a hybrid MoE LLM with 3B active parameters, up to 1M context, and speculative decoding support for efficient single-GPU inference.
@heyshrutimishra:NVIDIA 刚刚发布了 Nemotron 3.5 Lightning,300 亿参数,只有 30 亿激活,专为执行层打造…
NVIDIA 发布了 Nemotron 3.5 Lightning,这是一个拥有 300 亿参数的 MoE 模型,只有 30 亿激活参数,针对智能体执行任务进行了优化。它声称在保持 OpenMDW-1.1 完全开源的同时,实现更快、更便宜的工具调用和智能体执行。
@ctnzr: 我们更进一步:Nemotron 3 Super 拥有120B参数,在NVFP4精度下基于25T tokens进行了预训练。Nemotron 3 Ultra 大约为500B参数,……
NVIDIA 宣布推出 Nemotron 3 Super(120B)和 Nemotron 3 Ultra(约500B)模型,这些模型在 NVFP4 精度下基于25T tokens进行了预训练,强调加速计算和效率提升。
nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4
NVIDIA 发布 Nemotron-3-Ultra,一个拥有 5500 亿参数的开源权重模型,采用结合 Mamba-2、MoE 和注意力的混合架构,支持高达 100 万 token 的上下文长度和可配置的推理模式。
@FinanceYF5: 来源:
英伟达宣布将于本周发布Nemotron 3 Ultra。