Nemotron-3-Super-120B-A12B(混合Mamba+MoE)在4×3090上实现504K token的完美针检索
摘要
英伟达的Nemotron-3-Super-120B-A12B,一种混合Mamba和混合专家模型,仅使用四块RTX 3090 GPU就实现了在504K token下的完美大海捞针检索。
暂无内容
相似文章
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B 在双RTX 3090上
关于在双RTX 3090上使用vLLM运行量化后的NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B模型的详细指南,支持完整的262K上下文,实现高推理速度且无需CPU卸载。
@ctnzr: 我们更进一步:Nemotron 3 Super 拥有120B参数,在NVFP4精度下基于25T tokens进行了预训练。Nemotron 3 Ultra 大约为500B参数,……
NVIDIA 宣布推出 Nemotron 3 Super(120B)和 Nemotron 3 Ultra(约500B)模型,这些模型在 NVFP4 精度下基于25T tokens进行了预训练,强调加速计算和效率提升。
nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4
NVIDIA 发布 Nemotron-3-Ultra,一个拥有 5500 亿参数的开源权重模型,采用结合 Mamba-2、MoE 和注意力的混合架构,支持高达 100 万 token 的上下文长度和可配置的推理模式。
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
NVIDIA released Nemotron 3.5 Lightning 30B-A3B-NVFP4, a hybrid MoE LLM with 3B active parameters, up to 1M context, and speculative decoding support for efficient single-GPU inference.
NVIDIA Puzzle-75B-A9B 在3×3090上使用NVFP4达到132 t/s——为何这个尺寸类别在其他方面是一片荒漠?
NVIDIA的Puzzle-75B-A9B模型在三块RTX 3090 GPU上使用NVFP4量化达到每秒132个token,引发了对该模型尺寸类别缺乏竞争的讨论。