标签
NVIDIA强调其Nemotron开放模型如何让团队构建针对业务数据和工作流程量身定制的、值得信赖的专用AI。
NVIDIA shares five lessons from over 5,000 Kagglers who fine-tuned reasoning models using LoRA adapters and synthetic chain-of-thought data in the Nemotron Model Reasoning Challenge, focusing on verifiable data, token budget, and infrastructure.
本文介绍了对 NVIDIA 的 Nemotron 检索栈进行的端到端适配,使其适用于现代希腊语,包括新基准 HERA,以及在专业领域针对检索、重排序和有依据的生成进行微调的模型。
NVIDIA的数字营销团队使用NVIDIA Nemotron Speech构建了一个AI驱动的本地化平台,翻译周转时间减少约70%,成本节省约25%,处理了超过20,000个文件中的1100万单词。
本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。
用户分享了使用 RPC 在两台机器上运行 550B Nemotron Ultra 模型的基准测试结果,在较旧的 AMD MI50 和 Nvidia P40 GPU 上实现了令人印象深刻的吞吐量。
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。
NVIDIA发布Nemotron 3 Embed,这是一组开源嵌入模型,在RTEB排行榜上名列前茅,包括一个80亿参数的旗舰模型以及适用于生产规模检索的高效10亿参数变体。
关于在双RTX 3090上使用vLLM运行量化后的NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B模型的详细指南,支持完整的262K上下文,实现高推理速度且无需CPU卸载。
LangChain展示了一段7分钟的教程,由合作伙伴工程师Srimanth Tangedipalli讲解如何在受治理的NemoClaw OpenShell沙盒中运行Deep Agents代码,并通过Baseten使用NVIDIA Nemotron 3 Ultra。
成功在搭载 64GB 内存的 M2 Max Mac 上本地运行了 75B 参数的 Nemotron Puzzle 模型,展示了在消费级硬件上进行大规模模型推理的能力。
NVIDIA推出了TwoTower,这是一种在扩散语言模型中解耦上下文表示和去噪的方法,在30B MoE主干上实现了2.42倍的吞吐量,同时保留了98.7%的自回归质量。
Fuji Kanaeda 宣布在一年后离开英伟达,强调了对合成数据生成(NeMo Data Designer)和 Nemotron LLM 构建的贡献,并赞扬团队在开源AI方面的工作。
NVIDIA 讨论了开放数据和合成数据对于构建稳健 AI 智能体的重要性,并重点介绍了他们用于训练、推理和工具使用的 Nemotron 开放数据集。
NVIDIA Nemotron 3 Ultra 借助 LangChain Deep Agents 框架实现了基准测试领先性能,无需重新训练即可比闭源模型更低的成本获得更高准确度。
NVIDIA AI 发布了一个75B的MoE模型(9.3B活跃),该模型使用Iterative Puzzle框架从Nemotron-3-Super-120B压缩而来,支持100万token上下文。
NVIDIA 发布了 Nemotron-Labs-3-Puzzle-75B-A9B,这是一种从 Nemotron-3-Super 衍生而来的压缩混合 MoE 大型语言模型,实现了约 2 倍更高的服务器吞吐量和更高的并发性,同时在推理、编码和长上下文基准测试中保持强劲的准确度。
NVIDIA 发布了 Nemotron-Labs-Audex-30B-A3B,这是一个统一的音频-文本大语言模型,基于 30B MoE 主干网,激活参数量为 3B。该模型在音频理解、语音识别/翻译和生成方面表现出色,同时保留了文本推理和对齐能力。
NVIDIA强调,开放前沿模型和AI基础设施正在推动AI研究,这体现在ICML 2026接收的论文中,涵盖机器人学、生命科学和合成数据等领域。
OpenMed privacy-filter v2使用nemotron和MLX 8位,在Mac上实现了每秒755个token的处理速度,从一份13,000个token的临床文件中脱敏了22个类别的1,152个PII标识符,且数据从未离开本机。