@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……

X AI KOLs Following 模型

摘要

NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。

NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字 🔥 转录、翻译、声音识别与音频问答、TTS 以及完整的语音到语音转换,原生地听、思考并回应 开放权重,2B 和 30B ▶️ https://t.co/jUv9HVSfr3 https://t.co/uyfA9D4wIR
查看原文
查看缓存全文

缓存时间: 2026/07/21 14:45

NVIDIA Nemotron 刚刚发布了一款原生音频模型,它能听到整个世界,不仅仅是文字 🔥

转录、翻译、声音识别与音频问答、TTS 和完整的语音到语音功能,它原生地聆听、思考并回应

开放权重,2B 和 30B 参数版本

▶️ https://t.co/jUv9HVSfr3 https://t.co/uyfA9D4wIR


Nemotron-Labs-Audex - 由 NVIDIA 打造的 Hugging Face Space

Source: https://huggingface.co/spaces/nvidia/Nemotron-Labs-Audex 正在从 Hugging Face Docker 仓库获取元数据…

相似文章

@kwindla: https://x.com/kwindla/status/2062544580105359686

X AI KOLs Timeline

NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。

nvidia/Nemotron-Labs-Audex-30B-A3B · Hugging Face

Reddit r/LocalLLaMA

NVIDIA 发布了 Nemotron-Labs-Audex-30B-A3B,这是一个统一的音频-文本大语言模型,基于 30B MoE 主干网,激活参数量为 3B。该模型在音频理解、语音识别/翻译和生成方面表现出色,同时保留了文本推理和对齐能力。

nvidia/nemotron-3.5-asr-streaming-0.6b

Hugging Face Models Trending

NVIDIA 发布 Nemotron 3.5 ASR,这是一个6亿参数的多语言流式语音识别模型,支持40种语言区域,采用缓存感知的FastConformer-RNNT架构实现低延迟转录。该模型支持可配置的块大小,并已在OpenMDW-1.1许可证下准备商业化使用。