@DataChaz:@NVIDIA 刚刚悄悄发布了一个极其令人印象深刻的语音识别模型,它彻底改变了本地语音处理的计算方式……
摘要
NVIDIA 悄然发布了 Nemotron-3.5-ASR,这是一个轻量级、参数规模为 0.6B 的开源语音识别模型,专为实时流式传输设计,支持 40 多种语言、低延迟和缓存感知架构。
查看缓存全文
缓存时间: 2026/06/23 14:09
@NVIDIA 刚刚悄然发布了一款令人印象深刻的语音识别模型,彻底改变了本地语音处理管线的计算逻辑。
Nemotron-3.5-ASR 是一个 0.6B 参数的开源模型,专为实时流式处理而设计。
它的出色之处在于: → 支持 40+ 种语言 → 缓存感知架构(消除了冗余的音频计算) → 可配置延迟(最低可达 80ms 分片大小) → 自动输出精美标点且首字母大写的文本
由于它极其轻量,你不再需要依赖庞大的 H100 集群。
在 CPU 或广泛可用的 L40S GPU 上,它的扩展表现同样出色。
在最低延迟设置下,它能够处理约 17 倍于此前 1.1B 缓冲模型的并发流。
对于构建智能体管线的开发者来说,这是一场巨大的胜利:
你现在拥有了本地、离线的语音处理能力,更轻量、明显更快,并且数据能安全地保留在你的安全边界内。
100% 免费且开源。
仓库和权重见 ↓
相似文章
nvidia/nemotron-3.5-asr-streaming-0.6b
NVIDIA 发布 Nemotron 3.5 ASR,这是一个6亿参数的多语言流式语音识别模型,支持40种语言区域,采用缓存感知的FastConformer-RNNT架构实现低延迟转录。该模型支持可配置的块大小,并已在OpenMDW-1.1许可证下准备商业化使用。
@kwindla: https://x.com/kwindla/status/2062544580105359686
NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。
@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。
@thesupermanmx: NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,而且成本为零。这真是太快了……
NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,支持从单一检查点进行多种语言转录,并内置标点和大小写功能。
🟩 NVIDIA 的完整语音技术栈现已本地化。ASR + TTS + 编解码器,量化为 GGUF,通过 NeMo-Speech.cpp 在设备端运行
NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。