@kwindla: https://x.com/kwindla/status/2062544580105359686
摘要
NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。
查看缓存全文
缓存时间: 2026/06/05 05:06
开源、多语言转录模型——NVIDIA:Nemotron 3.5 ASR
NVIDIA 今日发布了一款新的多语言语音转文本模型:Nemotron 3.5 ASR,非常适合语音助手场景。
该模型提供多语言版本(Nemotron 3.5 ASR)和纯英文版本(Nemotron 3 ASR)两个检查点。这是我们测试过的所有 STT 模型中延迟最低的一款。同时,它完全开源、可微调,并且可以部署在自己的基础设施上。
来自 Pipecat stt-benchmark 的核心数据:
Nemotron 3.5 ASR 与 Nemotron 3 ASR(英文专用)语音助手指标
Nemotron 3.5 ASR 与 Nemotron 3 ASR(英文专用)语音助手指标
多语言模型在基准测试中比任何其他模型都快,准确率也相当不错。纯英文模型同样快速,准确率非常接近当前最佳模型。这定义了延迟/准确率帕累托前沿上的一个新节点。
实时转录帕累托前沿图
实时转录帕累托前沿图
上述基准测试是开源的,所有代码在此处。
延迟是可配置的,通过设置音频处理“块大小”来实现。较大的块大小可略微提升准确率。对于语音助手,我们始终将转录配置为最低延迟。不过,块大小是动态可调的,因此如果你同时有语音助手和批量转录的使用场景,可以通过单个模型部署同时服务两种需求。
自行托管模型具有诸多优势。
-
许多企业需要将所有语音助手数据处理保留在自己的安全和合规边界内。
-
你可以控制容量规划,并优先保障延迟(包括最小化中位数延迟与高负载下延迟之间的差距)。
-
可以大幅节省成本。
每个代理每小时的成本可低至 0.01 美元,甚至更低。如果自行托管,还需要考虑基准用量承诺、自动扩缩、冗余以及多区域部署等因素。因此,企业级部署的粗略成本估算可能更接近 0.05 美元/小时。作为对比,主流提供商典型的转录 API 成本为 0.10 至 1.00 美元/小时。
以下是每小时成本的计算过程。针对 Nemotron 3.5 ASR 优化的 C++/CUDA 服务具有出色的扩展性。我们推荐在 NVIDIA L40S 上运行,因为购买 L40S 容量远比购买 H100 或其他更受 LLM 服务追捧的大型 GPU 容易。以下是 Nemotron 3.5 ASR 在 NVIDIA L40S 上同时处理转录流的并发数和延迟数据。我们希望即使在重负载下,最终完成时间也保持在约 50 毫秒以下(这样才能让客户端测量的“最终片段时间”总体保持在约 250 毫秒以下)。因此“安全”的最大并发流约为 96 条。
针对最低延迟优化设置下的并发流
针对最低延迟优化设置下的并发流
一台 L40S 每小时成本约为 1.50 美元。我们可以安全地处理约 200 个到该服务器的语音助手 WebSocket 连接,因为语音助手仅在用户说话时进行转录(在实际使用场景中,用户说话时间不到一半)。因此,如果该服务器以满负荷运行,每小时成本低于 0.01 美元。
当然,如果需要进行伸缩,还需要考虑过度配置。另一方面,如果有稳定的基准用量并愿意签署年度合同,则可以降低 GPU 费用。
由于 Nemotron 3.5 ASR 完全开源,你可以针对自己的使用场景进行修改。构建该模型的 NVIDIA 团队还提供了一套完整的微调工具。例如,你可以进行微调,使模型针对两种特定语言进行优化。这将模型原本均匀覆盖 40 种语言的出色通用能力,集中到你针对的两种语言上。
这些微调工具也在不断演进。一项新的编码代理技能使得构建自己的定制转录模型比以往任何时候都更加便捷!
我们创建了一个代码库,其中包含了上述基准测试中使用的 C++ 服务器,以及一个 Python 服务器,它可以基于 Pipecat 的动态队列自动在模型的多语言版本和英文版本之间进行路由。
相似文章
nvidia/nemotron-3.5-asr-streaming-0.6b
NVIDIA 发布 Nemotron 3.5 ASR,这是一个6亿参数的多语言流式语音识别模型,支持40种语言区域,采用缓存感知的FastConformer-RNNT架构实现低延迟转录。该模型支持可配置的块大小,并已在OpenMDW-1.1许可证下准备商业化使用。
@DataChaz:@NVIDIA 刚刚悄悄发布了一个极其令人印象深刻的语音识别模型,它彻底改变了本地语音处理的计算方式……
NVIDIA 悄然发布了 Nemotron-3.5-ASR,这是一个轻量级、参数规模为 0.6B 的开源语音识别模型,专为实时流式传输设计,支持 40 多种语言、低延迟和缓存感知架构。
@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。
nvidia/NVIDIA-NemotronLabs-VoiceChat-11B · Hugging Face(全双工)
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款开放的端到端全双工语音模型,可实现实时对话式AI,轮转延迟约450毫秒,支持打断(barge-in)和实时工具调用,是首款支持工具调用的开放全双工模型。
🟩 NVIDIA 的完整语音技术栈现已本地化。ASR + TTS + 编解码器,量化为 GGUF,通过 NeMo-Speech.cpp 在设备端运行
NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。