Nemotron 3 说话人识别的流式处理
摘要
文章描述了用户亲身体验 Nemotron 3 Diarization 模型的过程,重点介绍了其流式处理能力,以及将其整合到带有机器人的语音转语音设置中。
我最近试用了 Nemotron 3 说话人识别模型,它填补了我本地语音代理方案中的一个空白:追踪谁在说话。这是一个说话人识别模型,因此它提供的是说话人标签,而非转录文本或人名。它可以流式输出结果,并最多追踪八位说话人。我尝试使用一秒的流式处理块进行测试,在我的测试中,其质量非常好。我将其接入了我运行在 DGX Spark 上的语音转语音设置,并连接到 Reachy Mini 机器人。有趣的部分在于观察新来者说话,然后看到机器人询问他们的名字并在对话中记住它(就是这个视频里的情况!)。该模型首发支持 Transformers,并将获得商业友好的许可证。
相似文章
nvidia/Nemotron-3-Diarization
Nemotron-3-Diarization是NVIDIA推出的一款开放权重说话人分离模型,用于真实世界音频分析,支持流式和离线推理,最多支持八个说话人,并且允许商业使用。
**识别谁在何时说话:使用 NVIDIA Nemotron 3 Diarization 构建实时、多说话人 AI**
NVIDIA 发布了 Nemotron 3 Diarization,这是一个开源100M参数模型,实现了最先进的说话人识别,错误率为14.72%,支持最多八名说话人的实时和离线处理。
NVIDIA 发布 Nemotron 3 Nano Omni:面向文档、音频和视频智能体的长上下文多模态智能
NVIDIA 发布 Nemotron 3 Nano Omni,这是一款新型长上下文多模态 AI 模型,能够以高准确性和高效率处理文档、音频、视频和文本。
nvidia/nemotron-3.5-asr-streaming-0.6b
NVIDIA 发布 Nemotron 3.5 ASR,这是一个6亿参数的多语言流式语音识别模型,支持40种语言区域,采用缓存感知的FastConformer-RNNT架构实现低延迟转录。该模型支持可配置的块大小,并已在OpenMDW-1.1许可证下准备商业化使用。
我在15段临床对话上比较了说话人分离模型:Nemotron 3、Pyannote、Sortformer 和 VibeVoice
对15段临床对话的说话人分离模型比较显示,Pyannote Precision-3实现了最低的DER,Nemotron 3是最快的本地模型,并通过专有运行时进行了优化改进。