Nemotron 3 说话人识别的流式处理

Reddit r/LocalLLaMA 新闻

摘要

文章描述了用户亲身体验 Nemotron 3 Diarization 模型的过程,重点介绍了其流式处理能力,以及将其整合到带有机器人的语音转语音设置中。

我最近试用了 Nemotron 3 说话人识别模型,它填补了我本地语音代理方案中的一个空白:追踪谁在说话。这是一个说话人识别模型,因此它提供的是说话人标签,而非转录文本或人名。它可以流式输出结果,并最多追踪八位说话人。我尝试使用一秒的流式处理块进行测试,在我的测试中,其质量非常好。我将其接入了我运行在 DGX Spark 上的语音转语音设置,并连接到 Reachy Mini 机器人。有趣的部分在于观察新来者说话,然后看到机器人询问他们的名字并在对话中记住它(就是这个视频里的情况!)。该模型首发支持 Transformers,并将获得商业友好的许可证。
查看原文

相似文章

nvidia/Nemotron-3-Diarization

Hugging Face Models Trending

Nemotron-3-Diarization是NVIDIA推出的一款开放权重说话人分离模型,用于真实世界音频分析,支持流式和离线推理,最多支持八个说话人,并且允许商业使用。

nvidia/nemotron-3.5-asr-streaming-0.6b

Hugging Face Models Trending

NVIDIA 发布 Nemotron 3.5 ASR,这是一个6亿参数的多语言流式语音识别模型,支持40种语言区域,采用缓存感知的FastConformer-RNNT架构实现低延迟转录。该模型支持可配置的块大小,并已在OpenMDW-1.1许可证下准备商业化使用。