@simplifyinAI: 大多数语音助手都需要你等待轮次,你说话,然后它回应,来回交替。NVIDIA 刚刚打造了一个不这样的助手……

X AI KOLs Timeline 模型

摘要

NVIDIA 推出了 Nemotron 3 VoiceChat,这是一个AI模型,能够实现实时全双工语音交互,允许自然中断,可通过实时演示体验,作为其开源 NeMo Speech 框架的一部分。

大多数语音助手都需要你等待轮次,你说话,然后它回应,来回交替。NVIDIA 刚刚打造了一个不这样的助手,你现在就可以试用。 它名为 Nemotron 3 VoiceChat,是 NVIDIA 开源 NeMo Speech 框架中的模型之一。它能实时监听和响应,全双工设计,因此你可以在对话中自然中断,就像真实对话一样。 这个框架需要 GPU 和 CUDA 来自行运行。但模型提供了实时演示,任何人都可以点击尝试。
查看原文
查看缓存全文

缓存时间: 2026/08/22 07:21

大多数语音助手都需要你等它说完,你一句我一句来回对话。而英伟达刚推出了一个打破这种模式的助手,现在就能体验。

它叫Nemotron 3 VoiceChat,是英伟达开源NeMo语音框架下的模型之一。它能实时监听并即时回应,实现全双工对话——你可以像真实交谈那样随时打断它的发言。

虽然运行该框架需要GPU和CUDA环境,但模型提供了公开演示,任何人都可以直接点击尝试。

相似文章

OpenAI的新语音模型不止于回话

Reddit r/ArtificialInteligence

OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。

@kwindla: https://x.com/kwindla/status/2062544580105359686

X AI KOLs Timeline

NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。