@simplifyinAI: 大多数语音助手都需要你等待轮次,你说话,然后它回应,来回交替。NVIDIA 刚刚打造了一个不这样的助手……
摘要
NVIDIA 推出了 Nemotron 3 VoiceChat,这是一个AI模型,能够实现实时全双工语音交互,允许自然中断,可通过实时演示体验,作为其开源 NeMo Speech 框架的一部分。
查看缓存全文
缓存时间: 2026/08/22 07:21
大多数语音助手都需要你等它说完,你一句我一句来回对话。而英伟达刚推出了一个打破这种模式的助手,现在就能体验。
它叫Nemotron 3 VoiceChat,是英伟达开源NeMo语音框架下的模型之一。它能实时监听并即时回应,实现全双工对话——你可以像真实交谈那样随时打断它的发言。
虽然运行该框架需要GPU和CUDA环境,但模型提供了公开演示,任何人都可以直接点击尝试。
相似文章
nvidia/NVIDIA-NemotronLabs-VoiceChat-11B · Hugging Face(全双工)
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款开放的端到端全双工语音模型,可实现实时对话式AI,轮转延迟约450毫秒,支持打断(barge-in)和实时工具调用,是首款支持工具调用的开放全双工模型。
@oliviscusAI:NVIDIA 刚刚移除了语音AI最大的痛点。他们开源了 PersonaPlex 7B,一个实时对话…
NVIDIA 开源了 PersonaPlex 7B,一个实时对话模型,能够同时聆听和说话,与大多数语音模型不同,它可以处理自然的打断和重叠。
OpenAI的新语音模型不止于回话
OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。
@kwindla: https://x.com/kwindla/status/2062544580105359686
NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。
NVIDIA 发布 Nemotron 3 Nano Omni 模型,统一视觉、音频和语言处理,助力 AI Agent 效率提升高达 9 倍
NVIDIA 宣布推出 Nemotron 3 Nano Omni,这是一款开放的多模态模型,通过统一视觉、音频和语言处理,使 AI Agent 能够更快、更高效地运行。与其他开放式的 Omni 模型相比,其吞吐量最高可提高 9 倍。