@oliviscusAI:NVIDIA 刚刚移除了语音AI最大的痛点。他们开源了 PersonaPlex 7B,一个实时对话…
摘要
NVIDIA 开源了 PersonaPlex 7B,一个实时对话模型,能够同时聆听和说话,与大多数语音模型不同,它可以处理自然的打断和重叠。
NVIDIA 刚刚移除了语音AI最大的痛点。
他们开源了 PersonaPlex 7B,一个实时对话模型。
它可以同时聆听和说话,因此能处理自然的打断和重叠,而不是像大多数语音模型那样卡住。
100% 开源 https://t.co/nKyARAgL0I
查看缓存全文
缓存时间: 2026/08/05 02:17
NVIDIA刚刚消除了语音AI中最大的摩擦点。
他们开源了PersonaPlex 7B,一个实时对话模型。
它能同时听和说,因此能处理自然的打断和重叠,而不是像大多数语音模型那样卡住。
100% 开源 https://t.co/nKyARAgL0I
相似文章
@simplifyinAI: 大多数语音助手都需要你等待轮次,你说话,然后它回应,来回交替。NVIDIA 刚刚打造了一个不这样的助手……
NVIDIA 推出了 Nemotron 3 VoiceChat,这是一个AI模型,能够实现实时全双工语音交互,允许自然中断,可通过实时演示体验,作为其开源 NeMo Speech 框架的一部分。
OpenAI的新语音模型不止于回话
OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。
nvidia/NVIDIA-NemotronLabs-VoiceChat-11B · Hugging Face(全双工)
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款开放的端到端全双工语音模型,可实现实时对话式AI,轮转延迟约450毫秒,支持打断(barge-in)和实时工具调用,是首款支持工具调用的开放全双工模型。
GPT新语音模型简直太疯狂了。
OpenAI 的新 GPT 语音模型实现了高度逼真、低延迟的实时语音对话,并具备情感表达能力,标志着 AI 语音交互的一次重大飞跃。
OpenAI 发布新语音模型,实现更自然的实时对话
OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。