标签
Sam Altman 发推文说,他现在和 ChatGPT 说话比打字还多,并指出新语音模型在质量上跨越了一个门槛。
OpenAI 的新 GPT 语音模型实现了高度逼真、低延迟的实时语音对话,并具备情感表达能力,标志着 AI 语音交互的一次重大飞跃。
OpenAI 已将新一代用于自然人机交互的语音模型 GPT-Live 全面推送给 Go、Plus 和 Pro 方案的 ChatGPT 用户,免费用户的推送正在进行中。
OpenAI 宣布推出 GPT-Live,这是一种全新的全双工语音模型,通过允许同时收听和说话,实现更自然、实时的对话,后端模型为 GPT-5.5。
OpenAI 新语音模型 Bidi 1 首测曝光,支持双向语音设计、实时翻译和更强的上下文记忆,目前已小范围推送至 ChatGPT。
多个AI模型发布延迟:GPT-5.6预计推迟至7月中旬,DeepMind的3.5 Pro延期发布,而OpenAI的Bidi语音模型和面向企业的Claude Sonnet 5取得进展。
OpenAI计划发布GPT-Bidi-1,其下一代语音模型,可同时听和说,处理中断,并实现更自然的对话。
DramaBox是一个基于LTX 2.3的高度表现力语音模型,由Resemble AI发布,其开源代码和模型可在GitHub和Hugging Face上获取。
OpenAI发布了GPT-Realtime-2语音模型,具备GPT-5级别的推理能力和128,000 token上下文窗口,支持实时翻译70多种语言到13种输出语言,在Big Bench Audio Intelligence评测中达到96.6%准确率,Greg Brockman称其为语音翻译领域的里程碑。
OpenAI 发布了新的语音模型 GPT-Live,能够以自然的方式进行多任务对话,并实时执行复杂的规划,例如安排东京-迪拜-夏威夷的一日游。
OpenAI 展示了新语音模型在嘈杂环境下的背景鲁棒性,能准确识别对话对象、理解上下文,并允许用户自然打断,实现流畅的多人互动。
OpenAI 展示了新语音模型 GPT-Live 的实时同声传译与对话能力,能够同时听和说,并在翻译与聊天之间无缝切换。
OpenAI 展示新版语音模型在个性化和自然度上的突破,能够进行自然的头脑风暴式对话,表现出共情和适时插话能力,接近人类对话节奏。