@reach_vb: 两个新的转录模型现已在 API 中可用!> GPT Live Transcribe 用于低延迟实时转录 > G…
摘要
OpenAI 发布了两个新的转录模型:GPT Live Transcribe 用于低延迟场景,GPT Transcribe 用于批处理工作负载,错误率降低高达 41%,并通过上下文提高了语义准确性。
查看缓存全文
缓存时间: 2026/07/29 14:05
现在API中提供了两个全新的转录模型!
GPT Live Transcribe:适用于低延迟实时转录 GPT Transcribe:适用于完整音频和批量工作负载
最酷的是它们能够充分利用上下文信息——你可以传递关于录音的自由形式信息、关键关键词以及多种预期语言。
Live模式还能利用之前的轮次作为上下文。
改进效果非常显著:
Live模式错误率从11.65%降至9.60%(降低约18%) Transcribe模式错误率从Whisper-1的15.21%降至8.98%(降低约41%) 添加上下文后,语义准确率从38.5%提升至44.6%(Live模式),从41.6%提升至45.2%(Transcribe模式)
简单来说:在口音和语言识别方面大幅提升,尤其适用于短句、数字、技术术语和嘈杂音频。
对语音助手、通话、字幕、会议等场景非常有用!
现在即可在API中获取!https://x.com/OpenAIDevs/status/2082201169443905798/video/1…
相似文章
Introducing gpt-transcribe and gpt-live-transcribe
OpenAI 发布 GPT-Transcribe 和 GPT-Live-Transcribe 两款转录模型,分别针对完整文件批处理与实时流式场景,支持 57 种语言、自定义词汇表及多语言自动切换,在口音和噪音等困难场景中表现更优。
@Azure:微软 Foundry 现已推出 GPT-transcribe 和 GPT-live-transcribe。使用高精度转录功能构建录播音频…
OpenAI 和微软在 Microsoft Foundry 中发布了 GPT-transcribe 和 GPT-live-transcribe,分别针对录播音频和实时语音提供高精度异步转录和低延迟流式转录,具备背景噪音处理、口音鲁棒性和字母数字感知等功能。
API 推出全新模型,推动语音智能发展
OpenAI 在 API 中发布了三款全新语音模型:具备高级推理能力的 GPT-Realtime-2、支持实时多语言翻译的 GPT-Realtime-Translate,以及用于流式转录的 GPT-Realtime-Whisper,旨在实现更自然、更具行动力的语音应用。
在API中引入下一代音频模型
OpenAI 为 API 引入了下一代音频模型,包括改进的语音转文本(gpt-4o-transcribe、gpt-4o-mini-transcribe)和可自定义的文本转语音模型,使开发者能够构建更智能、更具表现力的语音代理,在具有挑战性的场景中提升准确性。
OpenAI 发布新语音模型,实现更自然的实时对话
OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。