在 API 中使用 GPT‑Live‑1 构建更自然的语音体验

OpenAI Blog 模型

摘要

OpenAI 在 API 中推出了 GPT‑Live‑1,这是一款自然语音模型,使开发者能够构建支持语音的应用程序,具备流畅的打断功能、音调自定义以及将推理委托给其他模型的能力。

GPT‑Live‑1 在 API 中引入了自然的全双工语音对话,具有更强的指令遵循能力、自定义语音和电话支持。
查看原文
查看缓存全文

缓存时间: 2026/09/10 17:19

# 在API中使用GPT-Live-1构建更自然的语音体验 来源:https://openai.com/index/introducing-gpt-live-1-in-the-api/ 我们正式在API中发布GPT-Live-1,为开发者提供强大而自然的语音模型,用于构建支持语音的应用和业务流程。GPT-Live-1最初在ChatGPT(https://openai.com/index/introducing-gpt-live/)中推出,它能够同时进行语音输入和输出。正如在Codex和ChatGPT Work(在新窗口中打开)(https://www.youtube.com/watch?v=E0ZMOschrTU)中所展示的,它可以将更深入的推理任务委派给与之配合的模型和工具。 对于GPT-Live-1的API版本,我们重点开发了新的功能,让开发者能够根据用户、工作流程和目标来引导和定制语音体验。GPT-Live-1的一项核心优势是流畅的中断处理,它已经展现出商业价值:在早期评估中,Speak发现GPT-Live-1让学习者在语言导师回应前有更多时间思考,与之前的轮流式系统相比,中断率降低了近80%。 API中GPT-Live-1的主要优势: - **中断处理:** 通过单个模型同时处理输入和输出音频来改善中断处理,避免了传统的语音识别-大语言模型-语音合成链式架构的延迟和脆弱性。 - **推理与工具调用委派:** GPT-Live-1可以将推理和工具调用委派给后端文本模型,如GPT-6 Astra或第三方模型。 - **语气、节奏与风格:** 开发者可以通过系统提示来塑造智能体的语气、节奏和对话风格。 - **静默上下文管理与背景噪音:** 更好地处理背景噪音和静默,不会中断对话或逐步播报每个步骤。 - **长会话可靠性:** 在长时间交互中提升上下文记忆和对话质量。 - **电话支持:** 支持部署全双工语音智能体用于电话通话,从餐厅预订到客户支持。 ## 试用GPT-Live-1 开始一个会话并自然地交谈。可以打断、笑、改变主意——在家或在咖啡馆、城市街道等嘈杂环境中尝试。 探索其功能: - **自然地打断它。** 请求帮助,然后在回答中途打断以改变问题或补充细节。 - **随身携带。** 试试在户外行走或有日常背景噪音时进行对话,看看它如何保持流畅。 - **让它变得有趣。** 大笑、犹豫、使用简短的确认语,或短暂地与旁边的人交谈——然后继续对话。 此演示限时开放。使用即表示您同意OpenAI的服务条款(https://openai.com/policies/terms-of-use/)并知悉我们的隐私政策(https://openai.com/policies/privacy-policy/)。 ## 简化语音智能体架构并降低语音延迟 传统的语音智能体将语音识别、推理模型和语音合成拼接在一起。每一次交接都会增加延迟,并增加丢失时机、上下文或对话自然节奏的风险。开发者通常需要负责协调这些阶段,包括当有人打断、停顿或改变方向时的处理。 GPT-Live-1在一个模型中处理监听和语音,简化了语音层。它可以在中断和确认发生时实时响应,同时将更深入的推理委派给后端。这使得对话可以在后台进行处理的同时继续进行。 开发者可以选择对话背后的模型、工具和智能体框架。例如,他们可以将GPT-Live-1与Luna这样的模型配对,用于日程安排或订单更新等高容量任务,并使用Astra这样的模型来处理需要推理的复杂客户问题。这种灵活性让开发者能够根据每项任务匹配推理深度、速度和成本。 GPT-Live-1原生提供ASR转录和响应文本。它还具有强大的字母数字理解能力,并支持关键词偏差。虽然GPT-Live-1不是轮流式模型,但它原生支持轮次检测,因此开发者仍可围绕显式的轮次边界进行构建。 ## 评估全双工优势 在我们的评估中,与GPT-Realtime-2.1相比,GPT-Live-1将全双工基准性能提升了30个百分点,在轮次切换延迟和交互行为方面有显著提升。搭配中等推理能力的GPT-6 Astra,它在Tau3基准测试中排名第一,该测试衡量端到端任务上的前沿语音智能体智能水平。 评估在航空、零售和电信领域的语音客户服务任务。Pass@1衡量任务成功率;标题为每个领域分配了相等权重。 \* GPT Live后端:Astra(中等)。 评估带有知识检索和账户工具的语音银行支持。Pass@1是97个banking\_knowledge任务中成功完成的比例。 \* GPT Live后端:Astra(中等)。 评估停顿处理、对话轮换、中断和反馈信号。 测试对背景语音、对他人说话、听者反馈信号和中断的反应。 衡量智能体在用户结束一轮对话后开始回复的速度。 测试从包含自然停顿、犹豫和自我修正的语音请求中使用工具。Pass@1对工具调用序列进行评分。 \* GPT Live后端:Terra(低)。 评估对包含停顿、犹豫和自我修正的工具使用请求的语音回答。评分答案与参考意图的匹配程度。 \* GPT Live后端:Terra(低)。 ## 客户评价 ## 新的语音选项 开发者需要与其产品匹配、并让用户听起来自然的语音。通过GPT-Live-1,我们将语音选择从一小部分实时语音扩展到涵盖口音、方言和语言的更广泛选项,让开发者在助手声音的选择上有更多空间。 在未来的几个月里,我们将继续扩展语音选项和语言可用性。 ## 定价与可用性 GPT-Live-1现已在API中可用(在新窗口中打开)(https://developers.openai.com/api/docs/live),前端语音层定价为每分钟0.05美元。将其与适合您产品的后端模型和智能体框架配对,即可构建可随工作需求扩展的语音体验。 将GPT-Live-1连接到Codex。此摘录展示了应用程序如何将对话上下文传递给Codex,并将其答案返回给GPT-Live-1。连接设置和委派处理已省略。 如需定制语音访问权限,请联系销售团队(https://openai.com/contact-sales/)了解资格和申请流程。 基于GPT-Live-1构建语音工作流程的另一种方式是使用OpenAI Presence(https://openai.com/index/introducing-openai-presence/),它使用该模型来驱动实时语音交互。Presence帮助企业部署可信的AI智能体,这些智能体可以回答问题、解决问题、使用公司系统、执行批准的操作,并在需要时升级给人类。请联系您的OpenAI客户总监了解更多信息。

相似文章

OpenAI 发布新语音模型,实现更自然的实时对话

TechCrunch AI

OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。

GPT‑Live

Hacker News Top

OpenAI 宣布推出 GPT-Live,这是一种全新的全双工语音模型,通过允许同时收听和说话,实现更自然、实时的对话,后端模型为 GPT-5.5。

API 推出全新模型,推动语音智能发展

OpenAI Blog

OpenAI 在 API 中发布了三款全新语音模型:具备高级推理能力的 GPT-Realtime-2、支持实时多语言翻译的 GPT-Realtime-Translate,以及用于流式转录的 GPT-Realtime-Whisper,旨在实现更自然、更具行动力的语音应用。