API 推出全新模型,推动语音智能发展

OpenAI Blog 模型

摘要

OpenAI 在 API 中发布了三款全新语音模型:具备高级推理能力的 GPT-Realtime-2、支持实时多语言翻译的 GPT-Realtime-Translate,以及用于流式转录的 GPT-Realtime-Whisper,旨在实现更自然、更具行动力的语音应用。

探索 OpenAI API 中的全新实时语音模型,它们能够进行推理、翻译和语音转录,从而打造更自然、更智能的语音体验。
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:13

# 通过 API 中的新模型推进语音智能 来源:https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/ 我们在 API 中推出了三款音频模型,为开发者解锁了全新的语音应用类别。借助这些模型,开发者可以构建更自然、更智能响应、并能实时执行操作的语音体验: - **GPT-Realtime-2**,我们的首款具备 GPT-5 级别推理能力的语音模型,能够处理更复杂的请求并自然地推进对话。 - **GPT-Realtime-Translate**,全新的实时翻译模型,可将 70 多种输入语言的语音翻译成 13 种输出语言,并能跟上说话者的节奏。 - **GPT-Realtime-Whisper**,全新的流式语音转文本模型,可在说话者讲话的同时实时转录语音。 ## 体验 GPT-Realtime-2 启动会话,然后自然地与 GPT-Realtime-2 对话。 我可以问什么?启动会话后,试试说以下这些: - 我今晚要临时招待客人,只有 30 分钟,两位素食朋友,一位不吃蘑菇,厨房还很小。帮我规划一个简单的菜单。 - 我在日本主持一场现场活动,需要欢迎来宾。用日语说一段温暖自然的开场白——就像主持人开启特别活动那样。 - 我的订单号是 Orbit-742Q。请清晰地重复一遍,让我确认是否正确。 - 帮我练习向团队宣布我们达成了发布里程碑。先用沉稳自信的语气说一遍,再用更兴奋的语气说一遍。 - 我在为公路旅行准备 trivia 游戏。给我三个听起来简单实则很绕的 trick 问题,然后用一句话解释每个答案。 此演示有时间限制。使用即表示您同意 OpenAI 的[条款](https://openai.com/policies/terms-of-use/)并确认我们的[隐私政策](https://openai.com/policies/privacy-policy/)。 语音正成为人们使用软件最自然的方式之一。它让人们在驾驶时求助、在机场步行时更改旅行计划、用自己喜欢的语言获得支持,或在不停下来打字的情况下完成任务。 但构建实用的语音产品需要的不仅仅是快速轮次转换或自然的语音。语音代理需要理解用户的意图、跟踪上下文、在请求变化时恢复、在对话继续的同时使用工具,并以适合当下情境的方式回应。 我们此次发布的模型共同推动实时音频从简单的呼叫-响应模式,迈向真正干活的语音界面:倾听、推理、翻译、转录,并在对话展开时采取行动。 ## 语音作为人与产品之间的界面 随着语音成为使用软件更自然的方式,我们看到开发者围绕语音 AI 中的三种新兴模式进行构建: - **语音到行动**,人们可以描述需求,系统推理请求、使用工具并完成任务。例如,Zillow 正在构建一个能够倾听、推理并执行请求的助手:"帮我找 BuyAbility 范围内的房子,避开繁忙街道,并预约周六看房。" - **系统到语音**,软件可以将上下文转化为实时语音指导。例如,旅行应用可以主动告诉旅客:"您的 inbound 航班延误了,但您仍能赶上转机。我找到了新的登机口,规划了航站楼内最快的路线,您的行李预计仍能转运。" - **语音到语音**,AI 帮助实时对话跨越语言、任务或变化的上下文继续进行。例如,Deutsche Telekom 正在构建语音支持体验,客户可以用最舒适的语言说话,而模型实时翻译对话。 这些模式也可以协同工作。Priceline 正在努力实现这样的未来:旅行者可以通过语音管理整个行程——对话式搜索航班和酒店、处理诸如航班延误后调整酒店预订等变化、获取 TSA 等待时间的实时更新,以及在抵达目的地后翻译对话。 ## 实时语音:帮助语音模型推理并采取行动 GPT-Realtime-2 专为实时语音交互而构建,模型在推理请求、调用工具、处理纠正或打断的同时保持对话进行,并以适合当下情境的方式回应。 - **开场白**:开发者可以在主要回应前启用简短短语,如"让我查一下"或"稍等,我来看看",让用户知道代理正在处理请求。 - **并行工具调用与工具透明性**:模型可以同时调用多个工具,并通过"正在查看您的日历"或"现在帮您查询"等短语让这些操作可感知,帮助代理在完成任务时保持响应。 - **更强的恢复行为**:模型可以更优雅地恢复,比如说"我现在有点困难",而不是静默失败或打断对话。 - **更长的代理工作流上下文**:我们将上下文窗口从 32K 增加到 128K,以支持更长、更连贯的会话和更复杂的任务流。 - **更强的领域理解**:模型更好地保留专业术语、专有名词、医疗术语以及其他在生产环境中重要的词汇。 - **更可控制的语气和表达方式**:模型能更好地调整语气——解决问题时平静说话、用户沮丧时共情回应、确认成功时积极向上。 - **可调整的推理强度**:开发者现在可以从**minimal、low、medium、high 和 xhigh**中选择推理级别,默认**low**,在简单交互的较低延迟与复杂请求的审慎推理之间取得平衡。 这些提升体现在与生产语音代理密切相关的音频评估中:GPT-Realtime-2 (high) 在 Big Bench Audio 音频智能评估上比 GPT-Realtime-1.5 高出 15.2%。GPT-Realtime-2 (xhigh) 在 Audio MultiChallenge 指令遵循评估上高出 13.8%,超越了 GPT-Realtime-1.5,在实时对话中展现出更强的推理、上下文管理和控制能力。 [Big Bench Audio](https://artificialanalysis.ai/methodology/speech-to-speech-benchmarking) 评估支持音频输入的语言模型中的挑战性推理能力。[Audio MultiChallenge](https://labs.scale.com/leaderboard/audiomc-audio) 评估口语对话系统中的多轮对话智能,包括指令遵循、上下文整合、自我一致性以及处理自然语音纠正。 GPT-Realtime-2 的魔力体现在各种用例中: 正在加载实时示例... 在早期测试中,企业使用 GPT-Realtime-2 构建语音代理,帮助客户和员工通过自然对话完成工作: > "GPT-Realtime-2 最突出的是它为复杂语音交互带来的智能和工具调用可靠性。在我们最困难的对抗性基准测试中,这意味着经过提示优化后通话成功率提升了 26 个百分点(95% vs. 69%)。GPT-Realtime-2 在公平住房合规方面也明显更稳健,这对我们的业务至关重要。代理能力与护栏强度的结合,使其适用于 Zillow 的生产语音场景。" —— Josh Weisberg,Zillow 高级副总裁兼 AI 负责人 ## 实时翻译:构建实时多语言语音体验 GPT-Realtime-Translate 帮助开发者构建实时多语言语音体验,每个人都可以用自己的首选语言说话,并实时听到翻译后的对话,同时看到实时转录。它支持 70 多种输入语言和 13 种输出语言,适用于客户支持、跨境销售、教育、活动、媒体和面向全球受众的创作者平台。 对开发者而言,实时翻译需要在跟上说话者节奏的同时保留含义,即使人们自然说话、切换上下文或使用地区发音和领域特定语言。例如,Deutsche Telekom 正在测试该模型用于多语言语音交互,其中更低的延迟和更强的流畅度可以让跨语言对话感觉更自然。 在此视频中,Vimeo 展示了 GPT-Realtime-Translate 如何在产品教育视频播放时实时翻译,让全球客户无需等待单独制作的版本即可听到他们首选语言的更新。 > "为印度构建语音 AI 意味着处理多样化的地区语音。在我们对印地语、泰米尔语和泰卢固语的评估中,GPT-Realtime-Translate 的字错误率比我们测试的任何其他模型低 12.5%,同时回退率更低、任务完成率更高、延迟足以维持自然对话。它为多语言语音 AI 树立了新标准。" —— Prateek Sachan,BolnaAI 联合创始人兼 CTO ## 实时转录:构建低延迟转录体验 GPT-Realtime-Whisper 是一款专为低延迟语音转文本而构建的全新流式转录模型。它在人们说话的同时转录音频,让实时产品感觉更快、更响应、更自然——从即时出现的字幕,到跟得上对话的会议笔记。 该模型让实时语音在业务工作流中即时可用。团队可以为会议、课堂、广播和活动提供字幕;在对话仍在进行时生成笔记和摘要;构建需要持续理解用户的语音代理;并为客户支持、医疗、销售、招聘和其他高容量口语交互创建更快的后续工作流。 ## 安全 Realtime API 整合了多层防护措施和缓解手段以防止滥用。我们对 Realtime API 会话部署了主动分类器,这意味着如果检测到某些对话违反我们的有害内容准则,可以将其终止。开发者还可以使用 [Agents SDK](https://openai.github.io/openai-agents-js/guides/guardrails/) 轻松添加自己的额外安全护栏。 我们的[使用政策](https://openai.com/policies/usage-policies/)禁止将我们的服务输出用于垃圾邮件、欺骗或其他有害目的。开发者还必须向终端用户明确说明他们正在与 AI 交互,除非从上下文中已经显而易见。 ## 定价与可用性 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper 均可在 Realtime API 中使用。GPT-Realtime-2 定价为 $32 / 1M 音频输入 token(缓存输入 token $0.40)和 $64 / 1M 音频输出 token。GPT-Realtime-Translate 定价为 $0.034 / 分钟。GPT-Realtime-Whisper 定价为 $0.017 / 分钟。 ## 开始使用 要开始构建,[在 Codex 中打开此提示](codex://new?prompt=Build+or+add+a+minimal+Realtime+2+WebRTC+voice+agent+using+the+gpt-realtime-2+model.%0A%0AUse+the+latest+OpenAI+Realtime+API+docs+for+the+WebRTC+and+session+setup+patterns.+If+this+folder+already+contains+an+app%2C+add+it+to+the+existing+app.+Otherwise%2C+create+a+small+local+web+app.+Add+a+server-side+session+endpoint+that+uses+OPENAI_API_KEY+and+posts+browser+SDP+to+%2Fv1%2Frealtime%2Fcalls+following+the+docs+exactly%3A+multipart+FormData+fields+named+sdp+and+session%2C+not+file+uploads.+Connect+browser+microphone+input+and+model+audio+output+with+RTCPeerConnection%2C+open+an+oai-events+data+channel%2C+and+register+one+sample+function+tool+with+session.update%3A+check_calendar%28date%2C+time%29%2C+which+returns+whether+the+requested+time+is+available.%0A%0AKeep+it+small+and+include+setup%2Frun+instructions.),将 GPT-Realtime-2 添加到现有应用或开始新项目。如果您还没有 Codex,请先下载 [Codex 应用](https://openai.com/codex/)。

相似文章

OpenAI的新语音模型不止于回话

Reddit r/ArtificialInteligence

OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。

在API中引入下一代音频模型

OpenAI Blog

OpenAI 为 API 引入了下一代音频模型,包括改进的语音转文本(gpt-4o-transcribe、gpt-4o-mini-transcribe)和可自定义的文本转语音模型,使开发者能够构建更智能、更具表现力的语音代理,在具有挑战性的场景中提升准确性。

We’re introducing three audio models in the API

YouTube AI Channels

OpenAI 在 API 中推出了三个实时音频模型,包括支持70种语言的实时翻译模型 GPT Realtime Translate 和具备推理能力的语音智能体 GPT Realtime 2,使开发者能够构建更自然的语音交互界面。

推出 gpt-realtime 和实时 API 更新

OpenAI Blog

# 推出 gpt-realtime 和实时 API 更新,用于生产级语音智能体 来源:[https://openai.com/index/introducing-gpt-realtime/](https://openai.com/index/introducing-gpt-realtime/) 今天我们推出了正式版实时 API,包含新功能,使开发者和企业能够构建可靠的、生产级就绪的语音智能体。该 API 现已支持远程 MCP 服务器、图像输入和通过会话初始协议 (SIP) 进行电话呼叫,使语音智能体更

OpenAI 发布新语音模型,实现更自然的实时对话

TechCrunch AI

OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。