OpenAI推出GPT-Live-1用于全双工语音代理(阅读时间2分钟)

TLDR AI 模型

摘要

OpenAI已推出GPT-Live-1,这是一款用于API的全双工语音模型,为开发者提供自然的双向语音对话能力,降低延迟并改善语音代理中的轮次交替。

GPT-Live-1现在可在OpenAI API中使用,价格为每分钟0.05美元。该模型新增全双工语音、中断处理和12种语音选项。它能同时听和说,实时处理中断和确认,并在执行深度推理或操作时保持对话流畅。模型可通过系统提示控制语气、空间和风格。早期测试显示,与以前基于轮次的系统相比,中断减少了80%。
查看原文
查看缓存全文

缓存时间: 2026/09/11 14:13

# OpenAI 发布 GPT-Live-1,打造全双工语音代理 来源:https://www.testingcatalog.com/openai-launches-gpt-live-1-for-full-duplex-voice-agents/ OpenAI 已在 API 中推出 GPT\-Live\-1(https://www.testingcatalog.com/openai-rolls-out-gpt-live-voice-for-chatgpt-on-web-and-mobile/),将最初在 ChatGPT 中引入的自然语音模型带给构建语音应用和商业工作流的开发者。该模型能够同时聆听和说话,在对话进行中处理打断和确认,并能在通过配对模型与工具(如 GPT\-6 Astra、Codex 和 ChatGPT Work)执行更深层推理或操作时保持对话流畅进行。 与传统语音代理将语音识别、推理模型和语音合成按顺序串联不同,GPT\-Live\-1 将传入和传出音频作为整体处理。OpenAI 表示,这避免了可能丢失时机、上下文和对话节奏的延迟与脆弱交接。开发者可以通过系统提示控制语调、语速和风格,选择自己的后端模型和代理框架,并利用 ASR 转录、响应文本、关键词偏置、字母数字识别和原生轮次检测功能。电话支持针对预订、订单更新和客户服务场景,而模型的设计能处理背景噪音和静默,不会打断用户或对每个步骤进行叙述。 > OPENAI 🔥:GPT\-Live\-1 现已在 API 和 OpenAI 平台上线! > "GPT‐Live‐1 将 ChatGPT 自然、全双工的对话能力带入 API,提供对语音代理说话和行动方式的更多控制。" 这使用户能够构建由双向语音驱动的应用和工作流...https://t.co/xsYqzdHtjk?ref=testingcatalog.compic\.twitter\.com/vZQC5zLyOs (https://t.co/vZQC5zLyOs?ref=testingcatalog.com) — 🚨 AI News \| TestingCatalog \(@testingcatalog\)2026年9月10日 (https://x.com/testingcatalog/status/2098125513432936669?ref_src=twsrc%5Etfw&ref=testingcatalog.com) 早期结果表明轮次转换发生了显著变化。Speak 报告称,与之前的基于轮次的系统相比,打断减少了近 80%,让语言学习者有更多时间思考。OpenAI 表示,GPT\-Live\-1 在全双工基准测试中比 GPT\-Realtime\-2\.1 提升了 30 个百分点,并在与 GPT\-6 Astra 以中等推理强度配对时,在 Tau3 上排名第一。早期用户包括 Yelp Host、Speak、Intercom 的 Fin 和 Cognition 的 Devin。一位客户表示,从级联系统迁移过来,其语音代码库减少了 80%,并移除了用于实时患者对话的 23,000 行代码。 此次发布为 OpenAI(https://www.testingcatalog.com/tag/openai/)提供了一个前端语音层,可置于单独选择和定价的推理栈之上。GPT\-Live\-1 在 API 中的成本为每分钟 $0\.05,后端模型和代理框架费用单独收取。发布时提供 12 种涵盖口音、方言和语言的声音,而自定义语音访问需要联系销售。OpenAI 计划增加更多声音和语言,并引导企业使用 Presence 来实现实时工作流,该工作流可以调用公司系统、执行经批准的操作并升级至人工处理。 来源 (https://openai.com/index/introducing-gpt-live-1-in-the-api/?ref=testingcatalog.com)

相似文章

GPT-Live-1 现已登陆 API

YouTube AI Channels

OpenAI 发布了 GPT-Live-1,这是一款全双工 AI 模型,可通过 API 进行实时语音对话,支持背景噪声处理,并集成后端推理模型。

OpenAI 发布新语音模型,实现更自然的实时对话

TechCrunch AI

OpenAI 发布了新的全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,旨在实现更自然的实时对话,支持同时说话和聆听,在轮流发言和上下文处理方面有所改进,并取代 ChatGPT 中的 Advanced Voice Mode。

GPT‑Live

Hacker News Top

OpenAI 宣布推出 GPT-Live,这是一种全新的全双工语音模型,通过允许同时收听和说话,实现更自然、实时的对话,后端模型为 GPT-5.5。