Build Hour: GPT-Realtime-2

YouTube AI Channels 模型

摘要

OpenAI在Build Hour中发布了GPT Realtime-2及两个配套模型,增强了语音交互的智能性和自然度,支持128k上下文、并行工具调用和动态语音克隆,展示了语音驱动的购物助手和分析仪表盘等生产级应用。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:39

TL;DR: OpenAI在Build Hour中发布了GPT Realtime-2及两个配套模型,展示了更智能、更自然的语音交互,支持128k上下文、并行工具调用和动态语音克隆,并通过购物助手和分析仪表盘两个Demo演示了“语音到行动”的生产级工作流。 ## 发布概览:三个新模型 上周四OpenAI发布了音频更新,包含三个模型,分别针对不同的语音工作流: - **实时翻译模型**:支持70+输入语言和13种输出语言,提供低延迟的流式翻译。在Demo中,Sarah与Terry用英语对话,右侧实时输出西班牙语译文,该模型让语音对话跨越语言障碍,适用于视频通话、直播和客户服务。 - **GPT Realtime Whisper模型**:流式语音识别,延迟可低至200毫秒,支持80种输入语言。它能更早触发函数调用、更好地遵循指令,适合字幕、会议记录和环境代理场景。 - **GPT Realtime 2**:最智能的语音模型,将GPT-5级别的推理能力带入语音。在提示遵循、工具调用和多语言性能上大幅提升。 这三种模型对应三种构建方式: - **语音到行动**:免提的语音驱动应用 - **系统到语音**:口语化组织的语音“幕僚长” - **语音到语音**:客户服务电话等(如T-Mobile在全球使用的案例) ## 关键功能提升 - **动态语音克隆与情感匹配**:可区分多个说话者,并根据上下文匹配语调。还支持“开场白”功能,让模型在推理前说“让我查一下”,更像真人对话。 - **上下文窗口增加至128k**:最多可容纳约一小时的对话,避免截断导致信息丢失,显著提升指令遵循和智能水平。 - **并行工具调用**:不再需要依次调用工具,模型可以同时发起多个工具操作。 - **可控的表达力**:开发者可以引导模型耳语、兴奋、嫉妒等情绪表现。 - **更好的领域词汇理解**:对医疗、AI等专业术语的识别更准确。 - **上下文覆盖**:支持更复杂的智能体行为。 ## Demo 1:语音驱动的搜索代理 Erica演示了一个名为“Supply Co”的户外用品电商网站的购物助手。她通过语音与模型交互: 1. **唤醒助手**:要求回忆上次购物进度(工具:读取购物计划)。 2. **查找帐篷**:指定预算和人数(工具:搜索商品并筛选价格)。 3. **查询差评**:要求查看一星/二星评价(工具:读取评论并总结)。 4. **检查天气**:要求查询旅行地未来两周天气预报(工具:调用外部天气API)。 5. **综合建议**:模型根据天气评估帐篷的适用性,并推荐附加组件(地布、地钉)。 6. **添加购物车**:将帐篷和靴子加入购物车,并显示总价。 关键点: - 模型在15∼20个工具中选择,并行调用多个工具(如搜索、读评论、调用天气API)。 - 语音体验自然,且与UI视觉更新同步。 - Erica强调这不是“一次语音输入、一次动作输出”,而是真正的多步推理购物助手。 ## Demo 2:产品分析仪表盘 Erica切换到产品经理视角,使用AI助手分析欧洲市场的转化问题。 1. **筛选数据**:按欧洲区域、过去7天 vs 前7天对比。 2. **发现异常**:模型高亮显示Safari浏览器下的数据下降。 3. **深度调查**:进一步按“首次购物者”、“鞋类”、“语音搜索”筛选,发现激活流失严重。 4. **根因分析**:对比移动端Safari与Chrome,模型启动根因调查,生成仪表盘和工件。 5. **口头总结**:模型用两句话描述:“这是一个移动端Safari特有的回归问题,产品详情页的尺码选择器验证没有正确更新,导致欧洲首次购物的鞋类用户被卡住。” 关键点: - 模型只在用户要求时才说话,其他时候只执行操作(如筛选、高亮),体现了优异的指令遵循。 - 用户可随时查看推理过程和对话记录,也支持文本交互。 - 模型实际上写代码、创建图表、生成工件,充当“在环分析师”,实现实时对话式分析工作流。 ## 语音应用案例 Terry提到语音界面的广泛前景,并用GPT Imagination生成了一些示例图片: - 智能设备集成(如智能家居) - 编码助手(语音驱动的编程体验) - 移动App(为任何应用添加语音界面) - 语音控制的游戏(如上下跳动的体感游戏) - 教练:公共演讲教练、笔记记录助手 - 金融语音代理、语音视频通话 这些案例表明,未来孩子与AI对话的次数可能超过他们打字交流的次数。OpenAI已准备好支持这股浪潮。 ## 总结与期待 本次发布标志着语音AI进入新阶段:从简单的语音识别与应答,到能推理、调用工具、控制UI的智能代理。开发者现在拥有三个不同定位的模型,可以根据应用场景选择最合适的。后续Sierra团队还将分享构建语音代理的专家技巧,以及问答环节。 --- Source: [Build Hour: GPT-Realtime-2 - OpenAI YouTube](https://www.youtube.com/watch?v=qGS9Ghnq1RU)

相似文章

@seclink: OpenAI 发布了 GPT-Realtime-2,这是其迄今为止最智能的语音模型。 该模型具备 GPT-5 级别的推理能力、128,000 个 token 的上下文窗口,并支持调节“投入程度”以实现更自然的对话体验。 它可与 GPT-R…

X AI KOLs Following

OpenAI发布了GPT-Realtime-2语音模型,具备GPT-5级别的推理能力和128,000 token上下文窗口,支持实时翻译70多种语言到13种输出语言,在Big Bench Audio Intelligence评测中达到96.6%准确率,Greg Brockman称其为语音翻译领域的里程碑。

We’re introducing three audio models in the API

YouTube AI Channels

OpenAI 在 API 中推出了三个实时音频模型,包括支持70种语言的实时翻译模型 GPT Realtime Translate 和具备推理能力的语音智能体 GPT Realtime 2,使开发者能够构建更自然的语音交互界面。

Temporal awareness with GPT-Live

YouTube AI Channels

OpenAI发布了GPT-Live模型,具备持续在场和时间感知能力,支持打断式语音交互和实时计时功能,提升了语音助手的自然度和实用性。

Natural Conversations with GPT-Live

YouTube AI Channels

OpenAI 展示新版语音模型在个性化和自然度上的突破,能够进行自然的头脑风暴式对话,表现出共情和适时插话能力,接近人类对话节奏。