Token Goblin :[]: 使用 GPT-Realtime-2.1 API 进行实时语音 + 实时数据的现场测试 // 成本管理?

Reddit r/AI_Agents 工具

摘要

作者分享了使用 GPT-Realtime-2.1 API 进行实时语音和数据应用的现场测试经验,突出了成本挑战,并寻求在生产中管理开支的建议。

我一直在日常现场测试 Realtime-2.1/Live Transcribe 加上实时遥测数据(GPS/IMU),启用工具/推理后效果令人印象深刻,但成本就像一群十级鬼鬼祟祟的哥布林。一个非常活跃的用户每天可能消耗约5美元的代币。我的现场测试每天约8-10美元。寻求关于如何在生产中管理成本的建议或实时使用见解。 -------- 使用示例:(免提副驾驶应用)实时数据请求 功能/功能启动 请求遥测数据的摘要/比较 紧急数据的实时回放 记录语音笔记/费用 带有操作的时间请求 详情:模型:gpt-realtime-2.1 (WebRTC) 推理:低 语义VAD:中 自动响应:开启 自动中断:关闭(基于点击的UX) 噪声抑制:远场 实时转录:低延迟 工具选择:自动(19+工具) 自动提示缓存 工具的重度合约压缩 有限的指令/角色 响应的定制路由以限制代币(320-1024代币限制范围)
查看原文

相似文章

Build Hour: GPT-Realtime-2

YouTube AI Channels

OpenAI在Build Hour中发布了GPT Realtime-2及两个配套模型,增强了语音交互的智能性和自然度,支持128k上下文、并行工具调用和动态语音克隆,展示了语音驱动的购物助手和分析仪表盘等生产级应用。

实时 API 介绍

OpenAI Blog

OpenAI 推出实时 API,使开发者能够构建低延迟多模态语音对话体验,由 GPT-4o 驱动的自然语音交互。该 API 支持六种预设声音,简化开发流程,无需集成多个模型。