微软测试新的 MAI Realtime 语音模型(2分钟阅读)

TLDR AI 模型

摘要

微软正在其 MAI Playground 上以早期访问形式测试一款新的原生实时语音模型 MAI Realtime。该全双工系统支持多种语言、低延迟和可配置的轮流对话,定位为 OpenAI GPT Live 和 Sesame 的竞争对手。

微软首款原生实时语音模型 MAI Realtime 已作为公司 MAI Playground 中一个隐藏的早期访问条目出现。该条目指向一个双向、全双工系统,可以同时聆听和说话,而不是轮流讲话。目前可用的两种语音都比 Copilot 语音模式当前提供的语音明显更自然。该模型可能会在 Microsoft Foundry 和 Copilot 语音中提供,但尚无时间表。
查看原文
查看缓存全文

缓存时间: 2026/08/03 13:28

# 独家:微软测试全新 MAI Realtime 语音模型 来源:https://www.testingcatalog.com/exclusive-microsoft-tests-new-mai-realtime-voice-model/ 微软似乎正在准备推出其首个原生实时语音模型,名为 MAI Realtime。该模型已作为隐藏的早期体验入口出现在公司的 MAI Playground 中。这一列表显示,已有少量合作伙伴获得了实际使用权限。从可见信息来看,这似乎是一个双向、全双工系统——能够同时收听和说话,而非轮流交互,使其直接对标 OpenAI 的 GPT Live 1(https://www.testingcatalog.com/openai-rolls-out-gpt-live-voice-for-chatgpt-on-web-and-mobile/)或 Sesame(https://www.testingcatalog.com/sesame-debutes-ios-app-in-preview-with-personal-voice-agents/)。 > 它支持英语、德语、西班牙语、法语、意大利语、葡萄牙语、日语、韩语、中文、荷兰语、印地语、印尼语、阿拉伯语、俄语、土耳其语、越南语和泰语。pic.twitter.com/7BmcW2MBa0 (https://t.co/7BmcW2MBa0?ref=testingcatalog.com) — 🚨 AI News | TestingCatalog (@testingcatalog) 2026年8月2日 (https://x.com/testingcatalog/status/2083928447450067196?ref_src=twsrc%5Etfw&ref=testingcatalog.com) 目前提供两种语音:Victoria 和 Grant,两者都比 Copilot 当前语音模式明显更自然。语言可以手动固定,也可以保持自动检测,模型能够在对话中途切换语言且不会失去连贯性。对话轮次可通过两种侦听选项进行配置:一种**Switchboard 模式**,基于由内联控制 token 驱动的 MAI-Ears 端点检测器;另一种**确定性配置**,将基于静音的端点检测与 Whisper 语义端点检测器结合使用。 两者在实际使用中的差异较为微妙,但中断处理干净利落,响应延迟也较低。该模型不会唱歌或产生非语音声音,这使其严格意义上属于对话系统,而非通用音频生成器。调试面板展示了实时延迟数据、模型思考与处理步骤,而一旦访问范围扩大,Playground 用户预计还将获得样本共享功能。 这将填补一个明显的空白。目前微软已发布的所有 MAI 语音模型(https://www.testingcatalog.com/microsoft-previews-mai-image-2-5-pro-and-mai-voice-2-flash/)都是单向运行的:MAI-Voice-2 及其 Flash 版本用于合成,MAI-Transcribe-1.5 用于识别,而 Azure Speech 中 Voice Live API 的语音到语音层仍依赖 GPT-Realtime 模型。一个自研的全双工模型将终结 Mustafa Suleyman 超级智能团队在这方面的依赖。该团队在 Build 2026 上发布了七款自研模型,并一直在稳步将 OpenAI 组件从 Copilot、Teams 和 Bing 中替换出来。Microsoft(https://www.testingcatalog.com/tag/microsoft/)Foundry 很可能是开发者端的目标平台,而 Copilot 语音则是显而易见的消费端入口,不过两者目前均未公布时间表。

相似文章

Microsoft MAI-Voice-2

Product Hunt

微软发布了 MAI-Voice-2,这是一款支持 15 种语言语音克隆的表现力丰富的文本转语音系统。

OpenAI的新语音模型不止于回话

Reddit r/ArtificialInteligence

OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。

API 推出全新模型,推动语音智能发展

OpenAI Blog

OpenAI 在 API 中发布了三款全新语音模型:具备高级推理能力的 GPT-Realtime-2、支持实时多语言翻译的 GPT-Realtime-Translate,以及用于流式转录的 GPT-Realtime-Whisper,旨在实现更自然、更具行动力的语音应用。

推出 gpt-realtime 和实时 API 更新

OpenAI Blog

# 推出 gpt-realtime 和实时 API 更新,用于生产级语音智能体 来源:[https://openai.com/index/introducing-gpt-realtime/](https://openai.com/index/introducing-gpt-realtime/) 今天我们推出了正式版实时 API,包含新功能,使开发者和企业能够构建可靠的、生产级就绪的语音智能体。该 API 现已支持远程 MCP 服务器、图像输入和通过会话初始协议 (SIP) 进行电话呼叫,使语音智能体更