@FinanceYF5: 语音AI正开始进入手机。开源Audio8,将语音识别和语音合成打包…
摘要
这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。
语音AI正开始进入手机。开源Audio8,将语音识别和语音合成打包成一套可在手机和PC本地运行的模型。它还包括一个适用于iPhone的离线转录版本。超越云端,设备端能力正变得越来越可用。@LeonaYangAGI 干得好
查看缓存全文
缓存时间: 2026/09/16 20:11
语音AI正逐渐进入手机领域。开源项目Audio8将语音识别与语音合成整合为一套模型,可在手机和PC本地运行,同时提供适用于iPhone的离线转写版本。超越云端,设备端能力正变得日益实用。@LeonaYangAGI 做得漂亮!
Leona Yang (@LeonaYangAGI): 过去两个月我们开源了一套设备端音频模型。它叫做Audio8。这个系列可以在手机、PC及其他计算和内存有限的硬件上运行。你可以立即用它们进行本地推理。
包含内容: ASR:0.1B、0.3B、0.6B、3B TTS:
相似文章
@FinanceYF5: 1/ 语音代理终于能像真人一样同时聆听和讲话了。GPT-Live-1 的 API 最近已经……
GPT-Live-1 的 API 允许开发者集成能够同时聆听和讲话的语音代理,为应用程序提供自然流畅的对话体验。
Labs AI
Labs AI 是一款能将文字转化为自然AI语音的iPhone应用。
@thekuchh: 手机上的语音模式是真正的解锁,让Mac开着,去喝咖啡,整个步行过程中都在工作,本质上:ta…
文章强调了手机语音模式对于无缝AI助手访问的好处,并宣布Vellum在iOS和Android上免费开源可用,具有对话式语音模式等功能。
在API中引入下一代音频模型
OpenAI 为 API 引入了下一代音频模型,包括改进的语音转文本(gpt-4o-transcribe、gpt-4o-mini-transcribe)和可自定义的文本转语音模型,使开发者能够构建更智能、更具表现力的语音代理,在具有挑战性的场景中提升准确性。
OpenAI的新语音模型不止于回话
OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。