@FinanceYF5: 语音AI正开始进入手机。开源Audio8,将语音识别和语音合成打包…

X AI KOLs Timeline 模型

摘要

这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。

语音AI正开始进入手机。开源Audio8,将语音识别和语音合成打包成一套可在手机和PC本地运行的模型。它还包括一个适用于iPhone的离线转录版本。超越云端,设备端能力正变得越来越可用。@LeonaYangAGI 干得好
查看原文
查看缓存全文

缓存时间: 2026/09/16 20:11

语音AI正逐渐进入手机领域。开源项目Audio8将语音识别与语音合成整合为一套模型,可在手机和PC本地运行,同时提供适用于iPhone的离线转写版本。超越云端,设备端能力正变得日益实用。@LeonaYangAGI 做得漂亮!

Leona Yang (@LeonaYangAGI): 过去两个月我们开源了一套设备端音频模型。它叫做Audio8。这个系列可以在手机、PC及其他计算和内存有限的硬件上运行。你可以立即用它们进行本地推理。

包含内容: ASR:0.1B、0.3B、0.6B、3B TTS:

相似文章

Labs AI

Product Hunt

Labs AI 是一款能将文字转化为自然AI语音的iPhone应用。

在API中引入下一代音频模型

OpenAI Blog

OpenAI 为 API 引入了下一代音频模型,包括改进的语音转文本(gpt-4o-transcribe、gpt-4o-mini-transcribe)和可自定义的文本转语音模型,使开发者能够构建更智能、更具表现力的语音代理,在具有挑战性的场景中提升准确性。

OpenAI的新语音模型不止于回话

Reddit r/ArtificialInteligence

OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。