标签
一位用户分享了对一款轻薄、基于 Android 的设备的实机感受,该设备具备麦克风、扬声器、OCR、文字转语音和 ChatGPT 5.2 聊天功能,并指出其唯一明显的缺点是缺少彩色。
NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。
Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。
Speechfony是一款全新的完全本地桌面应用,可朗读PDF和EPUB,支持句子高亮、语义搜索和MP3有声书导出,使用Kokoro TTS和设备端嵌入模型。它优先考虑隐私和离线使用,采用开源MIT许可证。
Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。
Presents DLLM-TTS, a block discrete diffusion language model for text-to-speech synthesis that processes X-Codec2 tokens in blocks, enabling parallel generation with RTF 0.15 while achieving competitive quality with only 20K hours of training data.
OpenVoice 是一个开源的即时语音克隆模型,具备风格和语言控制能力,现已在 GitHub 上可用。
OpenMMLab开源了Amphion,一个支持TTS、歌声转换、音效生成等多功能的音频生成工具箱,完全免费可商用,支持本地部署。
SpeechifyAI的Simba 3.2在盲测语音排行榜上占据第一,超越了ElevenLabs、OpenAI和Google DeepMind,同时成本大幅降低,并提供了新的API和免费套餐。
Gradium 发布了新的 TTS 模型公测版,能原生准确读取电话号码、邮件地址、IBAN 以及时间表达式,并提供 API 接口和 100 万积分用于测试。
Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。
Audio8 发布了一款拥有 6 亿参数的多语言文本转语音模型,支持零样本声音克隆功能,在 Hugging Face 上以 Apache 2.0 许可证提供。
Dia 是一个1.6B参数的开源文本转语音模型,能够根据转录文本生成英语对话,支持双说话人生成、音频条件控制以及非语言提示。
一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。
一份按许可证类型组织的开源文本转语音模型参考指南,重点指出哪些模型可用于商业用途。
阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。
一位开发者使用先进的AI模型创建了一个用于本地文本转语音和听写的MacOS工具,强调速度和隐私。
Scylla's Band 是一款新的 TTS 模型和推理框架,包含用于部署的 Android 示例。