text-to-speech

标签

Cards List
#text-to-speech

@MaximeRivest:这款设备非常令人印象深刻。它具备麦克风、扬声器支持、文字转语音、OCR、ChatGPT 5.2 聊天,而且……

X AI KOLs Following · 昨天 缓存

一位用户分享了对一款轻薄、基于 Android 的设备的实机感受,该设备具备麦克风、扬声器、OCR、文字转语音和 ChatGPT 5.2 聊天功能,并指出其唯一明显的缺点是缺少彩色。

0 人收藏 0 人点赞
#text-to-speech

🟩 NVIDIA 的完整语音技术栈现已本地化。ASR + TTS + 编解码器,量化为 GGUF,通过 NeMo-Speech.cpp 在设备端运行

Reddit r/LocalLLaMA · 2天前

NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。

0 人收藏 0 人点赞
#text-to-speech

Scenema Audio 登陆 ComfyUI,可在 8GB 显存上运行

Reddit r/LocalLLaMA · 3天前

Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。

0 人收藏 0 人点赞
#text-to-speech

构建一款完全本地的PDF朗读与PDF转有声书桌面应用(基于Kokoro 82M、Qwen和llama.cpp)

Reddit r/LocalLLaMA · 3天前

Speechfony是一款全新的完全本地桌面应用,可朗读PDF和EPUB,支持句子高亮、语义搜索和MP3有声书导出,使用Kokoro TTS和设备端嵌入模型。它优先考虑隐私和离线使用,采用开源MIT许可证。

0 人收藏 0 人点赞
#text-to-speech

Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持

Reddit r/LocalLLaMA · 3天前

Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。

0 人收藏 0 人点赞
#text-to-speech

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

arXiv cs.CL · 4天前 缓存

Presents DLLM-TTS, a block discrete diffusion language model for text-to-speech synthesis that processes X-Codec2 tokens in blocks, enabling parallel generation with RTF 0.15 while achieving competitive quality with only 20K hours of training data.

0 人收藏 0 人点赞
#text-to-speech

@DanKornas: myshell-ai/OpenVoice 即时语音克隆,支持风格和语言控制 GitHub: 存档:

X AI KOLs Timeline · 6天前 缓存

OpenVoice 是一个开源的即时语音克隆模型,具备风格和语言控制能力,现已在 GitHub 上可用。

0 人收藏 0 人点赞
#text-to-speech

@CycleDecoded: 上海人工智能实验室(OpenMMLab)这次直接把“声音制造”给彻底打穿了。 他们开源的 Amphion,简直就是音视频创作界的“全能兵工厂”。从语音合成到 AI 歌声变换,这玩意儿能把绝大多数收费语音软件吊起来打。 基本信息 项目名称:…

X AI KOLs Timeline · 2026-08-01 缓存

OpenMMLab开源了Amphion,一个支持TTS、歌声转换、音效生成等多功能的音频生成工具箱,完全免费可商用,支持本地部署。

0 人收藏 0 人点赞
#text-to-speech

@PrajwalTomar_: 你严重低估了刚刚发布的东西。盲测语音排行榜上的第一名不是ElevenLabs……

X AI KOLs Following · 2026-08-01 缓存

SpeechifyAI的Simba 3.2在盲测语音排行榜上占据第一,超越了ElevenLabs、OpenAI和Google DeepMind,同时成本大幅降低,并提供了新的API和免费套餐。

0 人收藏 0 人点赞
#text-to-speech

@RemiCadene: Gradium 比 ElevenLabs 和 Cartesia 更好?

X AI KOLs Following · 2026-07-30 缓存

Gradium 发布了新的 TTS 模型公测版,能原生准确读取电话号码、邮件地址、IBAN 以及时间表达式,并提供 API 接口和 100 万积分用于测试。

0 人收藏 0 人点赞
#text-to-speech

Fish Audio 推出支持83种语言的S2.1 Pro(2分钟阅读)

TLDR AI · 2026-07-29 缓存

Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。

0 人收藏 0 人点赞
#text-to-speech

Audio8/Audio8-TTS-Preview-0.6b

Hugging Face Models Trending · 2026-07-28 缓存

Audio8 发布了一款拥有 6 亿参数的多语言文本转语音模型,支持零样本声音克隆功能,在 Hugging Face 上以 Apache 2.0 许可证提供。

0 人收藏 0 人点赞
#text-to-speech

Liso

Product Hunt · 2026-07-23

Liso 让你在任何网页上高亮文本,并将其转换为音频收听。

0 人收藏 0 人点赞
#text-to-speech

我们构建了NeuTTS-2E,一个支持7种可控情感的开源设备端TTS模型

Reddit r/LocalLLaMA · 2026-07-22

NeuTTS-2E是一个支持7种可控情感的开源设备端TTS模型。

0 人收藏 0 人点赞
#text-to-speech

@DanKornas: 编写双人音频演示不应只是拼接独立的语音片段。Dia 是一个1.6B参数的文本到…

X AI KOLs Timeline · 2026-07-21 缓存

Dia 是一个1.6B参数的开源文本转语音模型,能够根据转录文本生成英语对话,支持双说话人生成、音频条件控制以及非语言提示。

0 人收藏 0 人点赞
#text-to-speech

面向语音代理构建者的TTS精选列表 — 聚焦于流式延迟和流中取消

Reddit r/ArtificialInteligence · 2026-07-21 缓存

一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。

0 人收藏 0 人点赞
#text-to-speech

按许可证分类的开源 TTS 参考指南 — (因为一半的顶级开放权重模型无法用于商业用途)

Reddit r/AI_Agents · 2026-07-21

一份按许可证类型组织的开源文本转语音模型参考指南,重点指出哪些模型可用于商业用途。

0 人收藏 0 人点赞
#text-to-speech

@阿里的通义实验室:Qwen-Audio-3.0-TTS来了。我们最新的文本转语音模型,提供两个版本:• Flash:实时交互 • Plus:高…

X AI KOLs Timeline · 2026-07-20 缓存

阿里巴巴通义实验室发布了Qwen-Audio-3.0-TTS,一款新的文本转语音模型,提供Flash(实时)和Plus(高质量)两个版本,支持16种语言、自然语言风格控制以及更稳健的语音克隆。

0 人收藏 0 人点赞
#text-to-speech

我构建了一个完全本地且快速的MacOS工具,用于文本转语音和听写,运行顶尖AI模型

Reddit r/artificial · 2026-07-20

一位开发者使用先进的AI模型创建了一个用于本地文本转语音和听写的MacOS工具,强调速度和隐私。

0 人收藏 0 人点赞
#text-to-speech

推出 Scylla's Band,一款带有 Android 示例的新 TTS 模型和推理框架!

Reddit r/LocalLLaMA · 2026-07-20

Scylla's Band 是一款新的 TTS 模型和推理框架,包含用于部署的 Android 示例。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈