speech-synthesis

标签

Cards List
#speech-synthesis

Qwen-family LLMs 正悄然成为现代音频模型的支柱;一张图表展示100多个音频模型的架构

Reddit r/LocalLLaMA ↗ · 昨天

文章分析了超过100个音频模型,发现Qwen-family LLMs,特别是Qwen3,被广泛用作各种音频任务的语言骨干,如TTS、ASR和音乐生成。

0 人收藏 0 人点赞
#speech-synthesis

EmoRES-TTS:用于情感语音生成的残差增强向量引导

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了EmoRES-TTS,这是一种无需训练的情感语音生成方法,通过将情感向量分解为共享和残差分量来增强可控性,在基准测试中性能优于现有方法。

0 人收藏 0 人点赞
#speech-synthesis

BanglaKontho: 填补孟加拉语文本到语音中长篇韵律的空白

arXiv cs.CL ↗ · 5天前 缓存

BanglaKontho 推出了一套20小时单说话人孟加拉语TTS语料库,源自专业有声读物,并配备开源文本归一化器和预处理管道,旨在解决低资源孟加拉语语音合成中长篇韵律的不足。

0 人收藏 0 人点赞
#speech-synthesis

StillTalk

Product Hunt ↗ · 2026-09-17 缓存

StillTalk 是一款使用AI将生成的照片变成会说话角色的产品,支持在浏览器中实时渲染,并兼容多种语言和自定义句子。

0 人收藏 0 人点赞
#speech-synthesis

@FinanceYF5: 语音AI正开始进入手机。开源Audio8,将语音识别和语音合成打包…

X AI KOLs Timeline ↗ · 2026-09-16 缓存

这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。

0 人收藏 0 人点赞
#speech-synthesis

@neilzegh:大多数语音提供商都提供“max”和“flash”版本,其中“max”版本可靠,而“flash”版本……

X AI KOLs Timeline ↗ · 2026-08-31 缓存

Gradium发布了一款新的文本转语音模型,该模型结合了高准确率和低延迟,通过智能上下文处理和静音修剪,实现了低于250毫秒的首次音频时间。

0 人收藏 0 人点赞
#speech-synthesis

@vvolhejn: 我们的开源TTS变得更加开源了

X AI KOLs Timeline ↗ · 2026-08-25 缓存

Kyutai Labs 已经开源了他们的 Pocket TTS 训练工具集,包括数据流水线、训练方案和评估,允许开发者在GPU上训练文本转语音模型并在CPU上运行。

0 人收藏 0 人点赞
#speech-synthesis

Poly-InstructTTS:从开放式指令学习真实场景中富有表现力的语音合成

arXiv cs.CL ↗ · 2026-08-24 缓存

Poly-InstructTTS是一个文本转语音系统,它使用大规模多模态数据集从开放式自然语言指令中学习富有表现力的语音,从而提高TTS模型中的指令遵循度和表现力。

0 人收藏 0 人点赞
#speech-synthesis

构建和评估用于电信客户服务的合成孟加拉语音资源

arXiv cs.CL ↗ · 2026-08-24 缓存

本文介绍了一个用于电信客户服务场景的合成孟加拉语音数据集,包含10,000个音频-文本对,使用OmniVoice语音克隆技术生成,并通过ASR模型评估,实现了较低的单词错误率。

0 人收藏 0 人点赞
#speech-synthesis

超快速 Qwen3-TTS:34毫秒首音频时间,每秒处理10个请求 [OSS]

Reddit r/LocalLLaMA ↗ · 2026-08-21 缓存

Nari Qwen3-TTS 是针对 Qwen3-TTS 模型的高性能服务实现,在单块 H100 GPU 上实现低于 50 毫秒的首音频时间,并每秒处理 10 个请求。

0 人收藏 0 人点赞
#speech-synthesis

X2Streaming-TTS:基于流式文本与语音状态继承的因果令牌级文本转语音

arXiv cs.CL ↗ · 2026-08-20 缓存

X2Streaming-TTS 提出了一种因果令牌级文本转语音框架,用于真正的流式合成,使用因果承诺和语音状态继承来处理不确定的文本前缀,并在低延迟口语对话系统中保持声学连续性。

0 人收藏 0 人点赞
#speech-synthesis

VoiceChat-TTS:用于交互代理的低延迟连续语音合成模型

arXiv cs.CL ↗ · 2026-08-17 缓存

VoiceChat-TTS 是一种低延迟、连续的文本转语音模型,专为交互代理设计,支持实时流处理和中断处理,同时不损害语音质量。

0 人收藏 0 人点赞
#speech-synthesis

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

arXiv cs.CL ↗ · 2026-08-04 缓存

Presents DLLM-TTS, a block discrete diffusion language model for text-to-speech synthesis that processes X-Codec2 tokens in blocks, enabling parallel generation with RTF 0.15 while achieving competitive quality with only 20K hours of training data.

0 人收藏 0 人点赞
#speech-synthesis

SPARCLE:基于对比语言嵌入的说话者感知对齐表示

arXiv cs.CL ↗ · 2026-07-03 缓存

SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。

0 人收藏 0 人点赞
#speech-synthesis

@cevenif: 兄弟们,那些还得掏钱才能用的语音工具,是时候跟它们说88了! 开源免费的 Voicebox 已经杀出来了,直接把 ElevenLabs 和 WisprFlow 这两家付费巨头按在地上摩擦。 功能: 声音克隆,秒变任何人 全局语音输入,随时…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。

0 人收藏 0 人点赞
#speech-synthesis

HybridCodec: 面向高效语音语言模型的离散与连续表示建模

arXiv cs.LG ↗ · 2026-06-29 缓存

提出HybridCodec,一种结合时间压缩离散令牌与连续残差的新颖框架,旨在改进语音语言模型中说话人特征的保留,在保持质量的同时减少自回归步骤。

0 人收藏 0 人点赞
#speech-synthesis

owensong/Inflect-Nano-v2

Hugging Face Models Trending ↗ · 2026-06-25 缓存

发布了 Inflect-Nano-v2,这是一个固定语音的英文TTS模型,参数量低于4M,用于本地文本到波形合成,支持CPU或CUDA推理,以及长文本处理。

0 人收藏 0 人点赞
#speech-synthesis

@LinearUncle: 推荐一家叫模思的中国公司的开源声音克隆仓库: MOSS-TTS 你朗读一段文字,它克隆你的声音,然后就可以用你的声音朗读任意文本,查看帖子详情看我实战如何使用,效果很好,可以以假乱真。 https://github.com/OpenMOS…

X AI KOLs Timeline ↗ · 2026-06-19 缓存

MOSS-TTS是模思公司推出的开源声音克隆模型,用户朗读少量文本即可克隆声音,随后可用克隆的声音生成任意语音,效果逼真。

0 人收藏 0 人点赞
#speech-synthesis

基于LLM并行文本生成的低延迟实时音频游戏解说系统

arXiv cs.CL ↗ · 2026-06-12 缓存

本文介绍了一种低延迟实时音频游戏解说系统,该系统利用基于LLM的并行文本生成技术,将语句间的静默时间从9.6秒减少到0.3秒,与顺序基线相比显著改善了感知到的说话节奏。

0 人收藏 0 人点赞
#speech-synthesis

在构建 AI 辅导系统时,延迟比模型选择更重要

Reddit r/AI_Agents ↗ · 2026-06-04

一位从业者认为,在 AI 辅导系统中,语音启动延迟才是关键因素,而非模型的选择。他建议将语音启动延迟控制在 1 秒以内,并强调流式 TTS 是优化效果最显著的手段。文章梳理了从 ASR 到 TTS 再到虚拟形象同步的完整处理链路,并指出延迟叠加最严重的环节。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈