标签
Onepin 作为语音生成领域的模型路由与质量控制层正式发布,它架设在现有 TTS 服务商之上,对文稿进行规范化处理、按行选择音色,并大规模自动检测和修复发音或自然度问题。
kyutai_labs 发布了一篇技术博客,介绍如何训练 PocketTTS——一个拥有 100M 参数的端上文本转语音(TTS)模型。该模型采用 Deng 等人提出的 drifting 一步式生成目标,WER 低于 1%,同时具备高质量语音和声音克隆能力。据称这是首个以这种方式训练的语音模型,也是首个以这种方式训练的自回归模型。
文章分析了超过100个音频模型,发现Qwen-family LLMs,特别是Qwen3,被广泛用作各种音频任务的语言骨干,如TTS、ASR和音乐生成。
Tacit-TTS 将 IndexTTS2 的自回归文本到语义解码替换为掩码非自回归生成,并结合免训练的声学长度估计与 ReFlow 蒸馏,实现了无需参考文本的零样本语音克隆;在时长超过 5 秒的语音上,其生成速度比 IndexTTS2 快 10 倍以上,同时支持跨语言以及非语音(如婴儿咿呀学语、合成乱码)参考音频的克隆。
本文介绍了EmoRES-TTS,这是一种无需训练的情感语音生成方法,通过将情感向量分解为共享和残差分量来增强可控性,在基准测试中性能优于现有方法。
BanglaKontho 推出了一套20小时单说话人孟加拉语TTS语料库,源自专业有声读物,并配备开源文本归一化器和预处理管道,旨在解决低资源孟加拉语语音合成中长篇韵律的不足。
StillTalk 是一款使用AI将生成的照片变成会说话角色的产品,支持在浏览器中实时渲染,并兼容多种语言和自定义句子。
这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。
Gradium发布了一款新的文本转语音模型,该模型结合了高准确率和低延迟,通过智能上下文处理和静音修剪,实现了低于250毫秒的首次音频时间。
Kyutai Labs 已经开源了他们的 Pocket TTS 训练工具集,包括数据流水线、训练方案和评估,允许开发者在GPU上训练文本转语音模型并在CPU上运行。
Poly-InstructTTS是一个文本转语音系统,它使用大规模多模态数据集从开放式自然语言指令中学习富有表现力的语音,从而提高TTS模型中的指令遵循度和表现力。
本文介绍了一个用于电信客户服务场景的合成孟加拉语音数据集,包含10,000个音频-文本对,使用OmniVoice语音克隆技术生成,并通过ASR模型评估,实现了较低的单词错误率。
Nari Qwen3-TTS 是针对 Qwen3-TTS 模型的高性能服务实现,在单块 H100 GPU 上实现低于 50 毫秒的首音频时间,并每秒处理 10 个请求。
X2Streaming-TTS 提出了一种因果令牌级文本转语音框架,用于真正的流式合成,使用因果承诺和语音状态继承来处理不确定的文本前缀,并在低延迟口语对话系统中保持声学连续性。
VoiceChat-TTS 是一种低延迟、连续的文本转语音模型,专为交互代理设计,支持实时流处理和中断处理,同时不损害语音质量。
Presents DLLM-TTS, a block discrete diffusion language model for text-to-speech synthesis that processes X-Codec2 tokens in blocks, enabling parallel generation with RTF 0.15 while achieving competitive quality with only 20K hours of training data.
SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。
一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。
提出HybridCodec,一种结合时间压缩离散令牌与连续残差的新颖框架,旨在改进语音语言模型中说话人特征的保留,在保持质量的同时减少自回归步骤。
发布了 Inflect-Nano-v2,这是一个固定语音的英文TTS模型,参数量低于4M,用于本地文本到波形合成,支持CPU或CUDA推理,以及长文本处理。