标签
文章分析了超过100个音频模型,发现Qwen-family LLMs,特别是Qwen3,被广泛用作各种音频任务的语言骨干,如TTS、ASR和音乐生成。
本文介绍了EmoRES-TTS,这是一种无需训练的情感语音生成方法,通过将情感向量分解为共享和残差分量来增强可控性,在基准测试中性能优于现有方法。
BanglaKontho 推出了一套20小时单说话人孟加拉语TTS语料库,源自专业有声读物,并配备开源文本归一化器和预处理管道,旨在解决低资源孟加拉语语音合成中长篇韵律的不足。
StillTalk 是一款使用AI将生成的照片变成会说话角色的产品,支持在浏览器中实时渲染,并兼容多种语言和自定义句子。
这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。
Gradium发布了一款新的文本转语音模型,该模型结合了高准确率和低延迟,通过智能上下文处理和静音修剪,实现了低于250毫秒的首次音频时间。
Kyutai Labs 已经开源了他们的 Pocket TTS 训练工具集,包括数据流水线、训练方案和评估,允许开发者在GPU上训练文本转语音模型并在CPU上运行。
Poly-InstructTTS是一个文本转语音系统,它使用大规模多模态数据集从开放式自然语言指令中学习富有表现力的语音,从而提高TTS模型中的指令遵循度和表现力。
本文介绍了一个用于电信客户服务场景的合成孟加拉语音数据集,包含10,000个音频-文本对,使用OmniVoice语音克隆技术生成,并通过ASR模型评估,实现了较低的单词错误率。
Nari Qwen3-TTS 是针对 Qwen3-TTS 模型的高性能服务实现,在单块 H100 GPU 上实现低于 50 毫秒的首音频时间,并每秒处理 10 个请求。
X2Streaming-TTS 提出了一种因果令牌级文本转语音框架,用于真正的流式合成,使用因果承诺和语音状态继承来处理不确定的文本前缀,并在低延迟口语对话系统中保持声学连续性。
VoiceChat-TTS 是一种低延迟、连续的文本转语音模型,专为交互代理设计,支持实时流处理和中断处理,同时不损害语音质量。
Presents DLLM-TTS, a block discrete diffusion language model for text-to-speech synthesis that processes X-Codec2 tokens in blocks, enabling parallel generation with RTF 0.15 while achieving competitive quality with only 20K hours of training data.
SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。
一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。
提出HybridCodec,一种结合时间压缩离散令牌与连续残差的新颖框架,旨在改进语音语言模型中说话人特征的保留,在保持质量的同时减少自回归步骤。
发布了 Inflect-Nano-v2,这是一个固定语音的英文TTS模型,参数量低于4M,用于本地文本到波形合成,支持CPU或CUDA推理,以及长文本处理。
MOSS-TTS是模思公司推出的开源声音克隆模型,用户朗读少量文本即可克隆声音,随后可用克隆的声音生成任意语音,效果逼真。
本文介绍了一种低延迟实时音频游戏解说系统,该系统利用基于LLM的并行文本生成技术,将语句间的静默时间从9.6秒减少到0.3秒,与顺序基线相比显著改善了感知到的说话节奏。
一位从业者认为,在 AI 辅导系统中,语音启动延迟才是关键因素,而非模型的选择。他建议将语音启动延迟控制在 1 秒以内,并强调流式 TTS 是优化效果最显著的手段。文章梳理了从 ASR 到 TTS 再到虚拟形象同步的完整处理链路,并指出延迟叠加最严重的环节。