标签
作者描述了在课程视频制作中实验使用AI生成的静态图像和文本转语音技术创建动画草图,这有助于在拍摄前规划并识别问题。
NotebookLM 已集成 Gemini 3.8 TTS,使得中文阅读完美无瑕,并为知识创作者提供快速视频制作能力,同时讨论了多种 AI 视频内容方案。
文章介绍了sanoTTS,一个紧凑的294,279参数TTS系统,并展示了一个交互式网站来探索其内部机制。
Voice Acting Arena的推出,这是一个通过用户比较来评估配音AI模型的平台,旨在评估其在表演、指导和真实性方面的表现。
Nari Labs 推出 Qwen3-TTS 和 Qwen3-ASR 模型,在免费公开测试中提供高准确率、低延迟和成本效益,同时提供优化的 API 和服务用于生产部署。
一位独立开发者开源了一款免费的本地AI工具,作为ElevenLabs的替代品,支持语音克隆、646种语言的视频配音等功能,且所有数据均不离开用户设备。
LoudKit是一款开源的本地TTS工具,支持声音克隆和10种语言,并提供Python、Swift、Go、Rust和TypeScript的SDK,专为在边缘设备上高效运行而设计。
腾讯开源了一个名为AuK的1.5B参数AI模型,可以替代多个音频工具,通过自然语言指令处理TTS、语音克隆和降噪等任务。
X2-NativeCursor是一个轻量级观察器,用于在使用原生语音令牌的增量文本流式TTS系统中跟踪文本进度,与基于波形的基线相比,实现了更低的错误和更快的对齐。
一个名为 voicebenchmarks.com 的开源网站,旨在集中语音AI基准测试,包括TTS、LLM、STT等,提供用户友好界面,并欢迎社区贡献。
本文介绍了Wayu-Paxa-TTS-Edge,一个拥有8200万参数的泰语TTS模型,该模型通过语音克隆教师的合成语音进行训练,在无需参考音频的情况下实现了高精度和韵律,适用于设备端使用。
Gradium发布了一款新的文本转语音模型,该模型结合了高准确率和低延迟,通过智能上下文处理和静音修剪,实现了低于250毫秒的首次音频时间。
介绍本地声音克隆工具VoiceStudio,只需8秒录音即可高度还原声音,完全本地运行保护隐私,支持多种语言和平台。
一个轻量级的TTS实现,通过2000小时数据复现Audio8的训练,在H200上不到10小时训练就达到了0.72的SIM指标。
TontaubeV1 是一个开放权重的语音合成模型,专为本地长篇生成发布,支持英语和德语,具备零样本语音克隆功能,并可在 GPU 上实现低延迟推理。
Bland团队探讨AI语音的恐怖谷效应,并开发能模拟人类不完美特质的TTS模型,以提升电话交互的自然感和人性化体验。
audio.cpp 版本 0.7 引入了一个新的 Arena UI,用于本地比较音频模型,扩展至 62 个模型家族,拥有超过 85 个变体,并支持在边缘硬件如 NVIDIA Jetson Orin 上部署。
Cartesia的TTS模型Sonic-3.6现已全面上线,从架构层面进行了重建,并在预览阶段收到了积极反馈。
一个新的综合排名将三个公开的TTS排行榜合并为一个统一的排名,涵盖110个模型和46个提供商,每周更新并采用固定方法。