标签
Soniox TTS v2 是一款新的文本转语音模型,提供优质语音质量、通过音频标签实现的表现力控制、高保真语音克隆、支持 60 多种语言,以及低延迟流式传输,定价为每生成小时 0.70 美元。
一篇关于企业级语音AI架构的技术解析,该架构通过批发运营商将电话成本降低40-60%,并利用Deepgram、Claude/GPT-4o-mini和ElevenLabs/Cartesia实现低于500毫秒的延迟,通过n8n和Supabase进行编排。
介绍 KrillinAI,一个免费本地运行的视频翻译工具,支持精准字幕、自然配音和声音克隆,集成了 Whisper、LLM 和 CosyVoice,支持 Win/Mac 及 yt-dlp。
VideoLingo 是一个开源视频翻译、本地化与配音工具,利用 WhisperX 和 AI 实现 Netflix 级字幕与多语言配音,支持 yt-dlp 下载和多种 TTS,帮助视频搬运者自动化处理全流程。
作者使用 Parakeet STT、Qwen 2.5 7B 和 Qwen3-TTS 构建了一个本地实时语音栈,并与 Ollama 集成。
一位开发者分享了为金融科技构建印地语-英语语音代理的事后复盘,重点介绍了数字回读、语码混合TTS、负载下的延迟和合规性等挑战。关键的修复是选择对印度语码混合有一流支持的TTS,并在真实并发条件下进行测试。
Voicebox 是一个本地运行的开源AI语音工作室,支持7种TTS引擎、23种语言和声音克隆,所有处理在本地完成以保护隐私。项目在GitHub已获33.8k星标。
Audio8 的开源 TTS 模型在 Hugging Face 的 TTS 趋势榜上排名第一,总榜排名第十,团队对此表示感谢,并计划继续改进。
Gradium 发布了新的 TTS 模型公测版,能原生准确读取电话号码、邮件地址、IBAN 以及时间表达式,并提供 API 接口和 100 万积分用于测试。
一款新工具包可对小型Inflect-Nano/Micro TTS模型进行微调,支持自定义声音和语言,并支持热启动、恢复训练以及导出至PyTorch/ONNX。
audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。
LangChain 推出面向语音框架(Pipecat、LiveKit、OpenAI Realtime、Gemini Live)的 LangSmith 追踪功能,支持完整音频监控、STT/TTS 延迟跟踪、中断检测和 VAD 分析,且仅需极少量代码。
一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。
一份按许可证类型组织的开源文本转语音模型参考指南,重点指出哪些模型可用于商业用途。
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。
Scylla's Band 是一款新的 TTS 模型和推理框架,包含用于部署的 Android 示例。
audio.cpp中发布了基于C++/GGML实现的Supertonic 3、MOSS-TTS、IndexTTS2和Irodori-TTS,能够在RTX 5090上3分钟内生成10小时音频。
Cicero 项目支持与 AI 代理进行自托管、双向语音对话,可本地运行 TTS/STT,并能集成多种代理协议和工具(如 Claude Code 和 Hermes Agent)。
Matt Pocock 分享了一个使用 LLM 生成代码差异播客摘要的工作流想法,旨在防止快速迭代仓库中的理解债务;他已在个人 wiki 上实施,效果良好。