VocalVia
摘要
VocalVia 是一款将文档和文章转换为可编辑的多语音音频的工具。
<p>
将文档和文章转换为可编辑的多语音音频
</p>
<p>
<a href="https://www.producthunt.com/products/vocalvia?utm_campaign=producthunt-atom-posts-feed&utm_medium=rss-feed&utm_source=producthunt-atom-posts-feed">讨论</a>
|
<a href="https://www.producthunt.com/r/p/1194977?app_id=339">链接</a>
</p>
相似文章
OpenVoice:多功能即时语音克隆
OpenVoice是一种多功能语音克隆方法,它能够使用单个音频片段实现灵活的语音风格控制和高效率的零样本跨语言克隆。
@oliviscusAI: Microsoft 刚发布了一个工具,可以一次性转录整整一小时的音频,并追踪谁在什么时候说话。它叫……
Microsoft 发布了 vibevoice,这是一个7B参数的模型,可以一次性转录长达一小时的音频,内置说话人日志和时间戳,支持50多种语言,并且本地运行,无需API费用。
Voiser AI
Voiser AI 提供超过140种语言的人性化AI配音。
microsoft/VibeVoice
Microsoft 开源了 VibeVoice,这是一个统一的语音转文本模型,可单次处理长达60分钟的音频并转录说话人、时间戳和内容,同时还有一个实时文本转语音模型,支持流式输入和多语言语音。该项目通过量化技术为 ASR 提供了一个边缘 CPU 推理引擎。
VibeVoice 技术报告
VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。