让Jensen Huang听起来像任何人。新的流式语音转换模型MeanVC2发布!
摘要
一个新的流式语音转换模型MeanVC2已经发布,支持跨性别和跨语言转换,在CPU上实现实时性能。
终于看到一个新的语音转换模型。MeanVC2支持跨性别和跨语言语音转换。在CPU上使用audio.cpp实现3倍实时性能。免责声明:MeanVC2的转换语音质量不错;噪音来自我粗糙的演示工程,而非模型本身。这只是一个快速演示,展示MeanVC2实时运行。https://huggingface.co/ASLP-lab/MeanVC2
相似文章
微软发布VibeVoice-ASR-Streaming流式语音识别模型
微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。
@oliviscusAI:NVIDIA 刚刚移除了语音AI最大的痛点。他们开源了 PersonaPlex 7B,一个实时对话…
NVIDIA 开源了 PersonaPlex 7B,一个实时对话模型,能够同时聆听和说话,与大多数语音模型不同,它可以处理自然的打断和重叠。
@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。
微软测试新的 MAI Realtime 语音模型(2分钟阅读)
微软正在其 MAI Playground 上以早期访问形式测试一款新的原生实时语音模型 MAI Realtime。该全双工系统支持多种语言、低延迟和可配置的轮流对话,定位为 OpenAI GPT Live 和 Sesame 的竞争对手。
GPT新语音模型简直太疯狂了。
OpenAI 的新 GPT 语音模型实现了高度逼真、低延迟的实时语音对话,并具备情感表达能力,标志着 AI 语音交互的一次重大飞跃。