long-form-audio

标签

Cards List
#long-form-audio

MiniMax-Music3 发布!

Reddit r/LocalLLaMA · 2026-08-13 缓存

MiniMax 发布 Music 3,一款高性能音乐生成模型,可根据歌词和详细描述生成最长五分钟的完整歌曲,配备 8B 全局大语言模型和 0.6B 局部大语言模型,以实现长程连贯性和声学细节。

0 人收藏 0 人点赞
#long-form-audio

WanSong v1.0 技术报告

Hugging Face Daily Papers · 2026-07-16 缓存

WanSong是一个纯扩散式音乐生成模型,能够一次性直接生成长达5分钟的高保真多语种歌曲,并输出双音轨(人声和背景音乐),解决了高效生成、长音频和可控性方面的挑战。

0 人收藏 0 人点赞
#long-form-audio

VibeVoice 技术报告

Papers with Code Trending · 2025-08-26 缓存

VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈