text-to-audio

标签

Cards List
#text-to-audio

@rohanpaul_ai: AI视频正进入实时互动时代,MaineCoon如今在低延迟AI视频领域领先。@catnips_ai刚刚…

X AI KOLs Following · 2026-06-23 缓存

MaineCoon是一款22B参数的实时文生音频视频模型,在单张H100 GPU上可达47.5 FPS,支持低成本、长时长的流式生成,同步语音与画面,用于实时AI角色。

0 人收藏 0 人点赞
#text-to-audio

基于自回归扩散变换器的流式同步空间音频生成

Hugging Face Daily Papers · 2026-05-29 缓存

SwanSphere 提出了一种统一的流式框架,通过因果自回归扩散变换器和多模态学习策略,从全景视频和文本提示中生成高保真空间音频,在视频到空间音频和文本到空间音频任务中均实现了卓越性能。

0 人收藏 0 人点赞
#text-to-audio

google/magenta-realtime-2

Hugging Face Models Trending · 2026-05-28 缓存

Google DeepMind 发布了 Magenta RealTime 2,这是一个开源音乐生成模型,支持设备端流式处理,可通过文本、音频示例和 MIDI 实现低延迟控制。

0 人收藏 0 人点赞
#text-to-audio

Stable Audio 3.0(3分钟阅读)

TLDR AI · 2026-05-21 缓存

Stability AI发布了Stable Audio 3.0,这是一个开放权重模型系列,可生成最长六分钟的变长音频,支持LoRA微调和音频修复,基于完全许可的数据训练。

0 人收藏 0 人点赞
#text-to-audio

@multimodalart: @StabilityAI 的 Stable Audio 3 刚刚发布。主要提供3种开源变体:- Stable Audio 3 Medium (2B) - …

X AI KOLs Following · 2026-05-20 缓存

Stability AI发布了Stable Audio 3,提供用于音乐和VFX的开源变体,具备快速且高质量的音频生成能力。

0 人收藏 0 人点赞
#text-to-audio

Stable Audio 3

Hacker News Top · 2026-05-20 缓存

Stable Audio 3 推出了一系列快速潜扩散模型,用于变长音频生成与编辑,并开源了中小型模型权重。

0 人收藏 0 人点赞
#text-to-audio

WavFlow:波形空间中的音频生成

Hugging Face Daily Papers · 2026-05-18 缓存

WavFlow 通过波形分块和振幅提升,直接在原始波形空间中生成高保真音频,在视频到音频和文本到音频基准测试中取得了具有竞争力的性能,无需中间潜在表示。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈