audio-model

标签

Cards List
#audio-model

@svpino: 这里有一个新的开源权重音频模型,你可以集成到你的应用中。我非常喜欢那种你可以托管的开源模型,这样……

X AI KOLs Following · 2026-07-28 缓存

Fish Audio S2 是一个新的开源权重音频模型,可在 Hugging Face 上获取。它提供两个模型分别处理时序和声学细节,推理速度快,并且有托管版本 S2.1 Pro,支持 83 种语言,成本低于 ElevenLabs。

0 人收藏 0 人点赞
#audio-model

@DanKornas: 编写双人音频演示不应只是拼接独立的语音片段。Dia 是一个1.6B参数的文本到…

X AI KOLs Timeline · 2026-07-21 缓存

Dia 是一个1.6B参数的开源文本转语音模型,能够根据转录文本生成英语对话,支持双说话人生成、音频条件控制以及非语言提示。

0 人收藏 0 人点赞
#audio-model

Stereo2Spatial: 将立体声音乐曲目转换为空间化双声道混音 [P]

Reddit r/MachineLearning · 2026-07-17

发布了一个模型(Stereo2Spatial),可将立体声音乐曲目转换为空间化双声道混音,采用流匹配扩散和振幅提升技术以实现稳定训练。该模型及一款Windows应用均以Apache 2.0许可证开源。

0 人收藏 0 人点赞
#audio-model

OpenAI 准备在 ChatGPT 上推出双向语音模式(2 分钟阅读)

TLDR AI · 2026-06-24 缓存

OpenAI 正在为 ChatGPT 推出新的双向语音模型(Bidi 1),该模型支持同时说话、听到和聆听,实时翻译,以及改进的对话上下文处理。升级已在部分用户的网页界面和应用程序中出现,预计很快会广泛发布。

0 人收藏 0 人点赞
#audio-model

OpenAI准备用GPT-Bidi-1对ChatGPT进行重大语音升级(2分钟阅读)

TLDR AI · 2026-06-17 缓存

OpenAI正准备发布GPT-Bidi-1,这是一个面向ChatGPT的下一代语音模型,支持双向通信、打断和句中调整,旨在缩小语音与文本能力之间的差距。

0 人收藏 0 人点赞
#audio-model

Gemini 3.5 Live Translate

Product Hunt · 2026-06-09

Gemini 3.5 Live Translate 是一款全新的音频模型,用于实时语音到语音翻译。

0 人收藏 0 人点赞
#audio-model

借助 Gemini 3.5 Live Translate 实现流畅自然的语音翻译

Google DeepMind Blog · 2026-06-09 缓存

Google 发布了 Gemini 3.5 Live Translate,这是一款音频模型,支持超过 70 种语言的近乎实时的语音到语音翻译,并保留说话者的语调和节奏。该功能正在 Google 产品中逐步推出,包括 Gemini Live API、Google Meet 和 Google Translate。

0 人收藏 0 人点赞
#audio-model

Gemini 3.1 Flash Live:让音频 AI 更自然、更可靠

Google DeepMind Blog · 2026-03-26 缓存

Google 发布了 Gemini 3.1 Flash Live,这是一款全新的高质量音频模型,专为更自然、更可靠的实时语音交互而设计,具备更低的延迟和更强的推理能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈