标签
Fish Audio S2 是一个新的开源权重音频模型,可在 Hugging Face 上获取。它提供两个模型分别处理时序和声学细节,推理速度快,并且有托管版本 S2.1 Pro,支持 83 种语言,成本低于 ElevenLabs。
Dia 是一个1.6B参数的开源文本转语音模型,能够根据转录文本生成英语对话,支持双说话人生成、音频条件控制以及非语言提示。
发布了一个模型(Stereo2Spatial),可将立体声音乐曲目转换为空间化双声道混音,采用流匹配扩散和振幅提升技术以实现稳定训练。该模型及一款Windows应用均以Apache 2.0许可证开源。
OpenAI 正在为 ChatGPT 推出新的双向语音模型(Bidi 1),该模型支持同时说话、听到和聆听,实时翻译,以及改进的对话上下文处理。升级已在部分用户的网页界面和应用程序中出现,预计很快会广泛发布。
OpenAI正准备发布GPT-Bidi-1,这是一个面向ChatGPT的下一代语音模型,支持双向通信、打断和句中调整,旨在缩小语音与文本能力之间的差距。
Gemini 3.5 Live Translate 是一款全新的音频模型,用于实时语音到语音翻译。
Google 发布了 Gemini 3.5 Live Translate,这是一款音频模型,支持超过 70 种语言的近乎实时的语音到语音翻译,并保留说话者的语调和节奏。该功能正在 Google 产品中逐步推出,包括 Gemini Live API、Google Meet 和 Google Translate。
Google 发布了 Gemini 3.1 Flash Live,这是一款全新的高质量音频模型,专为更自然、更可靠的实时语音交互而设计,具备更低的延迟和更强的推理能力。