标签
DialectS2S是一个面向低资源中文方言的端到端语音对话模型,引入了可扩展的数据合成流程和一种带有自对齐语音监督的两阶段后训练策略。实验表明,在方言一致性、响应质量和可懂度方面均有提升,并且模型、数据和代码全部开源。
Bland 发布 Speech v3,声称它是世界上第一个人类语音引擎,并且在 Design Arena 的音频真实感基准测试中名列前茅,超越了 ElevenLabs、Grok、Cartesia 和 OpenAI。
微软正在其 MAI Playground 上以早期访问形式测试一款新的原生实时语音模型 MAI Realtime。该全双工系统支持多种语言、低延迟和可配置的轮流对话,定位为 OpenAI GPT Live 和 Sesame 的竞争对手。
在黎凡特阿拉伯语语音合成和英语代码切换方面取得了重大突破,使用单张RTX 3060在一晚上实现了76%的提升。
本文通过无监督发音探测进行案例研究,探讨自监督语音模型如何在普通话次方言中编码语音特征,发现唇音性等显著特征保持稳定,而更精细的频谱区别则表现出方言依赖的变化。