speech-model

标签

Cards List
#speech-model

DialectS2S:面向低资源中文方言的端到端语音对话建模

arXiv cs.CL · 2026-08-11 缓存

DialectS2S是一个面向低资源中文方言的端到端语音对话模型,引入了可扩展的数据合成流程和一种带有自对齐语音监督的两阶段后训练策略。实验表明,在方言一致性、响应质量和可懂度方面均有提升,并且模型、数据和代码全部开源。

0 人收藏 0 人点赞
#speech-model

@LinusEkenstam:这是改变生活的科技。我们需要更少的炒作,更多这样的东西。想象一下这能帮助多少人

X AI KOLs Following · 2026-08-04 缓存

Bland 发布 Speech v3,声称它是世界上第一个人类语音引擎,并且在 Design Arena 的音频真实感基准测试中名列前茅,超越了 ElevenLabs、Grok、Cartesia 和 OpenAI。

0 人收藏 0 人点赞
#speech-model

微软测试新的 MAI Realtime 语音模型(2分钟阅读)

TLDR AI · 2026-08-03 缓存

微软正在其 MAI Playground 上以早期访问形式测试一款新的原生实时语音模型 MAI Realtime。该全双工系统支持多种语言、低延迟和可配置的轮流对话,定位为 OpenAI GPT Live 和 Sesame 的竞争对手。

0 人收藏 0 人点赞
#speech-model

@alamin_ai_: 天哪,伙计们,这太难以置信了 请听一下黎凡特阿拉伯语和英语之间的无缝代码切换,提高了7…

X AI KOLs Following · 2026-07-06 缓存

在黎凡特阿拉伯语语音合成和英语代码切换方面取得了重大突破,使用单张RTX 3060在一晚上实现了76%的提升。

0 人收藏 0 人点赞
#speech-model

野外探测:无监督发音分析下自监督语音表示在普通话次方言中的案例研究

arXiv cs.CL · 2026-06-25 缓存

本文通过无监督发音探测进行案例研究,探讨自监督语音模型如何在普通话次方言中编码语音特征,发现唇音性等显著特征保持稳定,而更精细的频谱区别则表现出方言依赖的变化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈