Universal-3.5 Pro
摘要
Universal-3.5 Pro 改进了本地语码切换、说话人分离,并增加了更多语言,提升了语音识别能力。
<p>
本地语码切换,更好的说话人分离,更多语言。
</p>
<p>
<a href="https://www.producthunt.com/products/assemblyai?utm_campaign=producthunt-atom-posts-feed&utm_medium=rss-feed&utm_source=producthunt-atom-posts-feed">讨论</a>
|
<a href="https://www.producthunt.com/r/p/1185839?app_id=339">链接</a>
</p>
相似文章
Supertone/supertonic-3
Supertonic 3 是一个轻量级的开权重文本转语音模型,专为快速设备端推理而设计,支持的语言扩展至 31 种,并提升了稳定性及表情标签支持。
可在 Windows 上挑战 Dragon Professional 的 STT
一款新的语音转文字工具声称可与 Windows 上的 Dragon Professional 媲美,为语音识别提供了一个有竞争力的替代方案。
Gemini 3.5 Live Translate
Gemini 3.5 Live Translate 是一款全新的音频模型,用于实时语音到语音翻译。
nvidia/Nemotron-Labs-Audex-30B-A3B · Hugging Face
NVIDIA 发布了 Nemotron-Labs-Audex-30B-A3B,这是一个统一的音频-文本大语言模型,基于 30B MoE 主干网,激活参数量为 3B。该模型在音频理解、语音识别/翻译和生成方面表现出色,同时保留了文本推理和对齐能力。
@multimodalart: UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者……
UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。