underrepresented-languages

标签

Cards List
#underrepresented-languages

GigaAM Multilingual: Foundation Model for Underrepresented Languages

Hugging Face Daily Papers · 2026-07-11 缓存

本文介绍了 GigaAM Multilingual,这是一种基于 Conformer 编码器的模型,采用 HuBERT 风格的目标函数在 200 万小时音频上预训练,解决了中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的数据稀缺问题。它通过集群级数据平衡和领域感知采样,在目标语言上超越了 Whisper Large v3 等强基线模型。

0 人收藏 0 人点赞
#underrepresented-languages

月光之味:面向边缘设备的小型专用ASR模型

Papers with Code Trending · 2025-09-02 缓存

本文介绍了“月光之味”(Flavors of Moonshine),一套面向边缘设备的小型专用ASR模型。作者证明,在人类标注、伪标注和合成数据的平衡混合上训练的单一语言模型,优于Whisper等更大的多语言模型,在小型模型中实现了最先进的错误率,并实现了对低资源语言的设备端ASR。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈