data-balancing

标签

Cards List
#data-balancing

GigaAM Multilingual: Foundation Model for Underrepresented Languages

Hugging Face Daily Papers · 2026-07-11 缓存

本文介绍了 GigaAM Multilingual,这是一种基于 Conformer 编码器的模型,采用 HuBERT 风格的目标函数在 200 万小时音频上预训练,解决了中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的数据稀缺问题。它通过集群级数据平衡和领域感知采样,在目标语言上超越了 Whisper Large v3 等强基线模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈