标签
本文介绍了 GigaAM Multilingual,这是一种基于 Conformer 编码器的模型,采用 HuBERT 风格的目标函数在 200 万小时音频上预训练,解决了中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的数据稀缺问题。它通过集群级数据平衡和领域感知采样,在目标语言上超越了 Whisper Large v3 等强基线模型。