标签
本文介绍了 GigaAM Multilingual,这是一种基于 Conformer 编码器的模型,采用 HuBERT 风格的目标函数在 200 万小时音频上预训练,解决了中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的数据稀缺问题。它通过集群级数据平衡和领域感知采样,在目标语言上超越了 Whisper Large v3 等强基线模型。
本文介绍了“月光之味”(Flavors of Moonshine),一套面向边缘设备的小型专用ASR模型。作者证明,在人类标注、伪标注和合成数据的平衡混合上训练的单一语言模型,优于Whisper等更大的多语言模型,在小型模型中实现了最先进的错误率,并实现了对低资源语言的设备端ASR。