GigaAM Multilingual: Foundation Model for Underrepresented Languages

Hugging Face Daily Papers 论文

摘要

本文介绍了 GigaAM Multilingual,这是一种基于 Conformer 编码器的模型,采用 HuBERT 风格的目标函数在 200 万小时音频上预训练,解决了中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的数据稀缺问题。它通过集群级数据平衡和领域感知采样,在目标语言上超越了 Whisper Large v3 等强基线模型。

尽管近期在规模化方面取得了成功,但多语言 ASR 性能仍然高度不均衡,长尾语言面临严重的数据稀缺问题。本文针对构建面向低资源中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的稳健基础模型这一挑战展开研究。我们提出了 GigaAM Multilingual,这是一种采用 HuBERT 风格目标函数在 200 万小时音频上预训练的 Conformer 编码器。关键的是,我们在预训练中引入了集群级数据平衡策略,并在微调中引入了领域感知采样方法,以缓解主导语言的影响。在受控比较中,我们的方法在目标语言上优于强大的开源预训练编码器(Whisper Large v3、Omnilingual-1B),在保持效率的同时,在自发语音上取得了显著提升。我们发布了基础编码器和 ASR 模型,为在现实数据不平衡条件下进行有效的多语言适应提供了经过验证的方案。
查看原文
查看缓存全文

缓存时间: 2026/07/21 10:36

论文页面 - GigaAM Multilingual: 面向低资源语言的基础模型

来源:https://huggingface.co/papers/2607.10371

摘要

尽管近期在规模化方面取得了成功,但多语言ASR性能仍然极不均匀,长尾语言因严重的数据稀缺而备受困扰。本研究旨在解决为低资源中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)构建稳健基础模型的挑战。我们提出了GigaAM Multilingual,这是一个基于Conformer的编码器,通过HuBERT风格的目标在200万小时音频上进行了预训练。关键之处在于,我们在预训练期间引入了一种集群级数据平衡策略,并在微调期间引入了一种领域感知采样方法,以减轻头部语言的主导效应。在受控比较中,我们的方法在目标语言上优于强大的开源预训练编码器(Whisper Large v3、Omnilingual-1B),在自发性语音上取得了显著提升,同时保持了效率。我们发布了该基础编码器和ASR模型,为在现实数据不平衡条件下进行有效的多语言适配提供了一套经过验证的方案。

查看arXiv页面 (https://arxiv.org/abs/2607.10371)查看PDF (https://arxiv.org/pdf/2607.10371)GitHub692 (https://github.com/salute-developers/GigaAM)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10371)

相似文章

GigaChat Audio: 时间感知的大型音频语言模型

Hugging Face Daily Papers

本文介绍了 GigaChat Audio,一个时间感知的大型音频语言模型,能够对长达120分钟的音频回答问题并给出明确的时间戳,使用交错周期性时间标记和合成监督。该模型在基准测试中实现了强时间定位准确性,作者已发布模型权重和数据集。

Command A Plus GGUFs 已发布

Reddit r/LocalLLaMA

Cohere 已发布其 Command A+ 模型的 GGUF 量化版本(25B 活跃参数 / 218B 总参数,Apache 2.0),用于本地推理,针对智能体和多语言任务进行了优化。

大型音频语言模型中的多语言情感神经元

arXiv cs.CL

首次从神经元层面解释大型音频语言模型如何编码多语言情感,引入一致性正则化融合(Consistency-Regularized Fusion)以识别跨12种语言的多语言情感神经元,并展示了跨语言迁移的益处。