GigaAM Multilingual: Foundation Model for Underrepresented Languages
摘要
本文介绍了 GigaAM Multilingual,这是一种基于 Conformer 编码器的模型,采用 HuBERT 风格的目标函数在 200 万小时音频上预训练,解决了中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的数据稀缺问题。它通过集群级数据平衡和领域感知采样,在目标语言上超越了 Whisper Large v3 等强基线模型。
查看缓存全文
缓存时间: 2026/07/21 10:36
论文页面 - GigaAM Multilingual: 面向低资源语言的基础模型
来源:https://huggingface.co/papers/2607.10371
摘要
尽管近期在规模化方面取得了成功,但多语言ASR性能仍然极不均匀,长尾语言因严重的数据稀缺而备受困扰。本研究旨在解决为低资源中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)构建稳健基础模型的挑战。我们提出了GigaAM Multilingual,这是一个基于Conformer的编码器,通过HuBERT风格的目标在200万小时音频上进行了预训练。关键之处在于,我们在预训练期间引入了一种集群级数据平衡策略,并在微调期间引入了一种领域感知采样方法,以减轻头部语言的主导效应。在受控比较中,我们的方法在目标语言上优于强大的开源预训练编码器(Whisper Large v3、Omnilingual-1B),在自发性语音上取得了显著提升,同时保持了效率。我们发布了该基础编码器和ASR模型,为在现实数据不平衡条件下进行有效的多语言适配提供了一套经过验证的方案。
查看arXiv页面 (https://arxiv.org/abs/2607.10371)查看PDF (https://arxiv.org/pdf/2607.10371)GitHub692 (https://github.com/salute-developers/GigaAM)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10371)
相似文章
GaoYao基准:全面评估大模型多语言与多文化能力的新框架
GaoYao发布18.2万样本、覆盖26种语言与51个地区的基准,系统评测大模型多语言与多文化能力,首次揭示显著地域性能差异。
GigaChat Audio: 时间感知的大型音频语言模型
本文介绍了 GigaChat Audio,一个时间感知的大型音频语言模型,能够对长达120分钟的音频回答问题并给出明确的时间戳,使用交错周期性时间标记和合成监督。该模型在基准测试中实现了强时间定位准确性,作者已发布模型权重和数据集。
X-AuT:针对语音大语言模型的渐进式音频编码器压缩与跨尺度蒸馏
X-AuT是一个渐进式框架,用于压缩语音大语言模型中的音频编码器层,通过跨尺度蒸馏和LoRA适配等技术,在降低推理成本的同时恢复准确性。
Command A Plus GGUFs 已发布
Cohere 已发布其 Command A+ 模型的 GGUF 量化版本(25B 活跃参数 / 218B 总参数,Apache 2.0),用于本地推理,针对智能体和多语言任务进行了优化。
大型音频语言模型中的多语言情感神经元
首次从神经元层面解释大型音频语言模型如何编码多语言情感,引入一致性正则化融合(Consistency-Regularized Fusion)以识别跨12种语言的多语言情感神经元,并展示了跨语言迁移的益处。