通过跨语言分词器手术和离线蒸馏将多语言嵌入模型适配到土耳其语
摘要
本文提出了embeddingmagibu-200m,一个专注于土耳其语的句子嵌入模型,通过跨语言分词器手术和离线蒸馏构建,在土耳其语基准测试中取得了强劲性能,同时实现了成本与质量的平衡。
查看缓存全文
缓存时间: 2026/06/02 15:36
论文页面 - 通过跨语言分词器手术与离线蒸馏将多语言嵌入模型适配至土耳其语
来源:https://huggingface.co/papers/2605.29992
该论文提出了embeddingmagibu-200m,一个面向土耳其语的句子嵌入模型,通过跨语言分词器手术和离线嵌入蒸馏构建而成。我们并未进行昂贵的完整预训练,而是通过构建一个针对土耳其语优化的13.1万词汇分词器、克隆具有兼容嵌入表的教师架构,并从预计算的教师向量中进行蒸馏,从而适配多语言嵌入模型。
最终得到的2亿参数模型支持8192个token的上下文窗口,在STSbTR上达到77.55%的皮尔逊相关系数和77.45%的斯皮尔曼相关系数,超越了拥有3亿参数的教师模型。在TR-MTEB上,它取得63.9%的平均分,在26个模型中排名第7,同时提供了良好的成本-质量平衡。
所有产出的成果均已发布,包括模型权重、分词器文件、预计算嵌入数据集以及开源克隆与蒸馏工具。该工作对于土耳其语NLP、低资源语言适配、句子嵌入、语义搜索、RAG、分词器优化以及高效蒸馏具有参考价值。
相似文章
Morpheus:一种面向土耳其语的形态感知神经分词器与词嵌入器
本文提出Morpheus,一种面向土耳其语的神经分词器与词嵌入器,它在无需字符串归一化的情况下学习语素边界,实现了无损分词并在词汇检索中获得了具有竞争力的嵌入表示,同时比子词分词器使用更少的GPU内存。
m3BERT:一种现代、多语言、套娃式双向编码器
本文介绍了m3BERT,一种多语言双向编码器,采用新颖的预训练策略,联合优化跨Transformer层和多个嵌入维度的表示,使得单个模型能够适应不同的资源约束。在Bing-Click工业检索数据集上,它显著优于现有最优模型。
@liquidai: 介绍 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M:两款为超快且精准的多语言检索模型
Liquid AI 推出 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M,这两款多语言检索模型经过优化,可在11种语言中实现快速准确的搜索,延迟低至1.5毫秒。
beautyyuyanli/multilingual-e5-large
多语言 E5-large 嵌入模型现已上线 Replicate,单次运行约 0.00098 美元,在 Nvidia L40S 上约 1 秒完成。
面向语言集成可靠性审计的多语言句子嵌入
本文评估了多语言句子嵌入能否在教育评估中替代翻译进行跨语言的语言集成可靠性审计,发现母语嵌入能紧密复现基于翻译的可靠性估计。