葡萄牙语语言模型:一项系统映射研究

arXiv cs.CL 论文

摘要

本调查系统映射了46个葡萄牙语语言模型,分析其发展、特征、演进,并识别该领域的研究空白和未来方向。

arXiv:2608.18138v1 Announce Type: new 摘要:近年来,语言模型的快速发展通过广泛的应用改变了自然语言处理领域。然而,语言模型的发展在不同语言间并不均衡。在葡萄牙语方面,学术界和企业界最近加大了开发葡萄牙语语言模型和创建数据资源的力度。这些努力导致了一个日益多样化的葡萄牙语语言模型生态系统的兴起。然而,关于这些模型的信息仍然分散在科学出版物、技术报告、模型仓库和项目文档中。本调查对为葡萄牙语开发的语言模型进行了一项系统映射研究,提供了该领域当前状态的全面概述。我们共映射了46个模型,从基础模型、架构、计算资源、训练数据集、许可、代码可用性、数据和模型权重等多个方面对其进行特征分析。此外,我们通过系统发育视角分析了这些模型的演进和关系,识别了当前的研究空白和机会,并讨论了葡萄牙语语言模型开发的未来方向。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:05

# 面向葡萄牙语的语言模型:系统性映射研究
来源:https://arxiv.org/abs/2608.18138
查看PDF(https://arxiv.org/pdf/2608.18138)

> 摘要:近年来,语言模型的快速发展通过多样化的应用彻底改变了自然语言处理领域。然而,不同语言的模型发展并不均衡。在葡萄牙语方面,学术界与企业界近期正加大力度开发针对该语言的模型并构建相关数据资源。这些努力促使葡萄牙语语言模型生态日益多元化。但相关信息仍分散于学术论文、技术报告、模型仓库及项目文档中。本综述通过系统性映射研究,全面梳理了葡萄牙语语言模型的发展现状。我们共映射了46个模型,并从基础模型、架构、计算资源、训练数据集、许可证、代码可用性、数据及模型权重等多维度进行特征分析。此外,我们从系统发生学视角剖析了这些模型的演化路径与相互关联,识别出当前研究的空白与机遇,并探讨了葡萄牙语语言模型开发的未来方向。

## 提交历史
来自:Sandra Avila \[查看邮箱 (https://arxiv.org/show-email/91232f7e/2608.18138)\] **\[v1\]** 2026年8月3日(星期一)20:51:31 UTC \(430 KB\)

相似文章

Amália与欧洲葡萄牙语LLM的未来

Hacker News Top

葡萄牙政府向AMÁLIA投资了550万欧元。这是一款基于EuroLLM、面向欧洲葡萄牙语的开源大语言模型,但该模型的数据、权重及基准测试结果尚未公开。

大语言模型在低资源语言人文学科研究中的机遇与挑战

arXiv cs.CL

本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。

语言模型说哪种语言?

Reddit r/artificial

本文探讨大型语言模型是否拥有“母语”(很可能是英语),以及它们如何通过共享的概念空间或“语义中枢”处理多语言输入,并使用logit透镜探查内部表征。