迷失于翻译?探究从拉丁语到奥克语语法性别的演变

Hugging Face Daily Papers 论文

摘要

开发了一个深度学习框架,用于分析从拉丁语到罗曼语族的语法性别演变,重点是利用词汇和上下文分析处理低资源历史场景。

从拉丁语到罗曼语族的历时演变涉及语法性别系统的重组,在大多数罗曼语中从三分结构(阳性、阴性、中性)变为二分结构(阳性、阴性)。在这项工作中,我们引入了一个可解释的深度学习框架,在词汇和上下文层面研究这一现象。首先,我们表明传统的分词策略在这个低资源历史设置中不够稳健,而我们提出的分词器在这些基线上提升了性能。在词汇层面,我们评估了形态特征对性别预测的贡献。在上下文层面,我们量化了不同词性类别对语法性别预测的贡献。这些分析共同描述了性别信息在词元及其句子上下文之间的分布。我们在 https://github.com/ahan-2000/Lost-in-Translation-{https://github.com/ahan-2000/Lost-in-Translation-}. 公开提供了我们的代码库、数据集和结果。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:35

论文页面 - 《失译之误?语法性别从拉丁语到奥克语的演变探究》

来源:https://huggingface.co/papers/2605.09156

摘要

本文开发了一个深度学习框架,用于分析从拉丁语到罗曼语族的语法性别系统演变,在低资源历史语境下同时考察词汇因素与语境因素。

从拉丁语到罗曼语族的历时演变涉及语法性别系统的重组——在大多数罗曼语中,原有的三分体系(阳性、阴性、中性)演变为二分体系(阳性、阴性)。本研究引入一个可解释的深度学习框架(https://huggingface.co/papers?q=deep%20learning%20framework),分别从词汇层面和语境层面(https://huggingface.co/papers?q=contextual%20level)对这一现象进行探究。首先,我们发现传统的分词策略(https://huggingface.co/papers?q=tokenization)在此低资源历史语境中稳健性不足,而我们所提出的分词器在性能上优于这些基线方法。在词汇层面(https://huggingface.co/papers?q=lexical%20level),我们评估了形态特征(https://huggingface.co/papers?q=morphological%20features)对性别预测(https://huggingface.co/papers?q=gender%20prediction)的贡献。在语境层面(https://huggingface.co/papers?q=contextual%20level),我们量化了不同词性类别(https://huggingface.co/papers?q=part-of-speech%20categories)对语法性别预测(https://huggingface.co/papers?q=gender%20prediction)的贡献。综合分析揭示了词元与其句子语境之间性别信息的分布特征。我们的代码库、数据集及结果已在以下地址公开:https://github.com/ahan-2000/Lost-in-Translation-{https://github.com/ahan-2000/Lost-in-Translation-}。

查看 arXiv 页面(https://arxiv.org/abs/2605.09156)查看 PDF(https://arxiv.org/pdf/2605.09156)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.09156)

在您的 Agent 中获取这篇论文:

hf papers read 2605.09156

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

没有模型关联本论文

在模型 README.md 中引用 arxiv.org/abs/2605.09156 即可在本页建立链接。

引用本论文的数据集 0

没有数据集关联本论文

在数据集 README.md 中引用 arxiv.org/abs/2605.09156 即可在本页建立链接。

引用本论文的 Spaces 0

没有 Space 关联本论文

在 Space README.md 中引用 arxiv.org/abs/2605.09156 即可在本页建立链接。

包含本论文的收藏集 0

没有收藏集包含本论文

将本论文添加至收藏集(https://huggingface.co/new-collection)即可在本页建立链接。

相似文章

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。

解释GAND:性别模糊自然数据与对比归因资源

arXiv cs.CL

本文介绍了GAND,这是一个用于分析机器翻译中性别偏见的性别模糊自然英语句子的基准测试资源,并利用对比翻译进行可解释性分析,以揭示影响性别分配的源词。