迷失于翻译?探究从拉丁语到奥克语语法性别的演变
摘要
开发了一个深度学习框架,用于分析从拉丁语到罗曼语族的语法性别演变,重点是利用词汇和上下文分析处理低资源历史场景。
查看缓存全文
缓存时间: 2026/06/02 15:35
论文页面 - 《失译之误?语法性别从拉丁语到奥克语的演变探究》
来源:https://huggingface.co/papers/2605.09156
摘要
本文开发了一个深度学习框架,用于分析从拉丁语到罗曼语族的语法性别系统演变,在低资源历史语境下同时考察词汇因素与语境因素。
从拉丁语到罗曼语族的历时演变涉及语法性别系统的重组——在大多数罗曼语中,原有的三分体系(阳性、阴性、中性)演变为二分体系(阳性、阴性)。本研究引入一个可解释的深度学习框架(https://huggingface.co/papers?q=deep%20learning%20framework),分别从词汇层面和语境层面(https://huggingface.co/papers?q=contextual%20level)对这一现象进行探究。首先,我们发现传统的分词策略(https://huggingface.co/papers?q=tokenization)在此低资源历史语境中稳健性不足,而我们所提出的分词器在性能上优于这些基线方法。在词汇层面(https://huggingface.co/papers?q=lexical%20level),我们评估了形态特征(https://huggingface.co/papers?q=morphological%20features)对性别预测(https://huggingface.co/papers?q=gender%20prediction)的贡献。在语境层面(https://huggingface.co/papers?q=contextual%20level),我们量化了不同词性类别(https://huggingface.co/papers?q=part-of-speech%20categories)对语法性别预测(https://huggingface.co/papers?q=gender%20prediction)的贡献。综合分析揭示了词元与其句子语境之间性别信息的分布特征。我们的代码库、数据集及结果已在以下地址公开:https://github.com/ahan-2000/Lost-in-Translation-{https://github.com/ahan-2000/Lost-in-Translation-}。
查看 arXiv 页面(https://arxiv.org/abs/2605.09156)查看 PDF(https://arxiv.org/pdf/2605.09156)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.09156)
在您的 Agent 中获取这篇论文:
hf papers read 2605.09156
没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
没有模型关联本论文
在模型 README.md 中引用 arxiv.org/abs/2605.09156 即可在本页建立链接。
引用本论文的数据集 0
没有数据集关联本论文
在数据集 README.md 中引用 arxiv.org/abs/2605.09156 即可在本页建立链接。
引用本论文的 Spaces 0
没有 Space 关联本论文
在 Space README.md 中引用 arxiv.org/abs/2605.09156 即可在本页建立链接。
包含本论文的收藏集 0
没有收藏集包含本论文
将本论文添加至收藏集(https://huggingface.co/new-collection)即可在本页建立链接。
相似文章
MORPHOGEN:评估性别感知形态生成的多语言基准
研究者发布 MORPHOGEN,一个多语言基准,用于测试大模型能否在法语、阿拉伯语和印地语中将第一人称句子改写为相反性别,同时保留原意。
LLiMba:单卡GPU上的撒丁语——将3B参数语言模型适配至一种濒临消失的罗曼语族语言
本文介绍了 LLiMba,这是一个基于 Qwen2.5 适配而来的3B参数模型,旨在支持撒丁语。该模型在单张消费级 GPU 上通过继续预训练和有监督微调完成训练。文章评估了多种 LoRA 配置,发现适配器容量对低资源语言适配的性能和事实准确性有显著影响。
语言模型中跨语言泛化的体外研究
本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。
解释GAND:性别模糊自然数据与对比归因资源
本文介绍了GAND,这是一个用于分析机器翻译中性别偏见的性别模糊自然英语句子的基准测试资源,并利用对比翻译进行可解释性分析,以揭示影响性别分配的源词。
LoRA用于性别包容性重写与对立叙事生成的激活引导
本文介绍了IHLC在LT-EDI 2026共享任务中的提交方案,使用LoRA微调进行性别中性重写(排名第3)和激活引导进行对立叙事生成(排名第6),同时展示了其潜力与局限性。