构建欧洲多语言评估数据集:EMT网络内的MMLU本地化项目
摘要
本文报告了欧盟委员会翻译总局与欧洲翻译硕士网络合作,将MMLU数据集本地化为11种欧洲语言的项目。该项目不仅为LLM评估创建了更具包容性的基准,还为翻译专业学生提供了真实的项目式专业培训。
arXiv:2607.18432v1 公告类型:新论文
摘要:本文报告了翻译总局(DGT)与欧洲翻译硕士(EMT)合作,将MMLU数据集本地化为11种欧洲语言的项目。除了为LLM评估创建更包容的基准外,该项目还为硕士研究生提供了翻译、修订、项目管理和多语言协调方面的真实项目式专业培训,同时突出了关键的方法论、行政和工作流程挑战。
查看缓存全文
缓存时间: 2026/07/22 08:23
# 构建欧洲多语言评估数据集:EMT网络中的MMLU本地化项目 来源:https://arxiv.org/abs/2607.18432 查看PDF (https://arxiv.org/pdf/2607.18432) > 摘要:本文报告了翻译总司(DGT)与欧洲翻译硕士(EMT)合作将MMLU数据集本地化为11种欧洲语言的工作。除了为LLM评估创建更具包容性的基准外,该项目还为硕士生提供了翻译、审校、项目管理和多语言协调方面的真实项目式专业培训,同时突出了关键的方法论、行政及工作流程挑战。 ## 提交历史 来自:Susana Valdez [查看邮件 (https://arxiv.org/show-email/62c16c4d/2607.18432)] **[v1]** 2026年7月20日星期一 18:33:59 UTC (456 KB)
相似文章
使用跨语言对齐预测LLMs的多语言分类和翻译性能——英语足够吗?
论文比较了27种跨语言对齐(CLA)分数变体,用于预测LLM在多语言分类和翻译任务上的性能,并提出了一种基于PMI的翻译指标。研究发现,与英语的CLA对翻译质量的预测能力与源语言-目标语言CLA相当或更好,支持了LLMs使用英语作为内部枢轴语言的观点。
LLM翻译中数字本地化分析
本文分析了五款大语言模型在英德互译中对时间、数字和日期进行本地化的能力,并测试了改进准确率的策略,发现将本地化原则嵌入提示上下文可带来统计上显著的改进。
实际环境中的多语言多模态大语言模型:面向低资源语言的构建
本教程论文概述了如何为低资源语言构建多语言多模态大语言模型,涵盖数据创建、模型对齐、微调和评估,重点提供实用方案和动手资源。
面向语言集成可靠性审计的多语言句子嵌入
本文评估了多语言句子嵌入能否在教育评估中替代翻译进行跨语言的语言集成可靠性审计,发现母语嵌入能紧密复现基于翻译的可靠性估计。
MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据
本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。