基于模型的大规模多语言平行数据质量评估

Hugging Face Daily Papers 论文

摘要

本文提出了一种基于模型的方法来评估大规模多语言平行数据,将其分解为平行性评估和无参考质量估计,发现没有任何单一的通用指标适用于所有语言方向。

大规模多语言平行语料通常包含两个不同的问题:非平行句对和低质量翻译。我们将此类数据的基于模型的评估分解为两个独立的部分:基于多语言嵌入的平行性评估和无参考质量估计(QE)。在平行性方面,我们在FLORES-200和BOUQuET检索任务上对四个嵌入模型进行了基准测试,覆盖了我们目标语言对库存中的6,654个源-目标方向。在QE方面,我们在41,412个有序源-目标方向的专业FLORES-200翻译上评估了九个无参考评估器。结果表明,没有模型在翻译方向上普遍可靠。简单的QE集成会稀释强模型信号,而有文档记录的目标语言覆盖与更高的QE分数密切相关。总体而言,这些发现表明,多语言平行数据评估最好被视为一个方向感知的路由和校准问题,其中没有单一的通用指标能够适用于所有语言。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:34

论文页面 - 大规模多语言平行数据的基于模型的质量评估

来源:https://huggingface.co/papers/2606.00285

摘要

多语言平行数据评估需要根据具体方向采用不同方法,而非通用指标,因为不同语言对的表现差异显著。

大规模多语言双文本 (https://huggingface.co/papers?q=multilingual%20bitext) 通常包含两类不同问题:非平行句对和低质量翻译。我们将此类数据的基于模型评估分解为两个独立组件:基于多语言嵌入的平行性评估 (https://huggingface.co/papers?q=parallelism%20assessment) 和无参考质量估计 (https://huggingface.co/papers?q=reference-free%20quality%20estimation)(QE)。在平行性方面,我们在 FLORES-200 (https://huggingface.co/papers?q=FLORES-200) 和 BOUQuET (https://huggingface.co/papers?q=BOUQuET) 检索任务上对四种嵌入模型进行了基准测试,覆盖目标语言对清单中的 6,654 个源语言-目标语言方向。在 QE 方面,我们在专业 FLORES-200 (https://huggingface.co/papers?q=FLORES-200) 翻译上评估了九种无参考评估器,涵盖 41,412 个有序源语言-目标语言方向。结果表明,没有任何模型在所有翻译方向上普遍可靠。简单的 QE 集成会稀释强模型信号,而有记录的目标语言覆盖范围与更高的 QE 分数显著相关。总体而言,这些发现表明,多语言平行数据评估最好被视为一种方向感知的路径选择和校准问题,其中无法期望单一通用指标适用于所有语言。

查看 arXiv 页面 (https://arxiv.org/abs/2606.00285)查看 PDF (https://arxiv.org/pdf/2606.00285)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.00285)

在您的代理中获取此论文:

hf papers read 2606\.00285

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2606.00285 即可从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.00285 即可从此页面链接。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.00285 即可从此页面链接。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

MSQA: 一个原生来源的多语言多文化SimpleQA基准测试

arXiv cs.CL

本文介绍了MSQA,这是一个包含1,064个原生来源问题的基准测试,覆盖11个语言组和5个文化维度,用于评估多语言大语言模型的文化知识。它揭示了一种系统性的“文化对齐幻觉”,即模型能够流利地输出多语言内容,但缺乏真正的文化理解。

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。