基于模型的大规模多语言平行数据质量评估
摘要
本文提出了一种基于模型的方法来评估大规模多语言平行数据,将其分解为平行性评估和无参考质量估计,发现没有任何单一的通用指标适用于所有语言方向。
查看缓存全文
缓存时间: 2026/06/02 15:34
论文页面 - 大规模多语言平行数据的基于模型的质量评估
来源:https://huggingface.co/papers/2606.00285
摘要
多语言平行数据评估需要根据具体方向采用不同方法,而非通用指标,因为不同语言对的表现差异显著。
大规模多语言双文本 (https://huggingface.co/papers?q=multilingual%20bitext) 通常包含两类不同问题:非平行句对和低质量翻译。我们将此类数据的基于模型评估分解为两个独立组件:基于多语言嵌入的平行性评估 (https://huggingface.co/papers?q=parallelism%20assessment) 和无参考质量估计 (https://huggingface.co/papers?q=reference-free%20quality%20estimation)(QE)。在平行性方面,我们在 FLORES-200 (https://huggingface.co/papers?q=FLORES-200) 和 BOUQuET (https://huggingface.co/papers?q=BOUQuET) 检索任务上对四种嵌入模型进行了基准测试,覆盖目标语言对清单中的 6,654 个源语言-目标语言方向。在 QE 方面,我们在专业 FLORES-200 (https://huggingface.co/papers?q=FLORES-200) 翻译上评估了九种无参考评估器,涵盖 41,412 个有序源语言-目标语言方向。结果表明,没有任何模型在所有翻译方向上普遍可靠。简单的 QE 集成会稀释强模型信号,而有记录的目标语言覆盖范围与更高的 QE 分数显著相关。总体而言,这些发现表明,多语言平行数据评估最好被视为一种方向感知的路径选择和校准问题,其中无法期望单一通用指标适用于所有语言。
查看 arXiv 页面 (https://arxiv.org/abs/2606.00285)查看 PDF (https://arxiv.org/pdf/2606.00285)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.00285)
在您的代理中获取此论文:
hf papers read 2606\.00285
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.00285 即可从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.00285 即可从此页面链接。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.00285 即可从此页面链接。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
GaoYao基准:全面评估大模型多语言与多文化能力的新框架
GaoYao发布18.2万样本、覆盖26种语言与51个地区的基准,系统评测大模型多语言与多文化能力,首次揭示显著地域性能差异。
MSQA: 一个原生来源的多语言多文化SimpleQA基准测试
本文介绍了MSQA,这是一个包含1,064个原生来源问题的基准测试,覆盖11个语言组和5个文化维度,用于评估多语言大语言模型的文化知识。它揭示了一种系统性的“文化对齐幻觉”,即模型能够流利地输出多语言内容,但缺乏真正的文化理解。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
OpenCompass:大语言模型通用评测平台
OpenCompass是一个一站式、可扩展、高并发的大语言模型评测平台,支持多种基准测试和模块化设计,旨在统一和标准化LLM评估。
超越准确率:大型语言模型统计推理的多维评估
本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。