对比ESA:同时对多个翻译进行人工评估

arXiv cs.CL 论文

摘要

介绍对比错误跨度标注(cESA),这是一种同时对多个翻译进行人工评估的协议,与标准方法相比,减少了标注时间和噪声。

arXiv:2607.26640v1 公告类型: 新 摘要:当前机器翻译的人工评估通常孤立地评估单个输出,这种范式存在标注者噪声高和成本高的问题。我们引入对比错误跨度标注(cESA),一种将源输入(文本、视频、音频、图像)的多个翻译同时呈现的协议。在cESA中,标注者看到同一文档的多个翻译,标记主要和次要错误跨度,然后从0%到100%的绝对尺度上打分。通过让标注者访问多个输出之间的共享上下文,cESA促进了更一致和高效的判断。我们通过对12个模型的英语到日语翻译进行大规模人工评估来验证cESA,结果表明与标准逐点评估相比,标注时间和噪声有所减少。与现有的对比排序方法不同,cESA产生绝对质量判断,从而无需事后校正即可实现简单、可解释的非参数模型排名。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:58

# 对比性ESA:同时进行多译文的人类评估
来源:https://arxiv.org/abs/2607.26640
查看PDF(https://arxiv.org/pdf/2607.26640)

> 摘要:当前机器翻译的人类评估通常孤立地评估单个输出,这种范式存在标注者噪声高、成本大的问题。我们提出对比性错误跨度标注(cESA),该协议同时展示源输入(文本、视频、音频、图像)的多个译文。在cESA中,标注者查看同一文档的多个译文,标记主要和次要错误跨度,然后按绝对尺度给出0%到100%的评分。通过允许标注者访问多个输出之间的共享上下文,cESA促进了更一致、更高效的判断。我们通过对12个模型的英译日译文进行大规模人类评估来验证cESA,结果表明,与标准逐点评测相比,标注时间和噪声均有所减少。与现有的对比性排序方法不同,cESA能够产出绝对质量判断,从而在无需事后校正的情况下,实现简单、可解释的非参数模型排名。

## 提交历史

来自:Vilém Zouhar [查看邮件(https://arxiv.org/show-email/5bb1ecb7/2607.26640)] **\[v1\]**2026年7月29日星期三 09:01:59 UTC(5,306 KB)

相似文章

一种针对长语音同声传译的实用评估方法

arXiv cs.CL

本文提出了一种针对长语音同声传译的实用评估方法,该方法利用自动语音识别(ASR)、强制对齐和句子嵌入对齐来计算连续语音的延迟和质量指标,克服了先前方法的局限性。