对比ESA:同时对多个翻译进行人工评估
摘要
介绍对比错误跨度标注(cESA),这是一种同时对多个翻译进行人工评估的协议,与标准方法相比,减少了标注时间和噪声。
arXiv:2607.26640v1 公告类型: 新
摘要:当前机器翻译的人工评估通常孤立地评估单个输出,这种范式存在标注者噪声高和成本高的问题。我们引入对比错误跨度标注(cESA),一种将源输入(文本、视频、音频、图像)的多个翻译同时呈现的协议。在cESA中,标注者看到同一文档的多个翻译,标记主要和次要错误跨度,然后从0%到100%的绝对尺度上打分。通过让标注者访问多个输出之间的共享上下文,cESA促进了更一致和高效的判断。我们通过对12个模型的英语到日语翻译进行大规模人工评估来验证cESA,结果表明与标准逐点评估相比,标注时间和噪声有所减少。与现有的对比排序方法不同,cESA产生绝对质量判断,从而无需事后校正即可实现简单、可解释的非参数模型排名。
查看缓存全文
缓存时间: 2026/07/30 09:58
# 对比性ESA:同时进行多译文的人类评估 来源:https://arxiv.org/abs/2607.26640 查看PDF(https://arxiv.org/pdf/2607.26640) > 摘要:当前机器翻译的人类评估通常孤立地评估单个输出,这种范式存在标注者噪声高、成本大的问题。我们提出对比性错误跨度标注(cESA),该协议同时展示源输入(文本、视频、音频、图像)的多个译文。在cESA中,标注者查看同一文档的多个译文,标记主要和次要错误跨度,然后按绝对尺度给出0%到100%的评分。通过允许标注者访问多个输出之间的共享上下文,cESA促进了更一致、更高效的判断。我们通过对12个模型的英译日译文进行大规模人类评估来验证cESA,结果表明,与标准逐点评测相比,标注时间和噪声均有所减少。与现有的对比性排序方法不同,cESA能够产出绝对质量判断,从而在无需事后校正的情况下,实现简单、可解释的非参数模型排名。 ## 提交历史 来自:Vilém Zouhar [查看邮件(https://arxiv.org/show-email/5bb1ecb7/2607.26640)] **\[v1\]**2026年7月29日星期三 09:01:59 UTC(5,306 KB)
相似文章
评估多语言句子嵌入用于翻译错误检测:一项英语-希腊语对比研究
本研究评估了多语言句子嵌入在区分正确英希翻译与错误翻译方面的表现,发现这些嵌入提供了有用的语义信号,但更适合集成到更广泛的翻译评估框架中。
何时使用额外上下文:面向同声传译的基于证据的术语自适应
本文提出了EGTA,一种面向同声传译的基于证据的术语自适应框架,该框架选择性地使用文档特定术语来改进罕见词的翻译,在无需全模型微调的情况下,在命名实体和缩写召回率方面取得了显著提升。
一种针对长语音同声传译的实用评估方法
本文提出了一种针对长语音同声传译的实用评估方法,该方法利用自动语音识别(ASR)、强制对齐和句子嵌入对齐来计算连续语音的延迟和质量指标,克服了先前方法的局限性。
SESSE: 草图、扩展、排序、总结、评估 -- 通过结构化分解的LLM-as-Judge评估
SESSE是一个无需训练的框架,将整体性的LLM-as-Judge评估分解为结构化子问题,从而提高可解释性并诊断标签模糊性,同时与微调模型达到竞争性的性能。
DocOCR-Eval:一种无需真实标注、基于校正的OCR工具选择框架
DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。