对比ESA:同时对多个翻译进行人工评估
摘要
介绍对比错误跨度标注(cESA),这是一种同时对多个翻译进行人工评估的协议,与标准方法相比,减少了标注时间和噪声。
arXiv:2607.26640v1 公告类型: 新
摘要:当前机器翻译的人工评估通常孤立地评估单个输出,这种范式存在标注者噪声高和成本高的问题。我们引入对比错误跨度标注(cESA),一种将源输入(文本、视频、音频、图像)的多个翻译同时呈现的协议。在cESA中,标注者看到同一文档的多个翻译,标记主要和次要错误跨度,然后从0%到100%的绝对尺度上打分。通过让标注者访问多个输出之间的共享上下文,cESA促进了更一致和高效的判断。我们通过对12个模型的英语到日语翻译进行大规模人工评估来验证cESA,结果表明与标准逐点评估相比,标注时间和噪声有所减少。与现有的对比排序方法不同,cESA产生绝对质量判断,从而无需事后校正即可实现简单、可解释的非参数模型排名。
查看缓存全文
缓存时间: 2026/07/30 09:58
# 对比性ESA:同时进行多译文的人类评估 来源:https://arxiv.org/abs/2607.26640 查看PDF(https://arxiv.org/pdf/2607.26640) > 摘要:当前机器翻译的人类评估通常孤立地评估单个输出,这种范式存在标注者噪声高、成本大的问题。我们提出对比性错误跨度标注(cESA),该协议同时展示源输入(文本、视频、音频、图像)的多个译文。在cESA中,标注者查看同一文档的多个译文,标记主要和次要错误跨度,然后按绝对尺度给出0%到100%的评分。通过允许标注者访问多个输出之间的共享上下文,cESA促进了更一致、更高效的判断。我们通过对12个模型的英译日译文进行大规模人类评估来验证cESA,结果表明,与标准逐点评测相比,标注时间和噪声均有所减少。与现有的对比性排序方法不同,cESA能够产出绝对质量判断,从而在无需事后校正的情况下,实现简单、可解释的非参数模型排名。 ## 提交历史 来自:Vilém Zouhar [查看邮件(https://arxiv.org/show-email/5bb1ecb7/2607.26640)] **\[v1\]**2026年7月29日星期三 09:01:59 UTC(5,306 KB)
相似文章
何时使用额外上下文:面向同声传译的基于证据的术语自适应
本文提出了EGTA,一种面向同声传译的基于证据的术语自适应框架,该框架选择性地使用文档特定术语来改进罕见词的翻译,在无需全模型微调的情况下,在命名实体和缩写召回率方面取得了显著提升。
一种针对长语音同声传译的实用评估方法
本文提出了一种针对长语音同声传译的实用评估方法,该方法利用自动语音识别(ASR)、强制对齐和句子嵌入对齐来计算连续语音的延迟和质量指标,克服了先前方法的局限性。
DocOCR-Eval:一种无需真实标注、基于校正的OCR工具选择框架
DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。
稀疏特征干预何时真正局部化?基于SAE的安全控制匹配评估
本文介绍了一种针对语言模型中稀疏特征干预的匹配评估协议,表明在与公平密集基线进行恰当对比时,基于SAE的安全控制所声称的效率优势会消失或逆转。
ALEE: 通过以英语为中心的极小对进行嵌入的任意语言评估
介绍ALEE,一个使用抽象意义表示生成具有受控语义偏移的英语极小对的框架,并将其翻译用于评估275+种语言的文本嵌入,揭示了跨语言语义表示中持续存在的差距。