评估机器翻译对话中的交际成功度
摘要
本文提出一个三层清单-评判框架,用于评估机器翻译对话中口译智能体在语义、语用和文化-社会维度上的交际成功度,并通过广泛的基准测试进行了验证。
arXiv:2609.19885v1 公告类型:新
摘要:基于机器翻译(MT)构建的口译智能体日益成为不同语言人群实时对话的中介,但我们仍使用为孤立句子设计的指标来评估它们,这些指标衡量的是保真度而非交际是否成功。本文提出一个可复用的三层清单-评判框架,从语义、语用和文化-社会维度评估口译中介的对话,涵盖了保真度指标未测量的自然度、意图和社交得体性。它可在单轮和交互式多轮环境中运行,在对话展开过程中,模拟用户会对翻译消息进行回应,并对每一轮对话与整体对话一同进行评分。我们通过受控扰动、跨评判者比较和人工标注对其进行了广泛验证。我们的主要单轮基准测试评估了来自阿拉伯语、孟加拉语、印尼语和韩语的10种口译设置,涵盖5624个源自OpenSubtitles的场景和12个翻译方向;多轮研究则涵盖了所有6种语言对在脚本模式和实时模式下的表现。结果显示,交际成功度从语义层到语用层和文化-社会层呈持续下降趋势,而传统的MT指标忽略了较强口译智能体中的失败情况。提示消融实验表明,场景上下文、结构化指令和文化背景能提升交际成功度,尽管增益因设置而异。因此,我们的工作为对话中的口译智能体提供了一个评估框架和基准,并强调了在现有翻译指标之外交际成功度的重要性。
查看缓存全文
缓存时间: 2026/09/18 09:05
# 评估机器翻译对话中的交际成功度 来源:https://arxiv.org/html/2609.19885 作者:Alice Oh 所属机构:KAIST 计算机学院 邮箱:[[email protected]](mailto:) ###### 摘要 基于机器翻译(MT)构建的口译智能体,正日益成为不共享语言的人们之间实时对话的中介。然而,我们仍使用为孤立句子设计的指标来评估它们——这些指标衡量的是忠实度,而非交际是否成功。本文引入一个可复用的三层“清单-评判”框架,从语义、语用和文化-社会维度评估口译中介的对话,涵盖了忠实度指标未测量的自然度、意图和社会适当性。该框架适用于单轮及交互式多轮场景,其中模拟用户在对话展开时对翻译消息进行回复,每轮回应均与整体对话一起被评分。我们通过受控扰动、交叉评判比较和人类标注进行了广泛验证。主要的单轮基准测试评估了涵盖阿拉伯语、孟加拉语、印尼语和韩语的10种口译设置,基于5,624个源自OpenSubtitles的场景,覆盖12种翻译方向;多轮研究则涵盖所有6种语言对,在脚本模式和实时模式下进行。结果显示,从语义到语用再到文化-社会的成功度呈持续下降趋势;传统的MT指标忽略了较强口译设置中存在的失败案例;提示消融实验证明,场景上下文、结构化指令和文化背景能提升交际成功度,尽管增益在不同设置间存在差异。因此,我们的工作为对话中的口译智能体提供了评估框架与基准,并强调了在现有翻译指标之外关注交际成功度的重要性。 ## 1 引言 机器翻译(MT)发展迅速,基于MT构建的对话智能体现在正中介着不共享语言的人们之间的实时互动,从聊天和语音模式到在普通设备上部署的实时口译功能。这一角色长期以来依赖于人类译员,他们理解超越字面的对话上下文,在为目标用户调整翻译的同时传达预期的交际目的。这与Skopos翻译理论(Vermeer, 1989 (https://arxiv.org/html/2609.19885#bib.bib62))相契合,即翻译的目的驱动翻译过程;而通用大语言模型(LLMs)和专用MT模型正被尝试用于这一口译角色(Sperber and Paulik, 2020 (https://arxiv.org/html/2609.19885#bib.bib59); Robinson et al., 2023 (https://arxiv.org/html/2609.19885#bib.bib53))。然而,在像对话这样复杂且动态的场景中,意图、语气、自然度和文化适宜性等隐性方面最为重要,这些MT模型常常失败。现有的MT指标,如BLEU(Papineni et al., 2002 (https://arxiv.org/html/2609.19885#bib.bib43))、chrF(Popović, 2015 (https://arxiv.org/html/2609.19885#bib.bib44))、基于模型的指标如BERTScore(Zhang et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib69))和COMET/CometKiwi(Rei et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib50); Rei et al., 2022 (https://arxiv.org/html/2609.19885#bib.bib51)),以及基于MQM的指标(Lommel et al., 2013 (https://arxiv.org/html/2609.19885#bib.bib30); Freitag et al., 2021 (https://arxiv.org/html/2609.19885#bib.bib13); Kocmi and Federmann, 2023a (https://arxiv.org/html/2609.19885#bib.bib25); Kocmi and Federmann, 2023b (https://arxiv.org/html/2609.19885#bib.bib26); Lu et al., 2024 (https://arxiv.org/html/2609.19885#bib.bib31))并非为细致捕捉这些隐性方面而设计。图1(https://arxiv.org/html/2609.19885#S1.F1)展示了来自我们数据的一个真实案例,其中一款最流行的翻译应用未能提供恰当的翻译,却在CometKiwi上得分很高。在对话中,翻译准确性和交际成功度高度相关,而两者之间的差距正是翻译系统最可能失败的地方(Moghe et al., 2023 (https://arxiv.org/html/2609.19885#bib.bib35))。这一点对于低资源语言以及非英语源或目标的语言对尤为明显,因为直接翻译仍有待探索。参见图注图1:一个未能通过我们清单评估但在CometKiwi上得分很高的翻译样本(印尼语→韩语)。 本文研究处于口译角色的MT模型,并围绕由此产生的差距构建评估框架。每个翻译轮次根据涵盖语义、语用功能和文化-社会约束的场景特定三层清单进行评估,将交际成功度分解为小的、可核验的断言(Ribeiro et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib52))。多轮对话增加了跨轮一致性和对话级清单。我们对评判者及其他所有LLM生成的组件进行了广泛验证,并将该框架应用于10个模型、4种语言(阿拉伯语、孟加拉语、印尼语、韩语)、6个语言对、12个翻译方向,覆盖5,624个保留的OpenSubtitles对话场景(Lison and Tiedemann, 2016 (https://arxiv.org/html/2609.19885#bib.bib27))。我们的评估是文本层面的,未建模延迟、韵律或话轮转换,尽管它按轮次对对话进行评分,并设计用于嵌入实时口译流水线。我们还提出了一次性的、针对特定语言对的文化背景,其中包含每种语言及其语言对之间的语言和文化信息,并使用它来为LLMs提供可验证信息,以改进整体生成。我们做出三点贡献。首先,一个用于评估翻译对话的三层清单框架,包含一个经过验证的LLM评判者(覆盖单轮和多轮场景),以及经验结果证明其捕捉了与其他MT指标正交的方面。其次,一个可复用的数据到评估流水线,包含一个增强数据集,涵盖5,624个对话场景和来自真实OpenSubtitles对话的56,240个评估的系统输出,涉及6个语言对。第三,一个针对特定语言对的文化背景,它能提升清单质量和评判者可靠性,并在用于翻译简报时改进口译翻译。 ## 2 相关工作 #### MT指标。基于参考的指标如BLEU(Papineni et al., 2002 (https://arxiv.org/html/2609.19885#bib.bib43))、chrF(Popović, 2015 (https://arxiv.org/html/2609.19885#bib.bib44))和BERTScore(Zhang et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib69))衡量翻译的相似性,而学习型质量估计指标如COMET和CometKiwi(Rei et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib50); Rei et al., 2022 (https://arxiv.org/html/2609.19885#bib.bib51))无需参考即可预测人类判断。MQM以大规模(Freitag et al., 2021 (https://arxiv.org/html/2609.19885#bib.bib13))构建人类错误标注(Lommel et al., 2013 (https://arxiv.org/html/2609.19885#bib.bib30)),而LLM评估器如GEMBA、GEMBA-MQM、MQM-APE和RATE通过生成判断或评分标准扩展了这些方法(Kocmi and Federmann, 2023a (https://arxiv.org/html/2609.19885#bib.bib25); Kocmi and Federmann, 2023b (https://arxiv.org/html/2609.19885#bib.bib26); Lu et al., 2024 (https://arxiv.org/html/2609.19885#bib.bib31); Tian et al., 2026 (https://arxiv.org/html/2609.19885#bib.bib60))。所有这些方法仍在评估翻译质量,而非从交际角度评估。这一区别推动了外在MT评估(Moghe et al., 2023 (https://arxiv.org/html/2609.19885#bib.bib35)),这在语音和实时场景中最为重要,因为口译智能体必须推动对话前进(Sperber and Paulik, 2020 (https://arxiv.org/html/2609.19885#bib.bib59))。我们使用细粒度清单作为交际成功的代理指标,来评估口译智能体传达的内容。 #### 作为评判者的LLM可靠性与基于清单的评估。使用LLM对生成文本进行评分很常见(Zheng et al., 2023 (https://arxiv.org/html/2609.19885#bib.bib70); Liu et al., 2023b (https://arxiv.org/html/2609.19885#bib.bib29)),但已记录的失败模式包括位置和自我偏好偏差(Wang et al., 2023 (https://arxiv.org/html/2609.19885#bib.bib63); Panickssery et al., 2024 (https://arxiv.org/html/2609.19885#bib.bib42))、偏好更长或更自信风格的回应(Wu and Aji, 2023 (https://arxiv.org/html/2609.19885#bib.bib67)),以及对表面措辞的顺从(Hwang et al., 2026 (https://arxiv.org/html/2609.19885#bib.bib18))。缓解措施包括使用多样化的评判者小组(Verga et al., 2024 (https://arxiv.org/html/2609.19885#bib.bib61))以及将一个标量判断分解为小的、可独立核验的断言。这种分解在行为NLP测试(Ribeiro et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib52))和事实性评估(Min et al., 2023 (https://arxiv.org/html/2609.19885#bib.bib33); Wei et al., 2024 (https://arxiv.org/html/2609.19885#bib.bib64))中有先例,并且最近被证明是使用LLM作为评判者最可靠的方法之一(Cho et al., 2026 (https://arxiv.org/html/2609.19885#bib.bib7))。我们将这些想法扩展到翻译评估,同时广泛验证评判者和其他LLM生成的组件。 #### 低资源、文化扎根与非字面MT。资源不平等影响NLP研究(Joshi et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib21); Ranathunga et al., 2023 (https://arxiv.org/html/2609.19885#bib.bib48)),推动了参与式MT(Nekoto et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib38))和多语言基准(Goyal et al., 2022 (https://arxiv.org/html/2609.19885#bib.bib16); Ahuja et al., 2023 (https://arxiv.org/html/2609.19885#bib.bib1)),而文化扎根的NLP展示了系统如何将一种观点编码为默认(Hershcovich et al., 2022 (https://arxiv.org/html/2609.19885#bib.bib17); Naous et al., 2024 (https://arxiv.org/html/2609.19885#bib.bib37))。关于礼貌和语域控制(Sennrich et al., 2016 (https://arxiv.org/html/2609.19885#bib.bib56); Rao and Tetreault, 2018 (https://arxiv.org/html/2609.19885#bib.bib49); Madaan et al., 2020 (https://arxiv.org/html/2609.19885#bib.bib32); Hwang et al., 2021 (https://arxiv.org/html/2609.19885#bib.bib19))以及习语语言(Dankers et al., 2022 (https://arxiv.org/html/2609.19885#bib.bib9); Baziotis et al., 2022 (https://arxiv.org/html/2609.19885#bib.bib5); Liu et al., 2023a (https://arxiv.org/html/2609.19885#bib.bib28); Wu et al., 2026 (https://arxiv.org/html/2609.19885#bib.bib66))的研究表明,翻译超越字面意义的内涵具有难度,而Skopos理论将目的置于翻译行动的中心(Vermeer, 1989 (https://arxiv.org/html/2609.19885#bib.bib62)),规范意识翻译使之明确(Kayano and Sugawara, 2025 (https://arxiv.org/html/2609.19885#bib.bib23))。我们的框架通过测量对话上下文中的语义、语用和文化-社会成功度来连接这些方面。参见图注图2:对话评估框架概述,包含完整的数据到评估流水线。 ## 3 对话评估框架 ### 3.1 数据构建 我们的框架覆盖了口译中介对话的完整数据到评估流水线(图2(https://arxiv.org/html/2609.19885#S2.F2))。我们基于ODC-By 1.0许可下的OpenSubtitles(Lison and Tiedemann, 2016 (https://arxiv.org/html/2609.19885#bib.bib27))(一个电影和电视字幕语料库)构建它,使用4种语言(阿拉伯语arb、孟加拉语ben、印尼语ind、韩语kor)。通过双语对齐检查以及基于LaBSE相似度(Feng et al., 2022 (https://arxiv.org/html/2609.19885#bib.bib11))、长度比和词覆盖率的启发式方法,我们得到更干净、风险更低、对齐且足够有挑战性以区分字面忠实度和交际成功的片段。启发式特征来自每种语言的语言特征和文化背景,以及与语言无关的特征,如文字、长度和代词不对称性。通过手动加权,我们为每个无序语言对选择前500个对齐片段。双向增强产生6,000个候选场景,其中附录D.5(https://arxiv.org/html/2609.19885#A4.SS5)中的事后安全过滤器保留了5,624个。然后,我们为每个场景增加对话上下文,如说话者角色、场景设置、关系和交际目的,这些信息来自最多15个前置片段和2个后置片段的窗口(附录D(https://arxiv.org/html/2609.19885#A4))。 ### 3.2 交际目标清单 评估的核心是生成清单作为交际成功的代理指标。清单生成器首先分析场景设置、言语行为、说话者关系、语域和特定语言对的文化背景(描述每种语言及语言对之间的语言和文化信息),然后编写场景特定的标准,可以访问源文本、对话上下文以及参考翻译(如果有)。每个场景在三个评分层有二元标准。L1语义层检查命题、实体、数量以及改变源意义时的语法区分。L2语用层检查预期的言语行为、语气和互动目的是否得以保留,同时感觉自然。L3文化-社会层检查语域、敬语、面子管理、关系立场和其他依赖上下文的期望。所有三个层的标准都是具体的“是/否”断言,“是”始终表示要求得到满足。生成器生成3组标准,并使用LaBSE(Feng et al., 2022 (https://arxiv.org/html/2609.19885#bib.bib11))在余弦相似度0.80下去重。除了单个场景外,测试相同重复评估问题(例如“使用了礼貌的韩语敬语”)的标准跨场景汇集到一个*功能*中,这是后续用于功能级分析和人类校准的单元(附录C(https://arxiv.org/html/2609.19885#A3))。我们使用Gemini 3.1 Pro(Google DeepMind, 2026 (https://arxiv.org/html/2609.19885#bib.bib15)),设置较高的思考努力度作为生成器。提示和示例见附录K(https://arxiv.org/html/2609.19885#A11)。 ### 3.3 口译中介的对话 该框架涉及三个参与者。两个用户各自用一种语言产生话语,并且只观察到对方的翻译消息,两者都可以是真实人类或由LLM模拟。一个口译智能体通过根据可配置的翻译简报翻译和中继消息来连接他们。一个LLM评判者观察交互,并根据提供的清单,利用对话上下文、原始消息和接收者回应来评估每轮翻译和整体对话。 设置。在单轮评估中,一个话语被翻译一次,接收者使用翻译内容及其自身角色上下文用目标语言回复。多轮设置有3种模式。脚本模式回放固定的双语对话记录,其中每轮的回应是固定的。动态引导模式根据角色上下文从上下文中模拟用户,同时遵循基于用户角色上下文的每轮意图大纲。动态自由模式移除角色上下文,让用户自然回应。多轮评估保留轮次级L1-L3标准,并增加对话级标准以评估跨轮一致性、累积意义和目标完成度。 ### 3.4 评估与指标 评判者接收上下文、源文本、翻译文本、接收者回应和L1
相似文章
MTR-Suite:一个用于评估和合成对话检索基准的框架
介绍MTR-Suite,一个用于评估和合成对话检索基准的统一框架,具备基于LLM的审计器、用于成本效益对话生成的多智能体流水线,以及一个具有高区分度的基准。
基于AI翻译教学中的评价判断:AI辅助翻译与译后编辑的课堂案例研究
本文呈现了一项关于AI辅助翻译与译后编辑教学的课堂案例研究,重点关注学生评价判断能力的培养。
自我评价之言:大语言模型在机器翻译中的口头化置信度研究
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。
在现实对话环境中评估语言模型
本文介绍了UPHELD,这是一个用于评估LLMs人类规模对话能力的大型基准,并提出了一个Mixture-of-Judges框架,将与人类评估的相关性提高了约30%。
实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试
本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。