评估指标能否检测文言文到英语翻译中的错误?
摘要
本文以基于最小对立的诊断框架,研究机器翻译的自动评估指标是否适用于文言文到英语的翻译。结果发现所有指标都存在盲点,其中 MetricX24 整体表现最佳。
arXiv:2608.08283v1 公告类型:新
摘要:尽管大型语言模型能够以惊人的质量翻译某些历史语言,但由于缺乏可靠的评估,它们在进行数字人文工作时的实用性受到限制。我们以文言文到英语的翻译为测试案例,研究为现代语言开发的现有自动评估指标在此场景下是否可靠。我们引入了一个基于最小对立的诊断框架,捕获学术使用中突出的错误类型,并检测基于参考和无参考的指标对错误的敏感度以及对有效变体的容忍度。我们发现所有指标都存在盲点,但 MetricX24 整体表现最佳。我们的发现强调,需要为具有历史和文化独特性的翻译场景开发更稳健且可解释的指标。
查看缓存全文
缓存时间: 2026/08/11 08:07
# 评估指标能否检测文言文到英文翻译中的错误?
来源:https://arxiv.org/html/2608.08283
Osvaldo Quinjica¹ Eric Bennett¹,² Xinchen Yang¹ Andrew Schonebaum² Marine Carpuat¹
¹计算机科学系 ²东亚语言文化系
马里兰大学学院市分校
\{quinjica,ebenne92,xcyang,schone,marine\}@umd\.edu
###### 摘要
尽管大语言模型在一些历史语言的翻译上表现出出乎意料的能力,但由于缺乏可靠的评估手段,它们在数字人文工作流中的实用性受到限制。我们以文言文到英文的翻译为测试案例,研究为现代语言开发的现有自动评估指标在该场景下是否可靠。我们引入了一个基于最小对立对的诊断框架,该框架覆盖了学术使用中突出的错误类型,同时检验基于参考译文和无参考译文的指标在错误敏感性及对合法变异的容忍度方面的表现。我们发现所有指标均存在盲区,但MetricX24整体表现最佳。我们的研究结果表明,对于历史及文化差异显著的翻译场景,需要更加稳健且可解释的评估指标¹¹¹我们在此发布代码和数据集:https://github.com/cx-olquinjica/cc-mt-eval。
## 1 引言
大语言模型(LLMs)在涉及历史语言(如拉丁语(Volk等,2024(https://arxiv.org/html/2608.08283#bib.bib91))、韩文汉文(Son等,2022(https://arxiv.org/html/2608.08283#bib.bib92))或文言文(Jin等,2023(https://arxiv.org/html/2608.08283#bib.bib93)))的任务上展现出了出乎意料的强劲表现,这很可能归因于预训练期间偶然接触到的双语文本(Briakou等,2023(https://arxiv.org/html/2608.08283#bib.bib100))。这一能力为数字人文开辟了新的机遇,使得大规模搜索、翻译和计算分析海量历史语料成为可能,并有望降低古典文本获取的门槛(Nehrdich和Keutzer,2026(https://arxiv.org/html/2608.08283#bib.bib78);Sturgeon,2019(https://arxiv.org/html/2608.08283#bib.bib79);Song等,2025(https://arxiv.org/html/2608.08283#bib.bib81))。然而,在这些场景下评估基于大语言模型的机器翻译(MT)质量仍然是一个挑战。当前的评估实践依赖于主要在现代语言上验证的指标,它们对语言、文化和历史差异的稳健性尚不清楚。例如,文言文带来了独特的困难:其极度简洁和依赖语境的特点导致可接受的翻译存在巨大变异性,这使翻译和评估都变得复杂。对于缺乏源语言熟练度或需要大规模处理语料的学者来说,对大语言模型翻译的可靠评估至关重要。尽管机器翻译评估已取得进展——从基于字符串的指标(Papineni等,2002b(https://arxiv.org/html/2608.08283#bib.bib64);Popovic,2015(https://arxiv.org/html/2608.08283#bib.bib65))到基于人类评分训练的习得指标(Rei等,2020(https://arxiv.org/html/2608.08283#bib.bib66);Juraska等,2024(https://arxiv.org/html/2608.08283#bib.bib154))以及基于大语言模型的评判器(Kocmi和Federmann,2023c(https://arxiv.org/html/2608.08283#bib.bib57);Fernandes等,2023(https://arxiv.org/html/2608.08283#bib.bib51))——这些指标在历史和文化差异显著的场景中的稳健性在很大程度上仍未经过测试。现有研究主要评估与人类评分的总体相关性(Papineni等,2002a(https://arxiv.org/html/2608.08283#bib.bib5);Rei等,2020(https://arxiv.org/html/2608.08283#bib.bib66);Nehrdich等,2025(https://arxiv.org/html/2608.08283#bib.bib63)),但实际应用需要更细粒度的洞察:这些指标能可靠地检测哪些错误?它们对合理变异的容忍度如何?它们能否帮助判断译文是否足够准确,可以呈现给不熟悉源语言的学者,或用于构建语义搜索语料库?还是说它们有可能让扭曲学术解读或学习的错误漏网?
为解决这一问题,我们引入了一个针对文言文-英文机器翻译评估量身定制的错误诊断框架。基于最小对立对的挑战集(Warstadt等,2020(https://arxiv.org/html/2608.08283#bib.bib8);Isabelle等,2017(https://arxiv.org/html/2608.08283#bib.bib9))和自动扰动(Karpinska等,2022(https://arxiv.org/html/2608.08283#bib.bib24);Bennett等,2025(https://arxiv.org/html/2608.08283#bib.bib23)),我们的框架同时检验基于参考译文和无参考译文的指标,评估它们对引入错误的扰动的敏感性以及对可接受释义变异的容忍度。我们的贡献有三方面:(1) 一个用于评估该领域机器翻译指标的诊断框架;(2) 广泛使用的指标在文言文-英文翻译上的基准测试;(3) 对改进语言和文化差异显著场景下评估器的洞察。通过将机器翻译评估置于一个实际且具有历史意义的场景中,本研究旨在支持可靠的AI辅助学术翻译,同时加深我们对常用评估指标泛化能力的理解。
## 2 背景
文言文(wenyanwen)为基于大语言模型的语言理解、翻译及用于评估这些能力的指标提供了一个异常严苛且富有启示性的测试案例。作为东亚地区两千多年来治理、哲学、宗教、科学和文学的书面媒介,文言文承载了规模巨大且具有文化奠基意义的文本记录,其规模和历史重要性堪比欧洲的拉丁语(Sturgeon,2021(https://arxiv.org/html/2608.08283#bib.bib69))。然而,尽管具有核心地位,文言文对非专业人士来说仍然在很大程度上难以触及,这使得高质量翻译成为数字人文研究的关键使能技术。
从语言学角度看,文言文与大多数机器翻译系统和评估指标所基于的现代语言存在显著差异。它缺乏屈折形态、显式时态或一致标记,依赖高度灵活、以单音节为主的词汇,其句法和语义角色几乎完全由语境决定(Schonebaum等,2024(https://arxiv.org/html/2608.08283#bib.bib68))。意义常常是隐含的:论元通过普遍的零形回指被省略,时间和因果关系必须推断,短句往往允许多种合理解读(Schonebaum等,2024(https://arxiv.org/html/2608.08283#bib.bib68))。这些属性为翻译模型带来了系统性的失败模式:模型可能默认使用现代字义、无法消解多义词项,或在选择解读时未能充分整合更广泛的语篇和文化语境。这类错误可能产生流畅、形式上规范的英文译文,但在语义上却具有误导性。
因此,对评估而言,挑战是双重的:指标既应容忍合理的释义,又应对微妙的、依赖语境的解读错误保持敏感。为词汇重叠或通用语义相似度优化的指标可能忽视这些失败,使得扭曲历史含义的误译在常规自动评估下显得可接受。
尽管存在这些挑战,大语言模型已被用于翻译文言文(Sturgeon,2021(https://arxiv.org/html/2608.08283#bib.bib69)),但评估这些译文质量的研究相对较少。它们的翻译能力通常被归因于大规模预训练期间对历史和双语材料的偶然接触,以及模型从现代汉语和相关高语域文本中泛化的能力(Briakou等,2023(https://arxiv.org/html/2608.08283#bib.bib100);Chang等,2023(https://arxiv.org/html/2608.08283#bib.bib48))。越来越多的研究记录了大语言模型在文言文理解任务上的表现,包括句子理解、问答和历史知识探测(Zhou等,2023(https://arxiv.org/html/2608.08283#bib.bib153);Cao等,2024b(https://arxiv.org/html/2608.08283#bib.bib1);Li等,2024(https://arxiv.org/html/2608.08283#bib.bib125))。基于知识和检索增强的方法已被证明有助于注入历史语境、经典引用或经过整理的注疏,如TongGu和MITRA-zh等系统所示(Cao等,2024a(https://arxiv.org/html/2608.08283#bib.bib2);Nehrdich等,2023(https://arxiv.org/html/2608.08283#bib.bib3))。翻译专项研究报告称,大语言模型能够生成流畅且通常合理的文言文散文和诗歌英文译文,有时可与早期神经机器翻译系统媲美甚至超越(Wang等,2023(https://arxiv.org/html/2608.08283#bib.bib144);Chen等,2025(https://arxiv.org/html/2608.08283#bib.bib4);You等,2025(https://arxiv.org/html/2608.08283#bib.bib10))。与此同时,这些研究一致指出了重要的翻译失败:模型可能过度现代化词义、将不同的古典义项合并为一个当代释义,或未能利用更广泛的语篇和文体惯例来消解歧义。这些错误难以自动检测,这凸显了对可靠翻译质量评估的需求。
文言文翻译的评估相对来说仍未得到充分探索。大多数现有工作采用标准的机器翻译评估指标(如BLEU),或依赖专家人工判断的充分性、流畅性和文学质量等维度,尤其在诗歌翻译中(Chen等,2025(https://arxiv.org/html/2608.08283#bib.bib4))。少数研究已开始评估该领域中现代自动指标的表现。Nehrdich和Keutzer(2026(https://arxiv.org/html/2608.08283#bib.bib78))为佛教汉语构建了评估测试集。Bennett等(2025(https://arxiv.org/html/2608.08283#bib.bib23))在先秦(公元前221年之前)文言文文本上评估了基于字符串的和基于神经网络的翻译质量指标,发现面对人工扰动时,神经指标比BLEU或chrF更可靠。然而,这些指标在多大程度上能够检测学术解读所关心的自然发生的错误和可接受的变异,仍然不清楚。这一空白凸显了对细粒度、诊断性评估框架的需求——在受控的、具有语言学意义的扰动下检验指标行为,而非假设现代高资源场景中的表现会泛化到历史和文化的遥远语言上。
## 3 诊断框架
我们采用受DEMETR启发的受控元评估框架(Karpinska等,2022(https://arxiv.org/html/2608.08283#bib.bib24)),使用*最小对立对*来探测机器翻译评估指标。每对包含一个原始译文和一个最小编辑变体,两者恰好相差一个目标扰动。一个表现良好的指标应给原始译文打分高于扰动输出,从而使我们能够将分数差异直接归因于单一错误类型。在我们以文言文-英文翻译为案例的研究中,我们以两种方式扩展了先前的诊断设置:(i) 我们从专家对真实大语言模型输出的语文学检查中推导出扰动类别,并通过经过训练的标注者审核的半自动重写来实例化它们;(ii) 我们通过标准化分数差异的混合效应建模来量化指标敏感性,而不是针对灾难性基线(例如空输出)进行归一化——我们发现在该场景下后者不可靠。
### 3.1 数据来源
源文本选自中国哲学书电子化计划(CTP),这是一个经过整理的古代中国著作数字图书馆,涵盖多样的文体和历史时期(Sturgeon,2021(https://arxiv.org/html/2608.08283#bib.bib69))。CTP还提供由James Legge翻译的英文译文,我们将其视为高质量的人工参考译文,用于锚定评估和支持验证。虽然Legge的部分译文因解释性偏见和19世纪学术惯例而受到批评(MacKenzie,2024(https://arxiv.org/html/2608.08283#bib.bib155)),但他仍是文言文领域的基础性学者,其译文至今在学术研究中被广泛使用。为构建基线机器翻译,我们使用GPT-4o-mini将选定的CTP段落翻译成英文。这些输出作为所有最小对立对的起点。由于CTP文本及其译文在网上广泛可得,我们按照Chen等(2024(https://arxiv.org/html/2608.08283#bib.bib12))的方法进行了记忆化分析,以评估结果是否由训练数据重叠而非真正的翻译评估所驱动。如附录表6(https://arxiv.org/html/2608.08283#A3.T6)所示,我们几乎没有发现记忆化的证据。
| 类别 | 示例 | 描述 |
|---|---|---|
| **错误** | | |
| 现代汉语翻译 | Su Laoquan, twenty-seven. He began to feel passionate and read books. 苏老泉,二十七岁。他开始感到热情并阅读书籍。 | 文言文源文本先被翻译为英文,再被翻译为现代汉语。 |
| 省略宾语 | Zhang Gai said, “Please allow me to persuade the state of Lu to remain neutral.” Zhang Gai said, “Please allow me to persuade to remain neutral.” | 宾语the state of Lu被省略,导致不清楚被说服保持中立的对象是什么。 |
| 省略主语 | Zi Lu then said to the family, “Not to take office is not righteous.” Then said to the family, “Not to take office is not righteous.” | 主语Zi Lu被省略,导致不清楚说话者是谁。 |
| 错误的词汇翻译 | They all say, ‘We are wise; But who can distinguish the male and female crow?’ They all say, ‘We are wise; But who can distinguish the male and female pigeon?’ | Crow被误译为pigeon,替换了所指的实体。 |
| 代词替换 | The Master said, “There is Yung! He might occupy the place of a prince.” The Master said, “There is Yung! I might occupy the place of a prince.” | He被替换为I,引入了共指错误。 |
| 错误的时态 | I am not concerned that I am not known. I am not concerned that I was not known. | I am被改为I was,造成时态不一致。 |
| 头衔替换 | The duke of the state of Zhao conferred Wucheng on Lord Mengchang. The king of the state of Zhao conferred Wucheng on Lord Mengchang. | Duke被替换为king,错误表述了等级。 |
| 现代义项替换 | Fu Xie, looking very serious, turned him down: “If I did well and no one noticed, that is simply a matter of luck.” Fu Xie, looking very colorful, turned him down: “If I did well and no one noticed, that is simply a matter of luck.” | 古义(严肃/面色)被替换为今义(色彩丰富)。 |
| **可接受的变异** | | |
| 名称格式 | Zhong Yong: The Master said, “Perfect is the virtue which is according to the law!” ZhongYong: The Master said, “Perfect is the virtue which is according to the law!” | 罗马化名称中移除空格。 |
| 名称注释 | Zi Lu then said to the family, “Not to take office is not righteous.” Zi Lu(子路)then said to the family, “Not to take office is not righteous.” | 在括号内添加名称注释。 |
| 句子切分 | He, having grown old, still regrets his tardiness. You, young one, should think early. Having grown old, he still regrets his tardiness; you, young one, ought to think early. | 保持意义的切分和标点变化,伴有轻微释义。 |
表1:文言文翻译中的错误与可接受的变异相似文章
在英中语音到语音翻译中评估和保留词汇重音
一篇研究论文,提出了一种新的评估指标和重音感知系统,用于在英中语音到语音翻译中评估和保留词汇重音,实验表明在保持翻译质量的同时,其重音翻译能力显著优于现有方法。
关于 TranslateGemma-12b 基准测试文章的跟进:人工审核发现 71% 被自动指标评为合格的片段存在错误
对 TranslateGemma-12b 翻译结果的人工审核显示,71% 被自动指标评定为合格的片段实际上存在错误,凸显了仅依赖自动指标评估多语言翻译质量时的显著不足。
MetaHOPE:一种面向隐喻的评估框架,用于分析机器翻译和大语言模型翻译错误
MetaHOPE是一个面向隐喻的评估框架,用于分析机器翻译和大语言模型中的翻译错误。该论文提出了一种错误严重性感知的标注框架,并评估了GoogleMT、GPT5.4和Hunyuan-7b等模型在英汉隐喻翻译上的表现。
评估多语言句子嵌入用于翻译错误检测:一项英语-希腊语对比研究
本研究评估了多语言句子嵌入在区分正确英希翻译与错误翻译方面的表现,发现这些嵌入提供了有用的语义信号,但更适合集成到更广泛的翻译评估框架中。
苹果比苹果?迈向可比的跨语言语言模型评估
本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。