TQLite:多LLM评审团引导的蒸馏,用于实时MQM翻译质量评估
摘要
介绍了TQLite,一种利用多LRM评审团训练小型语言模型进行基于MQM的实时翻译质量评估的蒸馏框架,其性能远超现成的SLM,同时保持成本效益。
arXiv:2608.02975v1 公告类型:新
摘要:大语言模型(LLM)在基于MQM的翻译质量(TQ)评估中展现出了令人瞩目的性能,而近期大型推理模型(LRM)的进展有望带来更大的提升。然而,LLM和LRM在大规模部署时计算成本高昂,而小型语言模型(SLM)虽然效率高得多,却难以胜任评估任务所需的复杂推理。在这项工作中,我们进行了一项广泛的实证研究,在多种TQ评估设置下对SLM、LLM和LRM进行了基准测试,提供了对当前格局的全面视角,并确立了最佳实践。为解决可扩展性挑战,我们提出了TQLite,一种新颖的蒸馏框架,使SLM能够接近基于LRM的最佳评估器的MQM评估性能。我们的方法利用多LRM评审团,通过实用的数据整理技术和跨多种模型评审小组的评估响应聚合,生成高质量合成训练数据。结果表明,通过TQLite训练的SLM实现了强大的MQM评估性能,远超标准SLM的现成评估能力,为基于LLM和LRM的评估器提供了一种可扩展且经济高效的替代方案。
查看缓存全文
缓存时间: 2026/08/05 07:42
# TQLite:面向实时 MQM 翻译质量评估的多 LLM 陪审团引导蒸馏 来源:https://arxiv.org/html/2608.02975 ###### 摘要 大型语言模型(LLMs)在基于 MQM 的翻译质量(TQ)评估中表现出了令人印象深刻的性能,而最近大型推理模型(LRMs)的进展有望带来更大的提升。然而,LLMs 和 LRMs 在大规模部署时计算成本高昂,而小语言模型(SLMs)——*尽管效率要高得多*——却在评估任务所需的复杂推理上力不从心。在这项工作中,我们进行了广泛的实证研究,在多种 TQ 评估设置下对 SLM、LLM 和 LRM 进行基准测试,全面审视当前格局并确立最佳实践。为了应对可扩展性挑战,我们提出了 TQLite,一种新颖的蒸馏框架,使 SLM 能够接近基于最佳 LRM 的评估器的 MQM 评估性能。我们的方法利用多 LRM 陪审团,通过实用的数据整理技术和跨多种模型面板的评估响应聚合,生成高质量合成训练数据。我们的结果表明,通过 TQLite 训练的 SLM 取得了强大的 MQM 评估性能,远超标准 SLM 的开箱即用评估能力,为基于 LLM 和 LRM 的评估器提供了一种可扩展且成本效益高的替代方案。 ## 1 引言 大型语言模型(LLMs)的最新进展使其能够准确解决各种任务(Brown et al. (2020 (https://arxiv.org/html/2608.02975#bib.bib4)))。然而,与之前几代深度神经网络相比,LLM 的广泛范围使其更难评估。LLM 不仅能解决许多任务,而且它们解决的任务往往是开放式的——*任何给定问题都可能有许多“正确”答案*。在这种情形下,传统的文本生成评估指标效果较差(Papineni et al. (2002 (https://arxiv.org/html/2608.02975#bib.bib41)); Banerjee and Lavie (2005 (https://arxiv.org/html/2608.02975#bib.bib3))),且与人类判断的相关性往往不佳(Stiennon et al. (2020 (https://arxiv.org/html/2608.02975#bib.bib47))),这推动了无参考和开放式评估技术(如 LLM-as-a-Judge)的普及(Zheng et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib59)))。 见图 1:我们用于将多 LRM 陪审团蒸馏到 SLM 中,以实现高效 TQ 评估的 TQLite 框架。 LLM-as-a-Judge 的概念很简单:*我们只需提示一个强大的 LLM 去评估一段文本*。通常,提供给 LLM 评估器的提示的结构和内容类似于通常提供给人类评估者的指令(Chiang and Lee (2023 (https://arxiv.org/html/2608.02975#bib.bib5)));例如,评估标准的描述、带有详细评估说明的评分标准、返回分数的尺度或格式等。LLM-as-a-Judge 已被证明与人类对生成质量的评估具有良好相关性(Li et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib33))),因此作为 LLM 的评估技术被广泛采用(Gu et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib16)))。 LLM-as-a-Judge 方法最近已被应用于机器翻译(MT)研究。早先用于评估翻译质量(TQ)的学习式指标探索了在人类评估者标注上微调较小语言模型,以在片段(segment)和跨度(span)级别检测翻译错误(Sellam et al. (2020 (https://arxiv.org/html/2608.02975#bib.bib45)); Rei et al. (2022a (https://arxiv.org/html/2608.02975#bib.bib42)); Guerreiro et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib17)))。如今,根据 WMT 指标任务上的表现来判断,最好的翻译质量评估指标主要是基于 LLM 的(Freitag et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib13)))。已有多种技术被提出,将 LLM-as-a-Judge 应用于 TQ 评估,既可采用直接评估方法(Kocmi and Federmann (2023b (https://arxiv.org/html/2608.02975#bib.bib29))),也可采用多维质量指标(MQM)框架(Kocmi and Federmann (2023a (https://arxiv.org/html/2608.02975#bib.bib28)); Fernandes et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib11)))。当使用基于 MQM 的评分框架进行提示时,LLM 评估器在系统级 TQ 评估上提供了最先进的结果(Kocmi and Federmann (2023a (https://arxiv.org/html/2608.02975#bib.bib28)))。在片段级,这类模型的性能自然落后于最好的学习式指标(Juraska et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib23))),但这一差距可以通过额外微调来弥补(Fernandes et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib11)))。使用较小的开源模型评估 TQ 的可能性已被部分探索(Lu et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib36))),但几乎所有最先进的 TQ LLM 评估器都基于大型闭源模型(例如 GPT-4(Achiam et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib1)))或 PaLM(Anil et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib2)))),*这使得评估过程既昂贵又难以复现*。尽管目前依赖于闭源模型,这些趋势很可能在 LLM 研究的动态环境中被颠覆。鉴于评估与推理之间的密切关系,大型推理模型(LRMs)——*包括闭源(Jaech et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib22)))和开源(Guo et al. (2025 (https://arxiv.org/html/2608.02975#bib.bib18)); Team et al. (2025b (https://arxiv.org/html/2608.02975#bib.bib51)))变体*——有可能提升 TQ 评估能力,尽管代价是更大的计算开销(Feng et al. (2025 (https://arxiv.org/html/2608.02975#bib.bib10)))。此外,现在已有更高质量的开源 LLM(Team et al. (2025a (https://arxiv.org/html/2608.02975#bib.bib50)); Yang et al. (2025 (https://arxiv.org/html/2608.02975#bib.bib57))),它们可能在 TQ 评估方面与闭源模型相媲美。 我们的贡献。我们提供了一个全面且实用的现代 LLM TQ 评估基准,覆盖了各种模式(即推理型与标准型)、规模和开放程度的模型。这样的分析清晰地描绘了当前 LLM-as-a-Judge 在 TQ 上的能力。基于这一分析的结果,我们着重在三个关键领域改进现有能力: - 1. 成本。 - 2. 性能。 - 3. 开放性。 前沿级 LRM 和 LLM 已经具备令人印象深刻的评估能力,但我们发现当前开放模型——*尤其是小语言模型(SLMs)*——落后于顶级模型的 TQ 评估能力。为了解决这个问题,我们开发了“TQLite”,一种新颖的知识蒸馏框架,它使用顶级 LRM 和 LLM 组成的陪审团,通过多数投票构建高质量合成训练数据集用于 TQ 评估。我们表明,TQLite 可用于创建开源的、高效的、且在系统和片段级别都能与最先进指标竞争的基于 SLM 的 TQ 评估器。 ## 2 相关工作 推理。尽管早期 LLM 因其糟糕的推理能力而受到批评(Brown et al. (2020 (https://arxiv.org/html/2608.02975#bib.bib4))),但后来关于思维链(CoT)提示的工作发现,当提示 LLM 以少样本(Wei et al. (2022 (https://arxiv.org/html/2608.02975#bib.bib55)))或零样本(Kojima et al. (2022 (https://arxiv.org/html/2608.02975#bib.bib31)))方式解释其输出时,它们可以很好地推理。这一发现使 CoT 提示成为 LLM 的主流方法,并且已经提出了许多变体(Yu et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib58)))。LRM 的最新进展与 CoT 提示的工作有关,因为 LRM 的工作方式是在产生最终输出之前输出一个长 CoT(Guo et al. (2025 (https://arxiv.org/html/2608.02975#bib.bib18)); Team et al. (2025b (https://arxiv.org/html/2608.02975#bib.bib51)))。然而,LRM 并非通过提示来激发这种行为,而是通过大规模强化学习和可验证奖励来训练以利用其长 CoT——*通常称为“推理轨迹”或“长 CoT”*(Lambert et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib32)); Shao et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib46)))。LRM 的长 CoT 比标准 CoT 长得多,并且通常可以通过一个推理 token 来控制,以确定为解决问题投入多少努力(即低、中或高)。在更高的推理努力下,模型会生成更长的 CoT,从而在特定补全上投入更多的推理时计算。 LLM-as-a-Judge。使用 LLM 进行评估的想法由 Zheng et al. (https://arxiv.org/html/2608.02975#bib.bib59) 推广,他们对同一小组早期博客文章中使用的 LLM-as-a-Judge 方法进行了正式研究(Team (2023 (https://arxiv.org/html/2608.02975#bib.bib52)))。LLM-as-a-Judge 的正式提出引发了一系列相关研究。GPTScore(Fu et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib15)))基于多个 LLM 评估文本生成任务的能力对其进行了基准测试。AlpacaEval(Li et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib33)))使用 LLM 评估器为指令遵循型 LLM 创建自动化排行榜。G-Eval(Liu et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib34)))引入了一个评估框架,其中 LLM 使用详细的评分标准和思维链(CoT)提示来评估文本质量。Chiang and Lee (https://arxiv.org/html/2608.02975#bib.bib5) 和 Wang et al. (https://arxiv.org/html/2608.02975#bib.bib53) 探讨了 LLM-as-a-Judge 与人类评估者之间的一致性水平。Wang et al. (https://arxiv.org/html/2608.02975#bib.bib54) 分析了 LLM 评估器中的偏差,并提出了潜在的校准方法。Prometheus(Kim et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib25),2024 (https://arxiv.org/html/2608.02975#bib.bib26)))探索了微调开源模型以匹配前沿级 LLM 的评估能力。 用于 TQ 评估的 LLM。Gemba(Kocmi and Federmann (2023b (https://arxiv.org/html/2608.02975#bib.bib29)))开创了使用 LLM 进行 TQ 评估的先河,后来被 Gemba-MQM(Kocmi and Federmann (2023a (https://arxiv.org/html/2608.02975#bib.bib28)))扩展为使用基于 MQM 的评估框架。EAPrompt(Lu et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib37)))旨在通过探索多种提示策略(包括 CoT 提示)来提高 LLM 评估器在 TQ 片段级上的性能。MQM-APE(Lu et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib36)))通过使用 LLM 生成的后期编辑来识别最相关的错误跨度,扩展了 Gemba-MQM 框架。AutoMQM(Fernandes et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib11)))使用 MQM 框架对各种开箱即用和微调的 LLM 在 TQ 评估上进行了基准测试。 SLM 与蒸馏。LLM 的扩展定律表明,LLM 的性能随规模增大而平滑提升(Kaplan et al. (2020 (https://arxiv.org/html/2608.02975#bib.bib24)))。然而,标准的 Chinchilla 最优扩展定律(Hoffmann et al. (2022 (https://arxiv.org/html/2608.02975#bib.bib20)))只考虑训练成本,忽略了更大模型的长期推理成本。高昂的推理成本增加了人们对创建高质量 SLM 的兴趣,这类模型通常通过以下两种方式开发: - 1. 与更大的 LLM 并行开发——*目的是实现更快、更低成本的实验*——作为多 LLM 模型家族的一部分;例如 Llama-4-Scout(Meta (2025 (https://arxiv.org/html/2608.02975#bib.bib39)))或 Gemma-3-4b-it(Team et al. (2025a (https://arxiv.org/html/2608.02975#bib.bib50)))。 - 2. 将更大教师模型的知识蒸馏到更高效的学生模型中;例如 DeepSeek-R1-Distill(Guo et al. (2025 (https://arxiv.org/html/2608.02975#bib.bib18)))。 知识蒸馏(Hinton et al. (2015 (https://arxiv.org/html/2608.02975#bib.bib19)))的主题已在 LLM 和 SLM 中得到了广泛探索(Xu et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib56)))。 ## 3 预备知识 数据。我们的大部分实验在 WMT22 指标任务的测试集上进行(Freitag et al. (2022 (https://arxiv.org/html/2608.02975#bib.bib14)))。该测试集包含三个语言对:zh-en、en-de 和 en-ru。对于每个语言对,该数据集包含约 2,000 个句子,这些句子从四个可能的领域采样:新闻、社交、对话和电子商务。这些句子的翻译由 54 个不同的人类和机器翻译系统生成,主要取自 WMT22 通用 MT 任务(Kocmi et al. (2022 (https://arxiv.org/html/2608.02975#bib.bib27)))。总的来说,该数据集包含跨三个语言对需要评估的 106,758 个片段。 MQM 框架。如 Freitag et al. (2021 (https://arxiv.org/html/2608.02975#bib.bib12)) 所述,我们使用人类标注的 MQM 分数(Lommel et al. (2014 (https://arxiv.org/html/2608.02975#bib.bib35)))作为评估 TQ 的金标准,这些分数可用于 WMT22 指标测试集。在 MQM 框架中,人类被要求标记翻译片段中的个别错误跨度,并为每个错误跨度标注类别和严重级别(即 critical、major 或 minor)。最终 MQM 分数不是要求标注者直接提供质量分数,而是从这些错误跨度中自动推导出来。有趣的是,许多基于 LLM 的 TQ 评估器也采用 MQM 框架,要求模型识别错误跨度并从这些跨度推导最终分数(Kocmi and Federmann (2023a (https://arxiv.org/html/2608.02975#bib.bib28)); Fernandes et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib11)))。 指标。我们重点关注衡量 TQ 评估性能的两个关键指标: - 系统级成对准确率(Kocmi et al. (2021 (https://arxiv.org/html/2608.02975#bib.bib30)))。 - 带平局校准的片段级成对准确率,即 acc⋆(Deutsch et al. (2023 (https://arxiv.org/html/2608.02975#bib.bib8)))。 我们使用 WMT22 的官方脚本(https://github.com/google-research/mt-metrics-eval),并且为避免已知的对小样本量和离群值的敏感性,我们不在系统和片段级别报告基于相关性的指标(Mathur et al. (2020 (https://arxiv.org/html/2608.02975#bib.bib38)))。我们特意采用 Gemba-MQM 仓库(https://github.com/MicrosoftTranslator/GEMBA)中的评估代码,以确保完全一致。 基线。我们将我们的 TQ 评估模型与各种基线指标进行比较,并力求在分析中涵盖广泛的方法论。我们考虑了基于参考的学习式指标,如 MetricX(Juraska et al. (2024 (https://arxiv.org/html/2608.02975#bib.bib23)))、COMET-22(Rei et al. (2022a (https://arxiv.org/html/2608.02975#bib.bib42)))和 BLEURT(Sellam et al. (2020 (https://arxiv.org/html/2608.02975#bib.bib45)))。此外,还包括学习式无参考指标,如 COMET-kiwi(Rei et al. (2022b (https://arxiv.org/html/2608.02975#bib.bib44)))和 COMET-QE(Rei et al. (2021 (https://arxiv.org/html/2608.02975#bib.bib43))),以及先于 Gemba-MQM 的基于 LLM 的 TQ 评估指标,如 Gemba-DA(Kocmi and Federmann, 2023b)。
相似文章
CompactQE: 通过小型开放权重LLMs实现可解释的翻译质量评估
本文证明,小型开放权重LLMs(参数小于30B)能够实现具有竞争力的可解释翻译质量评估,包括MQM错误标注和修正,与更大的专有模型相媲美,同时保护数据隐私。
QIMMA قِمّة ⛰: 以质量为核心的阿拉伯语 LLM 排行榜
QIMMA 是由 TII UAE 推出的全新以质量为核心的阿拉伯语 LLM 排行榜,它在评估前对基准测试进行验证,以确保性能测量的准确性。该排行榜通过严格的多阶段验证流程,解决了现有阿拉伯语 NLP 基准测试中存在的系统性质量问题。
PoQ-Judge:一种面向去中心化LLM推理中成本感知质量证明的多架构评估框架
介绍了PoQ-Judge,一种采用无参考评判模型(TextCNN、MiniLM、DeBERTa)的多架构评估框架,用于去中心化LLM推理中的成本感知质量证明,实现了与地面真值代理的高相关性,同时消除了对参考答案的需求。
一个MUD能否评估LLM?一个99美元的概念验证
CrucibleBench将语言模型置于一个持久化的MUD环境中,通过50轮游戏和隐藏的社交目标来评估智能体行为。包含13个模型的概念验证发布显示,使用LLM评判组件可显著改变排行榜顺序,这凸显了在评判消融分析中报告排名稳定性的必要性。
SQuaD-SQL: 利用LLM引导的知识蒸馏实现小型语言模型的高效文本到SQL
SQuaD-SQL使用LLM引导的知识蒸馏训练小型语言模型进行Text-to-SQL,在WikiSQL上达到86.9%的执行准确率,同时提供更快的推理速度和更低的内存占用。