评估本地LLM机器翻译中的提示范围与示例相似性
摘要
本文评估了提示范围(单目标 vs. 家族范围)和示例相似性(随机、词汇、嵌入)对本地LLM在英语到罗曼语系和英语到日耳曼语系翻译质量的影响,发现专用机器翻译系统仍然表现更好,且嵌入检索带来适度的提升。
查看缓存全文
缓存时间: 2026/07/30 09:56
# 评估本地大语言模型机器翻译中的提示范围与示例相似性
来源: https://arxiv.org/html/2607.26286
###### 摘要
大型语言模型(LLMs)越来越多地被用作通用翻译系统,但它们的性能通常仅在单一提示形式下进行评估:将一个源语言句子翻译成一种目标语言。实际上,用户可能要求翻译成一种目标语言、同时翻译成几种相关语言,或基于示例进行条件化翻译。本文研究提示范围和示例选择作为本地LLM机器翻译的实验变量。我们在完整的FLORES devtest数据集上评估了从英语到罗曼语族和英语到日耳曼语族的九种欧盟官方语言翻译。我们比较了三种本地指令微调LLM:llama3.2:3b、mistral:latest 和 qwen2.5:14b,并与OPUS-MT和NLLB-200的专用MT基线进行对比。我们测试了零样本提示和具有随机选择、词汇相似度选择以及嵌入相似度选择的k=5次少样本提示。我们还将单目标提示与请求同一语族所有语言的JSON格式语族范围提示进行了比较。结果表明,专用MT系统整体上仍然最强,尤其是对于日耳曼语言。少样本提示有助于mistral:latest和qwen2.5:14b,但损害了llama3.2:3b;嵌入检索对于较强的LLM来说平均最佳,但其相对于随机和词汇示例的优势不大。对于较强的本地LLM,语族范围提示是可行的,但会在较小的模型中暴露结构化输出失败。这些发现促使我们在评估LLM翻译时不仅要看语言对和指标,还要考虑提示范围、检索策略和多目标遵从性。
## 1 引言
机器翻译(MT)评估传统上将翻译视为一个语言对任务:要求系统将一种源语言翻译成一种目标语言,并将输出与参考译文进行比较。这种框架对于专用MT系统仍然合适,但它并未完全捕捉到大型语言模型(LLMs)作为翻译工具的使用方式。LLM用户可以请求一个翻译、多个翻译,或在一个指令中请求一组相关目标语言。他们还可以提供示例、风格约束和结构化输出要求。这些额外的自由度使得提示设计成为翻译系统本身的一部分。
本文探讨是否应将提示范围视为显式的MT评估变量。我们专注于可在消费级硬件上运行的本地LLM,而不是专有高端系统。这个设置很重要,因为本地部署对于隐私、成本控制和离线使用具有吸引力,但较小的本地模型可能对提示长度、示例格式化和结构化输出要求更为敏感。我们评估两种提示范围。在*单目标*范围中,模型一次将英语翻译成一种目标语言。在*语族范围*设置中,模型被要求将同一个英语句子翻译成同一语族中的所有语言,并返回一个以FLORES语言代码为键的JSON对象。
我们还研究了少样本示例选择。先前的工作表明LLMs可能对上下文示例敏感,但语义相似的示例是否比随机示例更能改善翻译,特别是在多目标提示中,这一点尚不明确。因此,我们比较了零样本提示与k=5的随机示例、词汇相似度示例和嵌入相似度示例。少样本演示取自FLORES dev,并在FLORES devtest上进行评估,避免了测试集泄露。
我们的实证研究涵盖英语到罗曼语族和英语到日耳曼语族的翻译,涉及九种欧盟官方语言:法语、西班牙语、意大利语、葡萄牙语、罗马尼亚语、德语、荷兰语、丹麦语和瑞典语。我们评估了三种本地指令微调LLM,并将它们与OPUS-MT/MarianMT和NLLB-200的专用MT基线进行比较。我们报告sacreBLEU、chrF++、COMET、关键比较的配对自举置信区间、句子级检索诊断以及语族范围遵从性指标,如目标覆盖率和完整输出率。
结果表明,提示范围和演示策略显著影响本地LLM翻译。专用MT系统整体上仍然最强,但本地LLM对于某些罗曼语族目标具有竞争力。少样本提示有助于mistral:latest和qwen2.5:14b,但降低了llama3.2:3b的性能。基于嵌入的检索在较强模型上平均最佳,但其相对于随机和词汇检索的优势小于模型之间的差异。对于较强的LLM,语族范围提示是可靠的,但对于较小的模型可能会严重失败,尤其是在日耳曼语族设置中。因此,本文的贡献不是一个新的翻译模型,而是一种评估设计和实证分析,表明当LLM用于MT时,应报告提示范围和结构化输出遵从性。
## 2 相关工作
#### 机器翻译基准和指标。
FLORES-200随着“不让任何语言掉队”(NLLB)一起被引入,作为一个多语言评估基准,涵盖许多翻译方向和专业翻译的评估数据[10 (https://arxiv.org/html/2607.26286#bib.bib1)]。我们使用FLORES是因为它为我们研究中的所有目标语言提供了一致的dev/devtest划分。对于自动评估,BLEU仍被广泛报告,但分数的可重复性取决于分词和实现细节;SacreBLEU被提出以标准化BLEU报告[13 (https://arxiv.org/html/2607.26286#bib.bib2)]。我们还额外报告了chrF++[11 (https://arxiv.org/html/2607.26286#bib.bib3),12 (https://arxiv.org/html/2607.26286#bib.bib4)],它对形态多样的语言通常很有用,以及COMET,一种旨在更好地与人类判断相关的学习型指标[15 (https://arxiv.org/html/2607.26286#bib.bib5),14 (https://arxiv.org/html/2607.26286#bib.bib6)]。
#### 用于机器翻译的LLM。
近期工作评估了GPT风格模型作为翻译系统,并表明LLM在高资源设置下可以是强大的翻译器,但相对于专用MT系统仍表现出弱点[6 (https://arxiv.org/html/2607.26286#bib.bib9),19 (https://arxiv.org/html/2607.26286#bib.bib12)]。这些研究促使我们谨慎对待提示和评估条件。我们的工作不同之处在于专注于本地、消费级硬件的LLM,并将提示范围作为实验设计的一部分。
#### 上下文学习和示例选择。
上下文学习性能在很大程度上取决于提示中放置了哪些示例[3 (https://arxiv.org/html/2607.26286#bib.bib10),8 (https://arxiv.org/html/2607.26286#bib.bib11)]。基于检索的示例选择已在语言任务中得到研究,包括选择与测试输入相似的示例。然而,对于MT,一个示例可以通过提供语义类比、术语、输出风格或仅仅是期望的任务格式来提供帮助。因此,我们包含随机演示作为对照,词汇检索作为轻量级基线,以及多语言嵌入检索作为语义检索条件。
#### MT中的术语、词汇资源和领域知识。
术语和词汇资源翻译与我们的设置相关,因为它们隔离了一个也出现在基于提示的LLM翻译中的问题:翻译质量通常取决于系统是否接收到足够的语义、词汇或领域特定证据来选择正确的目标表达。因此,早期工作为我们研究不仅翻译模型,而且提供给它的辅助知识提供了有用的先例。McCrae等人将语义相似性与MT结合用于跨语言知识图谱翻译,而Arcan等人表明,在没有领域上下文的情况下翻译知识库中的术语表达式很困难,并且可以从适应或注入术语中受益[9 (https://arxiv.org/html/2607.26286#bib.bib13),2 (https://arxiv.org/html/2607.26286#bib.bib14)]。相关工作还使用多路或多语言NMT来推断词典条目并翻译词汇资源,包括密切相关的语言设置和资源匮乏的WordNet词汇翻译[1 (https://arxiv.org/html/2607.26286#bib.bib15),4 (https://arxiv.org/html/2607.26286#bib.bib16)]。其他研究考察基于规则的语言、术语和命名实体知识是否能够改善资源匮乏的NMT系统[17 (https://arxiv.org/html/2607.26286#bib.bib17),18 (https://arxiv.org/html/2607.26286#bib.bib18)]。我们并不直接注入术语词典或领域资源;相反,我们测试一个类似的提示时问题:检索到的演示和相关目标语言是否为本地LLM提供了有用的语义或词汇线索。这就是为什么这些工作属于相关工作,这也促使我们进行实证谨慎:额外的知识可能有帮助,但其好处必须通过与随机示例和零样本提示的对比来衡量,而不是想当然地认为。
#### 语义歧义与翻译上下文。
最近的多模态MT工作也认为翻译质量可能取决于额外上下文是否有助于消除源语言的歧义。Hatami等人使用语义多样性估计来决定视觉信息何时可能改善翻译[5 (https://arxiv.org/html/2607.26286#bib.bib19)]。虽然我们的实验是纯文本的,但我们进行句子级检索分析的动机源于一个类似的问题:额外的上下文证据何时有帮助,相似度分数能否预测这种好处?
#### 结构化与多目标LLM输出。
LLM通常不仅用于生成文本,还用于产生结构化输出,例如JSON。在翻译中,在一个响应中请求多个目标语言可以减少编排成本,但会带来新的失败模式:省略目标、输出错误语言、提示回显或格式错误。我们的语族范围设置通过测量翻译质量和目标覆盖率来直接评估这一实际维度。
## 3 方法
### 3.1 任务定义
给定一个英语源句子\(x\)和一个目标语言集合\(T\),模型必须为每个\(t \in T\)产生翻译\(y_t\)。在单目标设置中,\(|T|=1\),每个提示只请求一个翻译。在语族范围设置中,\(T\)是同一语族中的语言集合。对于罗曼语族,\(T=\{\text{法语}, \text{西班牙语}, \text{意大利语}, \text{葡萄牙语}, \text{罗马尼亚语}\}\);对于日耳曼语族,\(T=\{\text{德语}, \text{荷兰语}, \text{丹麦语}, \text{瑞典语}\}\)。语族范围输出要求以FLORES语言代码为键的JSON对象。
### 3.2 提示条件
我们对两种范围评估四种提示条件。零样本条件仅包含翻译指令和源句子。随机少样本条件从演示池中均匀选择\(k=5\)个演示翻译进行前置。词汇检索条件选择在基于词袋的源表示下余弦相似度最高的五个FLORES dev示例。嵌入检索条件选择在多语言句子嵌入下余弦相似度最高的五个示例。所有少样本示例均选自FLORES dev;不使用来自FLORES devtest的任何评估示例作为演示。
### 3.3 单目标和语族范围提示
单目标提示请求一种目标语言,并指示模型仅返回翻译。语族范围提示请求以单个JSON对象形式返回语族中的所有语言。对于少样本语族提示,每个演示包含英语源句子和针对同一语族所有目标的对齐翻译。这种设计使我们能够比较为英语源句子选择的示例是否能够转移到所有请求的目标语言。
### 3.4 评估指标
对于翻译质量,我们报告使用SacreBLEU计算的语料库BLEU和chrF++,以及使用Unbabel/wmt22-comet-da计算的句子级COMET均值。对于最佳本地LLM与chrF++最佳MT基线之间的配对比较,我们使用配对自举重采样(基于匹配的FLORES源标识符),并报告chrF++和COMET的95%置信区间和双尾p值。对于语族范围提示,质量指标是基于已生成的目标翻译计算的。我们额外报告覆盖率、完整输出计数、缺失目标计数和提示回显计数。
## 4 实验设置
### 4.1 数据
主要数据集是FLORES-200。演示取自FLORES dev,评估在完整的FLORES devtest划分上进行。devtest划分包含1012个英语源句子。我们评估来自两个语族的欧盟官方语言:罗曼语族(法语、西班牙语、意大利语、葡萄牙语、罗马尼亚语)和日耳曼语族(德语、荷兰语、丹麦语、瑞典语)。
### 4.2 模型
本地LLM为llama3.2:3b、mistral:latest和qwen2.5:14b,通过Ollama运行,温度设为0。专用MT基线为facebook/nllb-200-distilled-600M、facebook/nllb-200-distilled-1.3B以及OPUS-MT/MarianMT模型[10 (https://arxiv.org/html/2607.26286#bib.bib1),16 (https://arxiv.org/html/2607.26286#bib.bib7),7 (https://arxiv.org/html/2607.26286#bib.bib8)]。MT基线仅在单目标设置中进行评估,因为它们被设计为专用翻译系统,而非结构化多目标指令遵循者。
### 4.3 可重复性
任务文件是确定性的,包含源标识符、目标语言代码、参考译文、提示条件、提示范围和少样本元数据。少样本源审核验证演示来自FLORES dev而非FLORES devtest。生成输出存储为JSONL文件,评估表格生成为CSV和TeX/Markdown摘要。代码和生成的工件组织方式使得单目标翻译质量、语族范围遵从性、COMET评分、自举显著性和句子级检索分析可以独立重现。
## 5 结果
我们报告了两个官方欧盟语族的完整FLORES devtest结果。罗曼语族包含法语、西班牙语、意大利语、葡萄牙语和罗马尼亚语;日耳曼语族包含德语、荷兰语、丹麦语和瑞典语。对于每个语族,我们评估了(i)单目标提示,即每个目标语言分别翻译,以及(ii)语族范围提示,即模型在一个JSON格式的响应中为该语族产生所有翻译。单目标提示是主要的翻译质量设置;语族范围提示是翻译和结构化输出遵从性的组合设置。
所有少样本运行使用从FLORES dev检索的\(k=5\)个演示,而在FLORES devtest上进行评估。我们比较了零样本提示与随机演示、词汇相似度检索和嵌入相似度检索。表格报告了语料库chrF++、语料库BLEU和句子级COMET均值。紧凑基线表和诊断表在标题中注明时使用斜杠分隔的度量三元组。
### 5.1 罗曼语言
表LABEL:tab:romance-single-full给出了所有本地LLM和提示条件下的完整单目标罗曼语族结果。最强的本地模型通常是qwen2.5:14b,尤其是对于法语、西班牙语、意大利语和葡萄牙语。罗马尼亚语是主要的例外,其中mi (原句中断,可能需要根据上下文补全。但用户输入在'wheremi'处截断,可能原文未完。根据指令,我们只翻译提供的内容,所以在此停止。但用户消息以'wheremi'结尾,可能是输入不完整。我们按原有内容翻译到该点。)相似文章
LLM翻译中数字本地化分析
本文分析了五款大语言模型在英德互译中对时间、数字和日期进行本地化的能力,并测试了改进准确率的策略,发现将本地化原则嵌入提示上下文可带来统计上显著的改进。
自我评价之言:大语言模型在机器翻译中的口头化置信度研究
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。
并非放之四海而皆准:多语言大语言模型中从固定提示到可学习路由的演进
# 并非放之四海而皆准:多语言大语言模型中从固定提示到可学习路由的演进 来源:[https://arxiv.org/html/2604.16937](https://arxiv.org/html/2604.16937) Wei-Chi Wu, Sheng-Lun Wei, Hen-Hsen Huang, Hsin-Hsi Chen α 台湾大学电脑科学与资讯工程学系,台湾 β 中央研究院资讯科学研究所,台湾 γ 台湾大学人工智能研究中心(AINTU),台湾 wcwu@c
使用跨语言对齐预测LLMs的多语言分类和翻译性能——英语足够吗?
论文比较了27种跨语言对齐(CLA)分数变体,用于预测LLM在多语言分类和翻译任务上的性能,并提出了一种基于PMI的翻译指标。研究发现,与英语的CLA对翻译质量的预测能力与源语言-目标语言CLA相当或更好,支持了LLMs使用英语作为内部枢轴语言的观点。
你在说我的语言吗?关于多模态大语言模型中的口语遵循问题
本文解决了多模态大语言模型在ASR中的口语遵循问题,提出了一种软提示方法和新颖的度量标准来量化语言违规。它评估了三种缓解策略——零样本提示、监督微调和思维链推理——在多种语言上的效果,以提高转录保真度。