自我评价之言:大语言模型在机器翻译中的口头化置信度研究
摘要
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。
arXiv:2606.17234v1 公告类型:新发布
摘要:大语言模型(LLMs)在翻译领域的迅速普及要求对其自身输出置信度的可靠性进行深入研究。与许多生成任务不同,翻译错误和置信水平可以在不同粒度(token、单词或片段)上提供有价值的信息。基于内部信号(如预测概率)的无监督方法可能具有误导性,因为这类信号反映的是候选结果间的确定性而非正确性。此外,此类方法还需要访问这些内部信号。本文设计了五种口头化方法,用于提取LLM的每个token置信度,而无需上述缺陷,并将其可靠性与模型内部确定性信号进行了比较。我们通过两种对齐形式评估可靠性:细粒度错误检测和校准。在这两种形式中,内部方法和口头化方法表现相似,但结果因模型而异。有趣的是,我们发现内部方法与口头化方法之间几乎没有相关性。
查看缓存全文
缓存时间: 2026/06/17 05:39
# 自评之舌:论机器翻译中大语言模型的表述置信度 来源:https://arxiv.org/html/2606.17234 Ali Marashian¹ Alexis Palmer¹ Katharina von der Wense¹, ² ¹科罗拉多大学博尔德分校,美国 ²美因茨约翰内斯·古滕贝格大学,德国 通讯作者:ali\.marashian@colorado\.edu (https://arxiv.org/html/2606.17234v1/mailto:[email protected]) ###### 摘要 大语言模型(LLM)在翻译领域的迅速普及,要求我们对其自身输出的置信度可靠性进行深入研究。与许多生成任务不同,翻译中的错误和置信度可以在不同粒度层级(标记、单词或片段)上发挥作用。基于预测概率等内部信号的无监督方法可能具有误导性,因为它们反映的是替代项之间的确定性而非正确性。此外,这些方法需要访问此类内部信号。在本文中,我们设计了五种无需这些缺点的**表述性**(verbalized)方法来提取LLM的逐标记置信度,并将其可靠性与该模型内部确定性信号进行比较。我们使用两种对齐形式评估可靠性:细粒度错误检测和校准。对于这两种形式,内部方法和表述方法表现相似,但结果因模型而异。有趣的是,我们发现内部方法与表述方法之间几乎没有相关性。 自评之舌:论机器翻译中大语言模型的表述置信度 Ali Marashian¹ Alexis Palmer¹ Katharina von der Wense¹, ² ¹科罗拉多大学博尔德分校,美国 ²美因茨约翰内斯·古滕贝格大学,德国 通讯作者:ali\.marashian@colorado\.edu (https://arxiv.org/html/2606.17234v1/mailto:[email protected]) ## 1 引言 随着大语言模型(LLM)在机器翻译(MT)中越来越多地被使用(Kocmi 等,2024a (https://arxiv.org/html/2606.17234#bib.bib11),2025 (https://arxiv.org/html/2606.17234#bib.bib10)),判断其可靠性变得愈发重要。然而,已知LLM在机器翻译方面自我校准不佳:输出标记概率并不能很好地指示相应翻译的质量(Wu 等,2025 (https://arxiv.org/html/2606.17234#bib.bib39);Sarti 等,2025b (https://arxiv.org/html/2606.17234#bib.bib30))。 参见图注图1:内部置信度估计与表述置信度估计的示意图,使用标记概率作为内部信号,并通过提示获取单词级置信度;我们在实验中探索了这两种方法的更广泛变体。机器翻译校准的一个关键挑战在于,对于任何给定输入,并不只有一种翻译方式——例如,翻译同一概念时可以选择同义词,或者实现同一语义内容时可以选择多种句法实现。因此,如果模型在多个可能的标记之间不确定,我们不能直接将其视为模型对所选标记正确性的置信度。相反,它体现了模型的**不确定性**,因为一些可能有效的选项在概率上相互竞争。更一般地,这种在生成任务中的现象被称为**表面形式竞争**(Holtzman 等,2021 (https://arxiv.org/html/2606.17234#bib.bib8);Wiegreffe 等,2023 (https://arxiv.org/html/2606.17234#bib.bib38))。 在机器翻译领域,目前尚未充分探索的一点是,LLM具有独特的能力,可以通过生成估计置信度的标记来**表述**其确定程度(Tian 等,2023 (https://arxiv.org/html/2606.17234#bib.bib32))——即通过“说出”它们有多自信。因此,它们可以提供对输出正确性的估计,而不受表面形式竞争的限制。表述置信度还有一个优点:终端用户无需访问模型内部即可轻松获取。 在本文中,我们专注于LLM在机器翻译中的逐标记表述置信度,并探讨其与LLM翻译表现的一致性(参见图1 (https://arxiv.org/html/2606.17234#S1.F1))。由于没有单一的程序化方法来获取表述置信度,我们探索了五种技术。对于(通常考虑的)内部不确定性,我们采用两种不同的指标:标记级概率和熵。我们使用两种评估范式——细粒度二元错误检测和校准——比较了表述置信度和内部不确定性与真实情况的对齐程度。此外,我们检查了表述置信度与内部不确定性之间的相关性,以了解这两种高层次策略的相似程度。 我们的结果表明,根据模型的不同,在平均细粒度二元错误检测方面,表述置信度的表现与基于内部不确定性的方法相当或更优。在校准方面,我们发现表述方法的表现与模型概率相似,但落后于模型熵。此外,我们发现,在我们的设置中,表述置信度与内部不确定性之间没有显著相关性。 ## 2 相关工作 尽管**不确定性**(模型对特定输入的响应变异性)和**置信度**(模型认为特定输出正确的信念)是不同的概念,但二者密切相关,以至于在实践中不确定性经常被用来估计置信度(Liu 等,2025 (https://arxiv.org/html/2606.17234#bib.bib16))。因此,文献中的“校准”既可以指置信度(例如,由模型自身表述)与真实情况之间的对齐,也可以指确定性与真实情况之间的对齐。 为了估计模型的不确定性,一些方法利用外部知识,例如训练辅助模型来预测置信度分数(Mielke 等,2022 (https://arxiv.org/html/2606.17234#bib.bib21);Tsai 等,2024 (https://arxiv.org/html/2606.17234#bib.bib33);Ulmer 等,2024 (https://arxiv.org/html/2606.17234#bib.bib34)),或使用搜索引擎来检测错误(Gou 等,2023 (https://arxiv.org/html/2606.17234#bib.bib5))。其他方法则仅依赖模型本身。其中一些方法量化样本一致性,衡量多个模型响应之间的相似性(Tian 等,2023 (https://arxiv.org/html/2606.17234#bib.bib32);Manakul 等,2023 (https://arxiv.org/html/2606.17234#bib.bib20);Wang 和 Holmes,2024 (https://arxiv.org/html/2606.17234#bib.bib37))。许多工作使用内部信号。对于多项选择题问答或其他分类任务,可以聚合模型可能会用于每个选项的不同标记的概率(Han 等,2022 (https://arxiv.org/html/2606.17234#bib.bib7);Zhang 等,2024 (https://arxiv.org/html/2606.17234#bib.bib43);Wang 等,2024 (https://arxiv.org/html/2606.17234#bib.bib35);Lovering 等,2024 (https://arxiv.org/html/2606.17234#bib.bib17);Kumar 等,2024 (https://arxiv.org/html/2606.17234#bib.bib13))。 另一种仅利用模型本身的方法是让LLM表述其置信度。这通常用于问答任务(Lin 等,2022 (https://arxiv.org/html/2606.17234#bib.bib15);Kadavath 等,2022 (https://arxiv.org/html/2606.17234#bib.bib9);Tian 等,2023 (https://arxiv.org/html/2606.17234#bib.bib32);Yang 等,2024 (https://arxiv.org/html/2606.17234#bib.bib41);Xiong 等,2023 (https://arxiv.org/html/2606.17234#bib.bib40);Ni 等,2024 (https://arxiv.org/html/2606.17234#bib.bib23))。与问答不同,我们的工作聚焦于机器翻译。Kumar 等(2024 (https://arxiv.org/html/2606.17234#bib.bib13))并不考虑真实情况,而是关注模型内部不确定性与其表述置信度之间的关系,在问答任务中引入了“置信度-概率对齐”的概念。在我们的工作中,我们也考虑了表述方法与标记**熵**作为附加内部信号的相关性。 即使在LLM兴起之前,机器翻译校准也一直是文献中的热门话题(Ott 等,2018 (https://arxiv.org/html/2606.17234#bib.bib25);Kumar 和 Sarawagi,2019 (https://arxiv.org/html/2606.17234#bib.bib14);Wang 等,2020 (https://arxiv.org/html/2606.17234#bib.bib36);Lu 等,2022 (https://arxiv.org/html/2606.17234#bib.bib19))。机器翻译校准的一个关键挑战是将错误分配到输出的特定片段。之前的工作通过自动估计这些片段来解决这个问题,使用翻译编辑率(Snover 等,2006 (https://arxiv.org/html/2606.17234#bib.bib31))¹¹¹通过考虑从生成假设到黄金翻译所需的最小编辑次数:如果需要更改一个标记,则将其标记为错误。这些伪标签已被证明与真实标签不一致(Yang 等,2023 (https://arxiv.org/html/2606.17234#bib.bib42))。或者手动标注MT模型的输出(Fomicheva 等,2022 (https://arxiv.org/html/2606.17234#bib.bib4);Sarti 等,2022 (https://arxiv.org/html/2606.17234#bib.bib28);Yang 等,2023 (https://arxiv.org/html/2606.17234#bib.bib42);Sarti 等,2025a (https://arxiv.org/html/2606.17234#bib.bib29))。Dinh 和 Niehues(2025 (https://arxiv.org/html/2606.17234#bib.bib3))提高了某些标记的概率,以平衡机器翻译和其他生成任务中由表面形式竞争导致的信心不足。 与我们研究最相关的是 Sarti 等(2025b (https://arxiv.org/html/2606.17234#bib.bib30)),他们研究了不同模型不确定性信号的预测能力,以及这些信号与实际翻译错误片段的对齐情况。我们扩展了他们的工作,考察了LLM表述其置信度的能力,以及这些表述与真实错误片段和内部指标的对齐情况。 ## 3 实验设计 下面我们描述实验设计,包括数据集、模型、不同的模型置信度度量以及评估指标。 ### 3.1 数据集 我们的目标是研究不同模型置信度度量与真实错误标注的对齐情况。实验的基础是WMT2024通用机器翻译共享任务数据。我们考察从英语到中文、捷克语、印地语、日语和俄语的翻译。 为了评估模型置信度度量的可靠性,我们进一步利用了 Kocmi 等(2024a (https://arxiv.org/html/2606.17234#bib.bib11))的错误片段标注(ESA;Kocmi 等,2024b (https://arxiv.org/html/2606.17234#bib.bib12)),他们在9个语言对的多个模型输出中标记了错误。在ESA中,标注人员标记翻译中的错误片段,并将其分类为**轻微**或**严重**错误。表1 (https://arxiv.org/html/2606.17234#S3.T1) 展示了一个标注示例。 遵循先前的工作,我们不对两种错误类别进行区分:标记被视为正确或错误(Sarti 等,2025b (https://arxiv.org/html/2606.17234#bib.bib30))。对于每个翻译方向-模型对,我们有634个标注输出。我们将这些标注作为真实情况。作为开发集,我们为每个语言对随机选择100个英语句子及其相应翻译。这样每个语言对剩下534个测试句子。 #### 词语分割 我们提出的一些表述性方法需要提示模型对特定词语给出置信度。为此,我们自动将翻译文本分割成词语:对于捷克语、印地语和俄语,我们按空白分割;对于中文,我们使用 Jieba²²²https://github.com/fxsjy/jieba;对于日语,我们使用 Nagisa³³³https://github.com/taishi-i/nagisa。 ### 3.2 模型 Kocmi 等(2024a (https://arxiv.org/html/2606.17234#bib.bib11))使用ESA标注了28个系统的输出;包括共享任务提交、7个流行LLM以及其他在线系统。注意,并非所有系统和所有翻译方向都有标注。在可用的LLM中,我们选择了仅有的两个开源模型:Aya23(Aryabumi 等,2024 (https://arxiv.org/html/2606.17234#bib.bib1))和 Llama3-70B(Grattafiori 等,2024 (https://arxiv.org/html/2606.17234#bib.bib6))。我们采用与 Kocmi 等(2024a (https://arxiv.org/html/2606.17234#bib.bib11))相同的设置和提示,以便为标注输出获得相同的概率和熵。代码和结果可在 GitHub 上获取。⁴⁴⁴将在发表时提供链接。 ### 3.3 表述置信度度量 现在我们描述用于获取模型对其翻译的表述置信度的五种提议方法。遵循 Kumar 等(2024 (https://arxiv.org/html/2606.17234#bib.bib13))的做法,我们使用独立的提示进行翻译和置信度引出:我们不向LLM提供它在评估自己翻译的信息,以避免其判断中的偏差(Zheng 等,2023 (https://arxiv.org/html/2606.17234#bib.bib44))。我们将同会话自我评估留待未来工作。 1. **列表**:我们提示模型返回一个列表,其中包含翻译中它不自信的片段。如果一个标记属于任何返回的片段,我们将该标记标记为**不正确**。 2. **Word_Numeric**:我们提示模型将其对每个词语的置信度以一个 [0,1] 内的数字返回。我们在单独的提示中询问每个词语的分数;参见图1 (https://arxiv.org/html/2606.17234#S1.F1)。在我们的分析中,分配给一个词语的数值置信度分数将分配给其所有组成标记。如果一个标记包含两个词语的字母,我们将其视为第二个词语的一部分。 3. **Word_Likert**:我们不使用数字,而是要求LLM为每个词语分配定性标签。遵循 Kumar 等(2024 (https://arxiv.org/html/2606.17234#bib.bib13))在问答中的方法,我们考虑六个不同的标签:非常不确定、不确定、有点确定、中等确定、相当确定、非常确定。我们将这些标签转换为从0(非常不确定)到1(非常确定)的实际数字,步长为0.2。与Word_Numeric一样,分配给词语的分数将分配给其组成标记。Kumar 等(2024 (https://arxiv.org/html/2606.17234#bib.bib13))采用这种方法的动机是假设LLM可能更擅长使用定性描述符而非数值。 4. **Token_Numeric**:我们进一步探索增加粒度的影响,使用模型的标记器,将Word_Numeric方法应用于标记而非词语。⁵⁵⁵这需要使用模型的标记器,这限制了其实用性。此外,它比其他方法计算成本更高。我们在附录E.3 (https://arxiv.org/html/2606.17234#A5.SS3) 中报告了所有提示的成本。 5. **Token_Likert**:我们进一步尝试了Word_Likert的版本,但用于模型标记器提供的输出。 #### 提示 我们使用Aya23的英语到捷克语翻译的开发集以及相应的错误标注进行提示工程。附录A (https://arxiv.org/html/2606.17234#A1) 展示了所有表述置信度方法的提示。 #### 二值化 由于错误检测的真实标签是二元的,我们将连续方法的输出二值化,以衡量它们与真实情况的对齐程度。对于每个方法-模型对,遵循 Ni 等(2024 (https://arxiv.org/html/2606.17234#bib.bib23))的做法,我们在开发集上调优一个阈值。⁶⁶⁶我们还报告了基于测试集本身而非开发集确定的最优二值化阈值的结果,如附录C (https://arxiv.org/html/2606.17234#A3) 所示。# 自评之舌:论机器翻译中大语言模型的表述置信度 来源:https://arxiv.org/html/2606.17234 Ali Marashian¹ Alexis Palmer¹ Katharina von der Wense¹, ² ¹科罗拉多大学博尔德分校,美国 ²美因茨约翰内斯·古滕贝格大学,德国 通讯作者:ali\.marashian@colorado\.edu (https://arxiv.org/html/2606.17234v1/mailto:[email protected]) ###### 摘要 大语言模型(LLM)在机器翻译领域的迅速普及,要求我们对其自身输出的置信度可靠性进行深入研究。与许多生成任务不同,翻译中的错误和置信度可以在不同粒度层级(标记、单词或片段)上发挥作用。基于预测概率等内部信号的无监督方法可能具有误导性,因为它们反映的是替代项之间的确定性而非正确性。此外,这些方法需要访问此类内部信号。在本文中,我们设计了五种无需这些缺点的**表述性**(verbalized)方法来提取LLM的逐标记置信度,并将其可靠性与该模型内部确定性信号进行比较。我们使用两种对齐形式评估可靠性:细粒度错误检测和校准。对于这两种形式,内部方法和表述方法表现相似,但结果因模型而异。有趣的是,我们发现内部方法与表述方法之间几乎没有相关性。 自评之舌:论机器翻译中大语言模型的表述置信度 Ali Marashian¹ Alexis Palmer¹ Katharina von der Wense¹, ² ¹科罗拉多大学博尔德分校,美国 ²美因茨约翰内斯·古滕贝格大学,德国 通讯作者:ali\.marashian@colorado\.edu (https://arxiv.org/html/2606.17234v1/mailto:[email protected]) ## 1 引言 随着大语言模型(LLM)在机器翻译(MT)中越来越多地被使用(Kocmi 等,2024a (https://arxiv.org/html/2606.17234#bib.bib11),2025 (https://arxiv.org/html/2606.17234#bib.bib10)),判断其可靠性变得愈发重要。然而,已知LLM在机器翻译方面自我校准不佳:输出标记概率并不能很好地指示相应翻译的质量(Wu 等,2025 (https://arxiv.org/html/2606.17234#bib.bib39);Sarti 等,2025b (https://arxiv.org/html/2606.17234#bib.bib30))。 参见图注图1:内部置信度估计与表述置信度估计的示意图,使用标记概率作为内部信号,并通过提示获取单词级置信度;我们在实验中探索了这两种方法的更广泛变体。机器翻译校准的一个关键挑战在于,对于任何给定输入,并不只有一种翻译方式——例如,翻译同一概念时可以选择同义词,或者实现同一语义内容时可以选择多种句法实现。因此,如果模型在多个可能的标记之间不确定,我们不能直接将其视为模型对所选标记正确性的置信度。相反,它体现了模型的**不确定性**,因为一些可能有效的选项在概率上相互竞争。更一般地,这种在生成任务中的现象被称为**表面形式竞争**(Holtzman 等,2021 (https://arxiv.org/html/2606.17234#bib.bib8);Wiegreffe 等,2023 (https://arxiv.org/html/2606.17234#bib.bib38))。 在机器翻译领域,目前尚未充分探索的一点是,LLM具有独特的能力,可以通过生成估计置信度的标记来**表述**其确定程度(Tian 等,2023 (https://arxiv.org/html/2606.17234#bib.bib32))——即通过“说出”它们有多自信。因此,它们可以提供对输出正确性的估计,而不受表面形式竞争的限制。表述置信度还有一个优点:终端用户无需访问模型内部即可轻松获取。 在本文中,我们专注于LLM在机器翻译中的逐标记表述置信度,并探讨其与LLM翻译表现的一致性(参见图1 (https://arxiv.org/html/2606.17234#S1.F1))。由于没有单一的程序化方法来获取表述置信度,我们探索了五种技术。对于(通常考虑的)内部不确定性,我们采用两种不同的指标:标记级概率和熵。我们使用两种评估范式——细粒度二元错误检测和校准——比较了表述置信度和内部不确定性与真实情况的对齐程度。此外,我们检查了表述置信度与内部不确定性之间的相关性,以了解这两种高层次策略的相似程度。 我们的结果表明,根据模型的不同,在平均细粒度二元错误检测方面,表述置信度的表现与基于内部不确定性的方法相当或更优。在校准方面,我们发现表述方法的表现与模型概率相似,但落后于模型熵。此外,我们发现,在我们的设置中,表述置信度与内部不确定性之间没有显著相关性。 ## 2 相关工作 尽管**不确定性**(模型对特定输入的响应变异性)和**置信度**(模型认为特定输出正确的信念)是不同的概念,但二者密切相关,以至于在实践中不确定性经常被用来估计置信度(Liu 等,2025 (https://arxiv.org/html/2606.17234#bib.bib16))。因此,文献中的“校准”既可以指置信度(例如,由模型自身表述)与真实情况之间的对齐,也可以指确定性与真实情况之间的对齐。 为了估计模型的不确定性,一些方法利用外部知识,例如训练辅助模型来预测置信度分数(Mielke 等,2022 (https://arxiv.org/html/2606.17234#bib.bib21);Tsai 等,2024 (https://arxiv.org/html/2606.17234#bib.bib33);Ulmer 等,2024 (https://arxiv.org/html/2606.17234#bib.bib34)),或使用搜索引擎来检测错误(Gou 等,2023 (https://arxiv.org/html/2606.17234#bib.bib5))。其他方法则仅依赖模型本身。其中一些方法量化样本一致性,衡量多个模型响应之间的相似性(Tian 等,2023 (https://arxiv.org/html/2606.17234#bib.bib32);Manakul 等,2023 (https://arxiv.org/html/2606.17234#bib.bib20);Wang 和 Holmes,2024 (https://arxiv.org/html/2606.17234#bib.bib37))。许多工作使用内部信号。对于多项选择题问答或其他分类任务,可以聚合模型可能会用于每个选项的不同标记的概率(Han 等,2022 (https://arxiv.org/html/2606.17234#bib.bib7);Zhang 等,2024 (https://arxiv.org/html/2606.17234#bib.bib43);Wang 等,2024 (https://arxiv.org/html/2606.17234#bib.bib35);Lovering 等,2024 (https://arxiv.org/html/2606.17234#bib.bib17);Kumar 等,2024 (https://arxiv.org/html/2606.17234#bib.bib13))。 另一种仅利用模型本身的方法是让LLM表述其置信度。这通常用于问答任务(Lin 等,2022 (https://arxiv.org/html/2606.17234#bib.bib15);Kadavath 等,2022 (https://arxiv.org/html/2606.17234#bib.bib9);Tian 等,2023 (https://arxiv.org/html/2606.17234#bib.bib32);Yang 等,2024 (https://arxiv.org/html/2606.17234#bib.bib41);Xiong 等,2023 (https://arxiv.org/html/2606.17234#bib.bib40);Ni 等,2024 (https://arxiv.org/html/2606.17234#bib.bib23))。与问答不同,我们的工作聚焦于机器翻译。Kumar 等(2024 (https://arxiv.org/html/2606.17234#bib.bib13))并不考虑真实情况,而是关注模型内部不确定性与其表述置信度之间的关系,在问答任务中引入了“置信度-概率对齐”的概念。在我们的工作中,我们也考虑了表述方法与标记**熵**作为附加内部信号的相关性。 即使在LLM兴起之前,机器翻译校准也一直是文献中的热门话题(Ott 等,2018 (https://arxiv.org/html/2606.17234#bib.bib25);Kumar 和 Sarawagi,2019 (https://arxiv.org/html/2606.17234#bib.bib14);Wang 等,2020 (https://arxiv.org/html/2606.17234#bib.bib36);Lu 等,2022 (https://arxiv.org/html/2606.17234#bib.bib19))。机器翻译校准的一个关键挑战是将错误分配到输出的特定片段。之前的工作通过自动估计这些片段来解决这个问题,使用翻译编辑率(Snover 等,2006 (https://arxiv.org/html/2606.17234#bib.bib31))¹¹¹通过考虑从生成假设到黄金翻译所需的最小编辑次数:如果需要更改一个标记,则将其标记为错误。这些伪标签已被证明与真实标签不一致(Yang 等,2023 (https://arxiv.org/html/2606.17234#bib.bib42))。或者手动标注MT模型的输出(Fomicheva 等,2022 (https://arxiv.org/html/2606.17234#bib.bib4);Sarti 等,2022 (https://arxiv.org/html/2606.17234#bib.bib28);Yang 等,2023 (https://arxiv.org/html/2606.17234#bib.bib42);Sarti 等,2025a (https://arxiv.org/html/2606.17234#bib.bib29))。Dinh 和 Niehues(2025 (https://arxiv.org/html/2606.17234#bib.bib3))提高了某些标记的概率,以平衡机器翻译和其他生成任务中由表面形式竞争导致的信心不足。 与我们研究最相关的是 Sarti 等(2025b (https://arxiv.org/html/2606.17234#bib.bib30)),他们研究了不同模型不确定性信号的预测能力,以及这些信号与实际翻译错误片段的对齐情况。我们扩展了他们的工作,考察了LLM表述其置信度的能力,以及这些表述与真实错误片段和内部指标的对齐情况。 ## 3 实验设计 下面我们描述实验设计,包括数据集、模型、不同的模型置信度度量以及评估指标。 ### 3.1 数据集 我们的目标是研究不同模型置信度度量与真实错误标注的对齐情况。实验的基础是WMT2024通用机器翻译共享任务数据。我们考察从英语到中文、捷克语、印地语、日语和俄语的翻译。 为了评估模型置信度度量的可靠性,我们进一步利用了 Kocmi 等(2024a (https://arxiv.org/html/2606.17234#bib.bib11))的错误片段标注(ESA;Kocmi 等,2024b (https://arxiv.org/html/2606.17234#bib.bib12)),他们在9个语言对的多个模型输出中标记了错误。在ESA中,标注人员标记翻译中的错误片段,并将其分类为**轻微**或**严重**错误。表1 (https://arxiv.org/html/2606.17234#S3.T1) 展示了一个标注示例。 遵循先前的工作,我们不对两种错误类别进行区分:标记被视为正确或错误(Sarti 等,2025b (https://arxiv.org/html/2606.17234#bib.bib30))。对于每个翻译方向-模型对,我们有634个标注输出。我们将这些标注作为真实情况。作为开发集,我们为每个语言对随机选择100个英语句子及其相应翻译。这样每个语言对剩下534个测试句子。 #### 词语分割 我们提出的一些表述性方法需要提示模型对特定词语给出置信度。为此,我们自动将翻译文本分割成词语:对于捷克语、印地语和俄语,我们按空白分割;对于中文,我们使用 Jieba²²²https://github.com/fxsjy/jieba;对于日语,我们使用 Nagisa³³³https://github.com/taishi-i/nagisa。 ### 3.2 模型 Kocmi 等(2024a (https://arxiv.org/html/2606.17234#bib.bib11))使用ESA标注了28个系统的输出;包括共享任务提交、7个流行LLM以及其他在线系统。注意,并非所有系统和所有翻译方向都有标注。在可用的LLM中,我们选择了仅有的两个开源模型:Aya23(Aryabumi 等,2024 (https://arxiv.org/html/2606.17234#bib.bib1))和 Llama3-70B(Grattafiori 等,2024 (https://arxiv.org/html/2606.17234#bib.bib6))。我们采用与 Kocmi 等(2024a (https://arxiv.org/html/2606.17234#bib.bib11))相同的设置和提示,以便为标注输出获得相同的概率和熵。代码和结果可在 GitHub 上获取。⁴⁴⁴将在发表时提供链接。 ### 3.3 表述置信度度量 现在我们描述用于获取模型对其翻译的表述置信度的五种提议方法。遵循 Kumar 等(2024 (https://arxiv.org/html/2606.17234#bib.bib13))的做法,我们使用独立的提示进行翻译和置信度引出:我们不向LLM提供它在评估自己翻译的信息,以避免其判断中的偏差(Zheng 等,2023 (https://arxiv.org/html/2606.17234#bib.bib44))。我们将同会话自我评估留待未来工作。 1. **列表**:我们提示模型返回一个列表,其中包含翻译中它不自信的片段。如果一个标记属于任何返回的片段,我们将该标记标记为**不正确**。 2. **Word_Numeric**:我们提示模型将其对每个词语的置信度以一个 [0,1] 内的数字返回。我们在单独的提示中询问每个词语的分数;参见图1 (https://arxiv.org/html/2606.17234#S1.F1)。在我们的分析中,分配给一个词语的数值置信度分数将分配给其所有组成标记。如果一个标记包含两个词语的字母,我们将其视为第二个词语的一部分。 3. **Word_Likert**:我们不使用数字,而是要求LLM为每个词语分配定性标签。遵循 Kumar 等(2024 (https://arxiv.org/html/2606.17234#bib.bib13))在问答中的方法,我们考虑六个不同的标签:非常不确定、不确定、有点确定、中等确定、相当确定、非常确定。我们将这些标签转换为从0(非常不确定)到1(非常确定)的实际数字,步长为0.2。与Word_Numeric一样,分配给词语的分数将分配给其组成标记。Kumar 等(2024 (https://arxiv.org/html/2606.17234#bib.bib13))采用这种方法的动机是假设LLM可能更擅长使用定性描述符而非数值。 4. **Token_Numeric**:我们进一步探索增加粒度的影响,使用模型的标记器,将Word_Numeric方法应用于标记而非词语。⁵⁵⁵这需要使用模型的标记器,这限制了其实用性。此外,它比其他方法计算成本更高。我们在附录E.3 (https://arxiv.org/html/2606.17234#A5.SS3) 中报告了所有提示的成本。 5. **Token_Likert**:我们进一步尝试了Word_Likert的版本,但用于模型标记器提供的输出。 #### 提示 我们使用Aya23的英语到捷克语翻译的开发集以及相应的错误标注进行提示工程。附录A (https://arxiv.org/html/2606.17234#A1) 展示了所有表述置信度方法的提示。 #### 二值化 由于错误检测的真实标签是二元的,我们将连续方法的输出二值化,以衡量它们与真实情况的对齐程度。对于每个方法-模型对,遵循 Ni 等(2024 (https://arxiv.org/html/2606.17234#bib.bib23))的做法,我们在开发集上调优一个阈值。⁶⁶⁶我们还报告了基于测试集本身而非开发集确定的最优二值化阈值的结果,如附录C (https://arxiv.org/html/2606.17234#A3) 所示。
相似文章
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
通过探针目标微调,让LLM真正表达其自信程度。[研究]
这项研究提出了探针目标微调(LoRA)方法,使LLM能够口头表达其内部置信度,实现了对置信度输出的因果控制,并证明模型通常知道自己是正确还是错误,但未能表达出来。
大语言模型对其自身回应过度自信
本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。
使用跨语言对齐预测LLMs的多语言分类和翻译性能——英语足够吗?
论文比较了27种跨语言对齐(CLA)分数变体,用于预测LLM在多语言分类和翻译任务上的性能,并提出了一种基于PMI的翻译指标。研究发现,与英语的CLA对翻译质量的预测能力与源语言-目标语言CLA相当或更好,支持了LLMs使用英语作为内部枢轴语言的观点。
一致但校准不佳:评估LLM在自然语言风险沟通中的局限性
本文评估了九个LLM在自然语言中准确传达概率预测的能力,发现模型表现一致但校准不佳,尤其是在不确定性任务上。