迈向端到端多语言隐喻处理:整合检测、翻译与评估

arXiv cs.CL 论文

摘要

一份博士研究计划,概述了用于多语言隐喻处理的统一端到端框架,整合隐喻检测、翻译评估以及利用语言学理论和大语言模型的联合建模。

arXiv:2608.04260v1 公告类型:新增 摘要:隐喻性语言仍然是多语言自然语言处理中的一大挑战,因为成功的理解和翻译需要超越字面词汇意义的推理。现有研究大多将隐喻检测、机器翻译和翻译评估作为独立任务来研究,而很少有工作探索如何将这些组件整合到一个统一的计算框架中。本博士研究计划旨在开发一个端到端的多语言隐喻处理框架,包含三个互补的研究方向:(1)跨语言的稳健隐喻检测;(2)面向隐喻的翻译评估,既用于人工评估,也用于自动质量估计;(3)将隐喻检测与翻译评估相连接的联合建模。拟议研究将结合语言学理论与大语言模型的最新进展,开发新的数据集、标注方法、评估基准以及面向隐喻感知机器翻译的自动评估方法。预期成果是一个统一框架,能够改善多语言NLP系统在处理比喻性语言时的开发与评估。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:45

# 面向端到端多语言隐喻处理:整合检测、翻译与评估
Source: https://arxiv.org/html/2608.04260
Jiahui Liang1, Lifeng Han2,3 1Centre for Linguistics, Humanities, Leiden University, NL 2LIACS, Leiden University, NL 3BDS, Leiden University Medical Centre, NL j\.h\.l\.jiahui@hum\.leidenuniv\.nl \| l\.han@lumc\.nl

###### 摘要

隐喻性语言仍然是多语言自然语言处理面临的一项重大挑战,因为成功的解释与翻译需要对超越字面词汇意义的推理。现有研究大多将隐喻检测、机器翻译和翻译评估视为相互独立的任务,而很少有工作探索如何将这些组件整合到一个统一的计算框架中。本博士研究计划旨在开发一个用于多语言隐喻处理的端到端框架,包含三个互补的研究方向:(1) 跨语言的稳健隐喻检测;(2) 面向隐喻的翻译评估,同时服务于人工评估和自动质量估计;(3) 将隐喻检测与翻译评估相结合的联合建模。拟议研究将把语言学理论与大语言模型的最新进展相结合,开发新的数据集、标注方法、评估基准以及面向隐喻感知机器翻译的自动评估方法。预期成果是一个统一框架,能够在处理比喻性语言时改进多语言 NLP 系统的开发与评估。

面向端到端多语言隐喻处理:整合检测、翻译与评估

Jiahui Liang1, Lifeng Han2,31Centre for Linguistics, Humanities, Leiden University, NL2LIACS, Leiden University, NL3BDS, Leiden University Medical Centre, NLj\.h\.l\.jiahui@hum\.leidenuniv\.nl \| l\.han@lumc\.nl

## 1 引言

隐喻在我们的日常使用中无处不在,并在人类认知与交流中扮演核心角色。隐喻不仅仅是用于文体效果的一种修辞手法,更被视为人们概念化并理解世界的基本机制Lakoff and Johnson \(1980 (https://arxiv.org/html/2608.04260#bib.bib125)\); Kövecses \(2010 (https://arxiv.org/html/2608.04260#bib.bib99)\)。具体而言,这一过程通过从具体源域到抽象目标域的映射来实现Lakoff and Johnson \(1980 (https://arxiv.org/html/2608.04260#bib.bib125)\)。例如,在典型的概念隐喻“时间是金钱”中,时间被理解为一种宝贵的资源。

这些概念映射植根于具身化的身体与文化经验Lakoff and Johnson \(1980 (https://arxiv.org/html/2608.04260#bib.bib125)\); Gibbs \(2008 (https://arxiv.org/html/2608.04260#bib.bib21)\),而它们的解释往往依赖于上下文信息Li and Chen \(2025a (https://arxiv.org/html/2608.04260#bib.bib31)\)和共享的文化知识Lakoff and Johnson \(1980 (https://arxiv.org/html/2608.04260#bib.bib125)\)。由于具身经验和概念化方式在不同个体与文化之间可能存在差异Kövecses \(2010 (https://arxiv.org/html/2608.04260#bib.bib99)\),隐喻意义通常是非组合性的,无法仅从单个词语的字面意义推导出来。相反,它需要整合语言、概念、语境和文化信息。这些挑战促使人们日益关注计算隐喻处理研究,包括隐喻检测、解释、生成和翻译Rai and Chakraverty \(2020 (https://arxiv.org/html/2608.04260#bib.bib26)\); Geet al\.\(2023 (https://arxiv.org/html/2608.04260#bib.bib25)\)。在这些任务中,隐喻检测和隐喻翻译在很大程度上发展为独立的研究方向Lianget al\.\(2025 (https://arxiv.org/html/2608.04260#bib.bib20)\); Liang and Han \(2026 (https://arxiv.org/html/2608.04260#bib.bib1)\)。隐喻检测旨在区分隐喻性语言与字面语言,是许多下游应用的前提条件Shutova \(2010 (https://arxiv.org/html/2608.04260#bib.bib24)\),而隐喻翻译则侧重于在跨语言传递隐喻意义的同时兼顾语言与文化差异Karakantaet al\.\(2025 (https://arxiv.org/html/2608.04260#bib.bib30)\)。尽管神经语言模型取得了显著进展,这两项任务仍然具有挑战性。成功的隐喻检测要求模型能够识别超越表层词汇模式的非字面意义,而隐喻翻译还必须进一步处理不同语言在语言形式、交际功能和文化嵌入性方面的差异Karakantaet al\.\(2025 (https://arxiv.org/html/2608.04260#bib.bib30)\)。然而,将这两个领域联系起来的工作相对较少。现有的翻译评估方法通常假设隐喻实例已经由人工识别,而隐喻检测的进展很少被纳入翻译评估或质量估计中。

近期证据还表明,大语言模型可能更多地依赖表层词汇线索,而不是真正的隐喻理解,这表明即使是最先进的系统,比喻性语言仍然是一个难题Sanchez\-Bayona and Agerri \(2025 (https://arxiv.org/html/2608.04260#bib.bib23)\)。此外,隐喻翻译的进展受到高质量平行隐喻语料库和系统性评估资源有限性的制约Wanget al\.\(2024 (https://arxiv.org/html/2608.04260#bib.bib39)\); Hanet al\.\(2026b (https://arxiv.org/html/2608.04260#bib.bib38)\)。

近期工作还凸显了当前评估实践中的不足。通用机器翻译指标,如BLEUBanerjee and Lavie \(2005 (https://arxiv.org/html/2608.04260#bib.bib14)\)或COMETReiet al\.\(2020 (https://arxiv.org/html/2608.04260#bib.bib13)\),并非为捕捉隐喻特定现象而设计,人工评估协议也很少区分不同类型的隐喻翻译错误。新兴资源,如MMTE\(Wanget al\.,2024 (https://arxiv.org/html/2608.04260#bib.bib39)\),已开始弥补这一空白,而我们的MetaHOPE框架则通过隐喻特定的错误类别和标注指南扩展了面向人工的HOPE评估框架Liang and Han \(2026 (https://arxiv.org/html/2608.04260#bib.bib1)\)。尽管如此,可靠的面向隐喻的评估及其与自动隐喻处理的整合仍然是开放的研究问题。

本博士研究提出一个用于多语言隐喻处理的端到端计算框架,统一三个互补的研究方向:(1) 隐喻检测;(2) 整合MetaHOPE的面向隐喻的翻译评估;(3) 隐喻检测与翻译评估的联合建模。拟议研究并非将这些组件视为孤立任务,而是探索它们如何相互增强,以改进机器翻译和LLM系统的评估与开发。长期目标是建立面向隐喻感知的多语言NLP的可靠方法论、资源和基准。

## 2 背景与相关工作

### 2\.1 认知隐喻

隐喻传统上被视为一种用于丰富文学表达的修辞手法。然而,这一观点受到概念隐喻理论 \(CMT\) 的根本挑战,该理论认为隐喻不仅是语言的一种属性,更是人类思维与认知的基本机制\(Lakoff and Johnson,1980 (https://arxiv.org/html/2608.04260#bib.bib125)\)。根据CMT,抽象概念通过更具体的源域得到系统理解,从而产生诸如“争论是战争”和“时间是金钱”等概念映射。因此,语言中的隐喻表达是更深层概念结构的表层体现,而非孤立的文体手段。

后续研究进一步表明,隐喻是一个涉及认知、语言、交际和文化的多维现象。虽然概念映射为隐喻表达提供了认知基础,但其语言实现受到话语语境和交际意图的影响Semino \(2008 (https://arxiv.org/html/2608.04260#bib.bib92)\)。例如,刻意隐喻理论 \(DMT\) 区分了那些被有意使用以引导读者注意源域的隐喻与那些在日常语言中已经惯例化的隐喻\(Steen,2017 (https://arxiv.org/html/2608.04260#bib.bib103)\)。这一区分对计算处理尤为重要,因为并非所有隐喻表达都需要相同程度的语义解释。

隐喻在新闻话语、政治传播和其他面向公众的文体中尤为普遍,在这些文体中,隐喻除了文体装饰之外还承担多种交际功能。先前研究表明,隐喻可以简化复杂事件、构建公众舆论、唤起情感反应并传达意识形态立场\(Steenet al\.,2010b (https://arxiv.org/html/2608.04260#bib.bib76)\)。因此,成功的隐喻处理要求模型不仅捕捉词汇意义,还要捕捉话语层面和语用信息。

跨语言差异进一步增加了隐喻处理的复杂性。尽管某些概念隐喻在不同文化中似乎广泛共享,但由于语言特定惯例、文化经验和社会历史背景,其语言实现往往存在显著差异\(Kövecses,2010 (https://arxiv.org/html/2608.04260#bib.bib99)\)。因此,多语言NLP系统必须同时考虑普遍的概念映射和文化特定的隐喻表达Hanet al\.\(2026a (https://arxiv.org/html/2608.04260#bib.bib41)\)。这些挑战促使人们需要能够跨语言识别、解释、翻译和评估隐喻语言的计算方法。

### 2\.2 计算隐喻检测

自动隐喻检测已成为比喻性语言处理中最活跃的研究课题之一Shutova \(2015 (https://arxiv.org/html/2608.04260#bib.bib22)\); Rai and Chakraverty \(2020 (https://arxiv.org/html/2608.04260#bib.bib26)\); Hanet al\.\(2026a (https://arxiv.org/html/2608.04260#bib.bib41)\)。早期计算方法主要依赖手工编码知识、词汇资源和选择偏好来区分隐喻性语言与字面语言Shutova \(2015 (https://arxiv.org/html/2608.04260#bib.bib22)\)。然而,这些基于规则的方法通常难以扩展并跨领域、跨语言泛化,从而推动了数据驱动方法的发展。

随着基于语料库的隐喻研究的发展,人工隐喻识别程序也日益标准化。隐喻识别程序 \(MIP\)\(Group,2007 (https://arxiv.org/html/2608.04260#bib.bib80)\)及其扩展版本MIPVU\(Steenet al\.,2010b (https://arxiv.org/html/2608.04260#bib.bib76)\)提供了系统的基于词典的指南,通过将词汇单元的语境意义与更基本的意义进行比较,判断该词汇单元是否被隐喻性地使用。基于该程序,阿姆斯特丹自由大学隐喻语料库 \(VUAMC\)Steenet al\.\(2010a (https://arxiv.org/html/2608.04260#bib.bib75)\)被构建为最大的人工标注隐喻语料库之一,此后成为隐喻检测研究中广泛采用的基准。MIPVU标注语料库的可用性使得在一致标注标准下开发和评估监督式隐喻检测模型成为可能。

深度学习的进展显著提高了隐喻检测的性能。上下文语言模型,包括BERT及后续Transformer架构,通过对隐喻表达周围语境信息进行建模,实现了更丰富的语义表示。这些模型在标准基准数据集上持续优于早期统计方法,并在多个领域展现出更强的稳健性。这一转变体现在VUA隐喻检测共享任务中。2018年表现最佳的系统主要基于循环神经网络和特征工程,而2020年共享任务则由基于BERT的模型主导,最佳F1分数从0\.651提升到0\.769Leonget al\.\(2018 (https://arxiv.org/html/2608.04260#bib.bib95),2020 (https://arxiv.org/html/2608.04260#bib.bib96)\)。

最近,研究者开始探索使用大语言模型 \(LLMs\) 进行自动隐喻检测。LLMs并非完全依赖任务特定的监督训练,而是可以通过零样本和少样本提示来识别隐喻表达。近期研究考察了Llama、Qwen、Mistral、DeepSeek、Gemma、GPT\-4以及其他LLMs在隐喻识别中的应用,展示了它们在检测常规隐喻表达方面的潜力,同时也揭示了在实现稳健隐喻理解方面的局限性\(Lianget al\.,2025 (https://arxiv.org/html/2608.04260#bib.bib20); Reimann and Scheffler,2025 (https://arxiv.org/html/2608.04260#bib.bib18); Hanet al\.,2026a (https://arxiv.org/html/2608.04260#bib.bib41)\)。在这些进展的基础上,近期工作探索了任务特定的提示设计、MIPVU启发的推理、思维链提示以及检索增强生成 \(RAG\) 以进一步改进隐喻检测\(Reimann and Scheffler,2025 (https://arxiv.org/html/2608.04260#bib.bib18); Fuoliet al\.,2026 (https://arxiv.org/html/2608.04260#bib.bib27)\)。相关研究还将这些方法扩展到多语言、跨语言和多模态隐喻检测\(Laiet al\.,2023 (https://arxiv.org/html/2608.04260#bib.bib17); Hülsing and Im Walde,2024 (https://arxiv.org/html/2608.04260#bib.bib16); Xuet al\.,2024 (https://arxiv.org/html/2608.04260#bib.bib15)\)。尽管如此,当前结果仍然参差不齐,基于LLM的方法的有效性在很大程度上取决于任务、提示策略和评估数据集\(Reimann and Scheffler,2025 (https://arxiv.org/html/2608.04260#bib.bib18); Fuoliet al\.,2026 (https://arxiv.org/html/2608.04260#bib.bib27); Hanet al\.,2026a (https://arxiv.org/html/2608.04260#bib.bib41)\)。

尽管取得了这些进展,仍然存在若干挑战。当前系统常常难以处理常规隐喻、文化特定的隐喻表达,以及需要话语层面推理或常识知识的隐含比喻意义。此外,大多数现有工作将隐喻检测作为孤立的分类任务进行评估,而相对较少关注所检测出的隐喻表达如何支持机器翻译和翻译质量评估等下游应用。

基于我们先前使用GPT\-4进行英文新闻文本隐喻检测的工作Lianget al\.\(2025 (https://arxiv.org/html/2608.04260#bib.bib20)\),这一局限性构成了本博士研究第一个工作包的动机,即将隐喻识别扩展到多语言环境、改进提示策略,并开发更稳健的、能够支持下游翻译与评估的检测方法。

### 2\.3 隐喻翻译

隐喻翻译长期以来一直被公认为翻译研究中最具挑战性的问题之一,因为隐喻表达往往传达的不只是字面含义,

相似文章

MetaphorVU:面向隐喻视频理解

Hugging Face Daily Papers

本文介绍了MetaphorVU-Bench,这是首个针对隐喻视频理解的系统化基准,并提出了MetaphorBoost,一种推理时增强框架,可改善多模态大语言模型中的跨域映射。

基于模型的大规模多语言平行数据质量评估

Hugging Face Daily Papers

本文提出了一种基于模型的方法来评估大规模多语言平行数据,将其分解为平行性评估和无参考质量估计,发现没有任何单一的通用指标适用于所有语言方向。