双关妙语:基于对比学习与音义嵌入的多智能体文字游戏翻译
摘要
本文探讨了三种基于大语言模型的英法双关语翻译方法,结合了对比学习与音义嵌入。其多智能体系统和引导式思维链系统在CLEF JOKER 2025任务2竞赛中,经专家人工评估,分别位列第一和第二。
arXiv:2608.04311v1 公告类型:新
摘要:跨语言翻译文字游戏长期以来一直给专业译者和机器翻译系统带来挑战。我们研究了三种英译法双关语翻译方法,将大语言模型与文字游戏生成的语言学约束相结合。我们的基线方法使用大语言模型,并通过一个判别器提供反馈,该判别器以法语正负样本作为提示。我们的引导式推理流程使用融合的音义嵌入来检索用于文字游戏生成的词汇候选。最后,我们的多智能体框架利用专门化的反馈,迭代评估并重新生成候选翻译。我们的目标不是停留在字面翻译,而是保留源文本文字游戏的语言创造性、歧义性和幽默感,而非简单地复现其词汇。尽管在BLEU和BERTScore上仅取得小幅提升,我们的多智能体系统和引导式思维链系统在CLEF JOKER 2025任务2竞赛中经专家人工评估分别位列第一和第二。这些发现表明,与直接判别器引导生成相比,显式的音义引导和迭代多智能体评估都能改进基于大语言模型的文字游戏翻译,尤其是在平衡语义保真度、语音相似性和目标语言表达自然度方面。
查看缓存全文
缓存时间: 2026/08/06 07:46
11institutetext:佐治亚理工学院,美国佐治亚州亚特兰大 30332
11email:{rdtaylorjr,bherbert6,msana3}@gatech.edu
###### 摘要
双关语的跨语言翻译长期以来一直挑战着专业译者和机器翻译系统。我们研究了三种将大语言模型与双关生成的语言约束相结合的英译法双关翻译方法。
我们的基线使用大语言模型,并配合一个以法语正负例提示的判别器反馈。我们的引导推理流水线使用组合的语音-语义嵌入来检索用于双关生成的词汇候选。最后,我们的多智能体框架使用专门的反馈迭代式评估和重新生成候选翻译。
超越直译,我们的目标是保留源文本双关的语言创造性、歧义性和幽默感,而不是简单地复现其词汇。多智能体系统和引导式思维链系统在 CLEF JOKER 2025 任务 2 竞赛中,在专家人工评估下分别排名第一和第二,尽管 BLEU 和 BERTScore 仅有适度提升。
这些发现表明,相对于直接判别器引导生成,显式的语音-语义引导和迭代式多智能体评估都能改进基于大语言模型的双关翻译,尤其是在平衡语义保真度、语音相似度和目标语言表达自然度方面。
## 1 引言
跨语言翻译双关语仍然是机器翻译中最具挑战性的问题之一,因为它需要同时保留意义和双关。
双关语依赖于语义歧义和语言不协调,而语言模型主要训练于对规则语言和语义模式进行建模[4](https://arxiv.org/html/2608.04311#bib.bib3)。这种不协调正是双关语令人惊讶和幽默的核心所在[1](https://arxiv.org/html/2608.04311#bib.bib2)。
即使源语言双关语被正确理解,目标语言中也极少存在等价的双关语。由于同音词和其他形式的文字游戏具有语言特定性,要同时保留意义和幽默,往往需要创造全新的双关语,而不是逐字翻译原文。
生成有效的目标语言双关语除了语言和文化知识外,还需要创造力。即使对人类来说,创作原创幽默也很困难,而专业译者长期以来一直将幽默翻译视为最具挑战性的翻译任务之一[16](https://arxiv.org/html/2608.04311#bib.bib12)、[15](https://arxiv.org/html/2608.04311#bib.bib11)。
大语言模型拥有从网络规模语料库中获得的广泛语言和文化知识,这使得重新审视以前不可行的计算性双关翻译方法成为可能。与此同时,计算性双关生成的最新进展为语义歧义建模、语音相似性和迭代优化提供了新机制。
我们有两个主要贡献。首先,我们表明优先考虑功能对等而非字面对应可以在跨语言双关翻译中获得更强的人工评估结果。其次,我们研究三种逐步更复杂的基于 LLM 的方法来实现这一目标:判别器引导生成、显式语音-语义引导和迭代多智能体评估。
## 2 相关工作
计算性双关翻译处于语言幽默理论、翻译研究、机器翻译、计算性双关生成和创造性语言评估的交叉领域。
### 2.1 幽默语言学
言语幽默通论(GTVH)将脚本对立视为言语幽默的核心组成部分,其中不兼容的指涉框架被并置以产生惊讶[2](https://arxiv.org/html/2608.04311#bib.bib27)。Veisbergs 认为,即使底层语言机制发生变化,只要脚本对立保持完整,幽默通常也能在翻译中得到保留[22](https://arxiv.org/html/2608.04311#bib.bib28)。
关联理论认为,成功的双关翻译取决于复现可比较的惊讶和认知重新诠释,而非相同的词汇形式[26](https://arxiv.org/html/2608.04311#bib.bib29)。Aarons 进一步认为,双关语依赖于说话者和听者之间共享的隐性语言知识,这表明具有广泛隐性语言知识的模型可能特别适合这项任务[1](https://arxiv.org/html/2608.04311#bib.bib2)。
### 2.2 专业人工翻译中的双关
专业翻译研究早已认识到双关语是最难翻译的形式之一。Delabastita 的有影响力框架确定了跨语言翻译双关语的八种策略[6](https://arxiv.org/html/2608.04311#bib.bib35),而 Low 提出了一种迭代搜索程序,逐步扩展语义和语音替代方案,直到找到合适的目标语言双关语[15](https://arxiv.org/html/2608.04311#bib.bib11)。虽然是为人工译者开发的,但 Low 的框架与现代检索-生成流水线非常相似。
### 2.3 双关的机器翻译
连续几届 CLEF JOKER 共享任务的结果表明,双关翻译仍比常规机器翻译困难得多[10](https://arxiv.org/html/2608.04311#bib.bib5)。Miller 提出了一个由双关检测、语义解释、语音检索、生成和排序组成的模块化流水线[16](https://arxiv.org/html/2608.04311#bib.bib12)。虽然在现代大语言模型出现之前很难实现,但最近的推理模型使这种模块化架构变得切实可行。
### 2.4 双关生成
基于提示的方法通过结构化推理改进了双关生成。Xu 等人证明提示设计显著影响双关识别、解释和生成,而 Zhong 等人和 Wang 等人通过跳跃思维提示和多智能体生成扩展了这些想法[25](https://arxiv.org/html/2608.04311#bib.bib24)、[28](https://arxiv.org/html/2608.04311#bib.bib26)、[23](https://arxiv.org/html/2608.04311#bib.bib21)。
第二条研究思路引入显式语言结构。He 等人对多重意义的语境支持进行建模,而 Zeng 等人通过对比学习和判别器引导的语义规划改进生成[13](https://arxiv.org/html/2608.04311#bib.bib8)、[27](https://arxiv.org/html/2608.04311#bib.bib25)。Sharma 等人开发了基于 IPA 的语音嵌入,并在英语 JOKER 数据集上证明了其有效性[20](https://arxiv.org/html/2608.04311#bib.bib16)。我们在此方法基础上构建法语语音嵌入,并将其纳入跨语言双关翻译的引导检索框架。
### 2.5 生成双关的评估
评估翻译后的双关语仍然具有挑战性,因为 BLEU 和 BERTScore 等常规机器翻译指标奖励词汇相似性,而非比喻意义和幽默的保留。因此,近期工作提出了针对创造性语言定制的评估方法,包括隐喻感知评估[24](https://arxiv.org/html/2608.04311#bib.bib22)、直译错误检测[4](https://arxiv.org/html/2608.04311#bib.bib3),以及使用多个评估者角色对幽默进行基于 LLM 的集成评估[11](https://arxiv.org/html/2608.04311#bib.bib7)。我们的评估框架借鉴了这些互补方法。
总的来说,这些研究表明,成功的双关翻译既需要语言推理,也需要超越词汇相似性的评估方法。
## 3 方法
本节描述本研究中使用的数据集、模型和实验流程。我们首先介绍基线系统,然后介绍两种逐步更复杂的方法,它们结合了引导推理和迭代多智能体优化。
### 3.1 数据与资源
我们的主要数据集是 CLEF JOKER 2025 任务 2 英法双关翻译数据集[8](https://arxiv.org/html/2608.04311#bib.bib41)、[9](https://arxiv.org/html/2608.04311#bib.bib42)。训练集包含 1,405 个英语双关语及其 5,838 个法语翻译,隐藏测试集由 376 个英语双关语组成,通过共享任务进行评估。
我们还使用了 CLEF JOKER 2023 双关定位与解释数据集[10](https://arxiv.org/html/2608.04311#bib.bib5),并补充了每个英语示例的双关词、双关类型、预期含义和支持语境的人工标注。这些标注由作者协作完成。然后我们将其与 LLM 预测进行比较,在最终确定标注前人工复核所有分歧。这些标注作为双关识别的参考标准。
为了进行对比判别,我们为 JOKER 数据集中的每个参考法语双关生成一个非双关样本,从而构建了一个平衡数据集。我们使用 gemini-2.5-flash-preview-05-20,并重新生成候选,直到一个独立提示确认不再存在双关。
为了进行语音-语义检索,我们按照 Sharma 等人[20](https://arxiv.org/html/2608.04311#bib.bib16)的方法,使用 Lexique 发音数据库和 PanPhon 发音特征[18](https://arxiv.org/html/2608.04311#bib.bib38)训练法语语音嵌入,然后将其与预训练的法语 FastText 语义嵌入[12](https://arxiv.org/html/2608.04311#bib.bib39)拼接。
Gemini 2.5 Pro 用于双关识别,o4-mini 用于双关词和同义词翻译,Lajavaness/bilingual-embedding-large 用于双语语义相似度,Mistral Medium 2505 和 o4-mini 用于基线生成,Gemini 2.5相似文章
搜索音义碰撞:基于图的可供性检索与多评估器排序在CLEF 2026 JOKER任务2双关语翻译中的应用
本文从计算角度研究双关语翻译,将其视为一个发现、探索和选择的过程,使用基于图的可供性检索和多评估器排序。作者表明,成功的双关语翻译依赖于在目标语言中发现新的音义碰撞,而非保留源语言词汇。
一次越狱,多种语言:学习语言不敏感的意图表示用于多语言越狱检测
本文提出MLJailDe,一个多语言越狱检测框架,利用反向翻译数据增强和相对距离约束来提高跨语言泛化能力和鲁棒性,在11种语言上实现了98.5%的F1分数。
论使用LLM处理专业术语:语料库的良好替代方案?
本研究评估了四款专有LLM(GPT-4o、GPT-5.2、Claude Sonnet 4.5、DeepSeek)在两个领域英译法的专业术语翻译,并比较了提示策略。结果显示Claude Sonnet 4.5表现最佳,但LLM目前尚无法取代专业语料库。
无奖励的表征:JEPA对LLM微调的审计
本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。
PolyWorkBench: 多语言长周期LLM智能体基准测试
介绍PolyWorkBench,一个用于评估LLM智能体在多语言长周期职场工作流中的表现的基准测试,涵盖五个领域,并展示了与单语言设置相比显著的性能下降。