搜索音义碰撞:基于图的可供性检索与多评估器排序在CLEF 2026 JOKER任务2双关语翻译中的应用
摘要
本文从计算角度研究双关语翻译,将其视为一个发现、探索和选择的过程,使用基于图的可供性检索和多评估器排序。作者表明,成功的双关语翻译依赖于在目标语言中发现新的音义碰撞,而非保留源语言词汇。
arXiv:2608.04299v1 公告类型:新
摘要:十五年前,Low提出双关语译者应停止寻找对等词,转而寻找音与义之间新的接触点。在本文中,我们从计算层面研究这一想法。我们将双关语翻译建模为一个发现、探索和选择的过程。一个检索系统在语义和语音邻域中搜索目标语言的可供性:即可能支撑新文字游戏的音义桥梁。随后,多个语言模型通过生成竞争性译文来探索这些机会,而一个多视角的生成-排序架构则在其中进行选择。除了系统开发之外,我们的主要贡献在于分析检索到的可供性如何在整个翻译过程中传播。我们发现,生成器会主动利用检索到的机会,评估器会逐渐聚焦于更强的音义桥梁,而精确的语音碰撞在可用时会被以不成比例的高频率选中。与此同时,许多双关语仍然无法产生可用的可供性,这表明检索仍是计算双关语翻译中的核心瓶颈。最终呈现的图景与Low所设想的流程惊人地接近。成功的双关语翻译并非源于保留源语言词汇,而是源于在目标语言中发现音与义发生碰撞的新位置。
查看缓存全文
缓存时间: 2026/08/06 07:45
# CLEF 2026 的 Joker Task 2
来源:https://arxiv.org/html/2608.04299
\\copyrightclause
本文版权归作者所有。允许根据知识共享署名许可证 4.0 国际版 (CC BY 4.0) 使用。
\\conference
CLEF 2026 工作笔记,2026 年 9 月 21–24 日,德国耶拿
\[orcid=0009\-0007\-0702\-2375, email=rdtaylorjr@gatech\.edu, \]\\cormark\[1\]
\[orcid=0000\-0000\-0000\-0000, email=abrikman3@gatech\.edu, \]
\[orcid=0009\-0002\-1878\-9700, email=pawate3@gatech\.edu, \]
\\cortext
\[1\]通讯作者。
Adam BrikmanPrateek Awate
(2026)
###### 摘要
十五年前,Low 提出双关语译者应停止寻找对等词,而应转而寻找声音与意义之间新的接触点。在本文中,我们以计算方法对这一观点展开研究。
我们将双关语翻译建模为发现、探索和选择的过程。检索系统在语义邻域和语音邻域中搜索目标语言的可供性(affordances):即那些可能支撑新文字游戏的声音–意义桥梁。随后,多个语言模型通过生成相互竞争的译稿来探索这些机会,而一种多视角的“生成–排序”架构则在其中进行选择。
除了系统开发之外,我们的主要贡献在于分析检索到的可供性如何在整个翻译过程中传播。我们发现:生成器会主动利用检索到的机会;评估器会逐渐聚焦于更强的声音–意义桥梁;并且当完全同音碰撞可用时,它们会以不成比例的高频率被选中。与此同时,许多双关语仍然无法产生可用的可供性,这表明检索仍是计算双关语翻译中的核心瓶颈。
由此呈现的图景与 Low 设想的流程惊人地相似。成功的双关语翻译并非源于保留源语言词汇,而是源于在目标语言中发现声音与意义得以发生碰撞的新位置。
###### 关键词:
双关语翻译、计算幽默、文字游戏生成、检索增强生成
## 1 引言
双关语翻译常被视为不可能,因为在一个语言中制造双关语的语言巧合很难在翻译成另一种语言后幸存。然而,译者长期以来都知道,成功的双关语翻译并不需要保留原词。它需要在目标语言中找到另一个声音与意义碰撞的位置。
其中特别有启发性的一个视角由 Low 提出,他主张译者不应寻找对等的词,而应寻找声音与意义之间的新接触点。他提出的“方形”“五边形”和“六边形”描述了一种在语义和语音邻域中逐步扩大的搜索过程,以追寻此类机会。虽然这一框架最初是面向专业人类译者的实用方法论,但其底层过程类似于一种天然适合计算实现的搜索程序[low2011translating]。
我们在 2025 年 CLEF Joker Task 2 中的提交在人工评估中获得了第一名和第二名,而这些工作深受上述视角的影响。我们将语义和语音检索与多智能体评估相结合,并发现针对幽默优化的系统往往优于专注于直译的方法[taylor2025pun]。然而,一个重要问题仍然悬而未决:检索在成功的双关语翻译中究竟扮演了什么角色?
在本文中,我们将双关语翻译视为一个发现、探索和选择的过程。检索识别语义–语音可供性:即目标语言中声音与意义可能支撑新文字游戏的机会[gibson1979ecological]。生成器通过产出多个相互竞争的译稿来探索这些机会。随后,评估器通过反映幽默、文字游戏质量、流畅度以及保留原笑话的底层设定和幽默意图等多个视角来作出选择。
为了支持这项研究,我们大幅扩展了检索空间,引入了短语级语义嵌入和学习式语音嵌入;用两阶段“生成–排序”架构取代了基于再生成的评估;并追溯了可供性在整个人工流程中的传递。这不仅让我们得以提升性能,还可以研究哪些声音–意义桥梁能够在生成和选择的各个阶段中存活下来。
结果表明,成功的双关语翻译既不是直接翻译,也不是不受约束的创造。它是一个搜索过程。检索揭示了语义领域之间隐藏的桥梁,生成器对这些桥梁进行探索,而评估器则逐渐聚焦于声音与意义之间最强的碰撞。
## 2 系统改进
### 2.1 预处理
与 Miller 提出的双关语翻译计算框架一致,预处理的目标是在检索和候选生成之前识别源双关语及其相关语义领域[miller2019punsters]。
#### 2.1.1 数据清理
我们修订了预处理流程,以提高 LLM 对源双关语的理解[taylor2025pun]。与旧系统相比,该清理器会规范化 Unicode 标点,修复格式错误的引号和对话结构,保留明确标记双关词的词汇主题标签线索,移除社交媒体痕迹(URL、用户名、主题标签、表情符号和反应文本),并通过自动验证纳入了约 100 项针对数据集的修复。这些改动旨在改善下游的双关识别与解读,而非直接贡献于翻译质量。
#### 2.1.2 双关词识别与翻译
我们保留了旧系统中双关词识别与翻译的阶段,但简化了输出表示。模型会识别双关词、双关类型,以及与文字游戏相关的两个语义领域词表。与旧系统不同,我们移除了显式的上下文词提取,只翻译下游检索所需的语义字段。我们使用 gemini-3-flash 和结构化 JSON 输出实现了该流程。
### 2.2 扩展的可供性嵌入空间
我们旧系统的一个局限在于,可供性发现主要在单词层面进行。然而,许多双关语依赖于固定表达、搭配和短语层面的重新解读,而这些超出了单个词项的范围。为了解决这一局限,我们构建了一个包含 370,450 个条目的法语表达库,并为其建立了稠密检索索引。
#### 2.2.1 表达级语义嵌入
该表达库包含:51,589 个法语维基词典条目,标记为表达、谚语或惯用语[wiktionary_latex];12,308 个来自 PARSEME 的带注释多词表达句子上下文[savary2017parseme];以及 306,553 个 OpenSubtitles 高关联搭配[lison2018opensubtitles],这些搭配通过 spaCy 词形还原、词性模式过滤、频率阈值和点互信息评分挖掘得到[spacy2]。经过规范化和去重后,355,803 个条目(96.1%)为多词单位。
所有条目均使用 BAAI/bge-m3 进行嵌入[chen-etal-2024-m3],嵌入向量经过归一化,并使用 FAISS 内积搜索建立索引[johnson2017billion]。与旧系统主要搜索单个词汇可供性不同,该表达库能够对多词表达、搭配、习语结构和更长的语义上下文进行检索。这些新增内容扩大了检索系统的搜索空间,并提供了能够支撑目标语言文字游戏的短语级语义锚点。
#### 2.2.2 学习式语音嵌入
基于一个包含正字形式和 IPA 音标的法语词典,我们构建了一个大规模语音相关性图,其中包含 245,746 个唯一的词–IPA 对和 446 万个带标签的音韵关系[sharma2021phonetic]。正关系包括完全同音、近同音、schwa 删除变体、卷舌音变体、鼻化变体、韵脚关系、辅音骨架关系和元音骨架关系;硬负例则从音韵上相似但缺乏有意义音韵等价性的形式中挖掘。最终数据集包含 272 万个正训练对和 355,007 个留出评估关系。各类别数量汇总见表1(https://arxiv.org/html/2608.04299#S2.T1)。
表1:用于语音嵌入的正关系类型。
| 关系类型 | 数量 |
| --- | --- |
| 强韵 | 1,518,818 |
| 元音骨架 | 426,532 |
| 辅音骨架 | 421,482 |
| 卷舌音变体 | 73,139 |
| 近同音(编辑距离2) | 66,379 |
| 鼻化变体 | 57,013 |
| 完全同音 | 56,521 |
| Schwa 删除 | 30,295 |
| 弱韵 | 25,761 |
| 近同音(编辑距离1) | 8,198 |
| 边界删除 | 323 |
| 总计 | 2,684,461 |
与主要关注精确发音相似性的传统语音检索系统不同,我们的监督信号有意强调更广泛的音韵邻域,包括韵脚、辅音骨架和元音骨架关系,以支持检索可用于双关构造的近似声音对应关系。这些关系被用于在 IPA 序列上使用 SentenceTransformers 和 Multiple Negatives Ranking Loss 微调 BAAI/bge-m3[reimers-2020-multilingual-sentence-bert][chen-etal-2024-m3]。训练通过对每类关系进行封顶采样来平衡样本,以防止主导关系类别压垮嵌入几何。训练使用 batch size 为 128,训练一个 epoch。所得嵌入空间经过训练,能够捕获对双关构造有用的音韵关系,而不仅仅是精确的发音等价性。训练后的模型将 IPA 表示嵌入到使用 FAISS 索引的稠密检索空间中[johnson2017billion],并支持通过余弦相似度最近邻搜索进行近似语音检索。
我们在一个包含 6,321 个查询 IPA 形式和 244,948 个索引项的内在检索基准上评估了该语音编码器。在近同音和辅音骨架关系上性能最强,Recall@10 分别为 0.642 和 0.371,而硬负例检索则几乎为零。这些结果表明,该嵌入空间能够有效捕获超出完全同音匹配的、与双关相关的语音相似性。
表2:语音检索内在评测。
| 关系 | R@10 | MRR |
| --- | --- | --- |
| 全部 | 0.394 | 0.191 |
| 近同音(编辑距离1) | 0.642 | 0.293 |
| 辅音骨架 | 0.371 | 0.172 |
| 强韵 | 0.027 | 0.013 |
| 硬负例 | 0.000 | 0.000 |
### 2.3 基于图的可供性检索
遵循 Low 关于双关语翻译是对可资利用的声音–意义碰撞进行搜索的提议,我们将检索建模为对连接两个语义领域的语义邻域和语音邻域的探索,而不是对单个词项之间的直接翻译。我们将检索到的语音–语义对称为“可供性”,因为它们为目标语言双关构造提供机会,而不是直接译法。
我们将检索空间视为一个异构图,其顶点是词项和表达。语义检索产生语义边,语音检索产生语音边。可供性发现对应识别那些通过语义和语音关系的组合连接源双关语两个语义领域对应语义区域的桥梁结构。
令 \(V\) 表示法语词项和表达的集合。语义检索生成语义邻域 \(N_S(\cdot)\),语音检索生成语音邻域 \(N_P(\cdot)\)。设 \(A\) 和 \(B\) 分别表示源双关词两个不同语义领域的翻译词表。它们充当两个语义区域的种子集合。
#### 2.3.1 语义扩展
每个语义区域通过法语表达库上的稠密检索和有界 FastText 词项扩展独立进行扩展[grave2018learning]。所得语义邻域为
\[
A_S = N_S(A), \qquad B_S = N_S(B).
\]
所有被检索的候选项在参与后续语音检索之前,必须具有已考证的 IPA 表示。分离式语音恢复定义为
\[
A_P = N_P(A \cup A_S), \qquad B_P = N_P(B \cup B_S),
\]
其中 \(N_P\) 表示在学习式 IPA 嵌入空间中的语音邻域扩展。
#### 2.3.2 分桶式桥梁挖掘
我们将语音桥梁检索定义为
\[
\Phi(X,Y) = \{(x,y) \in X \times Y : \operatorname{ipa}(x) \neq \emptyset, \operatorname{ipa}(y) \neq \emptyset, \cos(\mathbf{e}_x,\mathbf{e}_y) \geq \tau\}
\]
其中 \(\mathbf{e}_x\) 和 \(\mathbf{e}_y\) 分别是 \(x\) 和 \(y\) 的学习式语音嵌入。对于每个桶,检索会考虑源候选集合与目标候选集合之间的所有候选对,并仅保留那些满足 \(\Phi\) 所定义语音相似性准则的候选对。
检索按六个有序阶段进行:
1. 原始领域词之间的语音匹配:\(R_1 = \Phi(A, B)\)
2. \(A\) 的语义扩展与原始 \(B\) 词之间的语音匹配:\(R_2 = \Phi(A_S, B)\)
3. 原始 \(A\) 词与 \(B\) 的语义扩展之间的语音匹配:\(R_3 = \Phi(A, B_S)\)
4. 两个领域的语义扩展之间的语音匹配:\(R_4 = \Phi(A_S, B_S)\)
5. 以 \(A\) 领域为唯一语义锚点的语音恢复:\(R_5 = \Phi(A_P, A \cup A_S)\)
6. 以 \(B\) 领域为唯一语义锚点的语音恢复:\(R_6 = \Phi(B_P, B \cup B_S)\)
重复的可供性保留其被发现的最早阶段的所属权。语音检索通过学习式 IPA 嵌入空间中的最近邻搜索执行,而不是精确同音查找,从而能够检索语音嵌入训练期间学到的近似声音关系。
#### 2.3.3 可供性排序与剪枝
可供性排序结合了几种启发式质量信号。语音分数衡量发音相似性,语义分数衡量与源语义领域的锚定能力,自然度分数估计其作为法语词汇材料的可识别性,枢纽分数估计其对双关构造的可用性。总分数代表用于检索剪枝的组合可供性排序分数。
在导出前会执行多个剪枝阶段。首先移除完全重复项。对平凡屈折变体、重音变体、复数变体以及同根形态回声进行惩罚或过滤。每个表层形式和每个词根的容量上限可防止单个词族主导可供性列表。此外,约束条件会限制同一性可供性及其他低创造力的碰撞。
最终检索输出是在我们的过滤准则下得分较高的、去重多样化的可供性集合,分布在扩展后的检索空间中。这些可供性充当下游法语双关生成的约束和灵感来源。
### 2.4 候选生成
我们之前的系统使用英源文本、翻译后的语义领域和一小部分检索到的法语可供性,为每个输入行生成一个法语双关语。然而,可供性检索仅覆盖了数据集的14%,限制了检索引导生成的有效性。相似文章
双关妙语:基于对比学习与音义嵌入的多智能体文字游戏翻译
本文探讨了三种基于大语言模型的英法双关语翻译方法,结合了对比学习与音义嵌入。其多智能体系统和引导式思维链系统在CLEF JOKER 2025任务2竞赛中,经专家人工评估,分别位列第一和第二。
CroCo:基于自生成的跨语言对比偏好调优
本文介绍了CroCo,一种基于自生成响应的跨语言对比偏好调优方法,表明在英语偏好上训练的奖励模型能够有效对其他语言的响应进行排序,在无需特定语言标注的情况下,提升模型在14种语言上的性能。
一次越狱,多种语言:学习语言不敏感的意图表示用于多语言越狱检测
本文提出MLJailDe,一个多语言越狱检测框架,利用反向翻译数据增强和相对距离约束来提高跨语言泛化能力和鲁棒性,在11种语言上实现了98.5%的F1分数。
lmfaoooo在SemEval-2026任务1:幽默即受众——约束幽默生成中的偏好建模
本文介绍了一个面向约束幽默生成的系统,该系统采用“先生成大量候选,再择优选择”的策略,并使用从人类比较中学习到的偏好模型。在SemEval-2026任务1中,该系统在英语和中文子任务中排名第一,在西班牙语子任务中排名第二。
DS@GT ARC 在 CheckThat! 2026:基于 LLM 的推理轨迹排序与分组奖励建模用于多语言数值声明验证
本文介绍了面向 CLEF 2026 CheckThat! 任务2 的系统,该系统利用基于 LLM 的推理轨迹排序和分组奖励建模来验证英语和阿拉伯语的数值声明,并比较了微调验证器与轻量级奖励模型。