G-IdiomAlign:基于释义的跨语言习语对齐基准
摘要
G-IdiomAlign是一个基于释义的基准,用于评估大语言模型中的跨语言习语对齐能力,采用受控多项选择和释义对比协议来诊断字面翻译偏差以及语义枢轴的影响。
arXiv:2606.18989v1 公告类型:新
摘要:习语因其非组合性和弱表层形式基础而难以在不同语言间转移,导致字面映射不可靠。我们提出了G-IdiomAlign,一个基于释义的基准,其中每个习语通过维基词典中的英文释义进行锚定。我们进一步构建了一个高置信度的参考对齐集,以实现可复现的评估。G-IdiomAlign支持两种协议:(1) 受控多项选择习语等价,带有类型化干扰项用于错误归因;(2) 释义对比生成,通过对比无释义和有释义输入来隔离显式语义枢轴的效果。在多种大语言模型中,字面翻译偏差是主要的失败模式,尤其是当目标语言为低资源语言时。在基于嵌入的语义代理下,释义能够稳定提升释义对比生成的效果,但性能仍然有限,表明开放输出空间中存在显著的提升空间。随后对Qwen3-8B的分析进一步表明,跨条件差异更多集中在注意力头而非层上,同时有释义生成效果的提升与更强的释义锚定相关。
查看缓存全文
缓存时间: 2026/06/18 05:47
# 基于注释为枢纽的跨语言习语对齐基准
来源:https://arxiv.org/html/2606.18989
冯颖 Ye¹¹,孙彦明¹,詹润哲¹,张志琦²,Lidia S. Chao¹,Derek F. Wong¹
¹澳门大学计算机与信息科学系 NLP2CT 实验室
²澳门大学人文学院
nlp2ct.\{fengying, yanming, runzhe\}@gmail.com, \{lidiasc, derekfw\}@um.edu.mo
###### 摘要
习语因其非组合性及浅层表层形式的弱语义基础而难以跨语言迁移,导致字面映射不可靠。我们提出 **G-IdiomAlign**,一个以英文注释为枢纽的基准,每个习语通过维基词典的英文注释进行锚定。我们进一步构建了一个高置信度的参考对齐集,用于可重复的评估。G-IdiomAlign 支持两种协议:(1) 带类型干扰项的多选题习语等价任务,用于错误归因;(2) 在无注释和有注释输入下进行对比生成,以隔离显式语义枢纽的影响。在多种大语言模型中,对字面翻译的偏向是主要的失败模式,尤其在目标语言为低资源语言时更严重。在基于嵌入的语义代理下,注释一致地改善了对比生成的效果,但性能仍有限,表明在开放输出空间中存在显著提升空间。后续对 Qwen3-8B 的分析进一步表明,跨条件差异更多集中在注意力头而非层上,而有注释的更好生成结果与更强的注释锚定相关联。
¹数据集:https://github.com/NLP2CT/G-IdiomAlign
# G-IdiomAlign:基于注释为枢纽的跨语言习语对齐基准
冯颖 Ye¹¹,孙彦明¹²,詹润哲¹,张志琦²,Lidia S. Chao¹,Derek F. Wong¹³
¹澳门大学计算机与信息科学系 NLP2CT 实验室
²澳门大学人文学院
nlp2ct.\{fengying, yanming, runzhe\}@gmail.com, \{lidiasc, derekfw\}@um.edu.mo
## 1 引言
习语因其比喻意义非组合性且植根于文化背景,使得逐词组合不可靠,因而对跨语言意义迁移构成持续挑战 (He et al., 2025)。近期证据表明,大语言模型常过度依赖表层统计线索(如搭配频率或句子概率),而非从上下文中恢复比喻意图 (Mi et al., 2025; Yang et al., 2025c; Ye et al., 2026)。准确的跨语言习语对齐不仅对跨文化交流和机器辅助本地化至关重要,也是检验大语言模型是否真正理解超越表层模式的文化嵌入语义的试金石,从而促使评估协议关注习语间的语义等价而非简单的词汇重叠。然而,现有资源对跨语言习语间等价的受控诊断性评估支持有限。强系统常生成字面、部分或缺失的习语翻译 (Yang et al., 2025c),但当前数据集缺乏统一基准和标准化协议以实现系统性错误归因。为了在不同语言间实现显式且可比的语义锚定,我们采用英文注释作为共享的“语义枢纽”,建模一个资源增强场景,使模型能够利用外部语义支持(如词典或知识库)。我们引入无注释和有注释输入之间的对比设置,以隔离这种显式语义信号的影响。
表 1:G-IdiomAlign 中不同语言对的示例习语对。II 和 GG 分别表示习语及其英文注释;下标表示语言。
在本工作中,我们提出 **G-IdiomAlign**,一个覆盖九种核心语言(包括四种来自代表性不足语言族的语言)的注释枢纽习语对齐基准,每个习语均链接至维基词典中语义等价的英文注释(示例见表 1)。我们通过一种精度优先的流水线构建高置信度参考集,该流水线结合了分布感知过滤和双向一对一约束。在此基准之上,我们提供两个互补的评估设置:带类型干扰项的多选题习语等价任务,以及在无注释和有注释输入下的对比生成。在不同的大语言模型中,模型普遍存在对字面翻译的偏向。虽然加入注释在基于嵌入的语义代理上带来一致但有限的改进,但这突显了在无约束空间中生成标准、语义等价的习语之难度。后续对 Qwen3-8B 的基于注意力的相关性分析进一步表明,有注释的更好生成结果与更强的注释锚定相关,跨条件差异主要集中在注意力头层面而非全局层级变动。我们的分析将 G-IdiomAlign 定位为未来稳健跨语言习语建模的基础。我们的贡献如下:(1) 我们发布了 G-IdiomAlign,一个包含九种核心语言间 36 个语言对(18,785 个习语对)的注释枢纽数据集,通过双向流水线过滤确保高语义等价性。(2) 我们建立了两个用于跨语言习语对齐的诊断协议:带类型干扰项的多选题习语等价任务,以及对比无注释和有注释输入以测试语义锚定的对比生成。(3) 我们揭示了大语言模型中广泛存在的对字面翻译的偏向,并提供了基于注意力的证据,将注释使用与改进的语义锚定联系起来。
## 2 相关工作
### 2.1 习语基准
现有习语基准支持两个核心任务:检测(判断短语是否被习语性使用)和歧义消解(判断表达式应作字面还是比喻解释)。检测数据集测试模型区分习语用法与字面用法的能力,范围从语言学家策划的对比集 (Mi et al., 2025) 到英文测试套件如 IdioTS (De Luca Fornaciari et al., 2024)、多语言基准 ID10M (Tedeschi et al., 2022) 和 CLCL 框架 (Zhou et al., 2023)。歧义消解数据集包括 EPIE (Saxena and Paul, 2020)、MAGPIE (Haagsma et al., 2020) 和 MultiCoPIE (Sentsova et al., 2025),它们对潜在的习语表达标注字面或比喻解读,支持上下文语义选择 (Fakharian and Cook, 2021; Zhou et al., 2021)。补充资源进一步扩大覆盖范围:LIdioms (Moussallem et al., 2018) 以链接数据形式跨语言连接习语,Fu et al. (2025) 评估中文习语的多项能力。尽管这些工作对习语识别和解释有价值,但它们并未直接针对统一跨语言评估中“习语到习语”的意义等价对齐。
### 2.2 习语对齐
跨语言习语对齐仍然具有挑战性,因为比喻意义常偏离字面形式,且受语言和特定文化惯例影响 (Moussallem et al., 2018; Donthi et al., 2025)。近期评估确认了神经机器翻译系统和大语言模型均存在持续失败 (Yang et al., 2025c; Sun et al., 2026),促使研究者采用分解翻译为语义分析和候选项选择的方法 (Qian, 2024),或注入外部信号,例如带损失加权的检索增强机器翻译 (Liu et al., 2023) 或多语言习语知识库 (Li et al., 2024)。然而,这些方法常依赖于表层线索:Sentsova et al. (2025) 报告在具有直接英文词汇对应词的习语上性能显著更高;跨语言评估注意到对提示的强敏感性以及低重叠语言对上的性能差距 (Khoshtab et al., 2025)。这种依赖在基于检索的对齐框架如双语词汇归纳中更为突出,后者将跨语言匹配公式化为对候选集的最近邻搜索 (Li et al., 2023)。除非受到精度导向标准(如双向一致)的约束,这类方法容易产生假阳性 (Ding et al., 2024)。为了解决这些限制,我们通过将对齐锚定在语义等价的英文注释上,超越基于表面的检索,并采用双向约束确保高精度的习语间配对,从而实现受控评估,将语义等价与词汇捷径相隔离。
参考图 1:G-IdiomAlign 构建流水线概览。使用英文注释作为共享语义枢纽,我们从维基词典提取习语条目和核心注释,在注释嵌入空间中检索前 k 个候选,保留 MNN 对,并应用特定于语言对的分布感知过滤,得到最终的 G-IdiomAlign 基准。
## 3 G-IdiomAlign
我们提出 **G-IdiomAlign**,一个基于注释枢纽的跨语言习语对齐基准,覆盖九种核心语言,包括四种来自低资源语言族的语言。英文注释来自维基词典(https://www.wiktionary.org/),作为共享语义枢纽,支持跨语言意义比较,同时减轻基于表层词汇重叠的捷径。我们通过精度优先、分阶段构建流水线来构建 G-IdiomAlign:(i) 提取习语条目和核心注释(排除用法说明/示例);(ii) 在共享注释嵌入空间中检索前 k 个候选;(iii) 通过双向一致保留相互最近邻对;(iv) 应用分布感知过滤以生成高置信度对齐集。最终基准用于评估和诊断分析。图 1 总结了构建流水线。
### 3.1 语言覆盖与数据收集
##### 语言范围。G-IdiomAlign 覆盖九种核心语言:德语、英语、西班牙语、芬兰语、法语、日语、波兰语、中文和葡萄牙语,我们的提取流水线为这些语言生成了足够数量的高质量对齐对。为扩大语言覆盖,我们进一步包括四种语言(阿拉伯语、韩语、泰语和越南语),并将其结果单独报告在附录 A 中。
##### 收集流水线。我们从特定语言的维基词典分类页面收集习语条目,并从每个条目的义项定义中提取清理后的核心注释,排除辅助材料如用法说明和示例;实现细节见附录 B。这些注释提供一致的意义描述,并作为整个构建过程中的语义枢纽。
##### 单义过滤。为保持参考集的可解释性,我们保留仅有一个维基词典义项(一个注释)的习语,并移除多义条目。这避免了构建时可能使习语间等价关系模糊的一对多意义对应。生成的参考集较小但更清晰,支持更可控的评估和诊断。
表 2:G-IdiomAlign 语言对组成。N 表示对齐的习语对数量,% 表示数据集比例(占所有对齐对)。我们使用规范顺序报告每个语言对一次。
##### 基于注释的候选检索。对于每个有向语言对 A→B,我们使用 OpenAI text-embedding-3-large (OpenAI, 2024) 嵌入两种语言习语对应的注释。对于源语言习语 x 及其注释 g_x 和候选习语 y 及其注释 g_y,我们定义注释相似度为 s(x,y) = cos(E(g_x), E(g_y)),其中 E(·) 表示嵌入函数。对于每个 x,我们根据 s(x,y) 在 B 中检索前 k 个候选(k=10),为后续双向过滤生成候选集。尽管最终对齐由排名第一的一致决定(见下文),使用 k>1 可在执行一对一约束前提高候选覆盖率和对嵌入噪声的鲁棒性。
##### MNN 对齐。为获得无歧义的评估对,我们通过相互最近邻实施一对一匹配约束。当一个对 (x,y) 在双向(A→B 和 B→A)下彼此都是排名第一的最近邻时,我们才保留该对。这一双向标准移除了可能由检索伪影引起的不对称或多对一关联,确保保留的对齐反映强相互语义对应。
##### 分布感知过滤。由于不同语言对的相似度分数尺度差异显著,固定的全局阈值难以校准。此外,即使在 MNN 下,最近邻检索总是返回数据集中最佳匹配,这可能在没有真正等价习语时强制产生对齐,导致虚假对。例如,中文习语“洞房花烛夜”(注释:新婚之夜)可能与英文习语“white marriage”(注释:未圆房的婚姻)对齐:尽管注释包含“wedding”和“marriage”等显著词,但底层意义并不等价。因此,我们应用语言对特定、参数轻量的截断阈值,以移除弱匹配,同时保留高置信度对齐。对于每个语言对,我们收集 MNN 确认对的排名第一相似度分数,并将对范围内的相似度离散化为 10 个等宽区间。设 b 为众数区间。我们保留分数落在 bin b 或更高区间的对,使用众数区间的下界作为截断阈值。此处相似度分数用作每个语言对内相对强度的诊断信号,而非语义正确性的绝对标准(细节见附录 C)。为确保确定性报告,我们使用每个无向语言对的固定规范方向计算相似度分数,而 MNN 准则始终双向强制执行。
### 3.2 基准统计
G-IdiomAlign 包含 18,785 个对齐的习语对,涵盖九种语言中的 36 个“无向”语言对。尽管对齐结果按无方向报告,每个对支持相似文章
IdiomX: 一个用于习语理解、检索和释义的多语言基准
IdiomX是一个大规模多语言基准数据集,用于习语理解、检索和释义,包含英语、阿拉伯语和法语超过19万个示例,设有四项任务来评估语言模型对习语表达的处理能力。
IdioLink:在习语与字面表达间检索超越字词的意义
介绍了IdioLink,一个包含10,700篇文档和2,140个查询的检索基准,覆盖107个习语,测试模型是否能够将习语表达与概念上等价的字面或释义含义联系起来。评估显示,当前的嵌入模型在此任务上表现不佳,突显了习语感知语义检索方面的空白。
SPLIT:英乌克兰跨语言同理心与文化根基的LLM响应评估
介绍SPLIT,一个包含500条提示的基准测试,用于评估大型语言模型在英语和乌克兰语中的跨语言同理心和文化根基。研究发现,Gemini-2.5-Flash和LLaMA-3.3-70B-Instruct在处理乌克兰语时性能下降,而DeepSeek-V3保持稳定,且人类与AI评估者在文化维度上的一致性较弱。
XLGoBench: 通过算法任务检测跨语言技能差距
XLGoBench 引入了一个合成算法任务基准,用于检测大语言模型中的跨语言技能差距,并在多个先进模型中展示了持续的差距。
PolyAlign: 条件化人类分布对齐
PolyAlign是一个分布感知的对齐框架,它将语言模型对齐到特定上下文的人类回复分布,而不是单一的全局风格,从而提升了双语环境下的自然性和忠实度。