IdioLink:在习语与字面表达间检索超越字词的意义

arXiv cs.CL 论文

摘要

介绍了IdioLink,一个包含10,700篇文档和2,140个查询的检索基准,覆盖107个习语,测试模型是否能够将习语表达与概念上等价的字面或释义含义联系起来。评估显示,当前的嵌入模型在此任务上表现不佳,突显了习语感知语义检索方面的空白。

arXiv:2605.22247v1 公告类型:新 摘要:习语给语言模型带来了根本性挑战,因为其意义无法仅从表面形式推断。因此,理解此类表达需要超越词汇重叠的语义抽象。我们介绍了IdioLink,一个检索基准,旨在测试模型是否能够将习语表达与以字面或释义形式表达的概念等价含义联系起来。IdioLink包含10,700篇文档和2,140个查询,涵盖107个习语的文字和比喻用法。每篇文档和查询都标注了传达核心含义的跨度。评估强嵌入基线(如BGE、E5、Contriever和Qwen)后,我们发现当前模型难以在多样化的表面实现之间检索等价含义,而是依赖主题和浅层语义线索。IdioLink揭示了习语感知语义检索的关键空白,并为未来模型提供了具有挑战性的测试平台。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:46

# 跨越习语与字面表达检索词语之外的意义 来源:https://arxiv.org/html/2605.22247 Kai Golan Hashiloni1,2,Daniel Fadlon1,2,Lior Livyatan1,2,Ofri Hefetz1,2, Jiahuan Pei3,Kfir Bar1,2, 1数据科学研究所,赖希曼大学,赫兹利亚,以色列,2Efi Arazi计算机科学学院,赖希曼大学,赫兹利亚,以色列,3阿姆斯特丹自由大学,荷兰 kai\.golanhashiloni@post\.runi\.ac\.il (https://arxiv.org/html/2605.22247v1/mailto:[email protected]),\{daniel\.fadlon, lior\.livyatan, ofri\.hefetz\}@post\.runi\.ac\.il, j\.pei2@vu\.nl,kfir\.bar@runi\.ac\.il ###### 摘要 习语对语言模型构成了根本性挑战,因为它们的意义无法仅从表层形式推断出来。因此,理解这类表达需要超越词汇重叠的语义抽象。我们引入了IdioLink,一个旨在检验模型能否将习语表达与以字面或释义形式表达的概念等价意义联系起来的检索基准。IdioLink包含10,700个文档和2,140个查询,涵盖107个习语的既有字面用法也有比喻用法。每个文档和查询都标注了传达核心意义的片段。通过对强嵌入基线模型(如BGE、E5、Contriever和Qwen)的评估,我们发现当前模型在跨越不同表层形式检索等价意义时表现不佳,而是依赖主题和浅层语义线索。IdioLink揭示了习语感知语义检索中的关键差距,并为未来模型提供了一个具有挑战性的测试平台。 IdioLink:跨越习语与字面表达检索词语之外的意义 Kai Golan Hashiloni1,2, Daniel Fadlon1,2, Lior Livyatan1,2, Ofri Hefetz1,2,Jiahuan Pei3,Kfir Bar1,2,1数据科学研究所,赖希曼大学,赫兹利亚,以色列,2Efi Arazi计算机科学学院,赖希曼大学,赫兹利亚,以色列,3阿姆斯特丹自由大学,荷兰 kai\.golanhashiloni@post\.runi\.ac\.il (https://arxiv.org/html/2605.22247v1/mailto:[email protected]),\{daniel\.fadlon, lior\.livyatan, ofri\.hefetz\}@post\.runi\.ac\.il,j\.pei2@vu\.nl,kfir\.bar@runi\.ac\.il ## 1引言 理解语言不仅仅是将词语映射到意义:它涉及构建概念性解释,这些解释常常偏离表层形式。比喻语言,包括习语、隐喻和其他规约化表达,说明了这一挑战。像“break the ice”或“spill the beans”这样的潜在习语表达(PIE)所传达的意义无法从其组成词语中组合推导出来,但人类却能根据它们出现的上下文轻松理解,而这决定了该表达是比喻性还是字面性使用。数十年来的语言学和认知科学研究表明,这些表达是人类交流的核心,并依赖于丰富的概念、文化和上下文知识(Pollio et al.,1977; Weinreich,1969; Jackendoff,1997),使其成为评估超越词语的语义理解的关键基准。 参考图1:IdioLink中特定潜在习语表达的四种不同文档类型。 大型语言模型(LLM)的最新进展显著提升了模拟比喻语言的表现,包括习语识别(Tedeschi et al.,2022; Hashiloni et al.,2025)和比喻-字面表达歧义消解(Arslan et al.,2025; Mi et al.,2025)。然而,目前尚不清楚LLM能否可靠地将具有相同意义的表达在比喻、字面或释义形式之间对齐。嵌入和对比模型通常依赖词汇重叠而非更深层的语义等价(Wang et al.,2022; Miao et al.,2023; Shi et al.,2023),当查询意义以比喻或释义方式表达时(例如“break the ice”与“ease the tension”),会导致检索失败。这一差距在现实场景中尤其成问题,因为用户可能遇到不熟悉的习语,需要寻找语义等价的表达来理解其用法。 在这项工作中,我们引入了IdioLink,一个旨在评估跨习语、字面、简化和意义文档类型的概念级检索基准,如图1所示。每个实例都注释了一个标记片段,代表潜在习语表达(PIE)的核心语义单元,并与包含表达相同意义的片段的文档配对。我们制定了一个检索任务:给定一个包含标记片段(带有PIE,比喻性或字面性使用)的查询,模型需要检索出所有其标记片段传达相同意义的文档,而无需访问文档中的片段注释。据我们所知,这是第一个能够评估模型是否基于共享概念意义(无论是比喻性还是字面性表达)而非表层词汇或主题相似性来检索文档的设置。 我们评估了24个嵌入模型及其变体,比较了零样本和微调设置,使用或不使用指令编码查询,并采用了标准句子或片段嵌入方法。我们的结果表明,即使是最先进的嵌入模型,在形式偏离意义时也难以持续检索语义等价的表达,而是严重依赖词汇重叠和主题相似性。这些发现揭示了表层语义匹配与真正概念理解之间的持续差距。 总之,我们的贡献如下: - •我们引入了一个以习语表达为核心的新检索任务,能够超越表层形式进行概念相似性的受控分析。 - •我们发布了IdioLink,一个用于评估跨比喻、字面和释义表达的概念级检索的新基准。 - •我们提供了对现代嵌入模型的广泛评估,揭示了它们在表示和检索共享意义方面的系统性局限性。 IdioLink数据集、提示和评估代码已公开发布,以确保透明度和可复现性,数据集采用CC-BY-4.0许可,代码采用Apache-2.0许可:https://github.com/Intellexus-DSI/IdioLink。 ## 2相关工作 ### 2.1习语作为NLP的核心挑战 多词表达(MWE)由于其句法变异性和非组合语义(Constant et al.,2017)一直是NLP中的长期挑战。早期方法依赖于基于规则、统计和分布的方法(Cook et al.,2007; Fazly et al.,2009; Gharbieh et al.,2016),而近期工作主要使用基于Transformer的架构进行MWE识别和解释(Taslimipoor et al.,2020; Zeng and Bhat,2021; Savary et al.,2023)。习语构成了MWE中特别具有挑战性的子类,因为它们的意义无法从其组成词语中组合推断(Timothy Baldwin,2010)。 在NLP中,习语识别侧重于检测上下文中的习语片段,而习语分类则假设候选表达是预先指定的。已有大量数据集用于这些任务,包括VNC-Tokens(Cook et al.,2008)、IDIX(Sporleder et al.,2010)、SemEval基准(Korkontzelos et al.,2013; Tayyar Madabushi et al.,2022)以及更大的现代资源如MAGPIE(Haagsma et al.,2020)和EPIe(Saxena and Paul,2020)。尽管我们的工作聚焦于英语,但若干数据集将习语和MWE评估扩展到了多语言设置。PARSEME(Ramisch et al.,2020; Savary et al.,2023)和AlphaMWE(Han et al.,2020)提供了超越习语的广泛多语言MWE覆盖,PARSEME 2.0(Scholivet et al.,2026)还额外支持释义任务。其他多语言资源包括ID10M(Tedeschi et al.,2022)、Dodiom(Eryiğit et al.,2022)和MIDAS(Kim et al.,2025)。近期工作进一步探索了比喻语言理解、习语消歧和跨语言语义检索(Park et al.,2025; Mi et al.,2025; Aslantaş and Gungor,2026)。神经网络方法已被应用于习语分类和识别(Briskilal and Subalalitha,2022; He et al.,2024)。最近,LLM通过基于提示的推理取得了强性能,通常匹配或超越微调系统(Hashiloni et al.,2025; De Luca Fornaciari et al.,2024; Mi et al.,2025; Phelps et al.,2024)。LLM也被用于支持习语数据集和语料库的构建(Arslan et al.,2025)。 另一个相关方向是习语句子释义(ISP),侧重于将习语表达转换为字面释义或反之。先前工作探索了无监督、弱监督和可控释义设置,同时一致强调数据稀缺挑战(Zhou et al.,2021a; Qiang et al.,2023; Zhou et al.,2021b)。然而,目前没有现有工作专门针对我们处理的以习语为中心的检索任务。 ### 2.2文本检索与嵌入模型 随着神经嵌入模型的出现,文本检索经历了快速发展,这些模型将查询和文档映射到共享语义空间。早期的密集检索方法如Sentence-BERT(Reimers and Gurevych,2019)以及后续的对比学习框架(Gao et al.,2021; Izacard et al.,2022)通过学习语义上有意义的句子表示展现了强性能。最近的模型通过更大的架构、多语言训练和基于指令的监督扩展了这一范式(Wang et al.,2024a,c; Su et al.,2023; Muennighoff et al.,2025)。 越来越多的工作探索指令感知检索,其中自然语言指令引导嵌入朝向任务特定的表示。诸如InstructOR(Su et al.,2023)和FollowIR(Weller et al.,2025)等模型表明,指令可以显著提升检索性能,这激励我们使用指令增强输入来引导模型朝向习语或字面解释,而无需改变模型参数。 另一个相关方向涉及表示的粒度和上下文建模。标准检索流程通常嵌入整个文档或段落,这可能会掩盖细粒度的语义区分。为解决此问题,先前工作探索了基于固定窗口、句子边界或语义相似性的分块策略(Lewis et al.,2021; Kamradt,2024)。最近,诸如后期交互(Santhanam et al.,2022; Jha et al.,2024)和后期分块(Günther et al.,2025)等方法旨在保留上下文信息的同时实现局部匹配。这些方法证明了在表示学习过程中保留更广泛上下文可以显著提升检索质量,尤其是当意义依赖于微妙的上下文线索时。我们的工作建立在这些见解之上,同时解决了一个独特的挑战:基于潜在概念意义检索语义等价的文档。与先前关注主题相关性或一般相似性的工作不同,IdioLink测试模型是否能够区分字面意义和习语意义,尽管它们具有相似的表层形式,从而将该基准定位在信息检索和比喻语言理解的交叉点。 ## 3IdioLink数据集 ### 3.1问题形式化 我们将IdioLink形式化为一个检索任务,由不重叠的索引I\mathcal{I}和查询Q\mathcal{Q}组成。I\mathcal{I}和Q\mathcal{Q}都包含结构相似的文本,每个都与一个目标PIE p相关联,并包含一个传达p意义的标记片段,可能是习语性或字面性的。我们定义四种文档类型(示例见图1):1.字面型,其中p以其组合意义使用;2.习语型,其中p以其比喻意义出现;3.简化型,是习语型的副本,但将p替换为适合上下文的对其意义的明确解释;4.意义型,表达与p的习语用法相同的想法,类似于简化型,但作为独立的单独文档。我们设计字面型和习语型文档来测试模型是否能区分PIE的字面和习语用法。简化型文档评估模型是否捕捉到习语与其字面释义之间的等价性,而意义型文档则基于超越词汇重叠的共享抽象意义来探索检索。 查询仅生成自字面型或习语型文档类型。给定一个包含PIE p的查询q∈{literal, idiomatic},目标是检索I\mathcal{I}中所有包含表达p相同潜在意义的片段的文档(基于q中p的用法)。如果q是字面型,相关文档是同一p的其他字面实例。如果q是习语型,我们期望检索所有其他三种类型(即习语类型)。 ### 3.2数据集构建 所有用于构建数据集的模型均基于初步探索性实验选择,并使用默认温度值1。所有提示首先经过优化以减少不一致。

相似文章

跨语言习语表达的概念网络:一种基于特征的图方法

arXiv cs.CL

本文提出了一种可解释的基于网络的框架,使用二进制概念特征表示八种语言的习语表达。社区检测显示,习语按概念图式而非语言聚类,该框架在习语检测和跨语言迁移方面优于基于嵌入的基线方法。

重探语义处理的痛点:语言模型的语义推理基准测试

arXiv cs.CL

研究人员推出了 SemanticQA 基准测试,旨在评估语言模型在包含习语、名词复合词及动词结构等语义短语处理任务上的表现。结果显示,不同架构与规模的模型在语义推理任务上的性能存在显著差异。