如同火箭科学般简单:评估大语言模型理解比喻语言中否定表达的能力
摘要
本文研究了大语言模型如何处理否定与比喻语言的组合,发现这种组合构成了特殊挑战,且模型表现高度依赖于提示风格。作者为Fig-QA数据集新增了标注,并通过分析嵌入空间揭示了时态和具体性等额外语言因素的影响。
arXiv:2606.18922v1 公告类型:新
摘要:比喻语言和否定是当前语言模型面临挑战的两个领域,然而两者在书面语和口语中均广泛使用。大语言模型(LLMs)也广泛应用于日常场景,且在这些场景中未必能针对特定数据集进行微调。因此,理解大语言模型正确解读同时包含否定和比喻语言文本的能力至关重要。为探究此问题,我们为现有比喻语言数据集新增了一套标注,并对多种语言模型进行了测试。我们发现否定与比喻性的组合可能构成特殊挑战,而整体表现及不同否定类型下的表现尤其依赖于所使用的提示风格。
查看缓存全文
缓存时间: 2026/06/18 05:46
# 和火箭科学一样简单:评估大型语言模型理解比喻语言中否定含义的能力 来源:https://arxiv.org/html/2606.18922 Jasmine Owers 布里斯托大学智能系统实验室 英国 & Edwin Simpson 布里斯托大学智能系统实验室 英国 & Martha Lewis∗ 阿姆斯特丹大学逻辑、语言与计算研究所 荷兰 ###### 摘要 比喻语言和否定是当前语言模型面临的两大挑战,然而,两者在书面和口语中都被广泛使用。大型语言模型(LLMs)也广泛用于日常场景,在这些场景中,它们不一定能针对特定数据集进行微调。因此,理解 LLMs 正确解释包含否定和比喻语言的文本的能力至关重要。为了研究这一点,我们为现有比喻语言数据集开发了一套新的标注,并在该数据集上测试了一系列语言模型。我们发现,否定和比喻性的结合可能构成特别挑战,并且整体性能以及在不同否定类型上的表现尤其依赖于所使用的提示风格。 ## 1 引言 比喻语言在日常语言使用中非常普遍 Veale et al. (2016); Roberts and Kreuz (1994)。特别是隐喻,被认为是我们认知和创造能力的基本基础 Lakoff and Johnson (1980)。因此,语言模型需要在多种下游场景中(如文本摘要、自然语言理解(NLU)和自然语言推理(NLI))能够恰当回应比喻语言的使用。此外,模型应该能够开箱即用地做到这一点,而不需要特定的微调。 先前的研究表明,比喻语言可能会给语言模型带来困难,尤其是在 NLI 领域(Agerri, 2008; Chakrabarty et al., 2021)。另一方面,语言模型在该领域的积极表现可见于 Stowe et al. (2022); Liu et al. (2022) 的研究。在这些情况下,模型主要测试的是常规隐喻(Stowe et al., 2022),或者通过微调获得了良好性能(Liu et al., 2022)。许多关于比喻语言和 NLI 的工作都集中在隐喻上;一个例外是 Stowe et al. (2022),他们也研究了讽刺的影响,但仅限于矛盾语境中。 否定也是模型解释时已知的一个挑战,尤其是在没有特定微调的情况下(Hossain et al., 2020),而针对结合了否定和比喻语言的文本性能研究则很有限。因此,在理解现代语言模型能否正确解释涉及否定的语境中的新颖比喻语言方面存在空白。为了填补这一空白,我们为 Fig-QA 数据集(Liu et al., 2022)提供了一组新颖的标注,并评估了一系列语言模型在结合否定情况下解释新颖比喻语言的能力。我们分析了一个模型的嵌入空间,以发现可能有助于隐喻解释性能的其他语言特征,并发现时态和具体性也起作用,尽管其影响在某种程度上被否定的影响所掩盖。为了理解在没有比喻语言的情况下否定的影响,我们开发了一个小的字面释义数据集,发现模型在字面设置中表现更好。因此,我们发现否定和比喻语言的结合对一系列语言模型来说尤其具有挑战性。本文做出以下贡献: - • 我们为 Fig-QA(Liu et al., 2022)——一个较少常规比喻语言的现有数据集——提供了关于隐喻/明喻、否定、时态和具体性的标注。 - • 我们基于 Fig-QA 数据集创建了一个新的小规模字面否定数据集,旨在分离比喻语言和否定的影响。 - • 我们在这些数据集上测试了广泛的模型,包括最近的 LLMs,并分析了其中一个模型在此任务上的嵌入空间。 - • 我们发现否定和比喻性的结合构成了特别挑战,并且模型的性能对所用提示的类型很敏感。 代码和数据可在 https://github.com/jrdowers/Negation-and-Fig-Lang 获取。 ## 2 背景与相关工作 ### 2.1 比喻语言的类型 在本文中,我们考虑隐喻和明喻,以及以明喻与否定相结合形式出现的反讽。隐喻和明喻都用一个概念来解释另一个概念。在隐喻的情况下,被解释的概念(目标)更复杂或更抽象,并被更简单或更具体的概念(源域)所解释。例如,在“火吞噬了房屋”中,源域(“吞噬”的字面含义)的属性被应用于目标域(毁灭)以增强意义(Lakoff and Johnson, 1980)。在明喻的情况下,使用“像”或“如同”等词语给出一个明确的比较——通常是夸张的。在“盒子轻如鸿毛”中,盒子被描述为拥有羽毛的重量轻的特性。 隐喻和明喻在自然语言中都很普遍(对于隐喻,参见 Shutova (2010); Steen et al. (2010) 中计算的统计数据),并且隐喻被认为是由一种潜在的认知过程驱动的,通过将抽象或陌生的概念想象为更具体的概念来理解它们(Lakoff and Johnson, 1980)。人类心理学和认知科学领域的研究表明,总体而言,人们能够像理解字面句子一样容易地理解隐喻(Cacciari and Glucksberg, 1994),因此我们认为,如果语言模型要表现得像人类,它们也应该能够轻松理解隐喻。 ### 2.2 比喻语言解释 评估比喻语言解释的一种方法是通过评估模型正确释义使用隐喻的句子的能力(Shutova, 2010)。Bizzoni and Lappin (2018); Tong et al. (2024); Liu et al. (2022) 采用了这种方法,其中隐喻句子与两个或多个释义配对,其中一个释义是恰当的,模型的任务是挑出恰当的释义。总体而言,模型在此任务上的表现未达到人类水平,尽管 Liu et al. (2022) 发现通过微调,RoBERTa 的性能得到了显著提升。 比喻语言解释也通过自然语言推理任务进行了评估(Chakrabarty et al., 2021; Stowe et al., 2022)。相关任务包括要求模型生成解释(Chakrabarty et al., 2022b)或对文本续写进行分类(Chakrabarty et al., 2022a)。微调再次有助于提升性能,Chakrabarty et al. (2022a) 中通过使用知识库组件增强模型也是如此。 最近的工作表明,较新的模型在隐喻解释,特别是新异隐喻方面正在改进。Ichien et al. (2024) 表明 GPT-4 在 Fig-QA 上达到了接近人类的性能,并且还能够生成令人印象深刻的新异隐喻解释。用于测试 GPT-4 的提示给出了比喻句子和两个字面句子的选项。在本文中,我们通过在更细粒度的层次上分析性能来进一步探讨这一点。 表1:Fig-QA 中不同类型隐喻和明喻实例的示例 ### 2.3 否定 在自然语言中,根据领域不同,9% 到 30% 的句子包含否定(Hossain et al., 2020)。由于否定非常普遍,语言模型能够准确解释它至关重要。然而,否定在 NLU 中也给模型带来了特别的挑战。Hossain et al. (2020); Kassner and Schütze (2020); García-Ferrero et al. (2023) 表明,模型在解释否定方面存在困难,尽管微调后有一些改进(Hossain et al., 2020; Hosseini et al., 2021)。模型在推理包含否定的句子时可能会依赖表面模式;García-Ferrero et al. (2023) 表明,在真/假分类任务中,模型更倾向于将包含否定的句子标记为假。此外,模型的预训练会影响这一点;Truong et al. (2023) 发现,指令微调的模型在处理否定时表现更好,特别是当提示它们对否定进行推理时。 ### 2.4 结合比喻语言与否定 以上所有观点都表明,语言模型可能难以处理比喻语言和否定的结合。事实上,Liu et al. (2022) 曾简要指出这一点,Stowe et al. (2022) 中也包含了否定句子。在本文中,我们进一步研究比喻语言与否定的交互作用。我们考察否定对释义任务中隐喻解释准确性的影响,观察不同提示风格的影响,并比较一系列模型。实验不包含微调——我们认为,特别是大型预训练 LLMs 应该能够开箱即用地处理非常普遍的否定和比喻语言现象。 ## 3 否定数据集 为了理解 NLU 中隐喻、明喻和否定的影响,我们为 Fig-QA 数据集开发了一套标注,该数据集最初是为了支持比喻语言的解释而创建的。该数据集包含 10,256 个带有字面解释的比喻句子实例,由众包工作者根据指令生成,他们被要求生成罕见或创造性但易于解释的、具有相反含义的隐喻对,以及字面释义。每个比喻句子都有一个正确和一个不正确的释义。数据集中大部分比喻句子是明喻,大多数隐喻句子是系词隐喻¹¹如“X是Y”形式的隐喻,例如“那个女孩是只老鼠”。完整的 10,256 个句子数据集被原作者分为训练集(9,110 个句子)和测试集(1,146 个句子)。 我们通过将明喻分类为包含“as”(例如,“展示品亮如太阳”)、“like”(例如,“那个笑话像一吨混凝土”)或“the * of”(例如,“跑者有着出膛子弹的速度”)的句子,对实例进行近似分类,分为隐喻(met)(例如,“当他躲藏时,他变成了一只老鼠”)和明喻(sim)。 在明喻类别中,释义通常采用“NOUN is very ADJ”(名词非常形容词)的形式,其中明喻是对形容词的强化;或者“NOUN is not ADJ at all”(名词一点也不形容词),其中明喻否定了形容词。因此,我们将明喻实例分类为不同情况:明喻充当强化(intens)或否定(neg)。明喻通常成对出现,其中恰好一个被归类为neg,另一个被归类为intens。我们将这些对称为neg pairs(否定对),剩余的未配对明喻称为non-neg pairs(非否定对)。 在否定明喻类别中,我们定义了两种类型的否定明喻:not,在两种释义中恰好一个包含“not”、“n’t”或“no”;以及antonym,包含明喻中的“as * as”结构,并且形容词“*”恰好出现在两种释义之一。如果“as * as”结构包含一个多词短语,则使用第一个词,例如,“as easy to read as”中的“easy”,见表1中的示例。 表2显示了每个类别中的实例数量。标签为 Fig-QA 训练集中包含的 9,110 个句子提供;这些句子中的每一个都与两个可能的释义配对,并且有标签指示哪个释义是正确的。我们在大多数分析中使用这个更大的标注句子集。neg pair和non-neg pair的总数为 7064;还有 106 个明喻实例未包含在内:90 个明喻的搭档是隐喻,7 个明喻对(14 个实例)格式不一致,以及两个未配对的句子。intens实例比neg实例多 4 个;这是两个对,其中每个句子中的形容词不同:“蛋糕硬如磐石”但“蛋糕轻如鸿毛”,以及“这本书的剧情许多人会觉得枯燥乏味如同看油漆干”但“这本书的剧情许多人会觉得精彩刺激如同马戏表演”。因此,对中的两个句子都是强化。这些也是intens “antonym”中的两个额外对。 我们手动验证了从训练集(数据集的 2%)中按比例随机选取的每个类别的 184 个句子的标注。我们发现样本中有 7 个句子标注错误:3 个隐喻被分类为明喻(non-neg pairs),2 个明喻(non-neg pairs)被分类为隐喻,1 个明喻被错误分类为neg pair,还有 1 个句子在原始数据集中有损坏。由于我们的关键分析涉及neg pairs子集中的明喻,这些错误分类影响很小。 表2:Fig-QA 训练集每个划分中的句子数量 ## 4 方法 Fig-QA 的任务如下:给定一个三元组(fig, lit1, lit2),模型必须从lit1和lit2中选择最合适的释义。lit1和lit2中一个是fig的字面释义,另一个与其矛盾(回想表1中的示例)。我们测试了一系列不同的模型,包括基于嵌入的模型以及开源和闭源 LLMs。模型的范围需要一系列不同的评估方法。对于嵌入模型,我们比较比喻句子和每个释义的嵌入之间的余弦相似度。然而,自回归模型(如 Llama)没有自然的句子嵌入输出,因为它们被训练为输出序列上的概率。因此,我们使用以下两种方法用于自回归模型。
相似文章
“不太可能”有多不可能?评估大型语言模型对言语概率的感知
本文对大型语言模型如何解释言语概率表达式进行了系统性的跨模型评估,发现它们能够忠实追踪人类基准,但存在偏差,尤其是在负面表达方面,这对人类与AI之间的不确定性交流有影响。
视觉语言模型在多语言否定理解上的差异
MIT 研究人员发布首个涵盖七种语言的多语言否定基准,发现 CLIP 等模型在非拉丁文字上表现不佳,而 MultiCLIP 与 SpaceVLM 在各语言间的提升并不均衡。
When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models
Introduces CROWN-QA, a benchmark for completeness-sensitive negative reasoning in LLMs, showing models struggle to distinguish justified negative answers from insufficient evidence, often over-closing.
带否定的常识知识:一种提升否定理解能力的资源
研究者提出一种自动为常识知识语料添加否定信息的方法,生成逾200万条三元组,用于预训练可显著提升大模型对否定的理解。
团结中的智慧:多语言训练在谚语比喻语言识别中的作用
本文研究了多语言训练如何帮助识别七种语言谚语中的比喻语言,引入了一个多维标注框架,并发现约50%的翻译多语言数据足以实现接近最优的性能。