接地鸿沟:大语言模型如何以不同于人类的方式锚定抽象概念的含义
摘要
本研究调查了大语言模型(LLMs)与人类在理解抽象概念时的“接地”(grounding)差异,发现存在显著的“接地鸿沟”:模型过度依赖词语联想,而较少涉及情感或内在状态。作者利用稀疏自编码器(SAEs)识别出与接地维度相关的内部特征,表明LLM虽然具备这些信息,但在自由生成文本时并未像人类一样自然地调用它们。
arXiv:2605.08837v1 发布类型:新论文
摘要:抽象概念——如正义、理论、可用性——没有单一的、可直接感知的指代对象;在人脑中,它们的含义源于经验、情感和社会背景的交织网络。大语言模型(LLMs)是否以类似的方式对抽象概念进行“接地”?我们通过复现认知科学中的属性生成实验,在21个前沿及开源大语言模型上研究了这一问题。跨模型和实验的结果显示出一个一致的规律:与人类相比,模型过度依赖词语联想,并且较少生成与情感和内在状态相关的属性。这导致了一个巨大且一致的接地鸿沟:没有任何模型与人类回答之间的皮尔逊相关系数超过 r=0.37,而人类之间的一致性基准远高于 r=0.9。为了更好地解释这一差距,我们还复现了一项针对接地类别的评分实验,发现在此方面LLM与人类判断的契合度更高,且随着模型规模的增大,这种一致性也有所提升。随后,我们利用稀疏自编码器(SAEs)检查这些信息是否也反映在模型的内部特征中,并确实识别出了与“感觉运动”和“社会”等接地维度相连的特征。这些发现表明,当前的LLM在被明确查询时能够恢复接地维度信息,但在自由生成词汇时,并未以类似人类的方式调用这些信息。
查看缓存全文
缓存时间: 2026/05/12 07:03
# 锚定差距:大型语言模型如何以不同于人类的方式锚定抽象概念的含义 来源:https://arxiv.org/html/2605.08837 **Odysseas S. Chlapanis** 信息学系 雅典经济与商业大学 希腊雅典娜研究中心阿基米德实验室 & **Orfeas Menis Mastromichalakis** 电信研究所 葡萄牙 & **Christos H. Papadimitriou** 计算机科学系 哥伦比亚大学 美国 ###### 摘要 抽象概念——如正义、理论、可用性——没有单一的、可感知的指称对象;在人脑中,其含义是从经验、情感和社会背景的复杂网络中涌现出来的。大型语言模型(LLMs)是否以类似的方式锚定抽象概念?我们通过复现认知科学中的属性生成实验,对21种前沿和开源权重的大语言模型进行了研究。跨模型和实验,我们发现了一种一致的模式:与人类相比,模型过于依赖词语联想,而产生的与情绪和内部状态相关的属性较少。这导致了一个巨大且一致的“锚定差距”:没有任何模型与人类反应的皮尔逊相关系数超过 $r=0.37$,而人类之间的上限超过 $r=0.9$。为了更好地解释这一差距,我们还复现了一项关于锚定类别的评分实验,发现在此类实验中,大语言模型与人类判断的契合度更高,且随着模型规模增大,这种契合度有所提升。随后,我们使用稀疏自动编码器(SAEs)检查这些信息是否也反映在模型的内部特征中,并确实发现了与“感觉运动”和“社会”等锚定维度相关的特征。这些发现表明,当前的大语言模型在被明确询问时可以恢复锚定维度,但在自由生成词汇时,并未以类似人类的方式调用这些维度。 111 所有数据和代码均在 https://github.com/odychlapanis/grounding-gap/ 公开可用。 ## 1 引言 诸如 **cat**(猫)和 **table**(桌子)这类具体概念通过感官可感知的、可识别的指称对象锚定在共享经验中 (Borghiet al., 2017)。相比之下,诸如 **art**(艺术)、**adventure**(冒险)或 **justice**(正义)等抽象概念缺乏这样的指称对象。当人类处理抽象词汇时,他们会从具身经验中重构其含义。考虑一个人如何理解 **art**(艺术):一幅色彩斑斓的绘画、一种敬畏的感觉、一场喜爱的音乐会,以及诸如 **creativity**(创造力)等更抽象的想法。具身认知理论认为,这种感觉运动、情感和社会锚点并非偶然,而是构成意义的核心部分 (Lakoff and Johnson, 2003; Barsalou, 1999, 2026)。大语言模型是否以类似的方式代表抽象概念,还是主要依赖语言关联模式 (Bender and Koller, 2020; Bender et al., 2021),仍是一个未解之谜。 为了衡量大语言模型在抽象概念锚定方面与人类的一致程度,我们复现了两项来自认知科学的属性生成实验 (Harpaintner et al., 2018; Kelly et al., 2024)。在这些实验中,参与者(在这些参考文献中是人类,在本文中是模型)被给予一个概念,并被要求列出脑海中浮现的属性、情境或联想。虽然个体反应各不相同,但跨人类参与者的编码分布高度一致:人们以相似且一致的方式,沿着感觉运动体验、情感和社会背景等锚定维度来锚定抽象概念。然后,我们将模型产生的分布与人类产生的分布进行比较。 在21种前沿和开源模型中,我们发现存在巨大且一致的锚定差距。在两项实验中,没有任何模型的人机相关系数超过 $r=0.37$,而人人相关系数的上限超过 $r=0.9$。模型彼此之间的相似度也远高于它们与人类的相似度:模型-模型的相关性系统性地高于模型-人类的相关性。总体而言,这些结果表明,当前的大语言模型表现出一种共同的抽象概念锚定模式,这与人类的模式有系统性的差异。 但是,这种差距是因为模型缺乏对人类锚定结构类别的理解,还是因为在自由生成概念时没有以类似人类的方式调用这种理解?为了回答这个问题,我们转向认知科学中的一项评分实验,在该实验中,词汇直接沿着与锚定相关的维度进行评估 (Troche et al., 2017)。在那里,最近的大语言模型与人类判断的契合度要高得多,且随着模型规模的扩大,这种契合度有所提高,与人类的相关系数差距仅剩约 0.1。这种对比表明,当被明确询问时,模型至少部分地掌握了相关维度,但在属性生成期间并没有以类似人类的方式自发调用它们。 这就提出了一个机制性问题:我们能否在大语言模型中找到与这些锚定相关维度一致的内部表示?为了调查这一点,我们使用稀疏自动编码器(SAEs)分析模型,这是一种有助于识别可解释内部特征的技术 (Bricken et al., 2023; Huben et al., 2024; Templeton et al., 2024)。我们搜索激活值追踪锚定相关维度的特征,并确实发现了此类结构的证据:一些内部特征与人类锚定维度或子维度相关。随后,我们通过显示沿这些特征引导模型会增加来自相应目标类别的属性生成,来验证这些特征。 综上所述,我们的发现表明,当前的大语言模型对基本锚定类别的理解几乎——但并不完全——如同人类一样,但在自由生成时,它们并未以类似人类的方式调用这些类别。 #### 贡献。 * 我们在21种前沿和开源大语言模型上复现了两项来自认知科学的属性生成实验,并展示了人类与模型在抽象概念锚定方面存在巨大且一致的差距。 * 我们复现了一项关于锚定相关维度的评分实验,并显示大语言模型在此处与人类判断的契合度要高得多——尽管并非完全一致——这表明差距不仅仅是由于未能识别相关维度所致。 * 我们使用稀疏自动编码器探测 Gemma 模型中与锚定维度相关的内部特征,并发现了此类结构的证据。 ## 2 相关工作 #### 具身认知与锚定规范。 语言中*具身认知*的传统理论认为,抽象类别并不代表任意的符号,而是根植于感觉运动和情感体验中 (Barsalou, 1999; Barsalou and Wiemer-Hastings, 2005)。神经认知证据支持动作词会调动运动和预备运动皮层 (Hauke et al., 2004; Pulvermüller, 2005),而抽象概念的情感和社会维度已与内感受处理联系起来 (Critchley et al., 2004; Mancano and Papagno, 2026)。行为规范在大规模上实现了这些维度:数据集中,人类参与者根据感觉运动强度、唤醒度、效价和社会性等维度,在李克特量表上对词汇进行评分。Lynott et al. (2020) 提供了40,000个英语单词的模态特定强度评级,而 Scott et al. (2019) 和 Diveica et al. (2023) 涵盖了唤醒度、效价和社会性维度。这些语料库使锚定研究得以超越二元的具体/抽象区别 (Brysbaert et al., 2014)。 属性列举范式 (McRae et al., 2005; Barsalou and Wiemer-Hastings, 2005) 提供了更丰富的信号:参与者不是给出标量评级,而是自由生成概念的属性,从而在经验维度上产生分布轮廓。Harpaintner et al. (2018) 将该范式专门应用于抽象名词,表明它们激发了丰富的感觉运动、社会和情感特征。Kelly et al. (2024) 扩展了该范式,以测试情感概念是否形成一个独特的子类别,发现它们比其他抽象概念更强烈地依赖内感受特征。这两项研究构成了我们行为实验的经验基础。 #### 大语言模型认知实验。 早期工作表明,语言模型经常无法通过心理语言学诊断,并且不能可靠地锚定语义属性 (Ettinger, 2020)。Pezzelle et al. (2021) 将预训练变换器表示与人类概念规范进行比较,发现视觉共同训练提高了具体词对的契合度,但对抽象词对几乎没有好处。最近的研究通过将前沿和开源大语言模型提示为人式评分并与既定规范进行比较,将这个问题扩展到大语言模型。Xu et al. (2025) 报告在非感觉运动维度上与格拉斯哥和兰卡斯特规范有强烈的一致性,但在感官和运动领域的一致性较弱。Wang et al. (2025b) 同样发现,在九种大语言模型中,抽象概念、具身模态以及情感或社会维度方面存在持续差距,且随着规模扩大,契合度有所提高。相关研究还显示,大语言模型可以近似情感和感觉运动评级 (Trott, 2024),并仅从文本中恢复感知颜色结构的某些方面 (Abdou et al., 2021)。最接近我们设置的是 Suresh et al. (2023),他们使用属性列举而非评级,但关注具体概念以及与现有规范的特征重叠相似度。相比之下,我们针对抽象概念,并将生成的属性分类为经验类别。 #### 语义概念的机械可解释性。 机械可解释性工作的一条主要线索使用线性探针来定位大语言模型残差流中的非语言潜在结构,恢复了棋盘游戏状态、时空坐标和情感的概 念轴 (Li et al., 2023; Nanda et al., 2023; Gurnee and Tegmark, 2024; Tigges et al., 2024)。一些工作通过扩展这一范式,使用这些潜在向量将模型引导至检测到的概念 (Turner et al., 2024; Panickssery et al., 2024)。最近的研究确定了电路级情感组件以控制情感表达 (Wang et al., 2025a),并在如 Claude Sonnet 4.5 等模型中恢复了情感方向 (Sofroniew et al., 2026)。在这项工作中,我们分析由稀疏自动编码器(SAEs)学习的特征,以探测锚定相关信息是否反映在模型表示中。SAEs 将多语义的大语言模型表示分解为单语义、可解释的特征 (Bricken et al., 2023; Huben et al., 2024; Templeton et al., 2024)。最近,SAE 特征已应用于分析情感 (Wu et al., 2025)。在我们的工作中,我们利用 Gemma Scope 2 SAE 模型 (McDougal et al., 2025),即 Gemma Scope (Lieberum et al., 2024) 的继任者,并探测感觉运动、内部状态和社会概念。 ## 3 锚定差距 我们通过*属性生成*研究大语言模型对抽象概念的锚定,这是一种来自认知科学的行为范式,其中参与者被给予一个概念,并被要求列出针对该概念脑海中浮现的特征、情境或联想。与需要参与者将概念内容映射到固定的一组预定义维度的标量评分任务 (Troche et al., 2017) 不同,属性生成捕捉了人们在代表一个概念时自发调用的内容。因此,它已被用作一种更丰富、更忠实的方式来研究锚定,尤其是对于抽象概念 (Barsalou and Wiemer-Hastings, 2005; McRae et al., 2005)。 为了衡量大语言模型在概念锚定方面与人类的一致程度,我们复现了两项关于抽象概念的人类属性生成研究:Harpaintner et al. (2018) 和 Kelly et al. (2024)。我们选择这些研究是因为两者都提供了公开可用的数据和明确的编码分类法,使得在互补的实验设计下能够进行受控的人机比较。Harpaintner et al. (2018)(实验1)将抽象概念的属性组织为**感觉运动**、**内部状态**、**社会**和**言语联想**内容,反映了广泛文献中确立的抽象概念表示维度 (Troche et al., 2017; Villani et al., 2019)。Kelly et al. (2024)(实验2)提供了一个更专门的设置,具有不同的刺激设计和编码分类法,特别关注情感概念。使用这两项实验使我们能够测试人机锚定差距是否持续存在于不同的属性生成范式中,而不是源于单一数据集或编码方案。 ### 3.1 实验设置 图1:三个前沿大语言模型与人类基线在293个抽象名词基准测试 (Harpaintner et al., 2018) 上的每词属性类别频率分布。每个箱体跨越词级频率的第25-75百分位数;标注中位数。 我们在两项实验中应用相同的程序,遵循其原始设计。对于每个刺激词,我们提示模型生成脑海中浮现的属性、情境或联想(实验1为四个属性,实验2为五个),使用原始的人类指令(提示词见附录G)。然后,我们将生成的属性映射到该研究的分类法中……
相似文章
大型语言模型的地理空间概念探测:抽象性、组合性与接地
本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。
LLM神经解剖学第三部分 - LLMs似乎以几何而非语言思考
研究人员分析了LLMs在8种语言和多个模型中的内部表示,发现概念思考发生在transformer中间层的几何空间中,且与输入语言无关,这支持了类似于乔姆斯基理论的普遍深层结构假说,而非萨丕尔-沃尔夫语言相对论。
它们在思考什么?大语言模型中概念的界定、探测与追踪
本文提出了一种界定概念的方法,并训练线性探测器在大语言模型的嵌入中检测这些概念,以四个示例概念在三个模型上进行验证。该工作旨在实现对LLM内部表示的可扩展监控。
衡量人类与LLM研究思路之间的差距
本研究论文引入了一个框架,用于衡量人类生成与LLM生成的研究思路之间的分布差距,发现LLM思路集中在特定的机会模式与综合方法上,而人类思路则更为多样化。
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。