大型语言模型的地理空间概念探测:抽象性、组合性与接地

arXiv cs.CL 论文

摘要

本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。

arXiv:2608.07353v1 公告类型:新 摘要:理解概念是泛化的基础。尽管大型语言模型(LLM)在广泛任务上表现惊人,但在真正的概念理解上仍存在困难。先前的工作使用自然语言基准或范围狭窄的合成任务来评估LLM的概念理解,但这些设置常常混淆多种技能,或缺乏对底层概念及其属性的精确控制。为了支持对LLM中的概念进行受控探测,我们针对其核心属性设计了测试:抽象性、组合性和接地性。我们搭建了一个以概念为中心的基准,聚焦方向、距离、拓扑及其组合等空间概念,并使用问答任务作为代理。我们在多种LLM架构和训练方案上进行了大量实验,以分析模型规模和设计如何影响概念理解。结果揭示了当前LLM的明显局限性,并为影响其获取和组合结构化概念能力的因素提供了见解。我们的发现有助于重新设计基于概念的LLM,以改善信息访问和知识管理。代码将发布在 https://github.com/rd20karim/concept-probing。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:05

# 大语言模型的地理空间概念探测:抽象性、组合性与接地性
来源:https://arxiv.org/html/2608.07353 (2026)

###### 摘要

概念理解是泛化的基础。尽管大语言模型(LLMs)在各种任务上表现令人印象深刻,但它们仍然难以实现真正的概念理解。已有工作使用自然语言基准或范围狭窄的合成任务来评估LLM的概念理解,但这些设置往往混淆多种技能,或对底层概念及其属性缺乏精确控制。为了支持对LLM中概念的受控探测,我们围绕概念的核心属性设计了测试:抽象性、组合性和接地性。我们构建了一个以概念为中心的基准,针对方向、距离、拓扑及其组合等空间概念,并使用问答任务作为代理。我们在多种LLM架构和训练机制上进行了大量实验,以分析模型规模与设计如何影响概念理解。结果揭示了当前LLM的明显局限,并为哪些因素塑造其获取和组合结构化概念的能力提供了见解。我们的发现为如何重新设计基于概念的LLM以改善信息获取和知识管理提供了启示。代码将在https://github.com/rd20karim/concept-probing 上公开。

大语言模型、探测、地理、概念。

††版权:ACM许可††期刊年份:2026††DOI:XXXXXXX.XXXXXXX††CCS:信息系统 检索模型与排序

## 1. 引言

大语言模型(LLMs)展现出了广泛的能力,但关于它们能否成为人类语言理解的模型,仍是一场开放的哲学与科学辩论,影响着认知科学、机器学习(ML)、自然语言处理(NLP)以及信息研究学科(Pavlick,2023 (https://arxiv.org/html/2608.07353#bib.bib5);Yildirim和Paul,2024 (https://arxiv.org/html/2608.07353#bib.bib2);Goddu等人,2024 (https://arxiv.org/html/2608.07353#bib.bib1)),仅举几例。辩论的一个主要主题是其能力的来源:它们的行为是像“统计鹦鹉”,还是能够组织符号化、结构化的概念表征,并在生成过程中操作这些表征?这个问题至关重要,因为概念是智能的基石,能够带来更好的泛化性和可解释性(Poeta等人,2025 (https://arxiv.org/html/2608.07353#bib.bib27))。近期工作开发了针对LLM中概念的探测和学习技术。探测可以通过下游任务评估聚焦于事实知识(Manvi等人,2024b (https://arxiv.org/html/2608.07353#bib.bib42);Zhang等人,2025 (https://arxiv.org/html/2608.07353#bib.bib12);Ji等人,2025 (https://arxiv.org/html/2608.07353#bib.bib13);Dumitru等人,2025 (https://arxiv.org/html/2608.07353#bib.bib74)),或者聚焦于其内部表征以解释其预测(例如,机制可解释性(Wang等人,2024 (https://arxiv.org/html/2608.07353#bib.bib3);Parry等人,2025 (https://arxiv.org/html/2608.07353#bib.bib80)))。概念学习指的是学习概念表征并在模型内部层中显式利用这些表征,例如概念瓶颈模型(Koh等人,2020 (https://arxiv.org/html/2608.07353#bib.bib4))。鉴于概念跨任务和领域的开放性,其他工作评估了文献中公认的概念属性(Fodor和Pylyshyn,1988 (https://arxiv.org/html/2608.07353#bib.bib44);Stein等人,2024 (https://arxiv.org/html/2608.07353#bib.bib46);Lovering和Pavlick,2022 (https://arxiv.org/html/2608.07353#bib.bib20);Lewis等人,2024 (https://arxiv.org/html/2608.07353#bib.bib19))(例如,组合性(Stein等人,2024 (https://arxiv.org/html/2608.07353#bib.bib46);Lewis等人,2024 (https://arxiv.org/html/2608.07353#bib.bib19)))是否可以在LLM中被表示甚至学习。对概念属性的评估能提供对LLM概念理解更细粒度的洞察,从而更好地控制概念探测和学习。

研究空白。最近,人们越来越关注研究LLM对真(Azaria和Mitchell,2023 (https://arxiv.org/html/2608.07353#bib.bib22))、时间与空间(Gurnee和Tegmark,2024 (https://arxiv.org/html/2608.07353#bib.bib43))、患者性别(Ahsan等人,2025 (https://arxiv.org/html/2608.07353#bib.bib21))以及性别偏见(Yu和Ananiadou,2025 (https://arxiv.org/html/2608.

相似文章

大语言模型几何表示鲁棒性评测

arXiv cs.CL

# 大语言模型几何表示鲁棒性评测 来源:[https://arxiv.org/html/2604.16421](https://arxiv.org/html/2604.16421) Vedant Jawandhia 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Yash Sinha 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Ankan Pal 数学系,BITS Pilani

接地鸿沟:大语言模型如何以不同于人类的方式锚定抽象概念的含义

arXiv cs.CL

本研究调查了大语言模型(LLMs)与人类在理解抽象概念时的“接地”(grounding)差异,发现存在显著的“接地鸿沟”:模型过度依赖词语联想,而较少涉及情感或内在状态。作者利用稀疏自编码器(SAEs)识别出与接地维度相关的内部特征,表明LLM虽然具备这些信息,但在自由生成文本时并未像人类一样自然地调用它们。

地理空间基础模型的新兴范式:从预训练到智能体推理

arXiv cs.AI

本文综述了地理空间基础模型(GeoFMs)的新兴范式,这些模型在海量地理空间数据集上进行预训练,以实现对卫星和航空影像的快速微调和零样本分析。内容涵盖范式转变、模型适配策略,以及以大语言模型(LLMs)为编排器的智能体地理空间推理的前瞻性愿景。