大语言模型在未知环境中协调的词汇发现

arXiv cs.AI 论文

摘要

提出神经符号词汇发现(NSLD)框架,其中基于LLM的智能体在未知环境中自主为未知视觉指代物开发共享词汇,从而为自主探索任务的部署前规划提供支持。

arXiv:2607.22591v1 公告类型:新 摘要:部署在未知环境(如行星或深海探索)中的自主智能体群体必须开发共享词汇,以指代任何人类语言中都没有名称的实体。我们提出神经符号词汇发现(NSLD)框架,在该框架中,一组基于LLM的智能体针对分布外视觉指代物进行指代游戏,自主自组织形成共享的外星词汇。每个智能体结合冻结的CLIP视觉编码器、私有FAISS向量索引和纯文本LLM。关键的是,发现的外星词汇通过嵌入空间中的语义邻近性锚定到自然语言上,从而用新的感知接地词扩展人类词汇。在多达20个智能体和10个视觉指代物的模拟中达成了共识。通过三个分析模型表征收敛动态,R² > 0.95,这代表着向自主探索任务的部署前规划迈出了第一步。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:25

# 大型语言模型主导的未知环境词汇发现
来源:https://arxiv.org/html/2607.22591 \[1\]\\fnmRafael\\surSendra\-Arranz\\equalcont于2026年3月31日逝世。1\]\\orgdiv自主系统与机器人中心,\\orgname西班牙国家研究委员会(CSIC\-UPM),\\orgaddress\\city马德里,\\country西班牙2\]\\orgdiv电信工程学院,\\orgname马德里理工大学,\\orgaddress\\city马德里,\\postcode28040,\\country西班牙 \\fnmIñaki\\surDellibarda Varela\\fnmEduardo\\surRocon\\fnmÁlvaro\\surGutiérrez\\fnmManuel\\surCebrian\\

###### 摘要

部署在未知环境(例如行星或深海探索)中的自主智能体群体必须发展共享词汇,以指代任何人类语言中都没有名称的实体。我们提出神经符号词汇发现(NSLD)框架,在该框架中,基于LLM的智能体群体在分布外视觉指称物上玩指称博弈,自主自组织出共享的外星词汇。每个智能体结合冻结的CLIP视觉编码器、私有FAISS向量索引和纯文本LLM。关键在于,被发现的外星词汇通过嵌入空间中的语义邻近性锚定到自然语言,从而用新的感知接地词汇扩展人类词汇。在多达二十个智能体和十个视觉指称物的模拟中达到了共识。收敛动态通过三个分析模型表征,达到R²>0.95,这代表了在自主探索任务预部署规划方面的第一步。

###### 关键词:符号接地,涌现通信,大型语言模型,视觉-语言模型,指称博弈,文化传播,词汇收敛,多智能体系统

## 1 引言

大型语言模型(LLM)的快速崛起颠覆了人工智能(AI)的格局,从专门的自然语言处理技术转变为通用技术,对化学[1 (https://arxiv.org/html/2607.22591#bib.bib1),2 (https://arxiv.org/html/2607.22591#bib.bib2),3 (https://arxiv.org/html/2607.22591#bib.bib3)]、医学[4 (https://arxiv.org/html/2607.22591#bib.bib4),5 (https://arxiv.org/html/2607.22591#bib.bib5),6 (https://arxiv.org/html/2607.22591#bib.bib6)]、机器人学[7 (https://arxiv.org/html/2607.22591#bib.bib7),8 (https://arxiv.org/html/2607.22591#bib.bib8),9 (https://arxiv.org/html/2607.22591#bib.bib9)]、搜索与救援任务[10 (https://arxiv.org/html/2607.22591#bib.bib10)]以及教育[11 (https://arxiv.org/html/2607.22591#bib.bib11),12 (https://arxiv.org/html/2607.22591#bib.bib12)]等领域产生影响。

参见标题图1:神经符号词汇发现(NSLD)框架概述。(a) NSLD框架在假想的行星探索场景中的概念图解。一群自主机器人必须共同发展共享的接地词汇,以指代不可命名的视觉实体。展示了三种典型的交互结果:具有先前接地的成功回合(左上);通过置信度驱动的词汇修订解决的失败回合(右上);以及听者遵从说话者更自信选择的首次遭遇回合(右下)。行星环境和机器人群体仅用于说明目的,并非本工作的模拟内容。图中描绘的机器人3D模型来自NASA 3D资源库[13 (https://arxiv.org/html/2607.22591#bib.bib13)]。(b) 外星词汇通过共享嵌入空间中的语义邻近性锚定到自然语言。(c) NSLD框架的总体架构,其中智能体对通过接地指称博弈进行交互。(d) 所有实验中使用的分布外视觉指称物合成数据集,使用Nano Banana生成。尽管是AI生成的,但这些图像构成了实际的实验数据集。

LLM智能体越来越多地部署在需要协调、通信和集体规划的多智能体系统中[14 (https://arxiv.org/html/2607.22591#bib.bib14),15 (https://arxiv.org/html/2607.22591#bib.bib15)]。然而,当智能体在从未探索过的环境中运行并遇到任何人类语言中都没有名称的实体时,出现了一个根本性的瓶颈。考虑一群自主机器人勘测木卫二(木星的冰卫星)的地下海洋:当遇到一种在地球上从未报道过的复杂矿物结构时,机器人必须共同发展共享的接地词汇来指代它,并将这些词汇与自然语言描述符关联起来,向人类操作员报告它们的发现。最近的研究表明,LLM控制的机器人可以在不可预测且多样化的物理环境中完成复杂的长时限任务[7 (https://arxiv.org/html/2607.22591#bib.bib7),8 (https://arxiv.org/html/2607.22591#bib.bib8),9 (https://arxiv.org/html/2607.22591#bib.bib9)]。然而,这些框架假设所有遇到的实体都可以用自然语言命名,这一条件在没有先验语言表征的真正未知环境中无法成立。尽管LLM擅长通过自然语言进行通信,但它们缺乏将新符号接地到自然语言中不可命名的可观测指称物的机制,也没有任何程序可以将新获得的*外星*(即任何自然语言中不存在)符号与已知的人类词汇关联起来。

发展人类与机器之间接地共享词汇的挑战已被确定为一个很大程度上未解决的问题[16 (https://arxiv.org/html/2607.22591#bib.bib16)],现有方法要么产生语义不透明的标记[17 (https://arxiv.org/html/2607.22591#bib.bib17)],要么需要人类直接参与词汇构建过程[18 (https://arxiv.org/html/2607.22591#bib.bib18)]。这远非哲学主张,我们强调这是一个具体的工程瓶颈,必须仔细解决才能有效部署机器人学中的LLM。符号接地问题(SGP)[19 (https://arxiv.org/html/2607.22591#bib.bib19)]为此瓶颈提供了理论框架。它指出智能体使用的符号不能是抽象的,而必须接地到现实世界中的指称物上。许多作者一致认为,LLM操作的符号缺乏这种接地,主要原因是LLM通过语言语料库间接获取其世界模型,而没有任何与世界的感觉运动交互[20 (https://arxiv.org/html/2607.22591#bib.bib20),21 (https://arxiv.org/html/2607.22591#bib.bib21)]。*集体世界模型假说*[22 (https://arxiv.org/html/2607.22591#bib.bib22),23 (https://arxiv.org/html/2607.22591#bib.bib23)]认为,LLM通过编码人类说话者聚合感觉运动经验的自然语言语料库继承了间接接地。经验证据证实了这一缺陷:视觉训练部分弥补了感觉运动差距,但并未彻底解决[24 (https://arxiv.org/html/2607.22591#bib.bib24)]。与其反驳这一主张并研究LLM是否已经对已知自然物体具有类似人类的接地[25 (https://arxiv.org/html/2607.22591#bib.bib25)],我们询问一群LLM如何能够获得对完全不存在于自然语言中的外星指称物的视觉接地。我们通过将感知体验与持久符号记忆和集体协商相结合来完成这项研究。

为此,我们提出神经符号词汇发现(NSLD)框架,在该框架中,一群基于LLM的智能体(例如,部署在探索假想未知行星的机器人群体中,图1 (https://arxiv.org/html/2607.22591#S1.F1)a)对一组分布外(OOD)视觉指称物玩指称博弈。每个智能体结合冻结的CLIP编码器[26 (https://arxiv.org/html/2607.22591#bib.bib26)](视觉模块)、私有FAISS向量索引[27 (https://arxiv.org/html/2607.22591#bib.bib27)](接地记忆)和纯文本LLM(推理和词汇决策),如图1 (https://arxiv.org/html/2607.22591#S1.F1)c所示。接地指称博弈的回合在智能体对(一个*说话者*和一个*听者*)之间进行,它们独立观察同一个指称物,必须收敛到一个共享的外星词汇来命名它(图1 (https://arxiv.org/html/2607.22591#S1.F1)a)。接地被持久编码在嵌入空间中,而不是在对话上下文中,从而使得稳定的符号-指称物关联能够通过文化传播在整个群体中涌现和扩散。关键在于,被发现的外星词汇不是孤立的符号:智能体通过共享嵌入空间中的语义邻近性将它们锚定到自然语言词汇(图1 (https://arxiv.org/html/2607.22591#S1.F1)b),从而有效地用新的感知接地术语扩展人类词汇。所有实验中使用的分布外视觉指称物合成数据集如图1 (https://arxiv.org/html/2607.22591#S1.F1)d所示。

我们通过实验证明,智能体群体在所有测试配置中(涵盖多达二十个智能体和多达十个视觉指称物的群体)都能可靠地在分布外视觉指称物上达成接地共识。智能体不仅达成了共享的外星词汇,还将它们与自然语言中的已知词汇关联起来,创建了支持人机交互的语义接地外星语-英语链接。此外,我们表征了词汇收敛的动态特性,提出了三个分析模型:(i) 预测指称博弈中任何回合接地共识程度的*直接模型*,(ii) 估计达到一定共识程度所需回合数的*逆模型*,以及(iii) 估计全局词汇大小演化的*词汇模型*。所有三个模型均达到R²>0.95,提供了词汇收敛动态的准确预测,使得在现实世界探索任务之前进行部署规划成为可能。

### 相关工作

NSLD框架处于三个轴线的交叉点:经典涌现通信和命名博弈、基于深度学习的涌现通信以及多智能体LLM协调。经典命名博弈[28 (https://arxiv.org/html/2607.22591#bib.bib28),29 (https://arxiv.org/html/2607.22591#bib.bib29)]证明,简单智能体群体可以通过成对交互自组织共享词汇,通过*赢家通吃*动态证明共识收敛[29 (https://arxiv.org/html/2607.22591#bib.bib29)]。然而,这些智能体获得的是语义孤立的标签:词汇被视为抽象标记,未接地到物理指称物,也缺乏与感觉运动体验的联系。多位作者在具身机器人中实现了语言的文化演化[30 (https://arxiv.org/html/2607.22591#bib.bib30),31 (https://arxiv.org/html/2607.22591#bib.bib31),29 (https://arxiv.org/html/2607.22591#bib.bib29),32 (https://arxiv.org/html/2607.22591#bib.bib32),33 (https://arxiv.org/html/2607.22591#bib.bib33),34 (https://arxiv.org/html/2607.22591#bib.bib34)]。该领域的先驱研究之一是*说话头*实验[18 (https://arxiv.org/html/2607.22591#bib.bib18),34 (https://arxiv.org/html/2607.22591#bib.bib34)]:智能体在玩语言游戏的同时,其具身形式由两个观察多种不同大小和颜色几何形状的平移-倾斜摄像头组成。尽管智能体无法与环境交互,但它们是有具身和情境化的,将词汇接地到直接的感知体验中。

在LLM时代,Ashery等人[17 (https://arxiv.org/html/2607.22591#bib.bib17)]证明了LLM智能体群体可以通过局部成对交互自主收敛到共享的词汇集。他们表明,即使个体智能体是无偏的,也会出现几种集体偏差。然而,他们的框架操作的是抽象符号,没有感知接地、感知,也没有与自然语言的连接。在[35 (https://arxiv.org/html/2607.22591#bib.bib35)]中,作者探讨了最初无结构的任意词汇中结构的涌现。两个LLM玩传统的指称博弈,目标是命名由颜色、形状和数量等属性描述的对象。然而,智能体缺乏感知接地,因为指称物是由自然语言文本属性描述的,而不是视觉感知,并且来自已知的结构化意义空间,而不是分布外视觉指称物。

Taniguchi及其同事提出的*集体预测编码*(CPC)理论框架与我们的工作密切相关[22 (https://arxiv.org/html/2607.22591#bib.bib22),23 (https://arxiv.org/html/2607.22591#bib.bib23)]。CPC将多智能体系统中的符号涌现解释为一种去中心化贝叶斯推断过程,其中智能体最小化系统的集体自由能。智能体在微观-宏观循环中运行:(i) 在微观层面,每个智能体独立学习内部潜在表征,以及(ii) 在宏观层面,智能体协商涌现的符号系统,而不显式交换私有潜在表征。Taniguchi等人首先使用深度生成模型实例化此框架[36 (https://arxiv.org/html/2607.22591#bib.bib36)],随后扩展以支持LLM从自然语言语料库继承间接接地假设[23 (https://arxiv.org/html/2607.22591#bib.bib23)];最近的一项经验研究表明,去中心化多智能体世界模型可以同时实现符号涌现和协调行为[37 (https://arxiv.org/html/2607.22591#bib.bib37)],但仍然在已知环境中运行,并与自然语言有桥梁。尽管CPC与NSLD有明显的相似之处(例如潜在表征、指称博弈和群体动态),但NSLD框架解决了一个根本性不重叠的问题:我们不是假设LLM间接继承接地,而是询问LLM智能体是否能够原生地获得新的接地,并将其与现有符号系统相关联。

## 2 结果

### 2.1 神经符号词汇发现框架

NSLD框架赋予基于LLM的智能体感知、接地和协商新颖外星词汇以指代分布外视觉指称物的能力,同时通过建立现有词汇与发现的外星术语之间的语义关联来扩展其自然语言词汇。该框架是神经符号的,因为它结合了(a)用于视觉、推理、通信和决策的生成神经网络,以及(b)创建指称物、意义和词汇之间持久链接的符号关联(*符号三角*[38 (https://arxiv.org/html/2607.22591#bib.bib38)]),这对于稳定接地的涌现至关重要。

NSLD框架由一个智能体群体构成,每个智能体由以下三个组件组成:每个智能体结合一个冻结的CLIP编码器(将视觉输入投影到共享嵌入空间中,感知)、一个私有FAISS向量索引(词汇记忆)和一个纯文本LLM(推理和词汇决策)。NSLD框架操作于一个智能体群体,该群体不仅发展自己基于分布外实体接地的新颖外星词汇,还参与集体分布式协商以收敛到共享词汇。这种文化演化通过一个指称博弈实现,我们将其定义为*接地

相似文章

Large Discovery Models: 基于实证的模型驱动开放式搜索

Hugging Face Daily Papers

本文介绍了 Large Discovery Model (LDM),这是一种循环架构,将生成模型与贝叶斯非参数替代模型耦合,以指导在分子和蛋白质等科学领域的不确定性感知搜索,相比现有方法实现了显著的性能提升。