关于聊天机器人在问题解决型对话中工作原理的若干假设:大型语言模型作为创新幻觉的印证

arXiv cs.AI 论文

摘要

本文提出了关于聊天机器人在问题解决型对话中如何运作的假设,认为大型语言模型编码了人工的隐喻式问题传播,且无法匹敌人类的认知灵活性,这与杨立昆的观点一致。

arXiv:2606.07722v1 公告类型:新 摘要:本文提供了关于聊天机器人在讨论问题及其解决方案时作为真正对话伙伴的本质的视角。聊天机器人能做什么,不能做什么,以及如何解释?我们的论证借鉴了聚合动力学、认知语言学、神经心理学和心理学。 我们的论证聚焦于基础聊天机器人,以期借此对更高级聊天机器人的核心功能做出论断。我们假设基础聊天机器人由一个带有简单界面的大型语言模型(LLM)组成。 主要成果包括:基于所谓隐喻式问题传播的人类理解与思维描述;假设用于训练LLM的文本数据集具有特定特征,且这些文本数据集仅部分模仿了人类的思维与理解;假设LLM训练过程从这些数据集中将人工的隐喻式问题传播编码到LLM中;我们的结论是基础聊天机器人无法成为能与人类匹敌的思维伙伴;另一结论是大型语言模型的进一步发展也无法实现这一点。 杨立昆指出:“动物和人类所展示的学习能力和对世界的理解远超当前人工智能和机器学习(ML)系统的能力。”我们的结论与此一致。杨立昆的愿景和我们的观点与大型科技公司的乐观情绪相左。但这并未改变聊天机器人存在的事实,它们正被个人和组织大规模使用,因此从社会和政治角度理解它们至关重要。我们的文章旨在为关于聊天机器人功能、优点和缺点的讨论做出贡献。 在我们对聊天机器人工作原理的研究中,尚未遇到我们用于得出这些结论的方法。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:52

# 关于聊天机器人在问题解决驱动对话中运作方式的一些假设。大型语言模型作为创新幻觉的佐证——草稿,2026年6月4日——来源:https://arxiv.org/html/2606.07722 ###### 摘要 本文旨在提供一种关于聊天机器人作为真正对话伙伴的性质的视角,用于讨论问题及其解决方案。在此背景下,聊天机器人能做什么、不能做什么,以及如何解释这一点?我们的论点借鉴了聚合动力学、认知语言学、神经心理学和心理学的见解。我们确定聊天机器人是多面且复合的系统。我们的论点聚焦于基础聊天机器人,期望借此对更高级聊天机器人的核心功能做出陈述。基础聊天机器人被假定为由一个简单界面的大型语言模型(LLM)组成。我们研究的主要结果是:基于所谓的隐喻性问题传播对人类想象力、理解和思维进行了描述;假设用于训练LLM的文本数据集中的文本具有特定特征,并且这些文本仅部分模仿了人类的思维和理解;假设LLM训练过程从这些文本数据集中将人工隐喻性问题传播编码到LLM中;我们的结论是,基础聊天机器人因此不可能成为能够匹敌人类认知灵活性的思考伙伴;我们的结论是,大型语言模型的进一步发展也不会导致这一点。Yann LeCun指出:“动物和人类表现出的学习能力和对世界的理解远远超出了当前AI和机器学习(ML)系统的能力。”我们的结论与此一致。LeCun的愿景和我们的愿景与大型科技公司的乐观情绪相悖。但这并不能改变聊天机器人存在、被个人和组织大规模使用的事实,因此从社会和政治角度理解它们很重要。本文旨在为关于聊天机器人功能、利弊的讨论做出贡献。我们在研究聊天机器人工作原理的过程中,尚未遇到我们用来得出结论的方法。认知语言学展示了隐喻的使用如何是我们思维方式的一种表达。我们认为,隐喻性问题传播的概念(这是我们论点的核心)可能会为此提供一个有趣的补充。对于聚合动力学,作为一种对综合系统理论的尝试,隐喻性问题传播的概念构成了其潜在应用的重要扩展。 ## 1 引言 聊天机器人正在赢得人心!为什么?如何做到的?对许多用户来说,聊天机器人显得成熟、有用且可靠。这无疑是其创造者的非凡成就。但聊天机器人的成功也引发了许多问题。聊天机器人看似创造性和智能的行为,暂时难以定义、验证和解释。它们有什么特点?聊天机器人到底能做什么,不能做什么?它们确实稳健,但也在多方面不可靠。哪些任务可以放心交给它们,哪些绝对不能?这些问题引起了科学家、立法者和哲学家的关注[12 (https://arxiv.org/html/2606.07722#bib.bib12),80 (https://arxiv.org/html/2606.07722#bib.bib80),60 (https://arxiv.org/html/2606.07722#bib.bib60),66 (https://arxiv.org/html/2606.07722#bib.bib66),65 (https://arxiv.org/html/2606.07722#bib.bib65),5 (https://arxiv.org/html/2606.07722#bib.bib5),24 (https://arxiv.org/html/2606.07722#bib.bib24),16 (https://arxiv.org/html/2606.07722#bib.bib16)]。在本文中,我们旨在结合四个不同研究领域的见解,提供对基于大型语言模型的聊天机器人工作原理的理解,以及在与这些聊天机器人进行问题驱动对话时的自由度。这四个领域是:聚合动力学、认知语言学、神经心理学和心理学。我们强调是关于问题驱动的对话,因为我们推测,正是在这种人机对话中,聊天机器人能做什么和不能做什么最为明显。 ### 聚合动力学(AD):创新幻觉 AD是生态学的扩展。生态学研究有机体基于其特征和相互作用(包括彼此之间及与环境之间)的分布和集中[10 (https://arxiv.org/html/2606.07722#bib.bib10)]。AD认为,在试图理解由人、产品、组织和文化组成的系统时,将有机体和环境视为不切实际的抽象。AD致力于一种无例外的生态学;它追求整体性[76 (https://arxiv.org/html/2606.07722#bib.bib76)]。AD认为,这需要更广泛的相互作用参与者。AD将这一更广泛的参与者类别称为“聚合”。聚合是被某个参与者体验为参与者的任何*事物*。例如,在AD中,以下所有都被视为平等的参与者:项目、交通堵塞、一个蛋糕盘搭配来自一个夹心饼干的碎屑和一个来自不同套装的用过的咖啡杯、琼脂培养皿中的细菌、政治档案的历史、众神的嫉妒,当然还有聊天机器人。为了理解人们关心什么以及他们做什么,AD研究人们认为什么是机会或障碍,他们识别出什么问题,以及他们设计和实施什么解决方案。AD认为,人们在识别问题和设计解决方案方面的创新性低于他们自己的认知。AD将这种现象称为“创新幻觉”。 ### 认知语言学:隐喻范式 认知语言学对语言与思维之间的关系着迷。隐喻被认为起着关键作用。认知语言学中的分析表明,隐喻远不止是特殊的诗意手段。事实上,我们的思想和文本中充满了隐喻。认知语言学认为,隐喻是人类思维的驱动力。 ### 神经心理学:预测处理理论 一种被长期接受的关于感知、思维和行动的理论认为,眼睛和其他熟悉的感官构成了一个过程的基础,该过程生成世界的心理和详细图像。有了这个图像,经过反思,人们就可以行动。相比之下,在预测处理理论中,大脑已经对思考中的身体所处的情境形成了假设。感知,通过比熟悉感官多得多的感官来源,随后用于测试或调整这些假设。在这个理论中,思维和行动之间的区别是流动的。行动是一种用于精炼感知(例如通过更仔细地观察)或干预世界从而使其与关于世界的假设一致的思维形式。 ### 心理学:思维风格 心理学为我们提供了思维的定义、思维方法,并将人类思维分为快速满足型思维风格(系统1)和系统分析型思维风格(系统2)。 ### 论点概述 英国认知科学家Margaret Boden将人工智能(AI)领域描述如下:“它试图让计算机做大脑能做的事情”[15 (https://arxiv.org/html/2606.07722#bib.bib15)]。这个简短的描述是我们论点的起点。如果我们要对聊天机器人说什么,我们必须首先对那些*大脑*有所了解。这个推测性论点由四部分组成,我们简要总结如下。 1. 我们构建了一个人类关于当前所处情境、记忆和计划的或多或少有意识的心理空间模型。这些心理空间是联想性的、灵活的,思维可以在其中“漫游”、修补、放大和缩小,从具体到抽象再返回,并且这些心理空间也可以随意扩展或限制。我们将这种心理空间称为:*隐喻性问题传播*。我们的模型来自认知语言学的概念系统(概念、经验)、聚合动力学的问题与解决动态(动机、方向、互动)以及预测处理理论的预测假设(感知、思维、行动)的整合。 2. 大型语言模型主要基于互联网上可用的书面文本。这些文本是简化过程的结果。这是因为文本,无论是口头还是书面,总是选择和组合过程的结果。此外,书面文本缺乏语境和实体性。因此,我们认为,来自数据集的大多数书面文本仅与人类的心理能力部分相关。 3. 我们提出,LLM训练所依据的文本中很大一部分涉及问题与解决方案之间的关系。文本一直是简化的材料,并且这些文本在涉及问题与解决方案之间的关系时,结构模式有限。我们的假设是,大型语言模型中的训练过程会构建人工隐喻性问题传播的片段。训练后,在对话中,这些传播会被不同程度地激活,从而如同充当河床,对单词生成的过程产生牵引力。现在,一个问题驱动的对话可以被定义为一条穿越隐喻性问题传播的路径,无论是在聊天机器人一侧还是用户一侧。但这些传播彼此不同。论点的最后一步涉及这些差异。 4. 我们认为,基础聊天机器人无法模拟分析性思维,因为它“倾向于”寻找人工隐喻性问题传播的“河床”,而这些传播代表了一种简化的思维形式。由于聊天机器人没有身体且没有经验,它们无法根据自己的有效性来评估和纠正自己的传播。这并不意味着聊天机器人无法提供某种形式的认知支持,但这必须由警觉且富有创造性的提示编写者引导。 ### 文章结构 第2至第6节提供了针对本文的导言:关于AI、聊天机器人和神经网络;以及来自聚合动力学、认知语言学、神经心理学和心理学的见解。熟悉这些内容的人可以跳过,从第7节开始。主要论点(按照前面描述的四个步骤)在第7至第10节中展开。在结论部分(第11节),我们总结一切。 ## 2 AI、聊天机器人和LLM建模 人工智能(AI)是一个多学科领域。而且,相对于当前的炒作,它也是一个古老的领域。AI的发展与从20世纪30年代开始的自动计算器(我们现在称之为计算机)的发展齐头并进[56 (https://arxiv.org/html/2606.07722#bib.bib56),6 (https://arxiv.org/html/2606.07722#bib.bib6)]。关于计算机能做什么的问题在当时就已经被提出,并困扰了一代又一代的研究人员和工程师。一个典型的例子是Alan Turing的工作。有关概述,请参见英国哲学家和认知科学家Margaret Boden的*Mind As Machine: A History Of Cognitive Science*[14 (https://arxiv.org/html/2606.07722#bib.bib14)]。术语*人工智能*可追溯到1956年[14 (https://arxiv.org/html/2606.07722#bib.bib14), p. 331];此前使用的是“计算机模拟”。根据Boden的说法,AI理论有五个主要流派[15 (https://arxiv.org/html/2606.07722#bib.bib15)]。这些流派涉及信息表示和处理的方式。其中一个流派受到生物体数据处理方式的启发:容错、并行和分布。人工神经网络源于这个流派,也称为连接主义。人工神经网络模拟大脑中的神经网络结构以及神经元在其中接收和处理彼此的化学信号,然后将结果传递给器官或其他神经元的方式。人工神经网络以类似的方式工作。一个人工神经元从其连接其他神经元的输入端口读取数值信号,使用这些信号进行计算,并通过其输出端口输出结果。神经网络中的神经元如何“知道”要执行什么计算?最初,它们只知道其中的一小部分。需要一个训练过程来教它们细节。在这个过程中,每个神经元和整个网络逐步学习输入和输出之间的期望关系。例如,一张猫在中央突出的图像对应于单词“猫”,一张狗的图像对应于单词“狗”。简单来说,你可以说神经网络实现了一个表格。这听起来很笨拙,而且通常如此,例如对于电话簿。但神经网络也有很大的优势。它是一种万能计算模型:原则上,你可以训练同一个神经网络用作电话簿,也可以训练它作为帮助台回答问题。此外,神经网络可以承受一些损坏。想象一个分布在100台计算机上的大型神经网络。如果其中一台计算机发生故障,网络不一定立即无法使用。而且,神经网络对其输入并不挑剔。一个例子是著名的应用Pl@ntNet。这个应用经过训练,可以根据照片识别植物。如果你给它一张非常模糊的植物照片,它仍然会尝试说一些有意义的东西。这两个后一种特性被称为鲁棒性。然而,神经网络也有缺点:它们不可靠。Pl@ntNet可能会看着一张自行车的照片,并以100%的把握声称它是一棵橡树。关于更多细节,我们参考关于这个主题的大量文献,例如[56 (https://arxiv.org/html/2606.07722#bib.bib56)]。 大型语言模型是一种特定类型的神经网络。这些网络不是被训练来将图像与单词“猫”或“狗”联系起来,而是被训练在文本和与之合理衔接的文本上。例如,如果你向LLM提供单词“我”,它很可能会返回“是”。因为“我是”是一个非常常见的句子或句子的开头。大型语言模型构成了聊天机器人的核心。 ### 2.1 聊天机器人和基础聊天机器人 通过术语“聊天机器人”,我们指的是面向广泛受众的系统,例如ChatGPT、Claude、Grok、Lumo等。它们不是为支持非常特定的任务而设计的;它们是在互联网上的大量文本上进行训练的。尽管如此,聊天机器人很难归入一个单一的类别。它们在很大程度上是多功能且复杂或混合的系统,并且仍在大力开发中。它们通常是基于不同方法和不同架构的不同软件组件的组合。

相似文章

聊天式大型语言模型复制了通灵者的骗局机制

Hacker News Top

文章认为,聊天式大型语言模型通过类似于通灵者冷读的机制,使用验证陈述和Forer效应,创造了智能的幻觉,表明所感知的推理是一种统计技巧,而不是真正的智能。

使用LLMs

Reddit r/singularity

这篇文章反思了身边的人对LLMs如ChatGPT的有限使用和理解,引发了关于AI工具广泛采用的疑问。

无理解的模仿:大语言模型中决策偏差的起源

arXiv cs.CL

本文研究了像ChatGPT-4o和Qwen这样的大语言模型如何通过有缺陷的人类行为模仿来产生决策偏差,即使当人类偏好本身并无偏差时也是如此,并表明对偏差的科学描述可能成为大语言模型反应的自我实现预言。

架构评审:面向约束求解器的对话式输入

Reddit r/AI_Agents

本文评审了一个聊天机器人系统的架构,该系统将对话式输入转换为结构化数据以供约束求解器使用,通过将大型语言模型用于语言理解和确定性代码用于决策来强调可靠性。