柏拉图洞穴有一个问题:告诉某人他们看到的只是阴影,实际上就是在墙上投下了另一个阴影
摘要
本文探讨了在大型语言模型(LLMs)背景下柏拉图洞穴的哲学问题,提出了一种实验来比较不同对话机制——重建性与扰动敏感性——如何在交互行为中产生可测量的差异。
柏拉图洞穴有一个有趣的问题。如果某人正盯着墙上的阴影,你走过来说:“那些只是阴影,”你刚刚给了他们什么?另一个阴影。😂 你可以解释火焰。你可以解释物体。你可以画出一个美丽的洞穴图示。但解释仍然通过你试图指向的那个相同的表征表面传达。大型语言模型(LLMs)可能为我们提供一种奇怪的方式,从外部使这个问题可见。不是因为AI以某种方式“逃离了洞穴”。而是因为我们可以重复运行交互。取相同的对话起点,让它在两种不同条件下发展。在第一种条件下,每个回应都越来越基于对先前内容的重建:分类、总结、概括解释、对说话者的假设。在第二种条件下,交互中出现的小差异被允许改变接下来发生的事情。一个纠正会改变下一个回应。一个意外的区别会改变轨迹。分歧得以保留。每个回合都依赖于前几回合实际发生的事情。然后扰动它们。改变一个小东西。纠正一个假设。移除他们使用的词汇。引入一个两种轨迹在开始时都未包含的区别。并观察在多回合后发生什么。问题不在于哪个对话听起来更舒服。问题在于这两种机制是否留下了可测量的不同足迹。我们能否检测到重建距离、对扰动的敏感性、对输入区别的保留、错误后的纠正以及路径依赖方面的差异?如果可以,那么柏拉图的问题就变得有趣起来。我们不再只是将投影仪的另一个解释投射到洞穴墙上。我们可能能够扰动投影过程,并实时观察其下游行为的变化。所以我想在评论中公开尝试这个实验,而不是告诉你答案是什么。
相似文章
大语言模型真的知道自己不知道什么吗?内部状态主要反映知识回忆而非真实性
本文质疑了大语言模型能够通过内部信号可靠区分幻觉输出和事实输出的假设,论证内部状态主要反映知识回忆而非真实性。作者提出了一套幻觉分类法(相关性幻觉与非相关性幻觉),并证明相关性幻觉的隐藏状态几何特性与事实输出重叠,使得标准检测方法失效。
LLM的未来发展方向
文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。
为何LLM幻觉不是模型问题——而是系统架构问题(4个生产环境护栏)
本文认为,生产环境中的LLM幻觉通常是系统架构问题,而非模型问题,并概述了四个关键护栏:RAG接地、实时工具/函数调用、选择性人工监督,以及红队/对抗性测试。
LLMs为何在结构化知识上产生幻觉:对线性化表示推理的机制分析
本文对LLMs在推理线性化结构化知识时产生幻觉的原因进行了机制分析,发现幻觉源于系统的内部动态,例如对捷径线索的关注以及前馈层中语义基础的失败,而非随机噪声。
LLMs 能内省吗?现实检验
本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。