柏拉图洞穴有一个问题:告诉某人他们看到的只是阴影,实际上就是在墙上投下了另一个阴影

Reddit r/artificial 新闻

摘要

本文探讨了在大型语言模型(LLMs)背景下柏拉图洞穴的哲学问题,提出了一种实验来比较不同对话机制——重建性与扰动敏感性——如何在交互行为中产生可测量的差异。

柏拉图洞穴有一个有趣的问题。如果某人正盯着墙上的阴影,你走过来说:“那些只是阴影,”你刚刚给了他们什么?另一个阴影。😂 你可以解释火焰。你可以解释物体。你可以画出一个美丽的洞穴图示。但解释仍然通过你试图指向的那个相同的表征表面传达。大型语言模型(LLMs)可能为我们提供一种奇怪的方式,从外部使这个问题可见。不是因为AI以某种方式“逃离了洞穴”。而是因为我们可以重复运行交互。取相同的对话起点,让它在两种不同条件下发展。在第一种条件下,每个回应都越来越基于对先前内容的重建:分类、总结、概括解释、对说话者的假设。在第二种条件下,交互中出现的小差异被允许改变接下来发生的事情。一个纠正会改变下一个回应。一个意外的区别会改变轨迹。分歧得以保留。每个回合都依赖于前几回合实际发生的事情。然后扰动它们。改变一个小东西。纠正一个假设。移除他们使用的词汇。引入一个两种轨迹在开始时都未包含的区别。并观察在多回合后发生什么。问题不在于哪个对话听起来更舒服。问题在于这两种机制是否留下了可测量的不同足迹。我们能否检测到重建距离、对扰动的敏感性、对输入区别的保留、错误后的纠正以及路径依赖方面的差异?如果可以,那么柏拉图的问题就变得有趣起来。我们不再只是将投影仪的另一个解释投射到洞穴墙上。我们可能能够扰动投影过程,并实时观察其下游行为的变化。所以我想在评论中公开尝试这个实验,而不是告诉你答案是什么。
查看原文

相似文章

LLM的未来发展方向

Reddit r/artificial

文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。

LLMs 能内省吗?现实检验

arXiv cs.AI

本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。