探究鸿沟:为什么更好的AI答案并不自动带来更好的思考

Reddit r/artificial 新闻

摘要

本文探讨了“探究鸿沟”——生成答案与提出好问题之间的差异——认为更廉价的AI答案并不一定能改善思考。

在人类历史的大部分时间里,获得一个称职的答案是昂贵的。你可能需要进入图书馆、多年的专业训练、昂贵的设备,或者需要某个比你懂得更多的人的关注。即使答案已经存在,找到它、理解它并应用它也可能需要相当长的时间。生成式AI正在改变这一等式的一部分。对于越来越多的一般性认知任务,如今可以在几秒钟内产生看似合理且通常有用的答案。一个人可以以可忽略不计的边际成本请求解释一个技术概念、比较竞争理论、编写一个初始计算机程序、进行商业分析,或概括大量知识。这并不意味着可靠的知识已经免费。实验科学、数学证明、原创研究、不确定性下的判断以及对重大结论的验证仍然困难。AI系统也可能产生自信的错误、合成的引用、肤浅的类比和有说服力的胡说八道。尽管如此,一些重要的东西已经改变:生成一个“答案形状的物体”的成本急剧下降。当答案变得更容易获得时会发生什么?乐观的观点是,更好地获取答案自然会带来更好的思考。更多人将能够学习、解决问题、创造并参与智力工作。这可能部分正确。但它忽略了一种独立的认知能力:知道接下来需要问什么。答案生成和问题生成不是一回事。一个系统可能非常擅长解决一个明确定义的问题,却很难注意到问题被错误地框定、关键信息缺失、一个隐藏的假设在起关键作用,或者最有价值的下一步不是另一个答案,而是一个更好的问题。这就是“探究鸿沟”。 1. 答案并不定义自己的问题 考虑三个请求:“最有效的治疗方法是什么?”“这家公司的最佳策略是什么?”“这个AI系统安全吗?”每一个看起来都在请求一个答案。但还没有一个被明确定义的问题。对哪个患者、哪种情况、哪个结果、什么时间范围以及哪种风险容忍度有效?根据增长、韧性、利润、使命、员工福利还是生存概率来说是最佳?对谁安全、在什么环境中、针对哪些故障模式、在何种治理下、与什么替代方案相比?对一个不明确的问题给出一个复杂的答案,可能还不如对一个构造良好的问题给出一个适度的答案更有用。更糟糕的是,流畅的答案可能掩盖问题的不明确性。这个答案可能给人一种问题已经解决的印象,而真正的问题尚未被识别。这并非AI独有。人类经常这样做。我们回答被问到的问题、我们希望被问到的问题,或者我们的专业训练使我们准备回答的问题。AI使这一现象更加明显,因为它将响应生成工业化。语言模型很少仅仅因为问题本可以被更好地框定就拒绝继续。它通常会试图完成模式。这种倾向可能有用。它也可能制造一种认知闭合的错觉。 2. 一个问题实际上做了什么? 一个问题通常被描述为对信息的请求。这没错,但不完整。问题可以执行几种不同的操作。它们可以减少不确定性:它们可以揭露假设:它们可以改变分析层次:它们可以识别缺失的证据:它们可以挑战问题的边界:它们可以在社会中分布认知:它们可以产生替代方案:它们也可能误导、操纵、预设虚假前提、过早地收窄注意力或制造错误的困境。因此,一个问题并非自动有价值。它的价值取决于它对探究做了什么。一个有用的工作假设是:有时它收窄搜索空间。有时它重构搜索空间。有时它揭示当前的搜索空间是错误的。这种框架并非声称问题是智力的基本单位。它们不是。进化无需提问就能适应。控制系统无需语言就能最小化误差。神经网络可以通过基于梯度的优化来学习。科学进步可以从观察、仪器、实验、意外、激励和制度竞争中涌现。问题属于一个更大的认知操作符家族,包括目标、约束、假设、观察、模型、实验和决策规则。它们的特殊重要性可能在于别处:问题是一种非常紧凑的方式,可以在人与人、人与机器之间指导和协调认知。 3. 作为社会技术的问题 当私人不确定性可以被表达时,它在组织上就变得可操作。“我不理解”是一种状态。“什么证据会改变我们的决定?”是一个群体可以执行的操作。一个精心构造的问题可以:揭示不确定性的位置;将注意力引向一个缺失的区分;分配调查工作;确定应该咨询谁;定义答案的可接受形式;暴露先前隐藏的分歧;允许多个主体在同一问题的不同部分上工作。这使得问题成为社会技术的一种形式。它们不仅仅从另一个人那里提取信息。它们可以组织一个临时的认知系统,涉及研究人员、机构、数据库、仪器,以及越来越多的AI代理。这在科学中尤为明显。“为什么物体下落?”过于宽泛,本身不足以构成一个研究计划。但关于运动、力、测量、预测和数学关系的越来越精确的问题,可以重构整个领域。在组织中也是如此。一个团队问“我们如何更努力地工作?”产生的搜索过程,不同于一个团队问:哪个活动实际上在制约吞吐量?如果我们重新设计流程,哪些工作会消失?哪个指标在奖励错误的行为?什么能证伪我们当前的战略?哪个依赖关系阻止我们离开这个供应商?差别不是修辞上的。这些问题会产生不同的调查、证据、决策和制度轨迹。 4. 信息增益有用,但不够 评估一个问题的一种方式是期望信息增益。想象一组相互竞争的假设。一个好的诊断性问题会高效地划分它们。它的答案排除许多可能性,或急剧改变它们的概率。这个想法出现在信息论、贝叶斯实验设计、认知科学、诊断、主动学习和决策理论中。它给了我们一种严格的方法来理解为什么有些问题比其他问题更具信息量。一个完美平衡的是非问题,在正确的假设下,可以消除剩余可能性的一半。但信息增益并不是全部。一个问题可能具有高度信息量但仍然无关。假设我试图理解一家公司为何失败。询问员工鞋子的确切颜色分布可能会减少关于鞋类的不确定性,但对改善诊断毫无作用。一个问题也可能以过高的成本产生大量信息。一项医学检查可能有信息量但很危险。一个实验可以区分理论之间,但需要的资源可能更好地用在别处。问题也可能产生政治和组织影响。“谁负责?”启动的过程不同于“哪些条件使这种结果变得可能?”前者可能分配责任。后者可能揭示系统性原因。两者都不是普遍优越的。因此,更广泛的评估需要几个维度: 信息价值 答案可能减少多少不确定性? 区分价值 它会
查看原文

相似文章

AI更擅长寻找答案而非质疑假设

Reddit r/ArtificialInteligence

探讨了AI如何在既定范围内擅长寻找答案,但可能缺乏质疑基本假设的能力,暗示了与人类智能的关键差异。

用AI思考与依赖AI的区别

Reddit r/ArtificialInteligence

本文探讨了将AI作为增强思维的工具与过度依赖AI之间的区别,强调了保持人类批判性思维和判断力的重要性。

我觉得我们对AI的讨论搞错了方向。

Reddit r/ArtificialInteligence

作者认为,关于AI的对话应少关注更好的模型,多关注利用AI发展人类的专业知识、判断力和批判性思维,重新定义AI素养,帮助人们超越单纯的提示词使用而成长。