AI 自信犯错的程度远超人们想象,不服来辩

Reddit r/ArtificialInteligence 新闻

摘要

一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。

我一直在大量使用 AI 做研究和分析工作,最让我困扰的是,即使它错了,听起来也那么自信。不一定是编造虚假事实,更像是拿着单薄或含糊的数据,却以与数据充分时相同的语气给出结论。具体例子:我让它分析一批客户反馈,并对主要投诉进行排名。它给了我一份干净的清单,没有含糊其辞,没有“这不确定”。我回头亲自核对了原始数据,发现其中一条“主要投诉”在大约 200 条评论里只出现了两次。两次。但它呈现出来的自信程度,和那条出现了 60 次的投诉一模一样。没有标记,没有“样本量小”,什么都没有。只是一份整洁的排名列表,从上到下看起来都同样可靠。我认为问题在于,这些模型被优化得听起来连贯,而不是传达不确定性。人类分析师如果某个结论只有 2 个数据点,通常会说“不确定这个是否真实,样本量太小”,因为承认不确定性是人类正常的行为。模型不会这样做,除非你明确强迫它,因为生成一个含糊的表述不会像生成一个干净答案那样得到奖励。让我担心的是,人们很容易察觉不到这一点。输出读起来太专业了,你会停止质疑它。我之所以发现这个虚假模式,是因为我碰巧抽查了原始数据;如果我没这么做,那条 2/200 的投诉就会作为“头号关注点”出现在真正的战略文档里。这是一个已知的局限,人们已经找到了变通方法,还是说我们所有人都必须永远手动核验一切?这从一开始就在某种程度上违背了使用 AI 节省时间的初衷。不服来辩:这真的是个大问题,还是我想多了,这其实只是一个可修复的提示词问题?
查看原文

相似文章

AI研究工具仍过于热衷将公开信号转化为确定性

Reddit r/artificial

作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。

最重要的AI失败可能是虚假自信,而非错误答案

Reddit r/ArtificialInteligence

本文认为,最危险的AI失败并非源于错误答案,而是系统基于不完整的数据、过时的上下文或糟糕的假设,以虚假自信行事。这表明AI评估应优先考虑处理不确定性的能力,而非原始智能。

当AI显得“过于自信”

Reddit r/ArtificialInteligence

本文探讨了一种心理现象:用户不信任AI,并非因为它出错,而是因为其肯定语气与用户自身内心的不确定性不匹配,并运用期望违背理论来解释这种摩擦。