AI 自信犯错的程度远超人们想象,不服来辩
摘要
一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。
我一直在大量使用 AI 做研究和分析工作,最让我困扰的是,即使它错了,听起来也那么自信。不一定是编造虚假事实,更像是拿着单薄或含糊的数据,却以与数据充分时相同的语气给出结论。具体例子:我让它分析一批客户反馈,并对主要投诉进行排名。它给了我一份干净的清单,没有含糊其辞,没有“这不确定”。我回头亲自核对了原始数据,发现其中一条“主要投诉”在大约 200 条评论里只出现了两次。两次。但它呈现出来的自信程度,和那条出现了 60 次的投诉一模一样。没有标记,没有“样本量小”,什么都没有。只是一份整洁的排名列表,从上到下看起来都同样可靠。我认为问题在于,这些模型被优化得听起来连贯,而不是传达不确定性。人类分析师如果某个结论只有 2 个数据点,通常会说“不确定这个是否真实,样本量太小”,因为承认不确定性是人类正常的行为。模型不会这样做,除非你明确强迫它,因为生成一个含糊的表述不会像生成一个干净答案那样得到奖励。让我担心的是,人们很容易察觉不到这一点。输出读起来太专业了,你会停止质疑它。我之所以发现这个虚假模式,是因为我碰巧抽查了原始数据;如果我没这么做,那条 2/200 的投诉就会作为“头号关注点”出现在真正的战略文档里。这是一个已知的局限,人们已经找到了变通方法,还是说我们所有人都必须永远手动核验一切?这从一开始就在某种程度上违背了使用 AI 节省时间的初衷。不服来辩:这真的是个大问题,还是我想多了,这其实只是一个可修复的提示词问题?
相似文章
问题不在于AI犯错,而在于它犯错时如此自信
讨论了AI模型以高置信度产生错误答案的问题,强调了AI输出中的过度自信问题。
AI研究工具仍过于热衷将公开信号转化为确定性
作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。
最重要的AI失败可能是虚假自信,而非错误答案
本文认为,最危险的AI失败并非源于错误答案,而是系统基于不完整的数据、过时的上下文或糟糕的假设,以虚假自信行事。这表明AI评估应优先考虑处理不确定性的能力,而非原始智能。
当AI显得“过于自信”
本文探讨了一种心理现象:用户不信任AI,并非因为它出错,而是因为其肯定语气与用户自身内心的不确定性不匹配,并运用期望违背理论来解释这种摩擦。
AI在帮助研究与只是说你想听的话之间的界限在哪里?
一位用户分享了对使用LLM分析客户反馈的担忧,指出模型可能会自信地呈现罕见的反对意见,并建议抽查原始数据以验证AI生成的模式。