有多少已发表的AI研究因数据泄露而错误?

Reddit r/artificial 新闻

摘要

普林斯顿大学的一项研究发现,在17个领域的近300篇AI论文中存在数据泄露问题,导致结果过于乐观。作者强调了意外泄露数据的容易程度,并提醒不要轻信那些令人印象深刻的AI声明而不检查是否存在泄露。

有一篇由Kapoor和Narayanan撰写的普林斯顿大学论文。他们在包括医学和经济学在内的17个领域的近300篇论文中发现了数据泄露。数据泄露意味着模型在训练时使用了它在进行真实预测时永远不会拥有的信息。因此,模型在测试集上表现优异,但在现实世界中却失败。我最喜欢的例子是内战预测。据报道,复杂模型击败了旧的逻辑回归。一旦数据泄露被修复,那些花哨的模型并不比几十年前的统计模型更好。我构建过足够多的模型,知道这有多容易意外发生。你在划分数据之前进行缩放,或者使用一个实际上是答案替代的特征,你的数字看起来就会很棒。所以现在当我读到另一个"AI攻克X"的标题时,我的第一反应是是否有人检查过数据泄露。
查看原文

相似文章

AI 自信犯错的程度远超人们想象,不服来辩

Reddit r/ArtificialInteligence

一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。

最重要的AI失败可能是虚假自信,而非错误答案

Reddit r/ArtificialInteligence

本文认为,最危险的AI失败并非源于错误答案,而是系统基于不完整的数据、过时的上下文或糟糕的假设,以虚假自信行事。这表明AI评估应优先考虑处理不确定性的能力,而非原始智能。

AI研究工具仍过于热衷将公开信号转化为确定性

Reddit r/artificial

作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。