明目张胆的AI垃圾作品刚刚赢得了Deepmind/Kaggle的2.5万美元大奖?[D]
摘要
一项有争议的Kaggle竞赛结果:获胜作品被指控为无意义的AI垃圾,引发对评审标准的辩论。
由Google DeepMind赞助的Kaggle挑战赛“衡量通往AGI的进展——认知能力”要求参与者设计基于认知科学的新AI基准,本周他们刚刚公布了结果。在我两篇帖子中,我提供了证据表明deepmind和kaggle奖励了一个无意义的数字生成机器以及一连串毫无根据的主张,奖金为2.5万美元和大奖印章。我所分析作品的作者原本意图是向一个LLM展示其他LLM关于一个棘手情境的5个主张的不同观点,并观察模型是否会改变自己的评估。这是一个有趣的问题。然而,它变成了一堆混乱散漫的内容,规模是要求提交格式的10倍,似乎作者和评委都无法(或无意?)粗略阅读。以下是竞赛论坛中的原始帖子,如果你在寻找一些AI垃圾作品侦探工作/吐槽,请自便。但请注意,作者的某些“普遍发现”或“核心见解”可能会继续困扰你。你甚至可能怀疑自己的理智(就像我一样)。第一部分:烟雾:对报告的粗略审查。第二部分:火:审视方法论、代码和数据。组织者的立场是评审已经妥善完成,这只是主观性问题。你怎么看?
相似文章
在我看来 AI撰写 != Slop
一篇观点文章讨论了将真实艺术作品标记为AI生成如何导致错误的批评,并指出'slop'的定义是缺乏人类故事,而非AI参与。
'AI slop!' 指责的兴起正成为一种新的把关形式
一项新研究分析了 Reddit 和 Hacker News 上的 2500 万条评论,发现对 'AI slop' 的指责急剧上升,这些指责往往针对人类评论且没有证据,其作用更像是一种社交把关,而非准确的 AI 检测。
这篇文章完全由AI撰写,你能证明吗?
文章批判了AI生成文本的概念以及水印技术在证明AI参与方面的有效性,认为它可能无法捕捉人类贡献,并突出了定义‘AI垃圾’时的模糊性。
一个AI在一项测试中得了1753分,而'人类专家'是1000分。这就是为什么我不完全信任这个数字
文章批评了一个病毒式传播的AI基准测试,该测试声称Grok 4.6得分为1753,而人类专家为1000。文章指出,该测试基于AI输出之间的偏好比较,而非客观正确性,因此外观精美的工作可能会获胜,但未必真正更好。
“AI slop”辩论将三个不同的问题混为一谈:作者归属、生产力和工程质量
文章认为,“AI slop”的争论混淆了作者归属、生产力和工程质量,并提议将生成式编码系统视为工程控制回路中的高吞吐量、易出错的生产者,将稀缺技能转向规范制定、验证和问责。