可复现性在机器学习研究中似乎正变得无关紧要。是否为时已晚?[D]
摘要
一篇观点文章指出,机器学习研究中的可复现性正濒临失效,原因在于实体AI需要昂贵硬件、科技巨头发布了难以验证的性能数据,以及竞争压力使得作者不愿分享代码。
我认为机器学习研究中的可复现性如今已近乎徒劳,原因有三:许多研究正转向实体AI领域,要进行实验,你需要昂贵的硬件,甚至是配备高速摄像机的整套实验室。你根本无法确定实验能否被复现,只能相信演示视频。但演示并非完全可靠,而且人们有动机只展示其中成功的部分——录制一结束,整个系统可能就崩溃了。大型AI公司不断发布各种工具,声称能以一定的准确率或效率解决大量问题。除非你就在这些公司工作,否则根本无法证实这些说法,只能听信他们的一面之词。他们有强烈的经济利益驱动去夸大这些数字。而且他们所解决的问题本身往往非常模糊且主观,没有可靠的方法去验证。我们必须正视房间里的大象:人们有动机产出不可复现的成果,以免被竞争对手抢占先机,或让自己难堪。这就是为什么当我们发邮件向作者索要代码时,可能永远收不到回复。那现在该怎么办?也许一切都会好起来,因为我们可以将其与历史上早期的科学进展作对比,例如制造原子弹或送人登月。这些项目的“外部可复现性”很低,但“内部可复现性”很高。此外,这些工作本质上都是数学化的,并经过了仔细核查。但我认为机器学习研究的许多领域并非如此。你怎么看?我们应该放弃可复现性吗?如果不应放弃,那么未来又该如何最好地实现它?
相似文章
@askalphaxiv: 70%的AI研究不可重复。上周ICML 2026期间,有超过6000+篇研究论文发布,但……
Alphaxiv和Hugging Face发起了一项社区挑战,旨在检验ICML 2026上AI研究论文的可重复性,提供4500美元的GPU积分和一个自动研究代理来帮助参与者。
还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
FT:AI编程热潮令开源维护者不堪重负
《金融时报》报道称,AI编程热潮正用低质量的AI生成贡献淹没开源维护者,消耗着整个生态系统。具体证据包括cURL关闭其漏洞奖励计划、Ghostty禁止AI代码、tldraw自动关闭PR,以及研究表明贡献者参与度下降。
我们是在优化 AI 研究以迎合录用标准,而非追求长远价值吗?[D]
一位研究人员批评了 AI 会议的录用文化,认为其过于注重取悦审稿人,而非产出具有长远价值的工作。他指出,当前普遍要求提供详尽的评估结果,但这些数据几乎不会被后续研究者再次验证。
认知依赖
一篇简短的评论文章,探讨依赖AI进行软件开发是否会导致工程师技能退化,并可能造成AI进展停滞,直至递归自我改进(RSI)成为可能。