如今机器学习中是否还有理论指导的实践? [D]
摘要
文章探讨理论原则是否仍指导机器学习实践,强调许多曾被视为标准的理论如何被经验证据所挑战。
在机器学习的发展过程中,曾有一段时期应用似乎受到理论的指导。一些最著名的理论包括:如果你用过多数据训练模型,会导致过拟合,测试性能会受损。大型模型无法泛化,因为理论上你永远不会有足够的数据。永远不要在测试集上训练,因为这会导致高偏差。甚至永远不要查看测试集,因为作为建模者,你会立即产生偏差并使用错误模型。好的结果只能来自“兼容的”模型和优化流程。你不能只是将ADAM应用于某个全新模型,并期望它表现良好。优化为机器学习提供了坚实的理论,因此应使用优化文献中具有最佳性能保证的优化器。如果想要好的性能,确保使用多个模型而不是一个模型,因为堆叠或集成模型总是更优。这些理论大多起始于数学陈述(尽管是在一些与现实无关的虚构例子上)。在某些时候,这些理论变成了民间传说,被广泛复制在教科书和课堂中,甚至进入了数据科学相关公司的标准面试问题。每个学生都必须记住那个偏差-方差“靶心”图,就好像它在实践中相关一样。但随后,一些这样的理论开始被推翻。事实证明,你可以打破许多这些理论指导的实践,并仍然获得好的结果。那些推动这些理论的人(尤其是各种“统计机器学习”教科书的作者),悄悄停止了他们的假说,转而加入了炒作的浪潮。这让他们的学生感到困惑,因为从来没有任何撤回或解决。所以我的问题是:今天机器学习中是否还有理论指导的实践?例如,人们是否因为优化器在理论上是这类问题的最佳选择而使用它?人们是否因为某个模型或其相关组件在理论上表现良好而使用它?或者现在这完全是一个经验领域,实践由似乎对其他人有效的方法指导?
相似文章
当AI编写大部分代码时,我们还需要学习算法吗?[D]
探讨当AI能够编写和优化代码时,学习算法是否仍然重要,以及在AI编程助手时代,算法理解所扮演的角色。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。
在没有高性能计算资源的情况下,基础AI研究还能进行吗?[D]
讨论在没有高性能计算资源的情况下是否还能进行基础AI研究,考虑到像“Attention is all you need”这样的早期工作使用的是消费级GPU。
你对持续学习有何看法?[D]
一篇讨论帖,质疑AI中持续学习的定义和要求,引用了Dario Amodei和Demis Hassabis近期关于其对通用人工智能(AGI)重要性的言论。
近期人工智能的改进主要来自哪里?
讨论近期AI进步的来源,指出后训练、微调和强化学习已成为关键,并询问超越规模扩展的未来方向。