有没有人也对Google DeepMind未能在这些数学基准测试中领先感到惊讶?
摘要
作者对Google DeepMind尽管在该领域有过基础性工作,却未能在数学AI基准测试中领先表示惊讶,同时提到OpenAI最近的进展。
看到 OpenAI 最近的进展让我感到惊讶,但更让我惊讶的是,相比之下 Google DeepMind 的出现次数如此之少。DeepMind 可以说在过去几年中,在 AI 数学领域所做的基础性工作比任何其他实验室都多,他们拥有 AlphaGeometry、AlphaProof、AlphaEvolve,以及关于推理和搜索的长期研究历史。如果一两年你问我哪个实验室会主导困难的数学基准测试,我大概会说是 DeepMind。这仅仅是因为 Gemini 的优化方式与 OpenAI 的模型不同吗?Google DeepMind 是更关注更广泛的产品能力,而不是推动前沿研究?或者你只是觉得这些问题不太相关?我有点惊讶,在所有实验室中,DeepMind 竟然没有在一个历来是其最大优势之一的领域处于领先地位。你可以在这里看到更多关于这些统计数据的信息:https://vibemathed.com/stats ,以及 OpenAI 关于他们贡献的十个问题的最新博客:https://openai.com/index/ten-advances-in-mathematics/
相似文章
OpenAI 在关键基准测试中仍保持领先
本文讨论了OpenAI如何在关键AI基准测试中保持领先地位,强调了其在性能指标上的持续主导地位。
[Google DeepMind] AI联合数学家也在困难问题求解基准测试中取得了最先进的结果,包括在FrontierMath Tier 4上获得48%的得分,这是所有被评估AI系统的新最高分。
Google DeepMind的AI联合数学家取得了困难问题求解基准测试中的最先进结果,在FrontierMath Tier 4上获得48%的得分,是所有被评估AI系统中的最高分。
似乎每个OpenAI的数学突破都会默认被质疑
文章强调了对人工智能数学突破,尤其是与OpenAI相关的,日益增长的怀疑和质疑趋势。
@dair_ai: 令人瞩目的新成果来自 Google DeepMind,展示了智能体在科学研究中的实际应用。
Google DeepMind 发表了一篇关于使用 AI 智能体进行实际科学研究的论文,表明它们在诸如 HealthBench Hard 的计算机科学任务中能够超越前沿模型。
像DeepSWE这样的新基准测试现在显示专有模型与开源模型之间存在巨大差距
像DeepSWE这样的新基准测试揭示了专有与开源AI模型之间的显著性能差距,令开源社区感到失望。