MLE-Bench 的性能提升:算法贡献 vs. 更好的模型与更多搜索?[R]
摘要
一项新基准 FML-Bench 揭示,近期 MLE-Bench 分数的提升主要归因于更好的基础模型和增加的搜索预算,而非算法进步。
过去两年,MLE-Bench 的得分从 30% 跃升至 80%。但其中有多少是真正的算法进步,又有多少归功于更好的基础模型、问题定义的变化以及过拟合?事实证明:并不多。一旦你控制了相同的步骤预算和模型,并在不同的任务集上进行测试,两年前的 AIDE 算法与现代的智能体/进化搜索系统表现相当。该图来自 FML-Bench——一项新的自动化机器学习研究基准,它统一了代码编辑智能体、步骤定义以及验证/测试集划分,并旨在评估智能体的算法效率(搜索/记忆)。论文链接:[https://arxiv.org/pdf/2605.17373](https://t.co/8QllTan4cX) [测试改进与成对胜率](https://preview.redd.it/j9ev4x8kmo4h1.png?width=894&format=png&auto=webp&s=d38392fdc4d14f371db23592d8ef45b34bc1e7a8)
相似文章
MLE-bench:评估机器学习代理在机器学习工程中的表现
# MLE-bench:评估机器学习代理在机器学习工程中的表现 来源:[https://openai.com/index/mle-bench/](https://openai.com/index/mle-bench/) OpenAI 评估机器学习代理在机器学习工程中的表现 我们推出了 MLE-bench,这是一个用于衡量 AI 代理在机器学习工程中表现如何的基准。为此,我们从 Kaggle 精选了 75 个与 ML 工程相关的竞赛,创建了一个多样化的具有挑战性的任务集合,用于测试真实的 ML 工程
@__lu__jasper: 在OBLIQ-bench的子采样版本上尝试搜索的一些早期结果。Mixedbread的重排序器是一...
在子采样OBLIQ-bench上测试搜索的早期结果显示,Mixedbread的重排序器获得了较强的MRR,有时在某些指标上优于GPT 5.5,且速度更快,但该基准测试仍具有挑战性。
MLS-Bench:对 AI 系统在构建更优 AI 方面能力的全面与严格评估
本文介绍了 MLS-Bench,这是一个旨在评估 AI 系统能否发明具有通用性和可扩展性的机器学习方法,而非仅仅进行工程调优的基准测试。
InferenceBench:面向AI代理的开放式LLM推理优化基准测试
InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。
进化搜索中的计算分配:从深度-广度到多臂老虎机
本文研究了LLM引导的进化搜索中的计算分配问题,识别了经验规律,并提出了BaSE——一种多臂老虎机算法,该算法在多个模型和任务上提高了平均适应度和可靠性。