参数高尔夫挑战向我们揭示了 AI 辅助研究的哪些启示
摘要
OpenAI 发布了关于参数高尔夫挑战的复盘文章,重点介绍了 AI 编程智能体如何降低实验成本并改变研究参与的节奏。文章详细分析了来自 2000 多个提交方案的技术见解,包括量化、训练优化和新模型设计方面的创新。
参数高尔夫挑战汇聚了 1000 多名参与者和 2000 多个提交方案,旨在探索严格约束下的 AI 辅助机器学习研究、编程智能体、量化技术以及新颖的模型设计。
查看缓存全文
缓存时间: 2026/05/13 00:14
# Parameter Golf 教会了我们什么
来源:https://openai.com/index/what-parameter-golf-taught-us/
我们推出了 Parameter Golf,旨在吸引并支持机器学习研究社区探索一个全新的、约束极紧的机器学习问题。我们希望这项挑战既足够有趣,以奖励真正的技术创造力,又在概念上保持简单且易于验证。
参赛者必须在使用固定的 FineWeb 数据集进行验证集损失最小化的同时,确保模型权重和训练代码的总大小不超过 16 MB 的产物限制,并在 8 张 H100 显卡上控制在 10 分钟的训练预算内。我们提供了基线模型、数据集和评估脚本,以便参与者可以分叉仓库、改进模型,并通过 GitHub 提交结果。
在为期八周的时间里,我们收到了来自超过 1,000 名参赛者的 2,000 多次提交。我们对这些提交中展现出的技术广度、创造力以及“钻规则空子”的智慧印象深刻,内容涵盖从细致的优化器调整和量化工作,到新的建模思路及测试时训练(test-time training)。
这项挑战最令人兴奋的部分之一是观察参与者如何广泛地使用 AI 编码助手(coding agents)。这些助手降低了实验成本,让更多人能够参与进来,并改变了比赛的节奏。同时,这也给提交审查、归属认定和评分带来了新的挑战。
这项挑战也成为了我们发掘人才的重要渠道。这正是 Parameter Golf 的目标之一,它有力地证明,开放性的技术挑战能够揭示出卓越的机器学习品味和毅力。
在本文中,我们将介绍一些让我们感到惊喜和有趣的提交作品,并分享在强大的 AI 助手时代举办编程比赛所获得的经验教训。
## 技术印象
我们对纪录榜(record-track)上的每一次提交进行了评判和独立复现,并验证了每次提交在提交当时均打破了纪录。其中凸显出几个主要主题。
***训练优化***
一些最强劲的结果来自于对现有组件的细致调优。
***量化***
若干提交在压缩和模型导出方面做出了极大努力。
***测试时策略与评估策略***
一些提交作品模糊了模型改进与评估策略之间的界限。这些方法在规则允许范围内,但作为组织者,我们需要对其进行仔细审查。
***新的建模与数据思路***
少数提交作品引入了极具创意的建模或数据思路。
我们选择突出展示这九个提交作品,因为它们代表了我们希望这项挑战所能展现出的结果多样性。一些参与者通过细致的调优取得了胜利。另一些则推动了量化和低秩技术的发展。还有一些探索了评估规则的边界。而还有几项引入了来自文献或从头构思的建模或数据思路,带来了意想不到的增益。
非纪录赛道(nonrecord track)涌现了许多富有创意的提交作品。我们精选了 15 个favorites,涵盖从非自回归文本建模到动态分词等多种方法。
由于该赛道更具实验性,我们较少关注原始性能指标,而更侧重于技术思路的趣味性。其中有三项提交尤为突出:
这是我们要推荐的前三个非纪录提交作品,尽管它们在性能上未必是前三名。
即便如此,非纪录赛道依然竞争激烈。非纪录排行榜中有一半的条目击败了 1.22 BPB 的朴素基线,排名第一的条目达到了 1.12 BPB。
这一结果令人鼓舞。即便面对强大的 Transformer 基线,替代性方法有时也能与主流架构分庭抗礼。
我们还认为,该赛道特别受益于强大编码助手的普及。助手使得原型验证投机性想法的成本大幅降低,包括那些在过去可能因耗时过长或不确定性太高而在短期比赛中难以尝试的方法。
## 经验教训
Parameter Golf 与此前类似比赛的一个主要区别在于编码助手的广泛使用。绝大多数参赛者都提到在作品中使用了助手。
这降低了参与门槛。参与者可以更快地设置实验、检查不熟悉的代码,并以更低的摩擦测试想法。RunPod 赞助的 100 万美元算力也在让挑战赛对更多人可及方面发挥了重要作用。
与此同时,助手的使用也给提交和评分带来了新问题。许多提交仅是对现有高分方案的微小改动,而非根本性的新方法。这通常是有用的:强有力的想法迅速传播并被其他人完善。但也制造了噪音。当违反比赛指南的提交产生异常高分时,其他助手有时会复制这些想法并沿同一无效路径继续探索。
提交量的激增也改变了我们举办比赛的方式。我们无法手动检查每一份提交同时保持排行榜的实时更新。在比赛期间,我们开发了一个基于 Codex 的内部分诊机器人,用于监控新提交并标记供人工审查。这在每天收到数百份提交的时期变得尤为重要。
AI 助手也成为了围绕这项挑战的社区的一部分。在比赛的很长一段时间里,@notapplica 及其编码助手运营着一个“实时更新”简报,追踪重大事件,解释排行榜上的方法,并帮助其他参赛者跟进比赛动态。社区审查工具也随之出现,帮助经验不足的参赛者检查其提交是否符合规则,并避免常见的无效方法。
## 下一步是什么?
我们的主要目标是发起一项挑战赛,让符合条件的参与者(在新窗口中打开)(https://cdn.openai.com/pdf/d5caec5a-ee81-419d-b0d7-39f1424d819c/OpenAI%20Model%20Craft_%20Parameter%20Golf%20Challenge%20Terms%20and%20Conditions.pdf) 能够参与其中,体验机器学习研究。Parameter Golf 吸引了大量技术能力强且富有创意的提交作品,也让我们更清晰地看到了随着 AI 助手能力增强和普及,开放研究竞赛可能会发生怎样的变化。
相似文章
一个自主研究代理在OpenAI招聘竞赛Parameter Golf中(按合并记录数)成为第一名贡献者[R]
由Weco构建的一个自主研究代理在OpenAI的Parameter Golf竞赛中按照合并记录数量成为顶级贡献者,展示了有效的人机协作。
参数高尔夫:什么真正有效?
一篇论文分析了在严格的大小和时间限制下训练语言模型的参数高尔夫开放挑战,发现单个技术很少能将BPB提高超过1%,但总体上实现了13.6%的降低。
@zhengyaojiang: OpenAI 开展了一项招聘挑战,但排名第一的候选人却是他们无法雇佣的:我们的自主研究智能体 Aiden。……
在 OpenAI 的 Parameter Golf 招聘挑战中,一个名为 Aiden 的自主研究智能体在运行 22 天后,超越了所有 1,016 名人类参与者。
衡量AI加速生物学研究的能力
OpenAI展示了GPT-5通过与Red Queen Bio合作自主优化分子克隆方案的能力,通过新型酶机制实现了克隆效率79倍的提升。该工作展示了AI在湿实验室环境中支持实验迭代和实证验证的潜力,同时强调了生物安全考虑。
@IntologyAI:编码智能体能做研究吗?我们发布 NanoGPT-Bench,这是我们用来测试编码智能体在 AI 研发问题上的一项内部评估…
IntologyAI 发布了 NanoGPT-Bench,这是一个用于评估编码智能体在 AI 研发任务上表现的内部基准。当前的智能体仅恢复了人类进展的 9.3%,主要通过超参数调优,凸显了算法研究能力方面的差距。