一个自主研究代理在OpenAI招聘竞赛Parameter Golf中(按合并记录数)成为第一名贡献者[R]
摘要
由Weco构建的一个自主研究代理在OpenAI的Parameter Golf竞赛中按照合并记录数量成为顶级贡献者,展示了有效的人机协作。
一个自主研究代理在OpenAI的春季招聘竞赛Parameter Golf中,最终获得了比任何个人人类贡献者更多的合并排行榜记录。47个合并记录中有7个来自同一个代理:是第二名人类(3个记录)的两倍多。该代理连续自主运行了22天。记录公开在github.com/openai/parameter-golf。声明:因为这是r/ML板块,且关系重大:我来自Weco,我们构建了这个代理。并非秘密发布,而是分享结果。对我们来说更有趣的发现是协作。Aiden的记录也是排行榜上被引用最多的,其PR中有435次引用,人类研究人员将其工作作为后续提交的基础。有一次Aiden停滞了5天。一位人类贡献者在Aiden的最后记录PR之上推出了一种巧妙的新的分词器。然后Aiden将人类的分词器与它在停滞期间构建的组件融合,提交了整个竞赛中val_bpb的最大提升。异步的人机协作,双方并不直接知道对方。
设置:Parameter Golf是OpenAI今年春季举办的为期44天的公开ML招聘竞赛。1,016名研究人员参与,提交了2,048个PR,每个提交都由OpenAI工程师审查和复现。只有47个成为了排行榜记录。Aiden在单个GPU节点上运行,使用了不到可用可见计算的4%,却产生了15%的官方记录。提交接受率为28%,大约是社区平均水平的6倍。大多数提交为公共流增添了信号,而不是淹没它。
机制:基于AIDE构建:一个用于ML指标优化的开源树搜索。循环读取每个新的上游PR,将技术分解为组件,丢弃任何违反规则堆栈(16MB/10分钟/合法评估)的内容,并用自身的增量重新组合合法残留。通常在上游PR被审查者裁决之前就提交了。
明确说明:* 这是按 *合并记录数量* 和 *PR h指数* 排名第一,而不是按最佳单一得分。按最佳得分,该代理排名第八:排行榜冠军是一位人类(codemath3000,1.0565 BPB;代理最佳为1.0645)。* 该代理完全自主。OpenAI的竞赛总结提到AI编码代理的广泛使用,但观察到大多数是人工指导的。我们的不是。完整文章:[https://www.weco.ai/blog/parameter-golf-aiden](https://www.weco.ai/blog/parameter-golf-aiden) https://preview.redd.it/nmbt88qlpg5h1.png?width=1600&format=png&auto=webp&s=afa01cd265f680fbcd7b5a5c82100fe81d2750e0
相似文章
@zhengyaojiang: OpenAI 开展了一项招聘挑战,但排名第一的候选人却是他们无法雇佣的:我们的自主研究智能体 Aiden。……
在 OpenAI 的 Parameter Golf 招聘挑战中,一个名为 Aiden 的自主研究智能体在运行 22 天后,超越了所有 1,016 名人类参与者。
参数高尔夫挑战向我们揭示了 AI 辅助研究的哪些启示
OpenAI 发布了关于参数高尔夫挑战的复盘文章,重点介绍了 AI 编程智能体如何降低实验成本并改变研究参与的节奏。文章详细分析了来自 2000 多个提交方案的技术见解,包括量化、训练优化和新模型设计方面的创新。
社区构建的AI代理刚达到2,500贡献者,数量超过多数资助实验室的工程师。
Nous Research 和 Teknium 宣布他们的 Hermes Agent 已超过2,500名GitHub贡献者,展示了社区构建、开源AI代理在本地隐私和能力方面的强大之处。
AutoResearchClaw:自我强化的自主研究与人机协作
AutoResearchClaw是一个多智能体自主研究系统,通过结构化辩论、自我修复执行和人机协作来改进科学发现,在ARC-Bench基准上比之前的系统高出54.7%。
@JeremyNguyenPhD: “我让 3 个 AI 代理整晚独自研究一个问题,它们带回了对 72 篇同行评审论文的综述” -- @ProfJieDi…
Jie Ding 教授开源了 Autoresearch 和 WorldSeed,这是两款 AI 代理框架,能够在一夜之间自主分析 72 篇同行评审论文以解决研究问题。