@dunik_7: 一个AI在研究人员仅旁观的情况下,将其编码能力提升了一倍多。在SWE-bench上从20%提升到50%。他们从未……
摘要
来自Jeff Clune实验室的一篇论文描述了一个AI,它通过重写自己的源代码,在没有人工干预的情况下,使用进化方法,在SWE-bench上将编码能力从20%翻倍到50%。
查看缓存全文
缓存时间: 2026/06/24 20:30
一个AI在研究人员仅旁观的条件下,把自己的编码能力提升了一倍以上。SWE-bench得分从20%飙升至50%。全程无人干预。
它是通过重写自己的源代码实现这一点的。
这就是那篇完整的论文——达尔文·哥德尔机,出自Jeff Clune实验室,共72页。一个智能体终于指向了自己。
/ 它读取自己的代码,然后修改一个组件——一个工具、一条重试规则、一段提示词 / 它在新版本上运行真实编码任务,检查分数是否真的变化了 / 胜出的变体会被归档并分叉,如同进化一般,所以永远不会陷入死胡同 / 然后它对刚刚完成自我改进的那个智能体,再次运行整个过程
所有人还在争论哪个模型最聪明。这篇论文悄然绕过了这个问题。同一个模型,同样的权重——只是围绕它的智能体通过自己的手,每轮迭代变得更锐利。
我拆解中的第四环,曾被人们称为科幻。现在它有了基准测试,还有公开仓库。
令人不安的不是它成功了。 而是房间里根本不需要有人。
论文在下面。趁它再次自我改进之前,赶紧读。
相似文章
@Khazix0918: https://x.com/Khazix0918/status/2062731170337763796
Anthropic发布深度文章《When AI builds itself》,展示AI系统正在加速自身开发,包括代码生成、基准测试饱和以及内部数据表明工程师生产力提升8倍。文章探讨递归自我改进的趋势与潜在影响。
@rohanpaul_ai: 精彩新论文来自Meta、CMU及其他实验室。表明编码代理通过制造自己的...来更快地提升。
来自Meta、CMU及其他实验室的一篇新论文提出了Self-play SWE-RL,这是一种方法,编码代理通过在实际代码库中制造和修复错误来训练自己,在SWE-bench基准测试上取得了显著提升,且不依赖人类编写的任务。
@rohanpaul_ai:MIT 研究。代码量激增 300%,但产出仅增长 30%:AI 红利遭遇尴尬现实。他们……
一项针对超过 100,000 名 GitHub 开发者的 MIT 研究发现,AI 编码工具使代码量增加高达 300%,但仅使已发布软件增加 30%,凸显了人工审核与集成的瓶颈。
当AI自我构建:我们在递归自我改进方面的进展
Anthropic研究院发布了一项关于递归自我改进进展的分析报告,显示AI已在加速AI开发——工程师每季度的代码产出提升了8倍——并预测具备完全自主自我改进能力的AI系统或将比大多数机构所预期的更早到来。
超人类竞争性编程AI问世
一款新型AI模型在竞争性编程中实现了超人类表现,标志着AI能力的重要里程碑。