@dunik_7: 一个AI在研究人员仅旁观的情况下,将其编码能力提升了一倍多。在SWE-bench上从20%提升到50%。他们从未……

X AI KOLs Timeline 论文

摘要

来自Jeff Clune实验室的一篇论文描述了一个AI,它通过重写自己的源代码,在没有人工干预的情况下,使用进化方法,在SWE-bench上将编码能力从20%翻倍到50%。

一个AI在研究人员仅旁观的情况下,将其编码能力提升了一倍多。在SWE-bench上从20%提升到50%。他们从未干预过。 它通过重写自己的源代码实现了这一点。 这就是那篇完整的论文《达尔文·哥德尔机》,共72页,来自Jeff Clune实验室。一个智能体终于指向了自己。 / 它读取自己的代码,并编辑一个工具、一条重试规则、一个提示词 / 它在真实的编码任务上运行新版本,并检查分数是否真的有所变化 / 获胜的变体会被存档并分支,就像进化一样,因此永远不会陷入死胡同 / 然后整个过程再次运行,针对刚刚改进的智能体 所有人仍在争论哪个模型最聪明。这个问题被悄然绕过了。同一个模型,相同的权重,其周围的智能体每经过一次更新,就变得更加锐利,且完全出自自身之手。 在我之前的分析中,循环4曾被人们称为科幻情节。现在它就在这里,经过基准测试,并附有公开仓库。 令人不安的不是它成功了。 而是根本不需要有人在房间里。 论文如下。趁它再次自我进化之前,赶紧阅读。
查看原文
查看缓存全文

缓存时间: 2026/06/24 20:30

一个AI在研究人员仅旁观的条件下,把自己的编码能力提升了一倍以上。SWE-bench得分从20%飙升至50%。全程无人干预。

它是通过重写自己的源代码实现这一点的。

这就是那篇完整的论文——达尔文·哥德尔机,出自Jeff Clune实验室,共72页。一个智能体终于指向了自己。

/ 它读取自己的代码,然后修改一个组件——一个工具、一条重试规则、一段提示词 / 它在新版本上运行真实编码任务,检查分数是否真的变化了 / 胜出的变体会被归档并分叉,如同进化一般,所以永远不会陷入死胡同 / 然后它对刚刚完成自我改进的那个智能体,再次运行整个过程

所有人还在争论哪个模型最聪明。这篇论文悄然绕过了这个问题。同一个模型,同样的权重——只是围绕它的智能体通过自己的手,每轮迭代变得更锐利。

我拆解中的第四环,曾被人们称为科幻。现在它有了基准测试,还有公开仓库。

令人不安的不是它成功了。 而是房间里根本不需要有人。

论文在下面。趁它再次自我改进之前,赶紧读。

相似文章

@Khazix0918: https://x.com/Khazix0918/status/2062731170337763796

X AI KOLs Timeline

Anthropic发布深度文章《When AI builds itself》,展示AI系统正在加速自身开发,包括代码生成、基准测试饱和以及内部数据表明工程师生产力提升8倍。文章探讨递归自我改进的趋势与潜在影响。

当AI自我构建:我们在递归自我改进方面的进展

Hacker News Top

Anthropic研究院发布了一项关于递归自我改进进展的分析报告,显示AI已在加速AI开发——工程师每季度的代码产出提升了8倍——并预测具备完全自主自我改进能力的AI系统或将比大多数机构所预期的更早到来。

超人类竞争性编程AI问世

Reddit r/singularity

一款新型AI模型在竞争性编程中实现了超人类表现,标志着AI能力的重要里程碑。