@zostaff: 这篇论文彻底改变了我对自我演化代码库的看法:Backlog -> Ideate -> Triage -> Execute -> Poli…
摘要
这篇论文提出了一个利用LLM实现自我演化代码库的六阶段蓝图,强调向规范(specification)而非指标收敛。
查看缓存全文
缓存时间: 2026/06/28 10:05
这篇论文彻底改变了我对自我演进代码库的看法:
待办 → 构思 → 分类 → 执行 → 打磨 → 回退
以下是六阶段蓝图:
待办:循环不会关闭工单,而是像用户一样系统地遍历产品的整个规格说明。
构思:“作为用户 x 1000”——一个 LLM 智能体以人类千倍的速度运行,模拟超级用户。
分类:每项发现都通过无可挑剔的测试——代码作者无法伪造的基准真相验证。
执行:变更基于统一的信任模型落地,该模型锚定于规格说明而非某个指标。
打磨:漂移控制持续衡量质量,并通过自动门控暂停自身。
回退:回退预言机捕捉回滚,并将其保持为零。
关键洞察:38个绿色测试与一个完全破损的产品共存——循环必须收敛于规格说明,而非某个指标。
经过285+次迭代,这产生了1,094+个已合并的拉取请求,且零回退。
阅读本文,然后查看下面的文章。
相似文章
@leanxbt: 这篇论文完全改变了我对一个智能体如何修复自身代码的看法:生成代码 -> 执行 -> 解释...
本文介绍了一种自我调试技术,智能体通过迭代生成、执行和解释自身代码来发现错误,无需错误信息,准确率提升高达12%,并与生成10倍候选方案的基线持平。
@zostaff: 这篇论文完全改变了我对自我改进智能体的看法:初始化 -> 运行 -> 分析 -> 分支 -> 更新…
这篇论文提出了一种自我改进智能体的新颖蓝图,通过元智能体和反馈智能体结合支架编辑和权重训练,在AlphaFold的CUDA内核上实现了14倍加速。
@0xMovez:一位谷歌资深工程师刚刚发布了一篇19页的PDF,关于LLM和智能系统的“循环工程”。行动 → 观察 → …
一位谷歌资深工程师发布了一篇19页的PDF,关于LLM和智能系统的“循环工程”,概述了一个迭代反馈循环:LLM提出代码转换,观察编译器反馈,从中学习,并重复直到不再有改进。
自演化编码智能体
本文综述了自演化编码智能体,这类智能体通过从先前的编码交互中更新框架、记忆、技能、工具或模型来改进其未来行为,并提出了一个分类体系,涵盖演化什么、何时演化以及由哪些软件特定证据驱动。
超越静态评估:面向对抗博弈的LLM驱动策略演化中的共演化机制
本文提出了三种面向LLM驱动的对抗多智能体博弈代码演化的共演化机制(评估器共演化、分层深度评估和弱点压力),在MCTF 2026海上夺旗任务中取得了最先进的结果。