@Mnilax:谷歌和斯坦福的工程师刚刚发布了一份39页的PDF,内容是关于什么真正让AI agent自我改进的。输入→输出…
摘要
谷歌和斯坦福的工程师发布的一份39页论文分析了使AI agent通过反馈循环自我改进的关键因素,并指出只有9%的agent实际运行了真正的循环。
谷歌和斯坦福的工程师刚刚发布了一份39页的PDF,内容是关于什么真正让AI agent自我改进的。
输入 → 输出 → 反馈 → 更新 → 重复
开头给出的数字:只有9%的agent运行了真正的循环。
另外91%的agent是手动输入下一个提示。
他们的观点:循环不是一个抽象概念,而是三个隐藏的选择
- 起始工件
- 信用范围
- 经验批处理
我花了几周时间才把这三点做对。
现在我的循环在睡觉时运行,并重写自己的技能文件,这样它就不用再问我第二次。
论文解释了为什么91%的循环会悄然消亡。而那篇文章就是那个没有失败的。
查看缓存全文
缓存时间: 2026/06/25 11:18
Google和斯坦福的工程师们刚刚发布了一份39页的PDF文档,揭示了AI代理究竟如何实现自我改进。
输入 → 输出 → 反馈 → 更新 → 重复
文档开篇就给出了一个数字:只有9%的代理能够运行真正的循环。
其他91%的代理,实际上都是靠人类手动输入下一个提示。
他们的观点:循环不是一种氛围,而是三个隐藏的选择
- 起始工件(starting artifact)
- 信用跨度(credit horizon)
- 经验批处理(experience batching)
我花了几周时间才把这三点搞对。
现在,我的循环在我睡觉时自动运行,并重写自己的技能文件,这样它就不会再问我第二遍。
论文解释了为什么91%的循环静悄悄地死掉。而本文,就是那个没有死掉的循环。
相似文章
@HuggingPapers: 现代智能体系统中的自我改进——一项涵盖239篇论文的调研,关于AI智能体如何通过更新模型…
一项涵盖239篇论文的调研,分析AI智能体如何通过更新模型本身或框架(提示、记忆、工具)来自我提升。
@Saboo_Shubham_: Google 刚推出了一种让 AI 代理自我改进的新方法。一项代理评估技能,可发现你的 AI 代理中的质量漏洞…
Google 发布了一款新工具,让 AI 代理通过发现和修复漏洞来自我改进,兼容 Antigravity、Claude Code 和 Codex。
@0xMovez:别浪费两年时间去搞懂AI代理实际上是如何工作的。例如,Anthropic和Google的工程师在斯坦福刚刚发布了…
一则推文重点介绍了Anthropic和Google工程师在斯坦福的讲座,内容涵盖自我改进的AI代理、代理循环模式以及生成器-验证器差距。
@rohanpaul_ai: 自我改进的AI的真实性仅取决于其测试信号的有效性。梳理1250篇论文揭示了……
对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。
@dair_ai: 关于自我改进智能体的优秀论文:
本周一篇重要的AI论文探讨了自我改进智能体是否真正发现新知识,还是仅仅在重新混合现有信息。