@seclink: https://x.com/seclink/status/2057086514975404108
摘要
Anthropic工程师公开了长时AI智能体的开发经验,包括多角色分工、独立评估器等方法,使AI能在3-5小时内自动生成完整应用,连续运行能力提升12倍。
查看缓存全文
缓存时间: 2026/05/20 16:33
Anthropic工程师揭秘:长时AI智能体现在3-5小时就能全自动生成完整可用App
📌 内容来源: https://www.youtube.com/watch?v=mR-WAvEPRwE
⚡ 开篇先看 核心要点: 现在AI花3-5小时,就能跑出一个完整可用的全功能应用长时运行AI智能体经过一年迭代,连续稳定运行能力提升了12倍 多角色分工开发,成功率远高于单个智能体循环迭代 自我评估是AI开发的最大陷阱,独立对抗性评估器才是正确解法
在近期的全球AI工程师大会首场分享上,Anthropic应用AI团队的工程师公开了过去一年研发长时AI智能体的落地经验——不光拆解了行业公开Demo未披露的智能体外层脚手架实现细节,还把踩过的坑、验证过的可行方案全部公开。所谓长时AI智能体,就是能连续运行几小时甚至数天,自动完成复杂长任务的AI系统,最典型的应用就是全自动写代码开发应用。
过去很多人觉得,AI做开发只要堆模型能力、放大上下文窗口就够了。但Anthropic这一年的实践证明:AI智能体的能力,从来都是模型和外层框架共同成长出来的,把任务分给不同角色的AI,比让一个AI干所有事,效果好出好几个量级。
❓ 长时AI做开发,到底难在哪
长任务开发不是把上下文窗口放大就能解决,一共存在三个绕不开的核心问题。
本次讨论的长时运行智能体,指能连续跑5-6小时以上、甚至数天的AI智能体。Anthropic工程师总结,核心问题共分三类:
第一是上下文问题。除了大家熟知的上下文窗口(大模型一次能处理的文本总量上限,超过就会丢失最早的输入信息)大小限制,还有两个经常被忽略的问题:一个是上下文衰减,也叫上下文腐烂,会话越长,模型对早期内容的理解越差,越容易出错;另一个是上下文焦虑,模型感知到快接近窗口上限了,就会下意识仓促收尾,提前结束任务,哪怕功能还没做完。
第二是规划问题。原生大模型天生不擅长做长任务拆解,很容易走着走着就偏离原始需求。
第三是输出判断问题。大模型经常把半完成的功能,误判成已经开发完成,自己查错根本查不出来。
🔄 能力提升12倍的秘密:模型和脚手架共同进化
不要觉得模型越来越强,外层脚手架就会消失,脚手架会永远存在,只会跟着模型能力一起迭代。
先解释:这里说的脚手架,就是包裹在大模型外面,给大模型补充记忆、循环、工具调用、状态管理这些额外能力的外围框架代码,是长时智能体能稳定运行的核心基础。
Anthropic过去一年的迭代路线非常清晰:模型能力升级的同时,一定会同步更新脚手架。发现模型有能力缺口,先用脚手架补上,再用脚手架跑出来的真实数据优化模型,循环往复共同进化。
这个路线带来的提升非常明显:同样达到50%任务完成率,一年前的Opus 3.7只能连续稳定运行1小时,现在的Opus 4.6已经能跑12小时,整整提升了12倍。
最早的Claude Code,连写bash命令、处理字符串转义都经常出错,最多只能稳定跑20分钟;现在Claude Code本身的大部分代码,都是Claude Code自己写的,已经能稳定连续运行数天。
到今天,Anthropic的长时智能体已经能做到:接下用户需求后,3-5小时就能产出一个完整可开箱运行的全功能应用。
🤝 单智能体干过多智能体团队?这套分工逻辑直接抄
把长任务拆成不同角色交给不同AI,模拟人类开发团队的分工,比让一个AI干完全部活,成功率高太多。
过去主流的单智能体循环开发,有个绕不开的问题:如果生成的内容不达标,AI只会在原来的基础上不停打补丁,越改越乱,错的地方一直改不对。
Anthropic验证有效的方案,是直接把开发拆成三个角色,每个角色分配独立的上下文窗口,完全模拟人类开发团队的结构:
-
规划师对应产品经理:只负责把用户的模糊需求拆成高层级的迭代任务,不需要提前抠细粒度的技术细节,避免早期的错误决策在后续迭代中不断放大。
-
生成器对应开发工程师:负责写代码实现功能。
-
评估器对应测试QA:负责检查功能是否达标。
这套方案的核心创新,比之前流行的Ralph Loop多了关键一步:生成器和评估器会在写代码之前,先协商出明确的「完成标准」,写成可测试的验收契约,评估器只按契约验收,不是按规划师的模糊需求验收。
有个非常直观的对比测试:同一个提示词「做一个复古游戏制作工具」、同一个模型,两种方案跑出来的结果天差地别:
-
单智能体循环:UI看着没问题,精灵编辑器勉强能用,但核心的游戏播放模式完全用不了,按什么键都没反应。
-
多角色分工框架:总共花了6小时,自动做出了完整产品Retro Forge,不仅有新建项目对话框、完整的54色8位调色板,还自动加了AI精灵生成助手,核心的播放模式完全正常:物理循环、方向键控制角色、碰撞检测全部能用。整个开发拆了27条细粒度的验收契约,所有问题都能定位修复。
Anthropic工程师验证了一个反直觉但非常实用的结论:调优一个独立的评估器做严厉挑错,比让生成器自己做自我批评容易太多。就像普通人都能看出一幅画画得好不好,但是让你自己画一幅好的就难多了,这个能力差可以直接被工程化利用。自我评估本身就是AI开发的陷阱,必须用独立的对抗性评估器。
⚔️ 最新进展:评估器真的会点开网页测试BUG
Anthropic最新实验的生成-评估对抗模式,让评估器真的运行代码测试,比只读代码查错的漏网率低太多。
现在Anthropic工程师正在测试的最新方案,借鉴了生成对抗网络(GAN)(经典AI架构,把模型拆成生成内容和判断内容好坏两个部分)的思路,把生成和评估彻底分开:生成器只管搭功能写代码,评估器专门负责挑错打分。
和之前只检查代码改动不同,这个方案里的评估器,会真的用自动化工具打开运行中的页面,点击测试所有功能,再把问题反馈给生成器,循环迭代优化。
评估会从四个维度打分:设计、原创性、工艺、功能,目前权重会偏向设计和原创性,刚好能解决大家吐槽的AI生成界面千篇一律的问题。
工程师们还发现了一个超出预期的好现象:最新的4.6版本模型,非常愿意丢弃之前所有的工作重新开始,不会出现评估器放过问题、生成器固守错误成果的情况。这个行为其实和人类程序员一模一样:写乱了的代码,删掉重写比打补丁干净多了,刚好解决了单智能体循环攒烂补丁的问题。
这个模式不是和多代理团队架构冲突的,它本身就是多代理架构的一个子集,可以嵌入到任何复杂工作流的每个环节里,任何细分任务都可以配一个专属的评估代理。
💡 核心金句
-
在不确定的世界里,做确定的失败,比不确定的成功更好。
-
批评一幅画比画一幅画容易多了,大模型也是一样。
-
长时智能体的能力提升,是模型和外层脚手架共同进化的结果,脚手架不会消失,只会跟着模型迭代。
-
自我评估是AI开发的陷阱,一定要用独立的对抗性评估器。
-
AI的技术前沿不会缩小,只会不断移动。
-
看起来做完了,不代表真的能用。
-
开发AI代理最核心的能力,是学会站在大模型的角度换位思考,找对问题再调整。
-
我们不做靠人工擦屁股的AI,目标就是做全自主运行的开发代理。
相似文章
@Khazix0918: https://x.com/Khazix0918/status/2062731170337763796
Anthropic发布深度文章《When AI builds itself》,展示AI系统正在加速自身开发,包括代码生成、基准测试饱和以及内部数据表明工程师生产力提升8倍。文章探讨递归自我改进的趋势与潜在影响。
@aiDotEngineer: Most agents die after a few seconds. @AnthropicAI's workshop shows how to build agents that run for hours. full 75-min …
Anthropic 应用AI团队在研讨会上分享了如何构建能持续运行数小时的智能体,核心在于上下文管理、规划与自我验证,以及模型与配套工具的共同演进。
@seclink: https://x.com/seclink/status/2056985034955932126
Anthropic产品负责人Cat Woo分享了AI时代产品经理需从长期规划转向快速迭代的核心转变,强调明确目标、建立周或天级别的发布流程以及跨职能协作,以释放AI原生产品的最大潜能。
@ba_niu80557: https://x.com/ba_niu80557/status/2073413449930207662
Superpowers 6开源项目展示了AI不仅能写代码,还能自主优化开发流程(如审计、合并任务、减少浪费),这标志着AI开始管理自身工作流,比人类管理者更严谨。文章强调诚实的评估体系(eval)是避免自我欺骗的关键。
@ma_zhenyuan: https://x.com/ma_zhenyuan/status/2057702858800370052
这篇文章介绍了Superpowers,一套基于Claude Code的AI工作流Skills,提供自动化的头脑风暴、计划、子代理开发和测试驱动开发,能显著提升AI交付效率。