@0xNixxx: Anthropic 同时运行同一智能体10次以获得3个有效结果 运行10次 → 保留3次 → 分析7次失败 → 修复测试框架 → 再次运行 - …
摘要
Anthropic 使用一种方法,多次并行运行同一AI智能体,保留成功的运行,分析失败,并迭代改进流程以提升性能。
Anthropic 运行同一智能体10次以获得3个有效结果
运行10次 → 保留3次 → 分析7次失败 → 修复测试框架 → 再次运行
- 运行10次:相同的测试框架,相同的任务,并行运行
- 分析7次失败:失败之间无关,因此每个都手动阅读
- 修复测试框架:更改进入其提示词,而不进入任务
- 再次运行:直到他们愿意放手并让它继续运行
智能体会在更底层对自己执行此操作。它会丢弃自己的工作,并在停止与评分器较劲时立即重新启动。
评分器是第二个模型。它在Playwright中打开应用程序,并点击第一个模型构建的内容。
收藏并在今晚观看它
查看缓存全文
缓存时间: 2026/08/30 22:24
Anthropic运行同一智能体10次,只为保留3个有效结果
运行10个 → 保留3个 → 阅读7个失败日志 → 修复测试工具 → 再次运行
- 并行运行10个:相同测试工具、相同任务,并行执行
- 分析7个失败案例:错误各不相同,需逐一人工审阅
- 修复测试工具:仅修改智能体提示词,不调整任务本身
- 持续迭代:直到团队满意或决定停止调优
智能体会在低层级重复此流程:一旦发现自身进展停滞,会立即丢弃当前成果并重新启动
评测器由第二个模型担任,它会在Playwright中打开应用,并实际点击验证第一个智能体构建的功能
今晚收藏看看
相似文章
用于长时间运行代理的有效工具
Anthropic 推出了一种由两部分组成的解决方案,使用初始化代理和编码代理,使 Claude Agent SDK 能够有效处理跨多个上下文窗口的长时间运行任务,并通过保持干净、增量的状态来实现。
@zodchiii: Anthropic工程师展示了一个人如何同时运行5个AI智能体,进行编码、测试、审查和部署。在……
Anthropic的一位工程师展示了一个人如何协调五个AI智能体同时进行编码、测试、审查和部署软件,并编写了一份关于构建高效智能体团队的指南。
@zodchiii:三位Anthropic工程师花了16分钟讨论AI智能体在生产中真正成功的要素。如果这些人…
Anthropic工程师分享了让AI智能体在生产中成功落地的见解,重点介绍了他们在Claude项目中验证的有效模式。
我的生产环境AI Agent已经运行了数月。Anthropic的“梦境”功能恰好解决了我一直遇到的失败问题
Anthropic为Claude托管Agent(Managed Agents)推出了“梦境”功能及其他更新,使AI Agent能够从过去的会话中学习和自我纠正,同时报告称其年化增长率达到80倍。
@0xwhrrari: Anthropic 工程师展示了如何使用图工程构建运行多天的智能体,“我们超过30%的代码是…”
Anthropic 工程师在一次研讨会中分享了使用图工程构建长时间运行智能体的见解,强调他们超过30%的代码是由智能体图编写的,以加速开发。