@0xNixxx: Anthropic 同时运行同一智能体10次以获得3个有效结果 运行10次 → 保留3次 → 分析7次失败 → 修复测试框架 → 再次运行 - …

X AI KOLs Timeline 新闻

摘要

Anthropic 使用一种方法,多次并行运行同一AI智能体,保留成功的运行,分析失败,并迭代改进流程以提升性能。

Anthropic 运行同一智能体10次以获得3个有效结果 运行10次 → 保留3次 → 分析7次失败 → 修复测试框架 → 再次运行 - 运行10次:相同的测试框架,相同的任务,并行运行 - 分析7次失败:失败之间无关,因此每个都手动阅读 - 修复测试框架:更改进入其提示词,而不进入任务 - 再次运行:直到他们愿意放手并让它继续运行 智能体会在更底层对自己执行此操作。它会丢弃自己的工作,并在停止与评分器较劲时立即重新启动。 评分器是第二个模型。它在Playwright中打开应用程序,并点击第一个模型构建的内容。 收藏并在今晚观看它
查看原文
查看缓存全文

缓存时间: 2026/08/30 22:24

Anthropic运行同一智能体10次,只为保留3个有效结果

运行10个 → 保留3个 → 阅读7个失败日志 → 修复测试工具 → 再次运行

  • 并行运行10个:相同测试工具、相同任务,并行执行
  • 分析7个失败案例:错误各不相同,需逐一人工审阅
  • 修复测试工具:仅修改智能体提示词,不调整任务本身
  • 持续迭代:直到团队满意或决定停止调优

智能体会在低层级重复此流程:一旦发现自身进展停滞,会立即丢弃当前成果并重新启动

评测器由第二个模型担任,它会在Playwright中打开应用,并实际点击验证第一个智能体构建的功能

今晚收藏看看

相似文章

用于长时间运行代理的有效工具

Anthropic Engineering

Anthropic 推出了一种由两部分组成的解决方案,使用初始化代理和编码代理,使 Claude Agent SDK 能够有效处理跨多个上下文窗口的长时间运行任务,并通过保持干净、增量的状态来实现。