@vicky_grok: 这真是不可思议 我们对4种不同的AI代理架构在完全相同的120个任务套件上进行了基准测试。The wi…

X AI KOLs Timeline 新闻

摘要

对四种AI代理架构的基准测试表明,基于验证的设计达到了100%的成功率,这突显了架构选择比原始步骤预算对性能更为关键。

这真是不可思议 我们对4种不同的AI代理架构进行了基准测试,使用完全相同的120个任务套件。 获胜的并不是步骤预算最大的代理。 而是那个验证其工作的代理。 设置: 12个服务。 24个人员。 48个事件。 2个故意设置的陷阱。 相同的任务。 相同的16次调用预算。 四种不同的设计。 以下是结果: → 单次计划:83.3% 成功率 → 闭环:87.5% → 循环 + 语义记忆:87.5%,工具调用减少52.5% → 循环 + 验证:100% 成功率 这三个发现完全改变了我对代理架构的思考方式: 1. 更多预算 ≠ 更高精度 盲目规划器在从2次到16次调用中保持83.3%。 它的问题不在于预算。 它的上限是架构性的。 2. 记忆基本上是免费的预算 语义缓存命中率68.7%,消除了255次工具调用中的134次。 成功率零下降。 3. 验证是廉价的保险 在整个基准测试中,仅额外41次调用就带来了+12.5个百分点的成功率提升。 它挽救了所有15个陷阱任务。 这是我觉得最有趣的部分。 我们经常问: “我们应该给代理多少步骤?” 或许更好的问题是: “代理应该把这些步骤用在什么地方?” 规划? 检索? 记忆? 验证? 架构比原始步骤预算更重要。 如果你正在构建AI代理,请保存这个。 #AgenticAI #AIAgents #LLM #MachineLearning #AIEngineering
查看原文
查看缓存全文

缓存时间: 2026/08/29 12:05

这简直太不可思议了

我们对4种不同的AI智能体架构,使用完全相同的120项任务套件进行了基准测试。

最终的胜者并非拥有最多步骤预算的那个智能体。

而是能够自我验证工作的那个。

测试环境:

  • 12个服务
  • 24名人员
  • 48起事件
  • 故意设置的2个环境陷阱

相同任务集。 相同的16次调用预算。 四种不同设计方案。

测试结果: → 单次规划型:83.3% 成功率 → 闭环型:87.5% 成功率 → 闭环+语义记忆型:87.5% 成功率(工具调用次数减少52.5%) → 闭环+验证型:100% 成功率

三个关键发现彻底改变了我对智能体架构的认知:

  1. 更多预算 ≠ 更高精度 盲目规划型在2到16次调用范围内始终保持83.3%成功率。其瓶颈不在预算多少,而在于架构本身的局限性。

  2. 记忆相当于免费预算 语义缓存命中率达68.7%,在255次工具调用中消除了134次重复请求,且成功率完全保持不变。

  3. 验证是廉价的保险 整个基准测试中仅增加41次验证调用,就换来成功率提升12.5个百分点。这成功挽救了全部15项陷阱任务。

这正是我认为最有趣的发现。

我们通常会问: “应该给智能体分配多少步骤?” 或许更好的提问方式是: “智能体应该用这些步骤完成什么?” 是规划?检索?记忆?还是验证?

架构设计比原始步骤预算更重要。

正在构建AI智能体的请务必收藏。

#AgenticAI #AIAgents #LLM #MachineLearning #AIEngineering

Vikas gupta (@vicky_grok): 从LLM到智能体

LLM负责生成,智能体负责行动。

自主智能体融合:

🧠 推理能力 🗂️ 记忆系统 🛠️ 工具调用 🔄 规划能力 👀 反馈机制

这些要素协同作用,使智能体能主动追求目标——而不仅是回答提示。

相似文章

好的基准

arXiv cs.AI

这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。