Salesforce运行自家AI Agents基准测试,你看到了吗?
摘要
讨论Salesforce的CRMArena-Pro基准测试,结果显示代理在单轮任务中成功率为58%,在多轮任务中骤降至35%;并给出实用建议:将代理工作流拆分为狭窄阶段,以减少错误累积。
所以Salesforce构建了CRMArena-Pro作为一项研究的一部分,并于去年这个时候发布(Salesforce Research, arXiv 2505.18878)。他们在真实的CRM工作中测试了领先的代理,涉及4,280个查询和9个顶级模型。结果显示,单轮任务的成功率约为58%,一旦任务变成多轮,成功率就下降到约35%。我知道这看起来像是过时的新闻,考虑到它的发布时间以及AI领域的发展速度,但我相信今天AI代理的结果要么保持不变,要么只有小幅提升——这意味着运行AI代理的公司仍将为其代理所犯的错误买单。昂贵的现实是:问题并不真正在于模型本身,而在于自主运行的时长。代理运行的时间越长,早期丢失的上下文就越多,小错误也会不断累积。领先的AI参与者正在通过扩展上下文窗口至100万到200万个token、引入各种节省记忆的框架以及RAG等工具来对抗这一问题。但问题依然存在,尤其是对于需要全天候运行的长时间代理和工作流。这并不是我在推销什么,而是我在生产环境中行之有效的方法——实际上相当平淡但可靠。我不会把一个完整的工作交给一个代理。相反,我将整体工作拆分为狭窄的阶段,每个阶段对应一个任务,阶段之间通过纯文本交接,并在每个阶段设置检查点,以便在下一阶段运行前验证输出。负责研究的阶段不会同时负责撰写,负责撰写的阶段不会同时负责发送,而且代理永远不需要运行到足以产生漂移的长度。在每个阶段,我都能在错误累积之前识别出不良输出。有没有其他人发现,按阶段限定上下文比提示工程一个超级代理更有效?对于你们来说,"拆分为阶段"和"可以端到端运行"之间的界限在哪里?
相似文章
@alexxubyte: Salesforce部署了20,000个企业级AI代理。最大的教训?工作重心颠倒!传统软件→90%的精力在发布前…
Salesforce部署了20,000个企业级AI代理,揭示了大部分精力在发布之后而非之前。Agentforce首席产品官John Kucera分享了成功代理与停滞代理的区别。
@salesforce: 大多数AI智能体:擅长完成任务,但糟糕的是无法告诉你这些任务是否重要。“Loop engineering”赋予智能体一个…
Salesforce 讨论了 'Loop engineering' 作为一种让AI智能体评估自身进度的方法,但认为当前指标往往无法衡量真正的业务成果,并建议智能体应与共同业务目标对齐。
AI智能体在实际工作流中真正失败的地方(非演示环境)
讨论AI智能体在实际工作流中失败的地方,重点指出协调问题、混乱输入下的可靠性问题,以及在生产中减少人工干预的挑战。
@HowToAI_: Microsoft Research 和 Salesforce 发布了一篇论文,应该让每一位 AI 开发者此刻感到警惕。它的名字是……
Microsoft Research 和 Salesforce 发布的新论文揭示,由于“迷失于对话”(Lost in Conversation)现象,LLM 在多轮对话中的性能显著下降,这对当前单轮基准测试的可靠性提出了挑战。
每个人都关注他们的智能体是否完成任务,但几乎没人问它是否在随着时间的推移变得更好
文章指出了AI智能体开发中一个常见的忽视点:虽然大多数团队会监控任务完成情况,但很少有系统能够捕获失败模式并将其反馈到未来的运行中,从而实现学习和持续改进。