Salesforce运行自家AI Agents基准测试,你看到了吗?

Reddit r/ArtificialInteligence 新闻

摘要

讨论Salesforce的CRMArena-Pro基准测试,结果显示代理在单轮任务中成功率为58%,在多轮任务中骤降至35%;并给出实用建议:将代理工作流拆分为狭窄阶段,以减少错误累积。

所以Salesforce构建了CRMArena-Pro作为一项研究的一部分,并于去年这个时候发布(Salesforce Research, arXiv 2505.18878)。他们在真实的CRM工作中测试了领先的代理,涉及4,280个查询和9个顶级模型。结果显示,单轮任务的成功率约为58%,一旦任务变成多轮,成功率就下降到约35%。我知道这看起来像是过时的新闻,考虑到它的发布时间以及AI领域的发展速度,但我相信今天AI代理的结果要么保持不变,要么只有小幅提升——这意味着运行AI代理的公司仍将为其代理所犯的错误买单。昂贵的现实是:问题并不真正在于模型本身,而在于自主运行的时长。代理运行的时间越长,早期丢失的上下文就越多,小错误也会不断累积。领先的AI参与者正在通过扩展上下文窗口至100万到200万个token、引入各种节省记忆的框架以及RAG等工具来对抗这一问题。但问题依然存在,尤其是对于需要全天候运行的长时间代理和工作流。这并不是我在推销什么,而是我在生产环境中行之有效的方法——实际上相当平淡但可靠。我不会把一个完整的工作交给一个代理。相反,我将整体工作拆分为狭窄的阶段,每个阶段对应一个任务,阶段之间通过纯文本交接,并在每个阶段设置检查点,以便在下一阶段运行前验证输出。负责研究的阶段不会同时负责撰写,负责撰写的阶段不会同时负责发送,而且代理永远不需要运行到足以产生漂移的长度。在每个阶段,我都能在错误累积之前识别出不良输出。有没有其他人发现,按阶段限定上下文比提示工程一个超级代理更有效?对于你们来说,"拆分为阶段"和"可以端到端运行"之间的界限在哪里?
查看原文

相似文章