@rohanpaul_ai: 大多数代理基准测试在完成一项任务后就结束了,但经营商店并非如此,这也是这些代理开始失效的地方。MerchantBench…
摘要
MerchantBench 是一个基准测试,它通过让人工智能代理管理一个模拟在线商店一年来评估这些代理,揭示了在持续性能和连续行动方面的挑战。
查看缓存全文
缓存时间: 2026/08/24 09:48
大多数智能体基准测试都在完成单个任务后结束,但经营商店并非如此,这正是这些智能体暴露问题的地方。
MerchantBench为智能体提供一个小型在线商店,让它模拟运行一整年,涵盖采购产品、设定价格、管理现金流等全流程。该基准还评估了一项多数评估所忽略的能力:智能体是否仍在持续运作。
表现最佳的智能体在模拟一年的店铺经营中,收入仅达到人类经营者的约四分之一——这主要是因为它在中途就停止了活动。因此请务必监控你的智能体保持活跃的频率。
记录你的智能体在每个时间窗口内的操作行为,并观察其活跃度曲线。最终得分看似合格,可能掩盖了智能体已停摆数月的事实。
– arxiv.org/abs/2607.28956
标题:“MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations”
相似文章
@ApexAIHighlight:大多数AI基准测试模型是否能给出正确答案。@Accio_official 正在测试更难的事情:能否……
CommerceAgentBench是一个新的基准测试,包含107个真实电子商务任务,旨在检验AI代理能否实际完成工作,超越传统的基于答案的AI基准测试。
@rohanpaul_ai: 当前代理基准可能在真正失败开始之前就结束了。FM-Bench表明一个模型在5年后看起来很强,但20年后仍可能远远落后……
FM-Bench是一个用于评估长期AI代理的基准,揭示短期表现并不能保证在模拟20年管理任务中的长期成功。
EComAgentBench:面向长周期任务与分布式隐藏意图的购物代理基准测试
介绍EComAgentBench,一个用于评估基于LLM的购物代理在长周期任务中处理隐藏意图的基准测试,这些意图分布在查询、用户画像和澄清过程中。该基准测试使用真实的亚马逊产品并进行自动评分,结果显示即使是最佳模型也仅达到57.1%的准确率。
StartupBench: 基准测试:针对市场验证的端到端工作流程的通用代理
StartupBench 引入了一个基准,用于评估通用AI代理在真实世界创业工作流程中的表现,揭示顶级模型仅能完成约30%的任务,原因在于复杂指令遵循和领域特定专业知识方面的不足。
@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…
本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。