标签
MerchantBench 是一个基准测试,它通过让人工智能代理管理一个模拟在线商店一年来评估这些代理,揭示了在持续性能和连续行动方面的挑战。
MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。