MerchantBench:评测LLM智能体在电子商务运营中的长期连贯性
摘要
MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。
arXiv:2607.28956v1 公告类型:新
摘要:大语言模型智能体越来越多地被评估为自主工具使用者,但大多数基准测试关注的是具有即时成功标准的有界任务。现实世界的部署通常需要长期连贯性,即在长时间范围内保持有目的的行为,同时根据累积的证据调整决策。评估这种能力需要一个持久的环境,其中行动会限制未来的选择,反馈以异质性延迟到达,且不连贯的行为会产生可衡量的累积效应。卖方电子商务通过在产品采购、列表与定价控制、现金流管理以及混合延迟反馈适应方面的循环和相互依赖的决策,为这种评估提供了合适的场景。我们引入了MerchantBench,一个基于98,843条真实电子商务商品记录的365天订单级模拟,并配备了26种供智能体交互的工具。MerchantBench将即时可观察的上游供应商事件与延迟的下游订单结果相结合,要求智能体跟踪单个订单的完整生命周期并重新审视早期决策。我们在两种智能体框架下评估了八个LLM,共进行48次运行,每次跨越365个模拟日。结果显示,即使是最新的LLM与人类参与者之间也存在巨大差距,最佳LLM配置的最终净资产均值仅达到人类参与者平均值的27.3%。
查看缓存全文
缓存时间: 2026/08/03 07:30
# MerchantBench:评测LLM智能体在电子商务运营中的长期一致性 来源:https://arxiv.org/html/2607.28956 Qiming Shi2, Yulong Tao1, Linbo Jin1, Zhaolu Kang4, Yibo Dou4, Jiawen Zhu2, Tianjun Pan5, Shaokang Fu1, Chengyu Wang1, Siyue Li1, Yaping Cheng1, Di Weng3, Chengfu Huo1 ###### 摘要 大型语言模型智能体越来越多地被评估为自主工具使用者,然而大多数基准测试聚焦于具有即时成功标准的有限任务。现实世界部署通常需要长期一致性(Long-Term Coherence),即在扩展的时间跨度内保持有目的的行为,同时根据累积证据调整决策的能力。评估这种能力需要一个持久的环境,其中行动约束未来的选择,反馈以异构延迟到达,而不一致的行为会产生可衡量的累积影响。卖家端电子商务通过产品选品、上架与定价控制、现金流管理以及混合延迟反馈适应中的循环和相互依赖的决策,为这种评估提供了合适的场景。我们引入了MerchantBench,一个基于98,843条真实电子商务产品记录的365天订单级模拟,并配备了26个用于智能体交互的工具。MerchantBench将可即时观察的上游供应商事件与延迟的下游订单结果相结合,要求智能体跟踪单个订单生命周期并重新审视早期决策。我们在两种智能体框架下评估了八个LLM,共进行48次运行,每次跨越365个模拟日。我们的结果显示,即使是最新的LLM与人类参与者之间也存在显著差距,最佳LLM配置仅达到人类参与者平均最终净资产的27.3%。 ## 引言 大型语言模型已成为自主智能体的基础,这些智能体能够规划、调用工具、与外部系统交互并在多轮中做出决策。通用智能体基准测试现在衡量工具使用、网页交互、应用程序控制和状态改变工作流(Liu et al. 2024;Zhou et al. 2024;Yao et al. 2025;Trivedi et al. 2024)。然而,许多现实世界部署并不是具有即时且明确完成标准的有限任务。它们要求智能体在状态持续存在的环境中长时间运行,早期行动会限制后续选项,而相关后果可能只有在多次中间决策之后才会显现。近期基准测试的证据表明,即使是最先进的智能体也常常无法在长时间跨度内保持一致的性能(Luo et al. 2025;Wang et al. 2025c;Yuan et al. 2026)。这些结果促使我们将智能体评估从孤立的任务完成扩展到在现实的长时程环境中检查持续的目标追求和决策一致性。 图1:订单级动态将即时流动性压力与延迟反馈耦合。新订单在结算前占用可用现金,而异常结果稍后出现并影响店铺评分。 卖家端电子商务为评估长期一致性提供了合适的场景。与具有明确完成标准的有限任务不同,在线店铺运营需要在运营期间持续干预。智能体必须反复选择产品、控制上架和价格、管理有限的现金,并随着市场条件、供应商状态和订单结果的演变而修订早期决策。因此,卖家端电子商务测试的是智能体是否能够随时间维持和修订商家策略,而不是完成一个孤立的动作。Vending-Bench和RetailBench已经朝着现实的长周期业务评估迈出了重要步伐(Backlund and Petersson 2025;Zhang et al. 2026)。Vending-Bench评估自动售货机运营,而RetailBench则模拟基于96种杂货产品固定目录的超市管理。然而,卖家端电子商务引入了两个在这些环境中未统一呈现的挑战。首先,电子商务反馈通过单个订单生命周期生成。上架或定价决策可能会立即产生新订单并占用可用现金,而履约失败和售后结果只有在稍后才能被观察到。图1可视化这种即时订单驱动的现金承诺与延迟异常结果之间的时间不对称性。随着延迟证据的积累,智能体必须将后续结果与早期决策关联起来,并确定其当前的商家策略应维持还是修订。其次,如果可用产品及其需求保持静态,仅仅一个长情节并不能有意义地测试长期一致性。一个基于数据构建的大型产品目录具有全年需求轨迹,创造了一个不断变化的机遇集,其中有潜力的产品出现,而现有选择的价值随时间下降。因此,智能体必须
相似文章
E-Commerce Bench:针对长期自主业务运营的LLM代理评估基准
E-Commerce Bench是一个开源基准,用于评估LLM代理在电子商务中长期自主业务运营的能力,特色包括多店铺谈判和模拟一年内的动态事件。
Business Arena:在现实市场中对LLM智能体进行基准测试
Business Arena 是一个新的基准测试,在真实的跨境店铺环境中评估 LLM 智能体,揭示了与人类策略之间的巨大性能差距,并能够对商业决策进行详细归因。
CoffeeBench:异构多智能体经济中长期任务LLM智能体的基准测试
CoffeeBench 是一个用于在长期多智能体经济模拟中评估 LLM 智能体的基准测试,其中企业互动 90 天以最大化利润,揭示了不同模型在通信模式和性能上的差异。
EComAgentBench:面向长周期任务与分布式隐藏意图的购物代理基准测试
介绍EComAgentBench,一个用于评估基于LLM的购物代理在长周期任务中处理隐藏意图的基准测试,这些意图分布在查询、用户画像和澄清过程中。该基准测试使用真实的亚马逊产品并进行自动评分,结果显示即使是最佳模型也仅达到57.1%的准确率。
ORAgentBench:LLM代理能否端到端解决具有挑战性的运筹学任务?
本文介绍ORAgentBench,一个用于评估LLM代理在端到端运筹学任务中表现的执行基准,包含107个经过人工审查的任务。实验表明,当前最佳代理仅通过35.51%的任务,揭示了在可靠决策制定方面的重大不足。