E-Commerce Bench:针对长期自主业务运营的LLM代理评估基准
摘要
E-Commerce Bench是一个开源基准,用于评估LLM代理在电子商务中长期自主业务运营的能力,特色包括多店铺谈判和模拟一年内的动态事件。
查看缓存全文
缓存时间: 2026/09/02 03:44
论文页面 - E-Commerce Bench:评估 LLM 代理在长周期自主商业运营中的表现
来源:https://huggingface.co/papers/2608.30730 作者:
,
,
,
,
,
,
,
,
,
摘要
一项为期一年的电子商务基准测试,在18个前沿模型上评估了LLM代理在多店铺谈判、动态市场事件以及长周期策略适应等方面的表现。
长周期代理任务并非只是通过更多交互轮次来串联短任务。其不断演变的动态环境和长程依赖性要求大语言模型 (https://huggingface.co/papers?q=Large%20Language%20Models) (LLMs) 在数千个步骤中持续探索、从经验中学习并调整策略。我们推出了 E-Commerce Bench,这是首个将多轮对手谈判和动态事件 (https://huggingface.co/papers?q=dynamic%20events) 融入一年期商业运营的开源基准测试。在为期365天的模拟中,一个 LLM 代理 (https://huggingface.co/papers?q=LLM%20agent) 同时运营多家网店,研究市场、与供应商谈判采购库存、优化销售策略、处理订单、处理退货并管理现金流,以最大化其年终总资产。为构建真实的商家端运营环境,产品和供应商数据源自真实的电商平台,而为期一年的促销日历、自然灾害和供应链冲击持续重塑需求。为确保可重复性,市场的双方都是确定性的:客户购买和退货遵循固定的需求模型 (https://huggingface.co/papers?q=demand%20model),而谈判内核 (https://huggingface.co/papers?q=negotiation%20kernel) 决定供应商的定价、让步和决策,LLM 仅用于将其表述出来。我们在七个维度(包括年终资产)上评估了18个前沿模型,发现没有单一模型占据绝对优势。GPT-5.6 Sol 赚取最多,将100,000的初始资金增长至1,431,425,但在防欺诈方面在18个模型中排名第16,且运营效率落后于 Fable5。在开源权重模型 (https://huggingface.co/papers?q=open-weight%20models) 中,Qwen3.8-Max-Preview 以416,252领先,比 GLM 5.2 (high) 高出38%,并实现了最强的长周期学习效果,在多次订单中逐步压低价格。我们的代码已开源:https://github.com/QwenLM/E-CommerceBench.
查看 arXiv 页面 (https://arxiv.org/abs/2608.30730) 查看 PDF (https://arxiv.org/pdf/2608.30730) GitHub5 (https://github.com/QwenLM/E-CommerceBench) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30730)
在您的代理中获取此论文:
hf papers read 2608\.30730
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无链接到此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.30730 以从本页链接它。
引用本文的数据集0
无链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.30730 以从本页链接它。
引用本文的空间0
无链接到此论文的空间
在空间 README.md 中引用 arxiv.org/abs/2608.30730 以从本页链接它。
包含本文的收藏夹0
无包含此论文的收藏夹
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
MerchantBench:评测LLM智能体在电子商务运营中的长期连贯性
MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。
CoffeeBench:异构多智能体经济中长期任务LLM智能体的基准测试
CoffeeBench 是一个用于在长期多智能体经济模拟中评估 LLM 智能体的基准测试,其中企业互动 90 天以最大化利润,揭示了不同模型在通信模式和性能上的差异。
EComAgentBench:面向长周期任务与分布式隐藏意图的购物代理基准测试
介绍EComAgentBench,一个用于评估基于LLM的购物代理在长周期任务中处理隐藏意图的基准测试,这些意图分布在查询、用户画像和澄清过程中。该基准测试使用真实的亚马逊产品并进行自动评分,结果显示即使是最佳模型也仅达到57.1%的准确率。
Business Arena:在现实市场中对LLM智能体进行基准测试
Business Arena 是一个新的基准测试,在真实的跨境店铺环境中评估 LLM 智能体,揭示了与人类策略之间的巨大性能差距,并能够对商业决策进行详细归因。
EcoAgent-Bench:评估预算受限的LLM代理中的经济决策
本文介绍了EcoAgent-Bench,一个包含304个任务的基准测试,用于评估LLM代理在明确预算和定价操作下的经济决策,测试五个任务族中的四种与成本相关的决策。