E-Commerce Bench:针对长期自主业务运营的LLM代理评估基准

Hugging Face Daily Papers 论文

摘要

E-Commerce Bench是一个开源基准,用于评估LLM代理在电子商务中长期自主业务运营的能力,特色包括多店铺谈判和模拟一年内的动态事件。

长期代理任务超越了通过更多交互轮次链接短期任务的范畴。其不断演变的动态环境和长期依赖要求大语言模型(LLMs)在数千步中持续探索、从经验中学习并调整其策略。我们引入E-Commerce Bench,这是第一个将多轮对手谈判和动态事件整合到为期一年的商业运营中的开源基准。在365天内,一个LLM代理同时经营多个在线商店,研究市场、与供应商谈判采购库存、优化销售策略、履行订单、处理退货并管理现金流,以最大化其年末总资产。为了构建一个现实的商家端运营环境,产品和供应商数据来源于一个真实的电子商务平台,而为期一年的促销、自然灾害和供应链冲击日历不断重塑需求。为了可重复性,市场的双方都是确定性的:客户购买和退货遵循固定的需求模型,而一个谈判内核决定供应商定价、让步和决策,仅使用LLM来表达它们。我们在七个维度上评估了18个前沿模型,包括年末资产,发现没有单一模型占主导地位。GPT-5.6 Sol赚得最多,将10万初始资金增长到1,431,425,但在欺诈规避方面排名第16位(共18位),在运营效率上落后于Fable5。在开放权重模型中,Qwen3.8-Max-Preview以416,252领先,比GLM 5.2(高)高38%,并在整个过程中实现了最强的学习,通过重复订单逐步讨价还价降低价格。我们的代码可在https://github.com/QwenLM/E-CommerceBench获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:44

论文页面 - E-Commerce Bench:评估 LLM 代理在长周期自主商业运营中的表现

来源:https://huggingface.co/papers/2608.30730 作者:

,

,

,

,

,

,

,

,

,

摘要

一项为期一年的电子商务基准测试,在18个前沿模型上评估了LLM代理在多店铺谈判、动态市场事件以及长周期策略适应等方面的表现。

长周期代理任务并非只是通过更多交互轮次来串联短任务。其不断演变的动态环境和长程依赖性要求大语言模型 (https://huggingface.co/papers?q=Large%20Language%20Models) (LLMs) 在数千个步骤中持续探索、从经验中学习并调整策略。我们推出了 E-Commerce Bench,这是首个将多轮对手谈判和动态事件 (https://huggingface.co/papers?q=dynamic%20events) 融入一年期商业运营的开源基准测试。在为期365天的模拟中,一个 LLM 代理 (https://huggingface.co/papers?q=LLM%20agent) 同时运营多家网店,研究市场、与供应商谈判采购库存、优化销售策略、处理订单、处理退货并管理现金流,以最大化其年终总资产。为构建真实的商家端运营环境,产品和供应商数据源自真实的电商平台,而为期一年的促销日历、自然灾害和供应链冲击持续重塑需求。为确保可重复性,市场的双方都是确定性的:客户购买和退货遵循固定的需求模型 (https://huggingface.co/papers?q=demand%20model),而谈判内核 (https://huggingface.co/papers?q=negotiation%20kernel) 决定供应商的定价、让步和决策,LLM 仅用于将其表述出来。我们在七个维度(包括年终资产)上评估了18个前沿模型,发现没有单一模型占据绝对优势。GPT-5.6 Sol 赚取最多,将100,000的初始资金增长至1,431,425,但在防欺诈方面在18个模型中排名第16,且运营效率落后于 Fable5。在开源权重模型 (https://huggingface.co/papers?q=open-weight%20models) 中,Qwen3.8-Max-Preview 以416,252领先,比 GLM 5.2 (high) 高出38%,并实现了最强的长周期学习效果,在多次订单中逐步压低价格。我们的代码已开源:https://github.com/QwenLM/E-CommerceBench.

查看 arXiv 页面 (https://arxiv.org/abs/2608.30730) 查看 PDF (https://arxiv.org/pdf/2608.30730) GitHub5 (https://github.com/QwenLM/E-CommerceBench) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30730)

在您的代理中获取此论文:

hf papers read 2608\.30730

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无链接到此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.30730 以从本页链接它。

引用本文的数据集0

无链接到此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.30730 以从本页链接它。

引用本文的空间0

无链接到此论文的空间

在空间 README.md 中引用 arxiv.org/abs/2608.30730 以从本页链接它。

包含本文的收藏夹0

无包含此论文的收藏夹

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

MerchantBench:评测LLM智能体在电子商务运营中的长期连贯性

arXiv cs.AI

MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。