Business Arena:在现实市场中对LLM智能体进行基准测试

Hugging Face Daily Papers 论文

摘要

Business Arena 是一个新的基准测试,在真实的跨境店铺环境中评估 LLM 智能体,揭示了与人类策略之间的巨大性能差距,并能够对商业决策进行详细归因。

经营企业是一种具有挑战性的智能工作。经营者必须从不完整的信号中推断机会,在不确定性下投入资本,适应变化市场中延迟的结果,并在合法交易前满足监管义务。前沿 LLM 智能体越来越能够完成复杂的工作流程,然而现有的智能体基准测试很少评估与业务相关的能力。我们推出了 Business Arena,这是一个受控环境,其中 AI 智能体经营一家跨境电商店铺,在长期内从供应商处采购并向买家销售。我们基于真实的阿里巴巴采购数据以及从权威来源校准的市场状况来构建该竞技场。延迟且相互关联的后果使得单个商业决策难以评判,但它们的综合结果可以通过利润来衡量。由于仅靠利润无法解释智能体成功或失败的原因,我们将智能体与人类设计的策略进行比较以估算可用机会,使用技能级指标来揭示潜在的优势和劣势,并将已实现的收益和损失追溯到产生它们的行动。我们使用机制消融实验来证明,优异的结果反映的是真正的商业智能,而非疏忽或模拟器特有的捷径。我们评估了 15 个前沿模型,发现平均最终净资产存在九倍差异。即使是最好的模型也落后于人类设计的策略,这表明商业运营对 LLM 智能体来说仍然具有挑战性。技能级分析揭示了运营风格,从注重利润率的优质卖家到高周转批发商和客户服务专家,而行动级归因则识别了创造或破坏价值的采购、定价和回收决策。总之,Business Arena 朝着评估端到端商业智能体的真实且可信的测试平台迈出了第一步。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:22

论文页面 - Business Arena:在真实市场中基准测试LLM智能体

来源:https://huggingface.co/papers/2608.08621

摘要

Business Arena 评估了运营真实跨境店铺的LLM智能体,揭示了其与人类策略之间的巨大性能差距,并能够对商业决策进行详细归因。

经营企业是一种具有挑战性的智能工作形式。运营者必须从不完整的信号中推断机会,在不确定性下投入资本,适应不断变化的市场中延迟显现的结果,并在合法交易前满足监管要求。前沿LLM智能体(https://huggingface.co/papers?q=LLM%20agents)越来越能完成复杂的工作流程,但现有的智能体基准测试很少评估与商业相关的能力。我们引入了 Business Arena(https://huggingface.co/papers?q=Business%20Arena),这是一个受控环境,AI智能体在其中运营跨境店铺(https://huggingface.co/papers?q=cross-border%20shop),在较长的时间跨度内从供应商处采购并向买家销售。我们将该竞技场建立在真实的 Alibaba.com 采购(https://huggingface.co/papers?q=sourcing)数据和由权威来源校准的市场条件之上。延迟和耦合的后果使单个商业决策难以评判,但它们的综合结果可以通过利润来衡量。由于仅靠利润无法解释智能体成功或失败的原因,我们将智能体与人类设计的策略进行比较以估算可用机会,使用技能水平指标(https://huggingface.co/papers?q=skill-level%20metrics)揭示潜在的优缺点,并将已实现的收益和损失追溯到产生它们的行动。我们使用机制消融(https://huggingface.co/papers?q=mechanism%20ablations)来证明优异结果反映的是真正的商业智能,而非疏忽或模拟器特有的捷径。我们评估了15个前沿模型,发现平均最终净资产存在九倍差异。即使是最好的模型也落后于人类设计的策略,这表明商业运营对LLM智能体(https://huggingface.co/papers?q=LLM%20agents)来说仍然具有挑战性。技能水平分析揭示了运营风格,从注重利润的高端卖家到高周转批发商和客户服务专家,而行动级归因(https://huggingface.co/papers?q=action-level%20attribution)则识别出创造或破坏价值的采购(https://huggingface.co/papers?q=sourcing)、定价(https://huggingface.co/papers?q=pricing)和恢复决策(https://huggingface.co/papers?q=recovery%20decisions)。总之,Business Arena(https://huggingface.co/papers?q=Business%20Arena)朝着评估端到端商业智能体的真实可信测试平台迈出了第一步。

查看arXiv页面(https://arxiv.org/abs/2608.08621) 查看PDF(https://arxiv.org/pdf/2608.08621) 项目页面(https://business-arena.site.accio.ai/) GitHub16(https://github.com/Accio-org/BusinessArena) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.08621)

在你的智能体中获取这篇论文:

hf papers read 2608\.08621

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.08621,即可从此页面链接到该模型。

引用此论文的数据集0

没有链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.08621,即可从此页面链接到该数据集。

引用此论文的Spaces0

没有链接此论文的Space

在 Space 的 README.md 中引用 arxiv.org/abs/2608.08621,即可从此页面链接到该 Space。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集(https://huggingface.co/new-collection)中,即可从此页面链接到该收藏集。

相似文章

MerchantBench:评测LLM智能体在电子商务运营中的长期连贯性

arXiv cs.AI

MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。