@rohanpaul_ai: 大多数代理基准测试在完成一项任务后就结束了,但经营商店并非如此,这也是这些代理开始失效的地方。MerchantBench…

X AI KOLs Timeline 论文

摘要

MerchantBench 是一个基准测试,它通过让人工智能代理管理一个模拟在线商店一年来评估这些代理,揭示了在持续性能和连续行动方面的挑战。

大多数代理基准测试在完成一项任务后就结束了,但经营商店并非如此,这也是这些代理开始失效的地方。 MerchantBench 将一个小在线商店交给代理,让它运行一个模拟年,包括采购产品、设定价格和管理现金。它还评估了大多数评估忽略的一点:代理是否仍在行动。 最佳代理在完成一个模拟年的店铺经营后,只获得了人类收入的大约四分之一,主要是通过静默不行动,因此要跟踪你的代理仍在行动的频率。 因此,记录你的代理在每个时间窗口内的行动,并观察那条曲线。一个不错的最终分数可能会掩盖代理几个月前就停止工作的情况。 – arxiv.org/abs/2607.28956 标题:"MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations"
查看原文
查看缓存全文

缓存时间: 2026/08/24 09:48

大多数智能体基准测试都在完成单个任务后结束,但经营商店并非如此,这正是这些智能体暴露问题的地方。

MerchantBench为智能体提供一个小型在线商店,让它模拟运行一整年,涵盖采购产品、设定价格、管理现金流等全流程。该基准还评估了一项多数评估所忽略的能力:智能体是否仍在持续运作。

表现最佳的智能体在模拟一年的店铺经营中,收入仅达到人类经营者的约四分之一——这主要是因为它在中途就停止了活动。因此请务必监控你的智能体保持活跃的频率。

记录你的智能体在每个时间窗口内的操作行为,并观察其活跃度曲线。最终得分看似合格,可能掩盖了智能体已停摆数月的事实。

– arxiv.org/abs/2607.28956

标题:“MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations”

相似文章

@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…

X AI KOLs Following

本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。