Shopping Reasoning Bench:一个由专家编写的用于多轮对话购物助手的基准

arXiv cs.CL 论文

摘要

购物推理基准(Shopping Reasoning Bench)是一个由专家编写的用于评估多轮对话购物助手的基准,包含525个任务和超过10,000个二元评判标准。对GPT、Claude和Gemini的评估显示,当前模型仅能达到57%至77%的通过率,揭示了在专家级购物推理方面存在显著差距。

arXiv:2606.12608v1 公告类型:新 摘要:对话式购物助手现已服务于数亿客户,但现有的基准测试均未能同时评估真实购物对话所需的开放式多轮推理、领域专业知识和标准级质量。购物推理在语言模型应用中独树一帜。与事实问答或可验证的代码生成不同,它需要在多轮对话中平衡主观偏好、预算约束和跨产品权衡,这些能力是以前的电子商务和通用基准所缺乏的。我们推出了购物推理基准(Shopping Reasoning Bench),这是一个由零售领域专家编写的基准,包含525个任务(232个单轮、293个多轮)以及10863个由零售领域专家编写的带重要性权重的二元评判标准。这些标准按五个推理类别和十五个子类别的分类体系组织,涵盖偏好细化、权衡分析和兼容性评估等多种需求。对来自三个系列(GPT、Claude、Gemini)的九个模型的评估显示,总体通过率仅为57%至77%。在多轮任务中,所有模型在可选的“超越要求”标准上的得分比必需标准低13到29分,并且随着对话进行,性能下降4到18分。这些差距表明,当前模型能够处理基本的购物辅助,但远未达到专家级建议的水平,这使得购物推理基准成为未来购物助手开发的一个具有挑战性的测试平台。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:50

# 购物推理基准:一个专家撰写的多轮对话购物助手基准

来源:https://arxiv.org/html/2606.12608

Shuxian Fan∗Seonwoo Min∗Youna Hu Botao Xia Jayakrishnan Unnikrishnan Rowan Musselmann Yifan Gao Qingyu Yin Priyanka Nigam Bing Yin

Amazon

{fansx, seonwoom, ynhu, xiabota, jayunn, saramuss, yifangao, qingyy, nigamp, alexbyin}@amazon.com

###### 摘要

对话式购物助手现已服务数亿客户,然而现有基准尚未能共同评估真实购物对话所需的开放式多轮推理、领域专业知识和标准级质量。购物推理在语言模型应用中独具特色。与事实性问答或可验证代码生成不同,它需要在多轮对话中平衡主观偏好、预算约束和跨产品权衡,而这些能力是先前电子商务和通用基准所不具备的。我们引入了**购物推理基准(Shopping Reasoning Bench)**,这是一个由专家撰写的基准,包含525个任务(232个单轮,293个多轮),以及由零售领域专家撰写的10,863个重要性加权二值评判标准。这些标准组织在一个包含五个推理类别和十五个子类别的分类体系下,涵盖偏好细化、权衡分析和兼容性评估等多种需求。对GPT、Claude、Gemini三个系列共九个模型的评估显示,总体通过率仅为57-77%。在多轮任务中,所有模型在可选的“超越基本”标准上的得分比必需标准低13-29分,并且随着对话进行,性能下降4-18分。这些差距表明,当前模型能够处理基本的购物辅助,但尚未达到专家级建议的水平,这使得购物推理基准成为未来购物助手开发的一个具有挑战性的试验场。

购物推理基准:一个专家撰写的多轮对话购物助手基准

Shuxian Fan∗††感谢:同等贡献。Seonwoo Min∗ Youna Hu Botao Xia Jayakrishnan Unnikrishnan Rowan Musselmann Yifan Gao Qingyu Yin Priyanka Nigam Bing Yin

Amazon

{fansx, seonwoom, ynhu, xiabota, jayunn, saramuss, yifangao, qingyy, nigamp, alexbyin}@amazon.com

## 1 引言

假设一位顾客要求AI购物助手推荐适合徒步旅行、足够坚固的越野跑鞋。助手列出了五款热门型号,但从未警告说缓冲鞋底在负重下会失去稳定性,也从未建议增大尺码以适应长途徒步时脚的肿胀。这个回答回答了问题,但零售专家会认为它很肤浅。

对话式购物助手已达到消费级规模:Amazon Rufus服务于超过3亿客户(Amazon.com, Inc., 2026 (https://arxiv.org/html/2606.12608#bib.bib24)),包括Perplexity在内的主要搜索平台也已集成AI驱动的购物功能(Reuters, 2024 (https://arxiv.org/html/2606.12608#bib.bib25))。评估这些助手比评估许多传统的语言模型应用更困难。一个好的购物回答必须平衡主观偏好、预算约束和跨产品权衡,并在多轮对话中处理不断变化的用户意图,同时运用产品领域的专业知识。

##### 基准差距。

一个有用的基准必须满足:(i) **基于领域专业知识**,以捕捉众包标注员常缺乏的产品特定知识;(ii) **在标准级别上可基于评分标准验证**,以解决粗略聚合分数所掩盖的细微能力差异;(iii) **开放式和多轮**,以反映真实购物对话的迭代性质。现有的购物基准没有一个同时满足这三个要求(§2 (https://arxiv.org/html/2606.12608#S2))。据我们所知,**购物推理基准**是第一个同时满足这些要求的基准:它将领域专家撰写的评分标准与购物推理分类体系相结合,并在多轮购物任务中评估模型。

##### 为什么是购物推理?

上述复杂性并非偶然:购前购物是一种**实践推理**(Bratman, 1987 (https://arxiv.org/html/2606.12608#bib.bib28)),其输出是行动决策,而非可验证的真相。回答“哪些越野跑鞋足够坚固,也能用于徒步旅行?”需要分解顾客的约束条件,识别候选产品,运用领域专业知识评估每个产品是否符合这些约束,并综合给出一个推荐。没有一个步骤是可以直接检索的;每一步都取决于顾客需求与产品特定知识的全新交集。现有的推理基准——数学(Cobbe等人, 2021 (https://arxiv.org/html/2606.12608#bib.bib1); Hendrycks等人, 2021 (https://arxiv.org/html/2606.12608#bib.bib2))、逻辑和科学(Suzgun等人, 2023 (https://arxiv.org/html/2606.12608#bib.bib29); Rein等人, 2023 (https://arxiv.org/html/2606.12608#bib.bib4))或代码(Chen等人, 2021 (https://arxiv.org/html/2606.12608#bib.bib30); Jimenez等人, 2024 (https://arxiv.org/html/2606.12608#bib.bib5))——虽然覆盖了广泛的难度范围,但都有一个决定性属性:存在唯一可验证的答案。购物推理没有标准答案,只有更好和更差的深思熟虑,而这正是购物推理基准的专家撰写评分标准旨在衡量的差距。

##### 贡献。

- • **首个购前购物推理分类体系**。五个类别和十五个子类别,基于专家标注的轮次构建。这些分类体系捕捉了以往购物意图(Sondhi等人, 2018 (https://arxiv.org/html/2606.12608#bib.bib12))和产品问答(Yang和Alonso, 2024 (https://arxiv.org/html/2606.12608#bib.bib13))分类体系未能涵盖的购物特定推理模式(§3 (https://arxiv.org/html/2606.12608#S3))。
- • **专家撰写的多轮购物数据集**。由零售领域专家撰写的232个单轮查询和293个多轮任务(共1,764轮),涵盖五个产品系列(§3 (https://arxiv.org/html/2606.12608#S3))。
- • **重要性加权原子评分标准框架**,附带经过验证的LLM-as-judge。10,863个二值标准(其中85.0%为必需),将专家购物推理分解为独立可验证的通过/失败检查。LLM评判器经过专家共识验证,其每个标准的宏F1以专家间一致性为上限进行基准测试(§4 (https://arxiv.org/html/2606.12608#S4))。
- • **跨三个模型系列和能力层级的实证研究**。来自GPT、Claude和Gemini系列的9个模型,每个系列包含前沿、中端和小型三个层级。该基准能够区分不同系列,区分同一系列中的不同层级,并揭示随着对话变长出现的多轮性能退化(§5 (https://arxiv.org/html/2606.12608#S5))。

我们的基准数据、评判提示和每个模型的输出将在https://huggingface.co/datasets/amazon/ShoppingReasoningBench公开发布。

##### 主要发现。

我们在购物推理基准上评估了来自三个系列、三个能力层级的九个模型。首先,基准尚未饱和:九个模型的通过率范围为57%到77%。其次,所有模型在可选评分标准上的得分比必需标准低13-29分,揭示了基础购物辅助与专家级购物辅助之间持续存在的差距。第三,多轮性能在一个任务过程中下降了4-18分,与“迷失在对话中”现象(Laban等人, 2025 (https://arxiv.org/html/2606.12608#bib.bib11))类似。

## 2 相关工作

购物推理基准借鉴了购物领域基准、其他领域的专家撰写评分标准基准、查询和意图分类体系,以及多轮LLM评估。表1 (https://arxiv.org/html/2606.12608#S2.T1)将购物推理基准与最直接可比的购物基准以及其评估设计所借鉴的评分标准基准方法论进行了对比。

##### 购物和电子商务基准。

对话式购物助手的评估一直分散在不同的任务形式中。WebShop (Yao等人, 2022 (https://arxiv.org/html/2606.12608#bib.bib17)) 在模拟的网页导航中基准测试LLM代理,侧重于产品选择而非开放式推理。Shopping MMLU (Jin等人, 2024 (https://arxiv.org/html/2606.12608#bib.bib18)) 提供了一套广泛的分类式任务,但评估的是单轮封闭式答案。eCeLLM (Peng等人, 2024 (https://arxiv.org/html/2606.12608#bib.bib19)) 为电子商务构建了指令微调数据。ShoppingBench (Wang等人, 2025a (https://arxiv.org/html/2606.12608#bib.bib20)) 针对一个大型产品沙盒提供了基于意图的代理任务,衡量的是端到端的成功率而非回答质量。EcomEval (Xie等人, 2025 (https://arxiv.org/html/2606.12608#bib.bib10)) 评估了七种语言的购物助手,但没有提供用于开放式评分的专家撰写评分标准。SessionIntentBench (Yang等人, 2025 (https://arxiv.org/html/2606.12608#bib.bib8)) 使用层次化意图树模拟会话间意图转移,但使用分类指标进行评估。在对话数据集方面,Wizard of Shopping (Li等人, 2025 (https://arxiv.org/html/2606.12608#bib.bib21)) 和 MG-ShopDial (Bernard和Balog, 2023 (https://arxiv.org/html/2606.12608#bib.bib22)) 提供了对话式购物对话,但缺乏用于自动标准级评分的评分标准注释。

最直接的两个竞争对手是最近的两个基于评分标准的购物基准。ShoppingComp (Tou等人, 2025 (https://arxiv.org/html/2606.12608#bib.bib23)) 引入了一个专家策划的单轮基准,包含基于评分标准的产品检索、报告生成和安全性关键决策评估。SmartShopBench (Cheng等人, 2026 (https://arxiv.org/html/2606.12608#bib.bib3)) 引入了一个跨购物意图类别的层次化两级评估,旨在支持基于RL的代理训练。两者都是单轮的,且未围绕已发布的购物推理分类体系组织查询。

购物推理基准在三个维度上有所不同。首先,它增加了专家撰写的多轮任务,这些任务结构化地呈现为购物旅程,涵盖探索、比较和定向搜索,同时还包含单轮查询,这些查询本身需要分解客户约束、识别候选产品、并依据领域知识权衡利弊。其次,它围绕一个已发布的购前购物推理分类体系组织查询。第三,其评分标准带有重要性权重,而非统一的通过/失败。

##### 专家撰写的评分标准基准。

在多个领域,随着通用基准接近饱和,专家撰写的评分标准基准已经出现。HealthBench (Arora等人, 2025 (https://arxiv.org/html/2606.12608#bib.bib14)) 对模型在数千个多轮健康对话上进行评估,这些对话根据医生撰写的评分标准打分,并使用LLM评判器进行验证,与医生共识对比。PRBench (Akyürek等人, 2025 (https://arxiv.org/html/2606.12608#bib.bib15)) 将这种方法扩展到金融和法律领域。ProfBench (Wang等人, 2025b (https://arxiv.org/html/2606.12608#bib.bib16)) 涵盖了化学、物理、金融和咨询领域的博士和MBA级别,由领域专家标注了回答-标准对。早期科学领域的专家撰写基准(如GPQA (Rein等人, 2023 (https://arxiv.org/html/2606.12608#bib.bib4)))和软件工程领域(如SWE-bench (Jimenez等人, 2024 (https://arxiv.org/html/2606.12608#bib.bib5)))使用可验证的答案而非开放式评分标准。购物推理基准将这一系列工作扩展到零售领域,将重要性加权原子标准协议和LLM评判器验证设计应用于购物推理。

##### 查询和意图分类体系。

电子商务的查询分类体系主要关注**搜索查询意图**(Sondhi等人, 2018 (https://arxiv.org/html/2606.12608#bib.bib12))或**产品问答类型**(Yang和Alonso, 2024 (https://arxiv.org/html/2606.12608#bib.bib13)),而非对话式推理;通用对话分类体系如INFINITY-CHAT (Jiang等人, 2025 (https://arxiv.org/html/2606.12608#bib.bib7)) 并非针对购物。这些分类体系都没有解决将购前购物对话与搜索或一般聊天区分开来的推理模式:偏好细化、跨产品权衡分析、兼容性评估以及多轮购买决策进展。购物推理基准的分类体系填补了这一空白(§3 (https://arxiv.org/html/2606.12608#S3))。

##### LLM评估中的推理。

现有的推理基准——数学(Cobbe等人, 2021 (https://arxiv.org/html/2606.12608#bib.bib1); Hendrycks等人, 2021 (https://arxiv.org/html/2606.12608#bib.bib2))、科学(Suzgun等人, 2023 (https://arxiv.org/html/2606.12608#bib.bib29); Rein等人, 2023 (https://arxiv.org/html/2606.12608#bib.bib4))和代码(Chen等人, 2021 (https://arxiv.org/html/2606.12608#bib.bib30); Jimenez等人, 2024 (https://arxiv.org/html/2606.12608#bib.bib5))——覆盖了广泛的难度范围,但都有一个决定性属性:存在一个唯一正确的答案可以自动检查。购物推理从根本上缺乏这个属性(§1 (https://arxiv.org/html/2606.12608#S1));购物推理基准将基于评分标准的评估方法应用于这种情况,将深思熟虑分解为独立可验证的标准(§4 (https://arxiv.org/html/2606.12608#S4))。

表1:购物推理基准与购物领域基准以及其他领域基于评分标准的基准的比较。评估项目数量显示在每个名称下方。“MT” = 多轮;“Expert” = 专家撰写;“Rubric” = 专家撰写评分标准评分。

| 基准 | MT | Expert | Rubric |
| :--- | :--- | :--- | :--- |
| *购物领域基准* | | | |
| WebShop (Yao等人, 2022) (12,087条指令) | – | – | – |
| Shopping MMLU (Jin等人, 2024) (57个任务) | – | – | – |
| eCeLLM (Peng等人, 2024) (10个任务) | – | – | – |
| EcomEval (Xie等人, 2025) (37个任务) | – | ✓ | – |
| ShoppingBench (Wang等人, 2025a) (3,310个任务) | – | – | – |
| SessionIntentBench (Yang等人, 2025) (8,980条轨迹) | – | – | – |
| ShoppingComp (Tou等人, 2025) (120个任务) | – | ✓ | ✓ |
| SmartShopBench (Cheng等人, 2026) (120个任务) | – | – | ✓ |
| *专家评分标准基准(其他领域)* | | | |
| HealthBench (Arora等人, 2025) (5,000场对话) | ✓ | ✓ | ✓ |
| ProfBench (Wang等人, 2025b) (80个任务) | – | ✓ | ✓ |
| PRBench (Akyürek等人, 2025) (1,100个问题) | – | ✓ | ✓ |
| 购物推理基准(本文) (1,996个轮次) | ✓ | ✓ | ✓ |

## 3 购物推理分类体系

### 3.1 设计原理

专家遵循购物推理的流程:理解客户需求,识别相关选项,应用领域知识评估这些选项是否符合客户约束,并综合提出可操作的建议。图1 (https://arxiv.org/html/2606.12608#S3.F1) 通过一个代表性查询展示了这个流程:专家通过推理阶段分解查询,并生成任何充分回答必须满足的原子标准。现有的购物相关分类体系针对两个维度:**搜索查询意图**(Sondhi等人, 2018 (https://arxiv.org/html/2606.12608#bib.bib12))和**产品问答类型**(Yang和Alonso, 2024 (https://arxiv.org/html/2606.12608#bib.bib13)),而非对话式推理;通用对话分类体系不是针对购物的。这些分类体系都没有解决将购前购物对话与搜索或一般聊天区分开来的推理模式:偏好细化、跨产品权衡分析、兼容性评估和多轮购买决策进展。购物推理基准的分类体系填补了这一空白(§3 (https://arxiv.org/html/2606.12608#S3))。

相似文章

CallBench:电话助手双目标协调基准测试

arXiv cs.AI

CallBench是一个中文基准测试,用于评估电话助手中的双目标协调能力,包含50,000轮跨越六个场景的多轮对话,并采用预设感知的评估协议,覆盖语义理解、安全性和对话节奏。