SalesSim:基准测试并对齐多模态语言模型作为零售用户模拟器

arXiv cs.CL 论文

摘要

本文介绍了 SalesSim,这是一个用于评估多模态大型语言模型(MLLM)作为零售用户模拟器的框架和基准,旨在揭示角色对齐方面的不足,并提出了一种名为 UserGRPO 的新型强化学习方法。

arXiv:2605.08334v1 公告类型:新论文 摘要:我们提出了 SalesSim,这是一个用于评估多模态大型语言模型(MLLM)在多轮、多模态、工具增强型在线零售对话中模拟具有真实角色驱动行为的客户能力的框架和测试平台。与以往将用户模拟视为表面层对话生成的工作不同,SalesSim 将零售互动和决策建模为一个基于实体的过程,其中拥有不同背景、偏好和不可妥协条件的购物者与销售代理互动,寻求澄清并做出明智的购买决策。为了进行评估,我们设计了一套以决策对齐为中心的指标,用于衡量模拟器的行为与其角色规范之间的一致性,以及对话质量。在对 6 个开源和闭源的最先进模型进行基准测试后,我们发现了几种行为差距。首先,虽然模型能够生成流畅的对话,但与人类对话相比,它们表现出显著较低的词汇多样性,并在不同角色间过度披露标准。其次,模型倾向于被销售代理的建议所说服,从而偏离角色规范。即使是表现最强的模型,其平均对齐率也低于 79%。为了克服这些局限性,我们提出了 UserGRPO,这是一种多轮、多目标的强化学习方案,旨在在角色规范下同时优化对话流畅度和决策对齐。我们的实验表明,UserGRPO 将基线模型的决策对齐率提高了 13.8%,同时改善了对话质量。通过引入 SalesSim,我们为社区提供了一个新的测试平台,以调查和改进用户模拟器在目标导向场景中的遵从性。
查看原文
查看缓存全文

缓存时间: 2026/05/12 06:41

# SalesSim:基准测试与对齐多模态语言模型作为零售用户模拟器

来源:https://arxiv.org/html/2605.08334

Yada Pruksachatkun Salesforce Research &Elaine Wan$^{1}$ 加州大学洛杉矶分校 &Lyanna Chen 加州大学洛杉矶分校 &Kai-Wei Chang 加州大学洛杉矶分校 &Chien-Sheng Wu Salesforce Research

###### 摘要

我们提出 **SalesSim**,这是一个用于评估多模态大语言模型(MLLMs)模拟真实、由人设驱动的消费者行为能力的框架和基准测试,场景涵盖多轮、多模态、工具增强的在线零售对话。与将用户模拟视为表层对话生成的以往工作不同,**SalesSim** 将零售互动和决策制定建模为一个具身化的代理过程(grounded, agentic process),其中拥有不同背景、偏好和底线(dealbreakers)的购物者与销售人员互动,寻求澄清并做出明智的购买决策。为了进行评估,我们设计了一套以决策对齐为核心的指标,测量模拟器行为与其人设规格之间的一致性,以及对话质量。在对 6 款开源和闭源的最先进模型进行基准测试后,我们发现了几种行为上的差距。首先,虽然模型能产生流畅的对话,但与人类对话相比,它们表现出显著较低的词汇多样性,并且在跨人设中过度披露标准。其次,模型容易受到销售人员建议的说服,从而偏离人设规格。即使是最强的模型,其与其潜在人设规格的平均对齐率也低于 79%。为了解决这些局限性,我们提出 **UserGRPO**,这是一种多轮、多目标强化学习方案,旨在优化对话流畅度和在人设规格下的决策对齐。我们的实验表明,UserGRPO 在提高对话质量的同时,将基准模型的决策对齐率提高了 13.8%。通过引入 **SalesSim**,我们为社区提供了一个测试平台,用于调查和改进面向目标设置中用户模拟器的遵循程度。

## 1 引言

大型语言模型(LLMs)越来越多地被用作经济模拟的用户模拟器,以及交互式 AI 系统的评估和训练\[31 (https://arxiv.org/html/2605.08334#bib.bib51),9 (https://arxiv.org/html/2605.08334#bib.bib18),13 (https://arxiv.org/html/2605.08334#bib.bib20),15 (https://arxiv.org/html/2605.08334#bib.bib21),3 (https://arxiv.org/html/2605.08334#bib.bib48),40 (https://arxiv.org/html/2605.08334#bib.bib47),27 (https://arxiv.org/html/2605.08334#bib.bib46),26 (https://arxiv.org/html/2605.08334#bib.bib53),14 (https://arxiv.org/html/2605.08334#bib.bib32),25 (https://arxiv.org/html/2605.08334#bib.bib38),5 (https://arxiv.org/html/2605.08334#bib.bib3)\]。然而,用户模拟器本身的保真度(fidelity)相对研究不足。在本工作中,受\[25 (https://arxiv.org/html/2605.08334#bib.bib38)\]中的经济模拟以及产品销售培训等用例的启发,我们研究了使用多模态 LLMs(MLLM)作为零售互动中的客户模拟器的有效性。

现有工作主要从表层质量评估客户模拟器:\[9 (https://arxiv.org/html/2605.08334#bib.bib18),18 (https://arxiv.org/html/2605.08334#bib.bib26)\]主要使用任务成功率作为指标,该指标同时受购物者和销售人员表现的影响。在零售领域,Gromada 等人\[12 (https://arxiv.org/html/2605.08334#bib.bib24)\]引入了特定于客户模拟器的指标,这些指标依赖于评分量表和 LLM-as-a-judge 来评估人设遵循情况。与这项工作不同,我们设计的评估方法在人设规格和目录数据中可接受的产品之间存在真实的映射关系,从而可以对决策层面的人设遵循情况进行可验证的评估。

> 图 1:在 **SalesSim** 上的零售模拟定性示例。基准模型表现出过度宽容。它们也容易受到销售人员模拟器语气的影响,无论是进行不合适的购买,还是拒绝其人设规定的可接受产品。相比之下,我们的 **UserGRPO** 模型展示了基于产品属性的更扎实的推理。

我们引入 **SalesSim**,这是一个用于评估 MLLM 在多轮、多模态零售互动中作为人设驱动代理的测试平台。**SalesSim** 包含 6 个产品类别中 274 个丰富产品元数据对应的 674 个独特购物者人设。我们从以下几个方面评估模型模拟的客户代理:(1)**决策对齐(Decision Alignment, DA)**,衡量最终行为是否与人设约束一致;以及(2)**对话保真度(Conversational Fidelity)**,衡量与现实世界人类购物者对话\[16 (https://arxiv.org/html/2605.08334#bib.bib17)\]相比的对话真实性。通过对最先进 MLLMs 进行基准测试,我们揭示了现有模型在模拟真实购物者方面的局限性。虽然这些模型能产生流畅的输出,但它们往往容易受到销售人员代理建议的影响。即使是强大的闭源模型如 ChatGPT-5.4,其决策对齐率也仅为 74.3%。为了解决这一局限性,我们提出 **UserGRPO**,这是一种轨迹级别的强化学习方案,直接优化人设约束下的决策一致性。**UserGRPO** 将基准模型的决策对齐率提高了 13.8%,同时在保留跨产品领域的语言质量方面,超越了提示工程和监督微调(SFT)基准。

我们的贡献有三点:

*   我们提出 **SalesSim**,这是一个具身化的、多轮、多模态的代理环境,用于基准测试人设驱动的购物者模拟。
*   我们提供了实证证据,表明最先进 MLLMs 尽管语言流畅,但未能使决策与人设约束保持一致。
*   我们提出 **UserGRPO**,这是一种轨迹级别的多轮 RL 方案,提高了决策对齐率,并纠正了零售模拟中不自然的信息流。

## 2 SalesSim 基准测试:概述

> 图 2:**SalesSim** 产品和人设数据示例。我们的产品数据包含丰富的元数据,包括特征、价格和多媒体信息。我们的人设数据包含细粒度的偏好和底线,与产品选择紧密相关。

我们提出 **SalesSim**,这是一个针对零售互动的代理模拟环境。我们的框架扩展自 Murakhovs’ka 等人\[22 (https://arxiv.org/html/2605.08334#bib.bib19)\]的双代理设置,其生态目标是创建逼真的购物者模拟器,可用于下游应用,如销售培训、经济模拟以及零售代理的评估和训练。

### 2.1 基准测试构建

为了建立模型对购物者行为遵循情况的多样化基准基础,我们构建了一个包含 6 个产品类别、674 个消费者人设的基准测试,其中包含 274 个信息丰富的产品元数据,以高粒度描述不同特征(例如颜色、面料)。图 2 (https://arxiv.org/html/2605.08334#S2.F2) 展示了人设和产品规格。

#### 2.1.1 产品库存策划

为了评估用户模拟在多样化在线零售领域的表现,我们构建产品库存以确保类别多样性和多模态丰富性。我们创建了包含六个产品类别的基础产品库存:女装、男装、戒指、智能手表、汽车、游戏。我们通过整合来自多个来源的现实世界产品数据来构建基础库存,例如先前的推荐和销售数据集\[20 (https://arxiv.org/html/2605.08334#bib.bib9)\]和公开可用的商业零售来源。为了标准化跨领域的产品元数据,我们使用制造商和零售商来源的可用信息,对从制造商和零售商来源可用的信息进行手动清理和丰富,以统一属性架构(例如价格、材料和风格描述符)。为了模仿人类购物者能够查看多模态产品信息的现实世界在线零售环境,我们为每个产品条目添加了来自零售或制造商来源的图像。产品库存构建的完整细节见附录 A (https://arxiv.org/html/2605.08334#A1)。

#### 2.1.2 人设构建

为了模拟多样且真实的用户行为,我们通过结合现实世界的基础概况与结构化偏好生成了购物者人设。我们从 Nemotron-Personas 数据集\[21 (https://arxiv.org/html/2605.08334#bib.bib45)\]初始化人设,该数据集提供了与现实世界人口统计和地理分布对齐的大规模合成人设描述。这确保了多样化的背景覆盖并防止分布偏差。基于这些人设的背景和年龄字段,我们合成了与人设一致的产品特定偏好和底线,以便对决策行为进行受控评估。为了评估在不可行条件下的鲁棒性,我们还策划了一部分其需求无法由可用产品库存满足的人设子集。人设构建的完整细节见附录 A.2 (https://arxiv.org/html/2605.08334#A1.SS2)。我们的人设数据统计见附录 A (https://arxiv.org/html/2605.08334#A1),表 5 (https://arxiv.org/html/2605.08334#A1.T5)。

### 2.2 动作空间

我们将客户-销售人员互动建模为工具增强的双代理系统。

**购物者代理动作:** 这些是终止模拟的终端动作。

*   `add_to_cart`:接受产品推荐。
*   `end_conversation`:退出互动,不购买。

**销售机器人代理动作:** 这些工具通过允许销售人员检索最适合购物者指定偏好和底线的产品,支持具身化推荐。

*   `lookup_buying_guide`:访问高级产品知识,给定自然语言查询。
*   `lookup_product_items`:从库存中检索候选产品,给定自然语言查询。

我们使用 `sentence-transformers/all-mpnet-base-v2` 嵌入产品和购买指南及产品信息,并使用 FAISS 系统\[11 (https://arxiv.org/html/2605.08334#bib.bib8)\],采用 top-4 检索。更多细节见附录 B.1 (https://arxiv.org/html/2605.08334#A2.SS1)。

### 2.3 评估指标

#### 2.3.1 决策对齐

我们将 **决策对齐(Decision Alignment)** 形式化为一个二元函数,用于评估模拟购物者的最终决策是否与其潜在的人设约束一致。

设对话轨迹为 $C\mathcal{C}$。设 $R(C)\mathcal{R}(C)$ 表示销售人员推荐的产品集合,$a(C) \in R(C) \cup \{\emptyset\} a(C) \in \mathcal{R}(C) \cup \{\emptyset\}$ 表示购物者的最终动作(即添加到购物车的产品,或者如果未购买则为 $\emptyset \varnothing$),$A\mathcal{A}$ 表示由购物者人设定义的 acceptable(包括理想)产品集合。

我们定义决策对齐指示符为:

$$
DA(C) = \begin{cases} 
1, & \text{if } a(C) \neq \emptyset, \text{ and } a(C) \in \mathcal{R}(C), \text{ and } a(C) \in \mathcal{A}, \\
1, & \text{if } a(C) = \emptyset, \text{ and } \mathcal{R}(C) \cap \mathcal{A} = \emptyset, \\
0, & \text{otherwise}.
\end{cases} \quad (1)
$$

第一种情况捕获**正确接受**,即购物者选择了一个满足其约束的推荐产品。第二种情况捕获**正确拒绝**,即没有呈现可接受的选项,且购物者放弃购买。所有其他情况,包括接受不可接受的产品或未能接受可接受的推荐,均被视为未对齐。我们在不同产品类别的所有对话中报告**总体决策对齐率**作为实验中的主要指标。

#### 2.3.2 对话指标

从 Kostric 等人\[16 (https://arxiv.org/html/2605.08334#bib.bib17)\]中的现实世界客户-销售人员对话中,我们观察到人类购物者的许多对话特征与模型生成显著不同:

(1)人类购物者倾向于在对话开始时仅暴露一般的产品询问和极少的需求,并在整个对话过程中逐渐暴露底线和偏好。
(2)人类购物者在对话中使用更多非正式语言,语法完整的句子较少。
(3)人类购物者在询问不同产品时说话方式多样。

基于这些观察,我们使用以下指标评估模型生成的购物者对话:

*   **首轮标准计数(Crit.)**:测量购物者在首次发言中披露的平均标准数量。
*   **句子完整性(%Cpl.)**:测量购物者对话中语法完整且正确的句子的平均百分比,作为正式程度的代理指标。
*   **平均 TF-IDF 冗余度(Red.)**:测量同一产品类别内购物者对话之间的词汇相似度,从而反映冗余度。

对于 `%Cpl.` 和 `Red.`,我们将模型输出中的对话特征与来自 Kostric 等人\[16 (https://arxiv.org/html/2605.08334#bib.bib17)\]的现实世界购物者对话进行比较。较小的值表示更贴近人类行为的购物者行为。

#### 2.3.3 函数调用质量

我们 additionally 报告**工具调用格式错误率(Fmt.)**,以测量购物者代理在对话中遵循工具或动作调用模式和语法的程度。我们监控**早期退出(End.)**,这是一种虚假的终端动作,我们观察到模型在回合 1 放弃对话。高比例的早期退出意味着未能参与有意义的零售互动。

## 3 通过 UserGRPO 提高决策对齐和对话保真度

受 RL 在多智能体设置中有效性的启发\[2 (https://arxiv.org/html/2605.08334#bib.bib23),43 (https://arxiv.org/html/2605.08334#bib.bib22)\],我们提出 **UserGRPO**,这是一种方案,用于将购物者模拟器对齐到人设规格和更人性化的购物者行为。

### 3.1 奖励设计

将强化学习应用于用户模拟的一个关键挑战在于设计既能捕捉决策层面正确性又能捕捉对话质量的奖励信号。我们设计了三个主要奖励组件:

*   **决策对齐($R_{\text{align}}$)**:二元奖励,指示最终动作是否与人设约束一致。
*   **推理质量($R_{\text{reason}}$)**:采用 LLM 评判者\[24 (https://arxiv.org/html/2605.08334#bib.bib55)\]对推理轨迹与人设约束及最终决策的一致性进行评分。
*   **语言奖励($R_{\text{ngram}}$)**:捕捉语言的“AI”程度,通过一个基于 n-gram 的分类器进行测量,该分类器在来自 Kostric 等人\[16 (https://arxiv.org/html/2605.08334#bib.bib17)\]的现实世界人类购物者对话和基础模型对话上进行训练。

此外,我们引入了三个辅助奖励:(1)**动作格式**,鼓励有效的工具使用和结构化输出,惩罚格式错误的动作。(2)**响应长度**,惩罚过长的响应以维持自然的对话流。(3)**互动长度**,鼓励对话中更多现实的多轮互动。最终奖励实例化为所有奖励组件的加权平均,每个组件归一化到 $[0,1]$。

相似文章

RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距

arXiv cs.AI

本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。