SimPersona:从原始点击流学习离散买家画像以构建接地气的电商代理
摘要
SimPersona 使用 VQ-VAE 从原始点击流中学习离散的买家画像,并将其映射为 LLM 驱动的网络代理的画像令牌,在多个在线商店中实现了高转化率对齐。
arXiv:2605.14205v1 公告类型:新
摘要:基于 LLM 的网络代理能够在在线商店中导航,但它们常常退化为单一的“平均买家”策略,无法捕捉真实买家群体异质性及分布特性。现有个性化方法依赖手工制作的基于提示的画像,这些画像脆弱、难以扩展、上下文效率低下,且无法忠实反映群体级行为。我们提出 SimPersona,一种新颖框架,从历史流量中学习离散的买家类型,并将其作为紧凑的画像令牌暴露给 LLM 驱动的网络代理。给定原始点击流,行为感知的 VQ-VAE 归纳出一个离散的买家类型空间,捕捉真实买家行为以及商户特定买家群体分布的统计结构。为了向 LLM 驱动的网络代理提供行为特定的指导,SimPersona 将每个学到的买家类型映射为 LLM 代理词汇表中的一个专属画像令牌,并在真实浏览轨迹上使用这些令牌对代理进行微调。在推理时,每个合成买家通过一次编码器前向传递被分配到学到的买家类型,无需重新训练或商店特定的提示工程。对于群体级模拟,SimPersona 从每个商户在学到的 VQ-VAE 码本上的经验分布中采样买家类型,并使用相应的画像令牌实例化代理,从而保留商户特定的买家群体分布。在跨越 42 个留出实时商店的 837 万买家上进行评估,SimPersona 与真实买家实现了 $78\%$ 的转化率对齐,展示了跨买家类型的可解释行为变化,并在目标导向的购物任务上优于一个参数多 $8\times$ 的基线。我们进一步发布了一个开源数据管道,将原始电商事件日志转换为买家表示和代理训练轨迹。
查看缓存全文
缓存时间: 2026/05/15 06:22
# 从原始点击流中学习离散买家画像,构建基于实际场景的电子商务智能代理 **来源**: https://arxiv.org/html/2605.14205 **Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ted Chaiwachirasak, Han Li, Lingyun Wang** Shopify 美国华盛顿州贝尔维尤 ###### 摘要 基于大语言模型(LLM)的网络代理能够导航真实在线商店,但它们常常退化为单一的“平均买家”策略,无法捕捉真实买家群体的异质性和分布特性。现有的个性化方法依赖手工设计的提示词画像,这些画像脆弱、难以扩展、上下文效率低下,且无法忠实地代表群体层面的行为。我们提出SimPersona,一种新颖的框架,它从历史流量中学习离散的买家类型,并将其作为紧凑的画像令牌暴露给基于LLM的网络代理。给定原始点击流,一个行为感知的向量量化变分自编码器(VQ-VAE)诱导出一个离散的买家类型空间,该空间捕捉真实买家行为的统计结构以及商家特定的买家群体分布。为了向基于LLM的网络代理提供行为特定的指导,SimPersona将每个学习到的买家类型映射到LLM代理词汇中的一个专用画像令牌,并在真实浏览轨迹上使用这些令牌对代理进行微调。在推理时,每个合成买家通过单次编码器前向传播被分配到一个学习到的买家类型,无需重新训练或商店特定的提示工程。对于群体级模拟,SimPersona从每个商家在学习的VQ-VAE码本上的经验分布中采样买家类型,并用相应的画像令牌实例化代理,从而保留商家特定的买家群体分布。在8.37百万买家的42个持有测试的在线商店上进行评估,SimPersona实现了78%的转化率与真实买家对齐,展示了跨买家类型的可解释行为变异,并在目标导向的购物任务中优于一个参数多8倍的基线模型。我们进一步发布了一个开源数据管道,可将原始电子商务事件日志转换为买家表示和代理训练轨迹。 ## 1 引言 参考图例 图1:SimPersona框架概览。左上:从原始点击流中提取行为特征和产品嵌入。右上:行为感知的VQ-VAE将每个买家映射到K个画像令牌之一。右下:两阶段SFT将令牌注入LLM;首先是令牌预热(冻结主干),然后是全面微调。左下:在未见过的商店上进行行为对齐、转化对齐和指令跟随评估。 模拟真实的人类购物行为具有直接的商业影响,即使买家建模的微小改进也能转化为推荐增益(Ni 等 [15])、商店评估增益(Lu 等 [13])或合成A/B测试增益(Wang 等 [24])的可衡量提升。基于LLM的网络代理最近使得这种大规模模拟成为可能,它们可以导航真实商店并执行从搜索到结账的完整购物流程(Deng 等 [5]、Zhou 等 [34]、Gur 等 [8])。然而,尽管这些代理掌握了网络交互的*机械*操作,它们学习的是一个单一的群体级策略,产生一个“平均买家”:它们知道*如何*购物,但不知道他们是以*谁*的身份在购物。也就是说,引导代理反映特定买家群体——即*画像问题*——仍然是核心挑战,而重构共同定义商店流量的买家类型的*分布*仍然是一个开放问题(Wang 等 [26]、Lu 等 [12]、Gebreegziabher 等 [7])。 画像问题的标准方法是通过提示告诉代理是谁,其中利用记忆模块(Park 等 [16]、Park 等 [17])、购买历史摘要(Shi 等 [20, 21])或角色扮演档案(Shao 等 [19]、Chuang 等 [3])进行引导。然而,基于提示的条件化是脆弱的:行为随措辞而变化(Lutz 等 [14]),人口统计角色扮演无法匹配真实反应(Chuang 等 [3]),并且最佳基于提示的购物代理仅能再现11.9%的真实买家行为(Lu 等 [12])。基于文本的画像也很昂贵(需要辅助LLM调用并在每一步消耗上下文),且表现力有限,因为手工制作的模板无法捕捉真实行为的全部多样性。关键的是,它们没有解决*分布*问题,因为画像是单独制作的,而非从整个群体中学习,因此它们不携带每种类型有多少买家的概念,然而现实模拟不仅需要个体画像,还需要定义商店流量的正确的买家类型*混合*。最近基于强化学习的代理(Wang 等 [27]、Zhang 等 [32])面临同样的限制,因为它们的画像也源于LLM生成的文本档案。 用户建模领域采用数据驱动方法,直接从原始点击流中学习结构化的买家表示(Yang 等 [30]、Ni 等 [15]、Zheng 等 [33]、Hatt 和 Feuerriegel [9]、Wang 等 [25])。这些方法揭示了购物行为具有丰富的潜在结构,而文本档案无法表达这种结构,并且原则上可以捕捉群体层面的变异。虽然具有高表达力,但它们是为离线用户建模设计的;其表示用于预测、推荐和聚类等任务,而非驱动闭环环境中的代理行为。用户建模解决了画像*发现*问题,但没有解决画像*注入*问题:它捕捉了买家是谁,却没有教会代理如何根据提供的信息采取行动。 我们提出SimPersona(图1),一个联合解决画像发现、画像注入和群体分布学习的框架,通过将买家行为表示为*离散的画像令牌*:足够紧凑以占据单个上下文位置,同时又足够表达以捕捉真实行为结构。一个行为感知的向量量化变分自编码器(VQ-VAE)(van den Oord 等 [23])将每位买家的去标识化历史点击流映射到K个画像令牌之一,每个令牌编码一个粗略的不同行为特征。因为这些令牌是从真实流量端到端学习而来的,令牌分配上的分布自然反映了买家类型的真实群体混合,从而能够忠实地重建商店级流量模式——这是基于文本的方法根本做不到的。学习到的令牌被直接添加到LLM词汇表中,使其与基于令牌的代理兼容,并且可以通过单次编码器前向传播分配给新买家。由于新引入的画像令牌必须与预训练模型现有的语义和动作空间对齐,我们引入了一个两阶段画像注入过程,将学习*每个令牌的含义*与学习*如何对其采取行动*解耦。这防止了从提示中的表面线索进行捷径学习,并产生可跨未见商店迁移的画像嵌入。训练仅使用与评估不相交的小型语料库,以鼓励模型学习可复用的行为模式,而非记忆会话。在推理时,画像分配可在数秒内扩展到数百万买家,无需重新训练或每商店校准。 总之,我们的贡献如下: 1. **SimPersona**,一个通过行为感知的VQ-VAE从原始点击流中学习离散画像令牌的框架,实现可扩展的画像分配、买家群体分布的忠实重建以及闭环代理模拟。 2. **一个两阶段画像注入框架**,将学习*每个令牌的含义*与学习*如何对其采取行动*解耦,产生无需适应即可跨商店泛化的嵌入。 3. **一个开源数据管道**,用于将原始点击流转换为买家表示和代理训练轨迹,为买家行为模拟提供基础设施。 4. **在8.37百万未见买家上的评估**,显示78%的转化对齐、统计显著的行为分离,以及优于8倍大基线的指令跟随能力。 论文其余部分组织如下:第2节详述提出的框架,第3节在8.37百万买家中进行评估,第4节讨论局限性和未来方向。 ## 2 提出方法 如下详述,我们通过以下步骤从原始点击流数据构建画像条件化的购物代理:开发一个用于买家表示和代理轨迹的数据管道(第2.1节),一个学习离散画像并将其映射到可训练令牌的行为感知VQ-VAE(第2.2节),以及一个多阶段微调过程,将这些令牌注入代理行为中(第2.3节)。 ### 2.1 数据管道 现有的买家模拟方法通常从精心策划的输入开始,包括基准任务、明确的购物偏好或模拟的用户档案,而非生产电子商务系统中可用的原始点击流日志(Lu 等 [13]、Wang 等 [26, 24])。然而,在真实平台中,买家行为是通过碎片化的低级事件(页面浏览、搜索、购物车变更和结账动作)观察到的,而这些日志的优化目标是为了分析,而非为了买家建模或代理训练。因此,它们包含丰富的行为信号,但形式并不适用于表示学习方法或LLM代理。将原始点击流转换为结构化的买家表示和基于实际场景的多轮动作轨迹因此是一个必要但基本上未被探索的步骤。 我们通过一个模块化管道解决了这一差距,该管道对原始点击流执行一次富化传递,并生成两种互补数据类型,如图2。它首先生成紧凑的聚合买家级表示,结合行为统计与语义产品上下文;支持下游任务如分割、聚类和画像发现。然后,它基于真实商店交互生成可执行的代理轨迹。轨迹被格式化为多轮序列,包括DOM观测、结构化动作、记忆和逐步推理,用于监督微调(SFT)。这些组件在下文中将在画像学习背景下详细阐述(管道本身是任务无关且开源的¹¹URL已匿名化用于审稿,但源代码随提交提供)。 #### 2.1.1 买家行为表示 我们从包含页面浏览、购物车动作、搜索活动和其他细粒度交互记录的原始平台日志开始。这些记录捕捉了交互,但提供了关于买家*对什么*感兴趣或他们的动作如何跨会话关联的有限上下文。因此,我们通过用产品目录、集合目录和搜索查询记录增强日志来富化这些记录;生成结合行为信号与语义上下文(例如,产品标题、集合名称和搜索查询)的聚合买家-会话数据,见图3。 对于画像发现,我们将每个买家-会话历史压缩成一个单一向量,该向量捕捉买家*如何*购物以及*他们*购物什么两个方面。为表示购物风格,我们提取16个标量特征,组织成五组:*曝光与数量*(总会话数、活跃天数、产品浏览、加购、结账、搜索和集合浏览的会话计数)、*参与度*(总会话时长和产品总浏览数)、*漏斗*(加购率、结账率和仅浏览率)、*意图强度*和*货币值*(平均购物车和订单价值);详情见附录A。产品偏好通过平均每位买家浏览、加购和购买项目的768维产品嵌入,然后通过PCA将其每个降至128维(保留约85%方差)来捕捉,这样三个语义通道不会压倒行为标量。包含三个二进制掩码以显示哪些嵌入通道被观测到。最终的403维向量为每个买家-商店对提供了紧凑的买家表示(见图4)。 许多下游组件需要一个关于买家在转化漏斗中所处位置的共享概念。我们不使用任务特定的启发式方法,而是从聚合事件计数中定义一个单一的*漏斗分层*。每个买家通过从其原始行为信号中提取的优先级级联被分配到五个层级之一:A-购买者、B-结账放弃者、C-购物车构建者、D-橱窗购物者或E-跳出者。我们在管道中重复使用此标签,因为它指导模拟的意图推导,支持训练期间的分层采样,并为表示质量提供诊断(第3.1节)。 #### 2.1.2 从点击流到代理轨迹 买家表示捕捉了行为变异,但未能告知代理这些行为如何在商店中顺序展开。为解决此问题,我们在真实商店上重放真实买家会话。从先前步骤生成的富化会话表中,我们重建每个买家带时间戳的事件序列,并使用LLM(GPT-5)将其重写为保留原始会话结构的自然语言导航目标。另一个代理(Gemini 3 Flash)然后在真实商店上执行此目标,与真实页面交互,并以SFT就绪格式记录其轨迹。每个生成的训练示例由一个共享的*系统提示*(定义代理角色、输出模式和交互规则)和一个*用户提示*(包含会话推断的意图、买家档案字段(填充学习的画像令牌)、累积进度日志(作为代理推理和错误恢复的记忆)以及当前页面的DOM快照)组成。对应的*助手轮次*包含一个结构化的J——(此处原文不完整,疑为截断,按原文保留)
相似文章
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
SalesSim:基准测试并对齐多模态语言模型作为零售用户模拟器
本文介绍了 SalesSim,这是一个用于评估多模态大型语言模型(MLLM)作为零售用户模拟器的框架和基准,旨在揭示角色对齐方面的不足,并提出了一种名为 UserGRPO 的新型强化学习方法。
SimGym:基于流量锚定的VLM智能体实现电商A/B测试模拟框架
SimGym是一个利用视觉语言模型智能体模拟电商店面A/B测试的框架,将实验周期从数周缩短至一小时以内,并能实现与真实买家行为77%的方向一致性。
PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。
迭代优化搜索:用于评估电商中智能搜索架构的双智能体模拟框架
eBay的这篇论文提出了一个模块化的双智能体模拟框架,用于评估对话式购物助手架构,能够对响应器设计进行受控比较。关键发现包括:滚动窗口内存在速度上比意图提取内存快35%,系统性故障分析将故障率降低了62%。