Large Behavior Model: 零售客户的可提示数字孪生
摘要
本文介绍了大型行为模型(LBM),该模型通过人-环境公式、检索增强生成和强化学习,从零售交易中学习客户决策。它在零售任务上优于前沿LLM,并展现出强大的零样本迁移能力。
查看缓存全文
缓存时间: 2026/07/09 07:55
# 大行为模型:零售客户的可提示数字孪生 来源:https://arxiv.org/html/2607.06993 Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn Amity Research and Application Center \(ARAC\), Amity AI Holdings Co\., Ltd\. \{wachiravit, krittin, touchapon\}@amity\.co ###### 摘要 客户行为建模支撑着推荐、营销和决策支持,但现有方法要么优化预测准确性而不解释决策,要么模拟用户但缺乏真实行为数据的基础。我们提出大行为模型(LBM),通过统一的“人–环境”框架,直接从大规模零售交易中学习客户决策。客户状态由基于历史购买行为的行为画像表示,而产品上下文则通过检索增强生成技术融入。模型训练包括:对文本化的行为数据进行持续预训练、用于决策生成的监督微调,以及结合可验证奖励的强化学习进行基于证据的校准。我们评估了所提框架在购买预测、困难负样本区分、购物篮补全、促销响应和跨域券兑换等任务上的表现。该模型在域内零售任务上持续优于前沿通用语言模型,并在跨零售商和跨决策领域展现强大的零样本和微调迁移能力。消融研究表明,持续预训练是行为泛化的主要驱动力;检索在训练和推理期间同时应用时效果最佳;强化学习能提升模型对显式行为证据的依赖,减少对通用语言模型先验的依赖。这些结果表明,交易历史中编码的行为知识可以被语言模型有效学习,为构建可扩展的客户数字孪生及行为模拟提供了基础。 ## 1 引言 理解和预测人类决策一直是经济学、营销学、推荐系统和人工智能等领域长期存在的问题。精确的行为模型能够支持广泛的应用,如个性化推荐、需求预测、促销规划、定价优化和市场研究[15 (https://arxiv.org/html/2607.06993#bib.bib9),27 (https://arxiv.org/html/2607.06993#bib.bib10),31 (https://arxiv.org/html/2607.06993#bib.bib11)]。尽管经过数十年的研究,对个体行为进行忠实建模仍然具有挑战性,因为决策源于相对稳定的个人偏好与选择时所处环境之间的相互作用。这一观点与勒温的场论一致,该理论将行为视为人和环境的函数[11 (https://arxiv.org/html/2607.06993#bib.bib2)]。因此,仅捕捉群体层面模式的模型往往无法解释为何两个看似相似的客户在相同情况下会做出不同决策。 在零售领域,这一挑战尤为明显。大型零售商通常为数百万客户制定定价、促销和品类决策,但对客户偏好的理解仍主要依赖于调查、焦点小组和消费者面板[14 (https://arxiv.org/html/2607.06993#bib.bib12),31 (https://arxiv.org/html/2607.06993#bib.bib11)]。尽管这些方法在营销研究中不可或缺,但它们成本高昂、更新缓慢,且通常仅覆盖客户群体的一小部分。更重要的是,通过问卷收集的声称偏好往往与实际购买行为中观察到的揭示偏好存在差异,这促使人们越来越多地使用交易数据进行行为建模[5 (https://arxiv.org/html/2607.06993#bib.bib8)]。因此,零售商拥有丰富的行为数据,但将观察转化为个体客户决策的忠实模拟工具却相对有限。 为解决这一局限,先前研究已开发出多种行为模型。经典离散选择模型通过效用最大化原则估计购买概率[15 (https://arxiv.org/html/2607.06993#bib.bib9),27 (https://arxiv.org/html/2607.06993#bib.bib10)],而推荐系统和序列推荐模型则从历史交互中学习用户表示以预测未来购买[10 (https://arxiv.org/html/2607.06993#bib.bib7),6 (https://arxiv.org/html/2607.06993#bib.bib3),8 (https://arxiv.org/html/2607.06993#bib.bib4),25 (https://arxiv.org/html/2607.06993#bib.bib5),32 (https://arxiv.org/html/2607.06993#bib.bib21),24 (https://arxiv.org/html/2607.06993#bib.bib22)]。这些方法在购买预测、推荐和序列决策建模等任务上取得了显著成功。然而,它们通常针对单一下游任务进行优化,需要为推荐、促销响应、购物篮补全、需求预测及相关应用分别建立模型。因此,它们无法提供一个统一的、能够回答关于同一客户不同问题的行为模型。 大型语言模型(LLM)的最新进展提出了不同的方向。现代基础模型展现出强大的推理、指令遵循和上下文学习能力,使得单一模型仅通过自然语言提示即可执行多种任务[19 (https://arxiv.org/html/2607.06993#bib.bib31),2 (https://arxiv.org/html/2607.06993#bib.bib35),23 (https://arxiv.org/html/2607.06993#bib.bib36),3 (https://arxiv.org/html/2607.06993#bib.bib37)]。这种灵活性激发了越来越多关于使用LLM模拟人类行为的研究,包括社交互动、调查响应、经济决策和在线购物行为[20 (https://arxiv.org/html/2607.06993#bib.bib33),1 (https://arxiv.org/html/2607.06993#bib.bib34),21 (https://arxiv.org/html/2607.06993#bib.bib23),9 (https://arxiv.org/html/2607.06993#bib.bib13),13 (https://arxiv.org/html/2607.06993#bib.bib14)]。近期工作还探索了通过强化学习和行为数据集构建个性化购物代理[33 (https://arxiv.org/html/2607.06993#bib.bib16),30 (https://arxiv.org/html/2607.06993#bib.bib15)]。尽管有这些令人鼓舞的发展,现有方法主要使用人口统计信息、手动设计的用户画像或合成画像来表示个体[28 (https://arxiv.org/html/2607.06993#bib.bib18),18 (https://arxiv.org/html/2607.06993#bib.bib20),16 (https://arxiv.org/html/2607.06993#bib.bib17)]。虽然这些表示捕捉了广泛的群体特征,但它们包含的个体实际行为历史证据有限。因此,模拟响应往往反映的是基础模型编码的先验知识,而非被模拟个体表现出的行为模式,导致模拟行为与现实行为之间存在持续差距[34 (https://arxiv.org/html/2607.06993#bib.bib19),22 (https://arxiv.org/html/2607.06993#bib.bib25),4 (https://arxiv.org/html/2607.06993#bib.bib26)]。近期工作也探索了通过用户表示和嵌入来个性化语言模型,以更好地捕捉用户特定偏好[17 (https://arxiv.org/html/2607.06993#bib.bib27),7 (https://arxiv.org/html/2607.06993#bib.bib28),29 (https://arxiv.org/html/2607.06993#bib.bib29)]。然而,这些方法主要侧重于改进推荐或个性化,而非在各种行为任务中忠实模拟个体决策。 本文研究一个简单但根本的问题:*当语言模型基于纵向行为证据而非通用语言模型先验时,它们能否成为个体消费者行为的忠实模拟器?* 我们提出大行为模型(LBM),一个基于语言模型的个性化行为模拟框架,它将客户决策建立在两种互补信息源之上:从历史交易中提取的持久行为证据,以及当前决策环境。受勒温公式“行为源于人与环境的相互作用”的启发[11 (https://arxiv.org/html/2607.06993#bib.bib2)],我们将客户行为建模为,其中PP表示客户从纵向购买历史中学习到的持久行为表示,EE表示决策时可用的产品和上下文信息。在LBM中,行为表示通过轻量级个性化模块学习,而上下文信息则通过检索增强生成(RAG)[12 (https://arxiv.org/html/2607.06993#bib.bib6)]动态提供。这种显式分离允许同一底层语言模型模拟广泛的客户行为——包括购买预测、购物篮补全、促销响应、市场调查回答和评论生成——而无需为每个任务训练单独的模型。 在大规模零售交易数据上的大量实验表明,将语言模型建立在纵向行为证据之上,能显著提升客户级决策模拟的效果。在多个行为任务上,LBM持续优于前沿基础模型,同时能够跨零售商、产品目录和应用场景进行泛化。这些结果表明,对于个性化决策模拟,行为证据比仅依赖大型语言模型中编码的通用先验提供了更坚实的基础。此外,由于个性化是通过轻量级行为适配而非为每个客户建立独立模型来实现的,所提框架能够高效地扩展到数百万用户,同时保持适合自托管部署的实用性。 本文的贡献总结如下。 ### 贡献 1. 1\.个性化行为模拟的公式化表述。我们将客户行为建模为持久行为特征与决策环境之间的相互作用,将经典行为理论扩展到基于语言模型的模拟,并为建模多样化客户行为提供了统一框架。 2. 2\.大行为模型(LBM)。我们提出一种个性化语言模型架构,通过行为表示和检索增强的上下文基础,将行为模拟建立在纵向交易历史之上。与解决单个预测任务的传统推荐系统[10 (https://arxiv.org/html/2607.06993#bib.bib7),6 (https://arxiv.org/html/2607.06993#bib.bib3),8 (https://arxiv.org/html/2607.06993#bib.bib4),32 (https://arxiv.org/html/2607.06993#bib.bib21)]不同,LBM支持使用单个共享语言模型执行多种行为模拟任务。 3. 3\.可扩展的行为学习框架。我们开发了一个四阶段训练流程,结合持续预训练、监督微调和强化学习,使语言模型与客户行为对齐。全面的消融研究量化了每个阶段的贡献,并强调了联合学习行为表示和上下文基础的重要性。 4. 4\.客户级行为模拟基准。我们构建了一个涵盖多个零售决策任务的基准——包括购买预测、购物篮补全、促销响应和调查模拟——并精心设计了困难负样本和不同层次的行为模糊性,以评估客户特定的推理能力。 5. 5\.行为基础优于基础模型先验的证据。在域内和跨域评估中,我们证明将语言模型建立在纵向行为证据之上,能够持续提升个性化决策模拟效果,优于前沿基础模型。这些发现表明,在模拟个体消费者行为时,行为证据是比仅依赖大型语言模型中编码的通用先验更有效的基础。 ## 2 系统概述 我们提出大行为模型(LBM),一个从历史交易数据中模拟个体消费者决策的框架。LBM并非为每个下游任务学习独立的模型,而是将客户行为建模为持久行为画像与动态决策环境之间的相互作用。这种分解使得单一语言模型能够仅通过提示条件化,泛化到多种零售决策任务——包括购买预测、购物篮补全、促销响应和调查式偏好获取。图1 (https://arxiv.org/html/2607.06993#S2.F1)提供了整个系统的概览。原始零售交易被转换为行为表示和监督决策示例,同时一个检索模块在推理时注入产品知识以构建决策环境。 ##### 流程概览。该流程包含三个阶段。首先,历史交易日志被处理,以构建每位客户的持久行为表示。其次,真实的购买事件被转换为涵盖多个预测任务的监督行为决策示例。最后,在推理时,模型将客户表示与检索到的产品知识相结合,以模拟当前购物情境下的决策。这种设计将长期客户行为与短期环境上下文分离,同时允许两者都以自然语言编码。 参见图注 图 1: 从原始交易到模拟决策。画像提取器(Persona Extractor)总结稳定的人口统计/生命周期阶段特征,行为提取器(Behavior Extractor)从原始交易中推导决策点,共同形成 Shopping-DNA 画像。“人”部分由基于该画像构建的分段 LoRA 适配器及系统提示提供;“环境”部分由决策时的 RAG 提供。同一组权重通过提示选择,回答购买、购物篮、促销、调查和评论等问题。 ##### 人–环境 分解。我们假设客户决策源于持久行为偏好与当前决策上下文的相互作用。因此,我们将行为模拟建模为两个互补因素:“人”和“环境”。 - •人 (Person, PP):从历史购买行为中提取的持久表示,捕捉长期偏好、购物习惯和行为倾向。 - •环境 (Environment, EE):从产品知识库中检索到的、当前决策上下文中的可用产品的动态表示。 因此,消费者行为被建模为,其中语言模型在客户表示和周围购物环境的联合条件下预测决策。这种分离是我们框架的核心。客户身份并非通过模型参数记忆客户特定行为,而是通过提示条件化提供,而环境知识则在推理时动态检索。由此产生的架构自然能够泛化到未见过的客户,无需重新训练。该设计还使得同一底层模型可以跨多种行为任务重用——包括购买预测、购物篮补全、促销响应和调查式推理——而无需针对不同任务设计专用架构。 ### 2.1 数据 我们基于大规模零售交易日志和产品目录信息构建数据集。相似文章
审视LLM中类人行为:模型行为、用户因素和系统提示的多维度分析
本文对LLM中的类人行为进行了多维度分析,研究了来自四个模型的21,000个对话中的普遍性、影响和可控性,发现行为因模型和用户因素而异,并对负责任的设计具有启示意义。
LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs
This paper introduces LUNAR, a benchmark for evaluating how large language models personalize responses from longitudinal app interaction histories across daily-life domains such as clothing, food, housing, and mobility. Experiments on 19 mainstream LLMs reveal that effective personalization depends on evidence selection and cross-domain integration, and that stronger personalization can come at the cost of privacy protection.
面向可扩展多任务强化学习的大决策模型
本文介绍了LDM-v0,一个在来自数千个多样强化学习环境的轨迹上离线训练的大决策模型,证明了单一的Transformer策略可以在机器人、自动驾驶、库存管理、网络安全、交易和视频游戏等领域匹配特定任务策略的性能。
SalesSim:基准测试并对齐多模态语言模型作为零售用户模拟器
本文介绍了 SalesSim,这是一个用于评估多模态大型语言模型(MLLM)作为零售用户模拟器的框架和基准,旨在揭示角色对齐方面的不足,并提出了一种名为 UserGRPO 的新型强化学习方法。
模型何时该改变想法?大语言模型中的情境信念管理
本文介绍了面向大语言模型的情境信念管理(CBM)以处理长期信息,提出了用于评估的BeliefTrack基准,并展示了强化学习和表示层面引导显著减少了信念管理失败。