GrocLM:基于大型语言模型的电子商务杂货品类推荐
摘要
本文提出了GrocLM,一种通过两阶段LoRA训练策略和基于字典树的约束解码进行微调的语言模型,用于杂货品类推荐。在实时生产补货任务中,其每次展示的加购次数相对提升了7.5%。
arXiv:2607.24764v1 公告类型: 新
摘要:在线杂货购物的快速增长需要能够捕捉周期性购买行为和多样化用户意图的推荐系统。传统的商品级方法面临可扩展性和准确性的挑战,促使品类级推荐成为一种更结构化和实用的替代方案。我们提出了GROCLM,一种在真实生产环境中针对杂货品类推荐进行微调的语言模型。GROCLM采用两阶段LoRA训练策略,将周期性购买模式直接编码到模型参数中,与基于提示的条件化方法相比,能够更有效地利用复购信号。为了确保有效和可控的输出,我们进一步引入了一种基于字典树的约束解码机制,在预定义的品类空间内进行解码。在专有生产数据和公开基准上的实验表明,GROCLM始终优于强基线。在实时生产补货任务中,GROCLM每次展示的加购次数相对提升了7.5%,同时通过联合生成所有品类保持了高效的推理。这些结果凸显了将大型语言模型集成到结构化推荐系统中的有效性和实用性。
查看缓存全文
缓存时间: 2026/07/29 09:51
# GrocLM:基于大语言模型的电商杂货品类推荐
来源:https://arxiv.org/html/2607.24764
袁钟¹,阮传伟²,Moein Hasani²,Tejaswi Tenneti²,王海勋³,马逢龙¹
¹宾夕法尼亚州立大学,美国
²Instacart,美国
³Evenup,美国
¹{yfz5556, fenglong}@psu.edu
²{chuanwei.ruan, moein.hasani, tejaswi.tenneti}@instacart.com
³[email protected]
###### 摘要
在线杂货购物的快速增长要求推荐系统能够捕捉周期性购买行为和多样化的用户意图。传统的商品级方法面临可扩展性和准确性的挑战,这促使品类级推荐成为一种更有结构性和实用性的替代方案。本文提出GrocLM,一个在真实生产环境中微调的语言模型,用于杂货品类推荐。GrocLM采用两阶段基于LoRA的训练策略,将周期性购买模式直接编码到模型参数中,从而比基于提示的条件化方式更有效地利用重复购买信号。为确保有效且可控的输出,我们进一步引入了一种基于trie树的约束解码机制,在预定义的品类空间内进行约束。在专有生产数据和公开基准上的实验表明,GrocLM始终优于强大的基线模型。在线上生产补货任务中,GrocLM实现了每次展示加购次数7.5%的相对提升,同时通过联合生成所有品类保持了高效的推理。这些结果凸显了将大语言模型集成到结构化推荐系统中的有效性和实用性。
---
## 1 引言
在一个大规模的在线杂货电商平台上,我们每天为数百万客户提供服务,覆盖数千家零售商。与传统的电商不同,杂货购物是任务驱动且高度重复的:用户经常重复购买家庭必需品,并构建涵盖多个互补品类的购物篮。这种重复性要求推荐系统能够建模结构化的购物习惯和补货模式,而不仅仅是孤立的商品偏好。
我们的平台采用一种混合策略,结合了商品级和轮播级模型。虽然商品级推荐仍然至关重要,但品类级推荐提供了更具可扩展性且更符合业务需求的解决方案。在商店前端,用户与基于品类的轮播交互,这些轮播组织了产品曝光并确保库存可用性。在实践中,品类推荐通常以**自上而下**的方式实现:首先预测品类,然后填充商品,因为杂货场景要求严格的多样性和可用性约束,而自下而上的聚合难以满足。
品类级建模也更符合杂货购物行为。重复购买模式通常出现在品类层面而非商品层面:虽然特定产品(例如,**嘎啦苹果** vs. **富士苹果**)可能有所不同,但对更广泛的**苹果**品类的需求保持稳定。此外,杂货购物篮通常很大且涵盖互补品类,要求模型理解序列意图和不断变化的购物任务。
然而,设计有效的杂货品类推荐模型并非易事。现有的基于LLM的生成式推荐方法[Rajput等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib12); [Si等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib20); [Geng等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib16); [Zheng等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib18); [Tan等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib19); [Wang等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib21) 主要针对商品级预测开发,并未显式建模周期性重复购买行为。基于语义ID的方法通过中间ID映射进一步引入了潜在噪声。直接将购买历史输入LLM具有吸引力,但无约束生成会产生自由格式文本,与品类标签互斥且离散的本质相冲突。这些挑战呼唤一种定制化的解决方案。
我们提出**GrocLM**,一个用于杂货品类推荐的提示调优**语言模型**。基于LLAMA 3 [Dubey等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib32) 骨干网络和低秩适配器(LoRA)[Hu等人 (2021)](https://arxiv.org/html/2607.24764#bib.bib47),GrocLM采用两阶段微调策略。在第一阶段,我们使用预计算的重复购买统计量建模**品类级重复购买行为**,使模型能够捕捉高层次周期性模式,并在稀疏历史下提高鲁棒性。在第二阶段,模型从序列购买数据中学习**品类间的隐式关系**,并结合用户查询上下文以更好地反映即时意图。为了确保有效且离散的输出,我们引入了一种基于trie树的掩码机制[De Cao等人 (2020)](https://arxiv.org/html/2607.24764#bib.bib2) 结合束搜索,将解码约束为合法的品类标签。
本研究的主要贡献如下:
- • 我们将杂货品类推荐形式化为一个实际任务,其特征包括周期性购买模式、多样化的用户查询和离散输出约束。
- • 我们提出GrocLM,一个两阶段提示驱动的LLM框架,利用重复购买统计量、序列行为建模和trie约束解码。
- • 我们在专有和公开数据集上验证GrocLM,展示了相较于强基线的显著改进,以及在生产指标上的可测量提升。


---
## 2 相关工作
**基于LLM的生成式推荐。** 大语言模型(LLMs)的最新进展 [Deldjoo等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib59); [Xiao等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib38); [Chen等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib37); [Zhao等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib36); [Wu等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib35); [Zhang等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib45); [Wu等人 (2021)](https://arxiv.org/html/2607.24764#bib.bib46) 显著影响了推荐系统。利用预训练的编码器和解码器,这些模型支持多样化的输出,包括商品标识符 [Harte等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib49); [Mao等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib50); [Sanner等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib51); [Sileo等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib52)、用户评分 [Bao等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib39); [Kang等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib43) 和基于文本的推荐 [Li等人 (2020)](https://arxiv.org/html/2607.24764#bib.bib53), [2023](https://arxiv.org/html/2607.24764#bib.bib54); [Ni等人 (2019)](https://arxiv.org/html/2607.24764#bib.bib55); [Hada and Shevade (2021)](https://arxiv.org/html/2607.24764#bib.bib56)。它们的灵活性支持零样本推荐 [Dai等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib42); [Kang等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib43); [Zhang等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib45); [Liu等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib57); [Sanner等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib51); [Sileo等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib52) 以及通过微调进行领域适应 [Bao等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib39); [Cui等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib40); [Hua等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib41); [Geng等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib16); [Harte等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib49)。
生成式推荐模型通过直接生成商品标识符扩展了这些能力,减少了对传统排序管道的依赖。结合语义标识符 [Geng等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib16); [Rajput等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib12); [Tan等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib19)、协同过滤 [Zheng等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib18); [Wang等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib21); [Khattab and Zaharia (2020)](https://arxiv.org/html/2607.24764#bib.bib87); [Li等人 (2021)](https://arxiv.org/html/2607.24764#bib.bib89); [He等人 (2020)](https://arxiv.org/html/2607.24764#bib.bib88)、基于LLM的架构 [Bao等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib91); [Kim等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib90) 以及自编码器技术 [Si等人 (2023)](https://arxiv.org/html/2607.24764#bib.bib20) 进一步简化了推荐流程。尽管取得了这些进展,杂货推荐仍然未被充分探索。现成的LLM在通用领域语料库上预训练 [Deldjoo等人 (2024)](https://arxiv.org/html/2607.24764#bib.bib59),使得杂货数据本质上是分布外的。此外,隐私约束限制了大规模领域特定预训练。因此,周期性购买行为和多样化用户查询等挑战未能得到充分解决。
**LLM之前的检索与推荐方法。** 在基于LLM的方法之前,稀疏检索方法如向量空间模型 [Salton (1962)](https://arxiv.org/html/2607.24764#bib.bib60); [Salton等人 (1975)](https://arxiv.org/html/2607.24764#bib.bib61)、TF-IDF [Aizawa (2003)](https://arxiv.org/html/2607.24764#bib.bib22); [Ramos and others (2003)](https://arxiv.org/html/2607.24764#bib.bib15); [Robertson (2004)](https://arxiv.org/html/2607.24764#bib.bib62) 以及倒排索引 [Zobel and Moffat (2006)](https://arxiv.org/html/2607.24764#bib.bib63); [Zobel等人 (1998)](https://arxiv.org/html/2607.24764#bib.bib64) 主导了搜索和推荐。虽然计算效率高,但这些方法严重依赖关键词匹配,缺乏语义理解。学习排序技术 [Liu and others (2009)](https://arxiv.org/html/2607.24764#bib.bib65) 通过监督学习改善了相关性,但仍受限于稀疏表示。
密集检索模型 [Huang等人 (2013)](https://arxiv.org/html/2607.24764#bib.bib10); [Guo等人 (2016)](https://arxiv.org/html/2607.24764#bib.bib66), [2019](https://arxiv.org/html/2607.24764#bib.bib67); [Mitra and Craswell (2017)](https://arxiv.org/html/2607.24764#bib.bib68); [Kang and McAuley (2018)](https://arxiv.org/html/2607.24764#bib.bib11) 后来引入了学习到的嵌入以捕捉语义相似性。双塔模型和自注意力序列网络等架构更好地建模了用户行为和商品关系。基于Transformer的模型 [Vaswani (2017)](https://arxiv.org/html/2607.24764#bib.bib69) 和BERT [Devlin (2018)](https://arxiv.org/html/2607.24764#bib.bib70) 的出现进一步增强了上下文表示学习。
双编码器方法 [Karpukhin等人 (2020)](https://arxiv.org/html/2607.24764#bib.bib74); [Qu等人 (2020)](https://arxiv.org/html/2607.24764#bib.bib75); [Xiong等人 (2020)](https://arxiv.org/html/2607.24764#bib.bib76); [Ni等人 (2021a)](https://arxiv.org/html/2607.24764#bib.bib77), [b](https://arxiv.org/html/2607.24764#bib.bib78); [Reimers and Gurevych (2019)](https://arxiv.org/html/2607.24764#bib.bib9) 以及多表示模型 [Humeau等人 (2019)](https://arxiv.org/html/2607.24764#bib.bib79); [Luo等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib80); [Khattab and Zaharia (2020)](https://arxiv.org/html/2607.24764#bib.bib87); [Hofstätter等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib81) 实现了高效且细粒度的查询-文档匹配。然而,即使密集检索和预训练嵌入模型 [Guo等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib71); [Fan等人 (2022)](https://arxiv.org/html/2607.24764#bib.bib72); [Yates等人 (2021)](https://arxiv.org/html/2607.24764#bib.bib73) 也没有显式建模杂货推荐中诸如周期性重复购买模式和离散品类输出等特定领域的约束。
---
## 3 方法论
本研究旨在基于用户的历史交互和当前查询预测准确的杂货品类推荐。设 I = [(I₁, T₁), ⋯, (Iₘ₋₁, Tₘ₋₁)] 表示长度为 M-1 的历史交互序列,其中每个交互 Iₘ 在时间 Tₘ 是品类的一个子集,即 Iₘ ⊂ C,且 C 是所有杂货品类的集合。我们用 Q = [Q₁, ⋯, Qₙ] 表示当前的 N 个用户查询。给定 I、Q、LLM F 以及一组提示模板 P = [P₁, ⋯, Pₖ],目标是预测时间 M 的品类集合,记为 Iₘ。由于该任务要求生成**离散且互斥的品类标签**,我们将其形式化为品类令牌上的自回归生成:
p(Iₘ) = ∑_{c ∈ Iₘ} ∏_{l=1}^{L_c} p(wₗ | F, I, Q, P, w_{<l})。
两种方法使用相同的输入,区别仅在于周期性信息是通过参数适应(LoRA)还是通过提示提供。与基于LoRA的参数化相比,ICL公式导致提示更长,且对周期性信号的利用效率较低。
**表4:上下文学习(ICL)与基于LoRA的周期注入对比。**
如图[表4](https://arxiv.org/html/2607.24764#S4.T4)所示,仅使用ICL的变体在所有指标上表现显著较差。这表明直接通过提示提供统计信号是不够的,而基于LoRA的参数适应使模型能够更有效地内化周期性购买模式。这也解释了GrocLM对提示变化的鲁棒性,因为关键信息被编码在模型参数中,而不是依赖于提示设计。
---
## 5 数据规模敏感性分析
在本节中,我们对训练数据规模进行敏感性分析,以评估不同数据集大小对使用**Conversion**数据集的各种模型性能的影响。具体来说,我们分析了模型在原始训练数据集中抽取500、1,000、3,000、5,000、7,000和8,000个用户的情况下的Recall@10、Precision@10和F1@10性能。我们固定了测试数据大小以匹配原始测试数据集。我们选择双塔模型和SASRec作为基线,因为它们在工业界被广泛使用。我们将结果展示在图[4](https://arxiv.org/html/2607.24764#S4.F4)中。
如图所示,随着数据集规模的增加,我们的模型优于其他模型,特别是当数据集超过3000个用户后。对于较小的数据集(500–1,000个用户),双塔模型在精确率和召回率上表现略好,这可能是由于其更简单的架构在有限数据上表现良好。然而,随着数据集规模的增大,SASRec和双塔模型都在5000个用户左右趋于平稳。对于SASRec,虽然我们看到召回率随着用户增加而上升,但其精确率显著下降。相比之下,我们的模型持续改进,尤其是在7000和8000个用户的较大数据集上,展现了其捕获更多相关模式的能力。相似文章
Large Behavior Model: 零售客户的可提示数字孪生
本文介绍了大型行为模型(LBM),该模型通过人-环境公式、检索增强生成和强化学习,从零售交易中学习客户决策。它在零售任务上优于前沿LLM,并展现出强大的零样本迁移能力。
面向在线患者咨询的可操作分诊分类的小样本大语言模型
本文探讨了使用小样本提示的大语言模型对在线患者咨询进行可操作分诊分类,分为自我护理、预约就诊、紧急临床审查或急诊转诊。最佳模型(Claude Haiku 4.5,12次小样本提示)的macro-F1达到0.475,超过了有监督基线,但作者得出结论:LLMs可以支持分诊优先级排序和选择性人工审核,但不能自主部署。
强化学习用于大型语言模型的寻求证据诊断推理
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
通过检索增强大型语言模型提升金融情感分析
本文介绍了一种检索增强的大型语言模型框架用于金融情感分析,相比传统模型及ChatGPT、LLaMA等大型语言模型,在准确率和F1分数上实现了15%至48%的提升。
大型语言模型中的层次化分级
本文介绍了分级大型语言模型(GLLMs),这是一种代数框架,对 Transformer 表示施加层次化分级,理论上可提高语言层次结构的样本效率,同时保持推理复杂度不变。该框架提供了几何与信息论角度的论证,并概述了一种分级选择流程,该流程在配套手稿中得到验证。