LIGE-GR:在LLM时代从排名到生成式推荐的平滑跃迁

arXiv cs.LG 论文

摘要

本文介绍了LIGE-GR,一种使用大型语言模型平滑地从传统排名过渡到生成式推荐系统的方法,旨在提升LLM时代的推荐性能。

arXiv:2609.18148v1 公告类型:新 摘要:大型语言模型(LLMs)的显著成功为下一代推荐系统提供了重要灵感。在结构上,推荐和语言生成共享相似性:两者都旨在产生一个有序序列以优化用户体验。然而,如何精确地将LLM范式的精髓吸收到成熟的工业推荐系统中仍是一个开放问题。 有两个挑战。首先,尚不清楚如何将来自LLM范式的序列级生成和优化融入推荐中。其次,现实世界的推荐系统是成熟系统,多年来围绕特定产品、业务约束、服务基础设施和组织所有权进行了迭代定制。全面替换此类系统往往技术风险高且组织上具有破坏性。 在本文中,我们提出了LIGE-GR,一个列表级生成与评估推荐框架,将传统的基于单项目推荐的排名系统升级为生成式推荐范式。LIGE-GR不是从头重建整个推荐栈,而是将现有的点式推荐系统泛化为列表级生成系统。这使得成熟的推荐系统能够从列表级优化中受益,同时保持与现有模型、价值函数和服务基础设施的兼容性。 我们在Instagram Reels和Facebook Video的短视频推荐中验证了LIGE-GR。在这些推荐界面上,LIGE-GR在Instagram Reels上将用户停留时间提高了1.14%,在Facebook Video上提高了0.72%,而仅需适度的额外推理资源。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:18

# LIGE-GR:LLM时代从排序到生成式推荐的平滑飞跃

来源:https://arxiv.org/html/2609.18148

陈章赫⋆ 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
萨姆·伍德曼西⋆ 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
肖恩·利安⋆ 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
温杰·胡⋆ 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
任杰·姜⋆ 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
资衡·黄 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
新元·张 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
志豪·郑 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
卓然·余 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
瑞立·李 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
磊·袁 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
子伟·李 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
吉米·贾 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
梅特·特尔兹汉 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
埃克雷姆·科贾古内利 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
意铭·廖 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
志晨·赵 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
月·殷 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
月·翁 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
万林·马 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
旭峰·蔡 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
伟淼·吴 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
叶舟·黄 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
杜·张 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
宇坤·丁 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
亚伦·约翰斯顿 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
月明·王 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
兆杰·龚 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
雨婷·张 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
塞雷娜·李 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
阿迪亚·甘尼什 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
博英·刘 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
海川·杨 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
霞璐·李 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
迈特·马 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
群书·张 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
约翰·约书亚·米勒 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
普拉文·拉蒂纳韦鲁 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
程·黄 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
阿德哈·萨克德瓦 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
乔什·卡恩斯 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
安德烈斯·亚伦·古铁雷斯 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
尼尔·阿加瓦尔 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
古斯塔斯·普拉迪斯 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
弗拉基米尔·巴特金 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
戈帕尔·雷 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
阿迪亚·普里亚达希 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
尚塔努·帕蒂尔 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
哲·王 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
潘·潘 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
意平·韩 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
阿伦·辛格 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
广登·廖 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
碧雪 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
新尧·胡 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
杨·宋 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
意颂·宋 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
美虹·王 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
浩天·吴 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
迪帕克·阿加瓦尔 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  
基·刘 单位:Meta Platforms, Inc.\, 美国加利福尼亚州门洛帕克  

###### 摘要

大型语言模型(LLMs)的卓越成功为下一代推荐系统提供了重要启示。从结构上看,推荐与语言生成具有相似性:两者都旨在生成能优化用户体验的有序序列。然而,如何将LLM范式精确地融入成熟的工业推荐系统,仍是一个未解决的问题。

存在两大挑战。首先,尚不清楚如何将LLM范式——序列级生成与优化——融入推荐领域。其次,现实世界的推荐系统是经过多年迭代、围绕特定产品、业务约束、服务基础设施和组织权属进行定制化的成熟系统。全面替换此类系统往往技术风险高且组织干扰大。

本文提出LIGE-GR,一个列表式生成与评估推荐框架,旨在将传统排序系统(单项目推荐)升级至生成式推荐范式。LIGE-GR并非从头重建整个推荐栈,而是将现有的单点推荐系统泛化为列表式生成系统。这使成熟的推荐系统能够受益于列表式优化,同时与现有模型、价值函数和服务基础设施保持兼容。

我们在Instagram Reels和Facebook Video的短视频推荐中验证了LIGE-GR。在这些推荐场景中,LIGE-GR分别将用户停留时间提升了1.14%和0.72%,且仅需适度的额外推理资源。

††通信作者:Ji Liu, [madisonliu@meta\.com](mailto:[email protected]);⋆同等贡献。

## 1 引言

现代推荐系统为每个用户请求返回一个有序的内容项列表,随后按顺序呈现给用户。这一模式涵盖了短视频和信息流推荐。尽管高度复杂,许多工业推荐系统本质上仍围绕单项目优化构建。排序模型独立预测每个候选项目与用户的互动信号,预定义的价值模型(函数)将这些预测信号映射为标量分数。然后按各项得分排序形成推荐列表。额外的产品约束(如多样性或完整性调整)通常通过启发式或基于规则的分数修改引入。这是当今最先进产品普遍采用的通用框架。尽管此范式很成功,但存在根本性局限:它独立为每个项目打分,而非联合评估整个推荐序列。

图1:单项目优化与列表式优化。给定用户兴趣历史,单项目优化独立评分候选项目并返回前几名,而列表式优化则返回最佳组合。相比之下,LLMs从根本上解决了相同问题——在用户请求条件下生成最佳序列——但遵循完全不同的技术范式。LLM在生成每个词元时,基于先前生成的上下文,最终输出的质量由整个序列决定。这一对比凸显了我们所要解决的传统单项目推荐与生成式列表式推荐之间的范式鸿沟:

单项目(独立优化) vs. 列表式(联合优化)

图2:LIGE-GR升级的三个组成部分。排序模型:上下文无关排序器CF仅依据用户信息为每个项目评分,而上下文感知模型CA还依据已选入列表的项目(红色部分)进行条件评分。目标函数(由价值模型定义):从单项目分数之和转变为整个序列的列表式价值。解码器:现有的单项目贪心选择在逐位置-候选网格中锁定单一路径,而基于强化学习的解码器探索备选路径并返回找到的最佳列表。如图1(https://arxiv.org/html/2609.18148#S1.F1)所示,单项目推荐独立评分项目,而列表式推荐将它们作为序列进行评估。实现这种序列优化需要三项能力:预测每个候选项目在已选项目上下文中的价值、对整个序列进行评估、以及在产品约束和延迟限制下搜索可行序列。

受LLMs成功的启发,近期趋势是通过从头将推荐系统重建为完全生成式系统来探索实现这些能力,例如邓等人(2025)(https://arxiv.org/html/2609.18148#bib.bib8)的工作。然而,一个能充分利用列表式优化、适用于成熟工业应用的范式尚未出现,这仍是一个未解决的问题。具体来说,尝试全面替换现有技术栈面临两个额外的关键障碍:

- •系统挑战。成熟的推荐系统编码了多年的模型改进、产品逻辑、服务优化和业务约束。替代方案在早期比较中可能处于劣势,因为它必须首先恢复大量累积的基线价值,因此公平评估通常需要谨慎、长期的验证。一旦深度集成,新系统还可能带来回滚和可靠性风险,因为回滚可能不再意味着禁用一个孤立的组件。
- •组织挑战。推荐、广告和搜索团队通常围绕现有推荐系统组件组织,包括检索、排序、价值建模、服务基础设施和产品策略。因此,转向不同范式不仅会干扰技术栈,还会干扰团队边界、权属和长期规划。

LIGE-GR通过一个增量、可逆且资源需求低的框架来解决列表式技术挑战和替换挑战,该框架泛化了现有的单项目推荐系统。LIGE-GR保留了成熟系统的结构,同时增加了三个组件:排序模型中的列表式模块、从单项目到列表式价值建模的扩展、以及从现有单项目贪心解码器(在每个列表位置选择剩余候选中得分最高者)到基于强化学习的序列解码器的升级,如图2(https://arxiv.org/html/2609.18148#S1.F2)所示。因此,LIGE-GR不是传统推荐的替代品,而是泛化与升级。

我们在Instagram Reels和Facebook Video的短视频推荐中验证了LIGE-GR,两者均使用了强大、优化的基线。在Instagram Reels上,LIGE-GR将用户停留时间提升了1.14%,所需额外推理资源约为无上下文排序组件所用资源的10%,相对于现有基线,端到端每请求延迟增加了约7%。在Facebook Video上,LIGE-GR将用户停留时间提升了0.72%。

## 2 LIGE-GR:生成式范式

本节介绍所提出的生成式范式。我们首先进行问题定义,并将单项目推荐重构为列表式或生成式框架,从而将现有单项目系统升级为列表式系统。本节最后介绍列表式推荐。

### 2.1 问题陈述

对于每个用户请求,推荐系统返回一个有序的内容项列表:

VT=\[v1,v2,...,vT\],vt∈C\.\\displaystyle\{V\_\{T\}=\[v\_\{1\},v\_\{2\},\\ldots,v\_\{T\}\],\\qquad v\_\{t\}\\in\\mathcal\{C\}\.\}\(1\)此处C\\mathcal\{C\}是该请求的候选集,Vt=\[v1,...,vt\]V\_\{t\}=\[v\_\{1\},\\ldots,v\_\{t\}\]表示已选前缀——在第t个位置之后的部分列表,其中V0=∅V\_\{0\}=\\emptyset;可行的VT V\_\{T\}中的各项应互不相同。在我们的设定中,T约为10。项目按顺序呈现给用户。目标是构建一个能最大化用户体验和产品质量的个性化列表。

### 2.2 将单项目推荐重构为生成式框架

传统的工业推荐系统本质上是单项目优化系统。对于每个候选项目,排序模型预测一组用户互动信号,例如:

plike,pfollow,pshare,pwatchtime > 10s,...\\displaystyle p\_\{\\text\{like\}\},\\quad p\_\{\\text\{follow\}\},\\quad p\_\{\\text\{share\}\},\\quad p\_\{\\text\{watchtime > 10s\}\},\\ldots\(2\)单项目价值模型(itemVM)随后将这些预测的互动信号pp组合为一个标量项目分数。典型的单项目价值模型可写为:

itemVM\(p\)=w1⋅plike\+w2⋅pfollow\+w3⋅pshare\+⋯\.\\displaystyle\\textbf\{itemVM\}\(p\)=w\_\{1\}\\cdot p\_\{\\text\{like\}\}\+w\_\{2\}\\cdot p\_\{\\text\{follow\}\}\+w\_\{3\}\\cdot p\_\{\\text\{share\}\}\+\\cdots\.\(3\)系统然后根据项目的单项目价值模型分数选择前T个项目,并将其作为最终推荐列表返回。在成熟系统中,原始VM分数通常会通过多样性惩罚、完整性规则和其他产品约束进行进一步调整。这些调整引入了一些序列级感知,但通常作为基于规则的启发式方法实现,而非学习的列表式优化。单项目推荐目标可抽象为:

argmaxVT∑t=1TitemVM\(CF\(u,vt\)\),\\displaystyle\\argmax\_\{V\_\{T\}\}\\quad\\sum\_\{t=1\}^\{T\}\\textbf\{itemVM\\left\(\\textbf\{CF\\(u,v\_\{t\}\)\\right\)\,\(4\)其中CF表示一个*上下文无关*预测器(给定用户特征u和项目特征v_t,独立为每个项目评分的单项目排序模型预测用户u的各种互动信号,如p_like),它根据用户特征u和项目特征v_t独立为每个项目评分。在此目标下,最优列表由候选集中按公式(3)(https://arxiv.org/html/2609.18148#S2.E3)中的itemVM分数排序后的前T个项目组成。

如前所述,许多成熟的推荐系统包含一个额外的组件——控制层(尽管名称可能不同),以强制推荐列表的多样性。其目的是防止相似内容(例如来自同一类别的项目)在列表中靠得太近。常见的方法包括间隔降级规则(Gong et al., 2021(https://arxiv.org/html/2609.18148#bib.bib12); Pei et al., 2019(https://arxiv.org/html/2609.18148#bib.bib30))、行列式点过程(DPP)(Pan et al., 2020(https://arxiv.org/html/2609.18148#bib.bib27); Meng et al., 2019(https://arxiv.org/html/2609.18148#bib.bib25); Wang et al., 2021a(https://arxiv.org/html/2609.18148#bib.bib42); Li et al., 2018(https://arxiv.org/html/2609.18148#bib.bib18))以及硬编码的业务限制。我们将针对候选项目v_t,在给定前缀V_{t-1}时的附加控制层调整记为CL\(vt∣Vt−1\)∈R∪\{−∞\}\\textbf\{CL\(v\_\{t\}\\mid V\_\{t-1\}\)\\in\\mathbb\{R\}\\cup\\\{\-\\infty\\\}\。有限值修改候选项目的价值模型分数,而-∞屏蔽不可行的候选项目。以下示例说明了这些情况。

- •(硬性业务规则)如果v_t的类别和V_{t-1}中的某些类别因硬性限制不允许出现在同一列表中,则CL\(vt∣Vt−1\)=−∞;\\textbf\{CL\(v\_\{t\}\\mid V\_\{t-1\}\)=\-\\infty;
- •(示例间隔降级规则)如果V_{t-1}中与v_t同类别且最近的项目距离过近,则……

相似文章

从自适应列表排序角度重新审视自适应检索增强生成的必要性

arXiv cs.CL

本文提出了 AdaRankLLM,一个自适应检索框架,通过列表排序动态过滤检索到的段落,对自适应 RAG 的必要性提出质疑。研究表明自适应检索对于较弱模型充当噪声过滤器,对于更强模型充当成本效率优化器,在多个数据集和 LLM 上进行了广泛实验。