Shape Your Feed:基于LLM的对话式推荐智能体系统
摘要
Meta 推出了 Shape Your Feed (SYF),这是一个基于 LLM 的智能体框架,用于实时对话式推荐,通过多模态输入、智能体重排序和基于 DPO 的自我进化共同策展内容,在离线和在线评估中均取得了优异结果。
arXiv:2608.06632v1 公告类型:新
摘要:工业推荐系统主要采用被动排序范式,从隐式行为信号(例如点击、停留时间)中推断用户偏好,而非依赖显式的自然语言输入。因此,用户会持续感受到其明确兴趣与被动行为算法所提供内容之间的差异,这限制了他们在实时表达细微偏好或引导信息流方面的能力。为了解决推荐优化方式与用户表达兴趣意愿之间日益扩大的差距,我们提出了 Shape Your Feed (SYF),一种基于 LLM 的智能体推荐框架,支持实时、多模态的内容协同策展。SYF 采用三层架构:(i)感知流,从文本提示、语音指令和 UI 交互中捕获细粒度的用户意图;(ii)服务流,基于持续更新的语义档案(Semantic Profile)进行实时智能体重排序和候选项目剪枝,该档案编码了不断演化的用户偏好;(iii)自我进化流,通过直接偏好优化(DPO)和 LLM-as-a-Judge 集成将系统行为与人类判断对齐。离线评估表明,SYF 的对齐评分模块达到了 98.85% 的准确率,显著优于强少样本基线。在生产流量上进行的大规模在线 A/B 实验进一步证明,SYF 提高了信息流相关性和用户情感,为工业环境中实现交互式、用户可引导的推荐提供了一条实用且可扩展的路径。
查看缓存全文
缓存时间: 2026/08/10 07:58
# 塑造你的信息流:基于 LLM 的智能体对话式推荐系统 Bosen Ding ([email protected]), Yue Zhang ([email protected]), Ji Qi ([email protected]), Qingyuan Song ([email protected]), Jizhou Huang ([email protected]), Liwei Wang ([email protected]), Jeffrey Santelli ([email protected]), Yue Weng ([email protected]), Qichao Que ([email protected]), Zhenheng Yang ([email protected]), Junfeng Pan ([email protected]), and Linhong Zhu ([email protected]) — Meta Platforms, Menlo Park, California, USA (2026) ## 摘要 工业推荐系统主要采用被动排序范式,通过隐式行为信号(如点击、停留时长)而非显式的自然语言输入来推断用户偏好。因此,用户经常会感受到其显式兴趣与被动行为算法所推荐内容之间存在持续偏差,这限制了用户表达细腻偏好或实时引导其信息流的能力。为了解决推荐优化方式与用户表达兴趣意愿之间日益扩大的鸿沟,我们提出了 **Shape Your Feed (SYF)**,一个基于 LLM 的智能体推荐框架,能够实现实时、多模态的内容协同策展。SYF 采用三层架构:(i)**感知流(Perception Flow)**,从文本提示、语音指令和 UI 交互中捕获细粒度用户意图;(ii)**服务流(Serving Flow)**,基于持久化的语义画像(Semantic Profile)编码不断演化的用户偏好,对候选物品进行实时智能体重排序与剪枝;(iii)**自进化流(Self-Evolution Flow)**,通过直接偏好优化(DPO)和 LLM-as-a-Judge 集成机制,使系统行为与人类判断对齐。离线评估表明,SYF 的对齐评分模块准确率达到 98.85%,显著优于强大的少样本基线。在生产流量上进行的大规模在线 A/B 实验进一步证明,SYF 能提升信息流相关性和用户情感,为工业环境中实现交互式、用户可引导的推荐提供了一条实用且可扩展的路径。 大语言模型,对话式推荐,智能体系统 ## 1. 引言 个性化内容推荐是维持现代社交平台用户参与度的核心,用户在这些平台上消费快节奏的多格式内容流(如帖子、短视频、动态)。如今的信息流排序系统通过隐式行为信号实现了强相关性([Hu et al., 2008](https://arxiv.org/html/2608.06632#bib.bib4); [Rendle et al., 2009](https://arxiv.org/html/2608.06632#bib.bib5); [He et al., 2017](https://arxiv.org/html/2608.06632#bib.bib6); [Covington et al., 2016](https://arxiv.org/html/2608.06632#bib.bib7); [Cheng et al., 2016](https://arxiv.org/html/2608.06632#bib.bib8); [Naumov et al., 2019](https://arxiv.org/html/2608.06632#bib.bib9))。然而,平台用户经常感受到其显式兴趣与被动行为算法所交付内容之间存在持续偏差。解决这一鸿沟需要推荐系统赋予用户表达细腻偏好、理解内容为何出现以及实时引导其体验的能力([Govea et al., 2024](https://arxiv.org/html/2608.06632#bib.bib10))。这一需求催生了一类新的*对话式*和*交互式*推荐系统([Jannach et al., 2021](https://arxiv.org/html/2608.06632#bib.bib20)),其中用户通过自然语言(文本或语音)或简化的 UI 操作直接与底层模型沟通,系统则以透明、有依据的内容响应明确的意图。 大语言模型(LLM)的最新进展使对话式推荐系统变得切实可行:LLM 能够解释意图、解决歧义并维护对话上下文,相较于传统的查询驱动或按钮驱动界面,能够实现更精确的偏好匹配([Friedman et al., 2023](https://arxiv.org/html/2608.06632#bib.bib11); [Wei et al., 2024](https://arxiv.org/html/2608.06632#bib.bib12))。然而,在信息流环境中部署 LLM 也带来了独特的挑战。首先,推荐必须保持*目录锚定(catalog-grounded)*,确保生成的输出严格对应该平台实际可提供的有效物品。由于语言歧义和生成复杂性([Tonmoy et al., 2024](https://arxiv.org/html/2608.06632#bib.bib14); [Dziri et al., 2021](https://arxiv.org/html/2608.06632#bib.bib15)),不受约束的生成很容易导致幻觉物品或超出目录的建议;因此,系统必须严格约束交际意图到生产物品库的映射方式。其次,对话式交互本质上是多轮且混合意图的——用户通常会将即时目标(如“少一点政治短视频”)与长期兴趣(如“多一些做饭内容”)结合起来。确保多轮一致性需要*显式状态追踪*以及与稳健排序流程的集成([Kostric et al., 2024](https://arxiv.org/html/2608.06632#bib.bib16))。最后,系统必须在大规模环境下*可解释且可控*:用户应能轻松查看和修改推断出的状态,并且其输入必须能在严格的生产延迟预算内响应式地改变信息流布局([Chen and Pu, 2012](https://arxiv.org/html/2608.06632#bib.bib21))。这些约束激发了一种智能体式、目录锚定的架构,这正是我们提出的系统所瞄准的目标。 以往的工作通过混合检索-生成、模式约束提示或 RL 对齐框架(如 LLM-ConvRec([Feng et al., 2023](https://arxiv.org/html/2608.06632#bib.bib13))、协同检索([Zhu et al., 2025b](https://arxiv.org/html/2608.06632#bib.bib18))和 Rank-GRPO/ConvRec-R1([Zhu et al., 2025a](https://arxiv.org/html/2608.06632#bib.bib19)))来确保可靠的对话式推荐。虽然这些方法减少了幻觉并改善了状态追踪,但它们主要聚焦于静态目录(如电影或商品)中的*物品推荐*,未能应对*高吞吐量信息流环境*的需求——在这种环境中,排序流程必须持续且响应式地处理跨多种模态和 UI 界面的多样化细粒度反馈。 在本工作中,我们引入了 **Shape Your Feed (SYF)**,一个基于 LLM 的对话式推荐系统,能够实现直接、实时的用户控制。SYF 统一了多模态反馈(文本、语音、UI 控件),用于表达显式偏好(如“多推荐一些密友的帖子”)和厌恶(如“少一点标题党内容”)。我们将 LLM 用作*结构化控制器*,以处理:(i)意图检测与归一化,(ii)用户状态的持久记忆聚合,以及(iii)基于平台可检索物品库的动态*重排序*。通过维护用户偏好状态的可编辑表示,并持续将其投射到排序特征中以供候选选择,SYF 交付了一种可解释、用户可引导的信息流,同时保持了目录锚定和分发质量。 我们的贡献有三点: 1. **系统与架构**:我们提出了一种可扩展的对话式信息流推荐架构,将基于 LLM 的意图理解与结构化持久记忆及生产兼容的排序流程相结合,从而实现稳定的多轮行为和目录锚定的响应。 2. **多模态偏好监督**:我们展示了如何将多模态、用户驱动的反馈(文本、语音和 UI 控件)统一为一致的偏好状态,从而提升个性化、透明度和用户感知的掌控感。 3. **实证验证与洞见**:通过大量离线实验和在线 A/B 测试,我们证明了 SYF 能够提升信息流相关性和用户参与度,并提炼出关于开放挑战和有前景研究方向的实践洞见。 通过这些成果,SYF 将推荐系统从被动个性化推向交互式、用户与算法协同策展,为大规模社交平台中更透明、更可控的信息流排序提供了一条有原则的路径。 ## 2. 相关工作 我们的工作建立在并扩展了隐式反馈推荐、对话系统和用于个性化的大语言模型(LLM)等方面的研究。 **隐式反馈与深度推荐器**:现代推荐器依赖隐式信号(点击、停留时长、分享)来推断偏好([Hu et al., 2008](https://arxiv.org/html/2608.06632#bib.bib4); [Rendle et al., 2009](https://arxiv.org/html/2608.06632#bib.bib5))。矩阵分解([Hu et al., 2008](https://arxiv.org/html/2608.06632#bib.bib4))、BPR([Rendle et al., 2009](https://arxiv.org/html/2608.06632#bib.bib5))和神经混合架构(如 Wide & Deep([Cheng et al., 2016](https://arxiv.org/html/2608.06632#bib.bib8))、神经协同过滤([He et al., 2017](https://arxiv.org/html/2608.06632#bib.bib6)))等范式为工业级规模模型铺平了道路,例如 YouTube 的 DNN([Covington et al., 2016](https://arxiv.org/html/2608.06632#bib.bib7))和 DLRM([Naumov et al., 2019](https://arxiv.org/html/2608.06632#bib.bib9))。诸如 SASRec([Kang and McAuley, 2018](https://arxiv.org/html/2608.06632#bib.bib22))和 BERT4Rec([Sun et al., 2019](https://arxiv.org/html/2608.06632#bib.bib23))等序列注意力模型捕获了时间动态,但这些架构依赖于被动信号,并且为用户显式引导提供了有限的机制——这正是 SYF 直接解决的局限。 **对话式推荐系统(CRS)**:CRS 允许用户通过主动对话表达兴趣([Jannach et al., 2021](https://arxiv.org/html/2608.06632#bib.bib20); [Gao et al., 2021](https://arxiv.org/html/2608.06632#bib.bib25))。早期设计利用槽填充([Louvan and Magnini, 2020](https://arxiv.org/html/2608.06632#bib.bib26))或属性评论([Chen and Pu, 2012](https://arxiv.org/html/2608.06632#bib.bib21)),而 ReDial([Li et al., 2018](https://arxiv.org/html/2608.06632#bib.bib27))等数据集推动了同时优化对话和物品的端到端模型。为了提高对齐效果,知识图谱已被融合到对话流程中([Chen et al., 2019](https://arxiv.org/html/2608.06632#bib.bib28); [Zhou et al., 2020](https://arxiv.org/html/2608.06632#bib.bib30); [Wong et al., 2021](https://arxiv.org/html/2608.06632#bib.bib29); [Ren et al., 2024](https://arxiv.org/html/2608.06632#bib.bib31)),以弥合文本追踪与物品检索之间的鸿沟。然而,大多数 CRS 假设静态目录(如书籍、电影),无法应对需要实时多模态调整和快速负向约束执行的高吞吐量信息流动态。 **LLM 用于推荐**:LLM 为个性化技术栈引入了语义意图理解、推理和解释能力([Wu et al., 2023](https://arxiv.org/html/2608.06632#bib.bib32); [Fan et al., 2023](https://arxiv.org/html/2608.06632#bib.bib33))。在对话场景中,RecLLM([Friedman et al., 2023](https://arxiv.org/html/2608.06632#bib.bib11))在 YouTube 上集成了画像追踪,LLM-ConvRec([Feng et al., 2023](https://arxiv.org/html/2608.06632#bib.bib13))增强了回复质量。将物品库存进行锚定以减轻幻觉仍然是一个主要挑战([Tonmoy et al., 2024](https://arxiv.org/html/2608.06632#bib.bib14))。像 CRAG([Zhu et al., 2025b](https://arxiv.org/html/2608.06632#bib.bib18))这样的检索增强框架将 LLM 生成与协同过滤结合起来,而 RA-Rec([Kemper et al., 2024](https://arxiv.org/html/2608.06632#bib.bib17))则跨轮次追踪状态。Rank-GRPO([Zhu et al., 2025a](https://arxiv.org/html/2608.06632#bib.bib19))等对齐方法优化列表级排序,而微调现成 LLM 以模拟规范贝叶斯更新([Qiu et al., 2026](https://arxiv.org/html/2608.06632#bib.bib24))则改善了多轮概率推理。我们在这些工作的基础上,对高吞吐量内容流执行智能体式列表级优化。 ## 3. 问题范围 现代工业信息流推荐器依赖被动排序范式([Hu et al., 2008](https://arxiv.org/html/2608.06632#bib.bib4))。形式上,给定用户 \(u \in \mathcal{U}\) 和候选物品 \(v \in \mathcal{V}\),系统根据用户的历史隐式行为 \(\mathcal{H}_u\) 和当前上下文 \(\mathcal{E}\) 来估计参与概率 \(\hat{y}_{u,v}\)(如点击或停留时长): (1) \(\hat{y}_{u,v} = f_\theta(v, \mathcal{H}_u, \mathcal{E})\) 其中 \(f_\theta\) 是由参数 \(\theta\) 参数化的生产系统。这种公式的根本局限在于,它将偏好仅仅视为从 \(\mathcal{H}_u\) 推断出的潜在变量。由于缺乏对意识层面、实时兴趣表达的直变量,它使优化目标与用户即时能动性脱钩。 这种结构性局限表现为三个主要挑战: - **黑盒特性**:推荐逻辑对用户而言是不透明的。由于 \(\hat{y}_{u,v}\) 是在高维潜在空间中计算的,用户缺乏显式渠道来理解特定推荐或提供纠正性反馈。 - **粗粒度控制**:控制机制仅限于二元或类别化操作(如点击“显示更少”或关闭某条帖子)。这些对 \(\mathcal{H}_u\) 的更新过于粗糙,无法区分用户是不喜欢该话题、创作者还是语气。 - **缺乏多模态输入**:生产系统针对单点交互进行优化,缺乏处理自由文本或语音命令等多模态输入的能力。没有富有表现力的渠道,用户就无法传达复杂意图(如“多推荐一些科技新闻,但要避免 AI 炒作”),从而只能被动接受。 LLM 通过先进的语义理解和多模态支持解决了这些瓶颈,这使得从被动预测向用于对话式推荐的智能体系统的转变成为可能。
相似文章
对话推荐系统中用户模拟的提示优化:一个多目标框架
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。
@0xMorlex: Andrej Karpathy 解释了将LLM从聊天机器人转变为自主系统的五大转变:00:00 - 记忆将聊天转化为…
Andrej Karpathy 概述了五大关键转变——记忆、多模态、推理、搜索和工具——这些转变将LLM从简单的聊天机器人转变为完整的自主系统,为下一代AI工作流程提供了40分钟的路线图。
基于LLM的多模态音乐推荐系统
提出了一种多模态框架,融合音频、歌词和语义信号,并利用基于LLM的序列推理进行会话式音乐推荐,相较于仅使用ID的基线方法,召回率提升高达95%。
共识与异议:群体推荐系统中主观偏好的动态LLM建模
本研究在人类调查数据上微调LLM,使其作为群体推荐系统的判断模型,动态选择聚合策略以最大化满意度和共识。一项用户研究验证了该方法与人类对公平性和满意度的感知相一致。
学习可转移的潜在用户偏好以实现与人类一致的决策
本文介绍CLIPR,一个从最少的对话输入中学习可转移的潜在用户偏好的框架,以改进LLM中与人类一致的决策。