打破过滤气泡:面向多目标推荐的语义Pareto-DQN框架
摘要
提出一种多目标强化学习框架,结合语义嵌入与Pareto-DQN,在推荐中平衡参与度、多样性和公平性,缓解过滤气泡问题。
arXiv:2606.24042v1 公告类型:新
摘要:推荐系统通常通过单一地优化即时用户参与度,导致过滤气泡和语义同质化。标准的单目标模型,包括传统的Deep Q-Networks,难以在平台留存与信息多样性、提供者公平性等关键社会价值之间进行权衡。为解决这些局限性,我们提出了一种多目标强化学习框架,将推荐形式化为语义多目标马尔可夫决策过程。通过将高保真语义嵌入与Pareto-DQN智能体相结合,我们的架构将参与度、多样性和公平性视为独立、不可聚合的奖励信号,避免了静态奖励标量化的陷阱。在MovieLens小数据集上的实证评估表明,我们基于超体积的动作选择能够打破导致语义崩溃的反馈循环。通过维持高状态轨迹方差,Pareto-DQN有效映射了Pareto frontier,在辅助社会目标上取得增益,且仅对参与度产生轻微影响。这项工作为内在对齐、负责任的推荐系统提供了一条路径。
查看缓存全文
缓存时间: 2026/06/24 07:44
# 突破信息茧房:面向多目标推荐的语义Pareto-DQN框架
来源:https://arxiv.org/html/2606.24042
###### 摘要
推荐系统通常通过单方面优化即时用户参与度来诱导信息茧房和语义同质化。标准的单目标模型,包括传统的Deep Q-Networks(DQN),难以在平台留存率与信息多样性和提供者公平性等关键社会价值之间进行权衡。为了解决这些局限性,我们引入了一个多目标强化学习框架,将推荐形式化为一个语义多目标马尔可夫决策过程。通过将高保真语义嵌入与Pareto-DQN智能体相结合,我们的架构将参与度、多样性和公平性视为独立、不可聚合的奖励信号,避免了静态奖励标量化的陷阱。在MovieLens小规模数据集上的实证评估表明,我们基于超体积的动作选择能够破坏导致语义崩溃的反馈循环。通过维持较高的状态轨迹方差,Pareto-DQN有效映射了帕累托前沿,在辅助社会目标上取得了增益,而对参与度仅有轻微影响。这项工作为构建内在对齐、负责任的推荐系统提供了一条路径。
## I. 引言
推荐系统作为数字信息的主要守门人,旨在生成符合个人偏好的个性化建议[1 (https://arxiv.org/html/2606.24042#bib.bib1)]。然而,实证研究表明,这些系统会逐渐缩小用户接触到的内容范围,造成信息茧房,并随时间显著降低多样性[2 (https://arxiv.org/html/2606.24042#bib.bib2)]。标准的单目标模型,包括传统的Deep Q-Networks (DQN)[3 (https://arxiv.org/html/2606.24042#bib.bib3)],通常严格优化即时用户参与度。这导致了语义同质化,使得单目标架构无法有效平衡参与度与信息多样性、提供者公平性等更广泛、结构上存在对抗的社会价值[4 (https://arxiv.org/html/2606.24042#bib.bib4)]。
为了解决单目标优化的结构性局限,我们提出了一种多目标强化学习(MORL)框架,该框架将语义嵌入方法与Pareto Deep Q-Learning(Pareto-DQN)相结合,以成功应对这些固有的权衡[5 (https://arxiv.org/html/2606.24042#bib.bib5)]。我们的流程利用all-MiniLM-L6-v2 Sentence Transformer[6 (https://arxiv.org/html/2606.24042#bib.bib6)]构建语义状态表示。将用户和项目共置于相同的高保真潜在空间中,可确保标准内积自然地捕捉语义相关性[7 (https://arxiv.org/html/2606.24042#bib.bib7)],同时还能实现对未见项目的零样本泛化,从而缓解协同过滤的冷启动问题。
通过在MovieLens数据集[8 (https://arxiv.org/html/2606.24042#bib.bib8)]上的实证评估,我们通过用户嵌入方差量化了信息茧房的缓解效果,并分析了“责任代价”。我们的结果表明,Pareto-DQN能够有效破坏驱动语义崩溃的正反馈循环。通过全面映射帕累托前沿,智能体在多样性和公平性方面获得了相对增益,而参与度仅出现可管理的轻微下降,为构建高度可扩展、内在对齐且负责任的推荐系统提供了途径。
本文其余部分组织如下:第II节 (https://arxiv.org/html/2606.24042#S2)回顾了推荐系统强化学习中传统的单目标和多目标方法。第III节 (https://arxiv.org/html/2606.24042#S3)将推荐任务形式化为一个语义多目标马尔可夫决策过程,并详细阐述了所提智能体的架构。第IV节 (https://arxiv.org/html/2606.24042#S4)介绍实证评估,包括收敛性分析、通过语义方差破坏信息茧房以及经验性的责任代价。最后,第V节 (https://arxiv.org/html/2606.24042#S5)总结研究并指出未来方向。
## II. 相关工作
强化学习(RL)通过将推荐建模为马尔可夫决策过程,已成为最先进的范式。这使得系统能够通过由实时反馈驱动的持续策略更新来优化长期参与度[9 (https://arxiv.org/html/2606.24042#bib.bib9)]。利用Deep Q-Networks (DQN)的深度强化学习(DRL)因其鲁棒的更新策略和在离散动作空间中的良好性能,已成为基于值的标准方法[3 (https://arxiv.org/html/2606.24042#bib.bib3)]。近期实证证据表明,基于RL的方法因其交互特性和对动态用户偏好的自主适应能力,优于监督学习方法[10 (https://arxiv.org/html/2606.24042#bib.bib10)]。
尽管取得了这些进展,传统的单目标优化仍是一个根本性局限。现实场景通常涉及需要同时优化的多个相互冲突的目标[11 (https://arxiv.org/html/2606.24042#bib.bib11)]。标准DRL通常难以平衡准确度与非准确度指标,因此在导航复杂的现实权衡中效率低下[11 (https://arxiv.org/html/2606.24042#bib.bib11)]。多目标强化学习(MORL)通过使用向量化奖励而非标量奖励来解决这一差距,从而能够处理相互冲突的目标[5 (https://arxiv.org/html/2606.24042#bib.bib5)]。该方法基于帕累托优化这一理论框架,在此框架中,改善一个目标通常需要以改变另一个目标为代价[5 (https://arxiv.org/html/2606.24042#bib.bib5)]。近期的工业部署表明,基于帕累托的DRL方法能够在全面建模多个业务目标之间复杂关系的同时,同时改善多个业务目标[4 (https://arxiv.org/html/2606.24042#bib.bib4)]。因此,Pareto-DQN变体能够在传统准确度指标之外,优化多样性、新颖性、公平性和参与度[12 (https://arxiv.org/html/2606.24042#bib.bib12)]。
Pareto-DRL是我们提议的核心。当前MORL的应用涵盖广泛领域,包括行程推荐[13 (https://arxiv.org/html/2606.24042#bib.bib13)]、短视频平台[14 (https://arxiv.org/html/2606.24042#bib.bib14)]、电动汽车充电[15 (https://arxiv.org/html/2606.24042#bib.bib15)]、教育系统[16 (https://arxiv.org/html/2606.24042#bib.bib16)]、留存建模[17 (https://arxiv.org/html/2606.24042#bib.bib17)]以及公平性与效用权衡[4 (https://arxiv.org/html/2606.24042#bib.bib4)]。
我们提出的框架整合了大语言模型(LLM)的先进生成能力,利用语义空间融入推荐流程。通过采用Pareto Deep Q-Network (Pareto-DQN)方法,该框架有效解决了传统协同过滤的结构性局限和单目标优化的狭隘聚焦。本方法利用LLM嵌入作为高保真机制来导航复杂的价值权衡,从而规避了直接进行用户实验所带来的伦理风险和高昂成本,为负责任的推荐系统提供了领先范式。
## III. 方法论
我们提出了一种具有语义方法的多目标强化学习(MORL)框架,应用于项目推荐,该框架联合优化用户参与度、信息多样性和提供者公平性。研究表明,推荐系统会逐渐缩小用户接触的内容范围,产生随时间推移降低多样性的信息茧房[2 (https://arxiv.org/html/2606.24042#bib.bib2)]。我们的方法将语义方法与帕累托深度Q学习相结合,以在这些相互冲突的目标之间进行固有权衡,从而在保持推荐质量的同时减轻这种收窄效应。
### III-A 语义嵌入管道
为了为我们的环境构建鲁棒的状态表示,我们将每个项目 \(i\) 的特征(如标题、类型和用户生成标签)拼接成单个文本文档 \(d_i\)。这种表示策略已在基于内容的推荐中得到实证验证[7 (https://arxiv.org/html/2606.24042#bib.bib7)]。我们使用 all-MiniLM-L6-v2 Sentence Transformer[6 (https://arxiv.org/html/2606.24042#bib.bib6)] 将此文档映射到连续向量空间:
\[
\mathbf{v}_i = \frac{\text{Encoder}(d_i)}{\|\text{Encoder}(d_i)\|_2}
\]
该模型将文本映射到优化用于相似性检索的384维向量。我们使用 \(L_2\) 归一化作为关键的几何约束;这固有地平衡了嵌入质量与计算效率(该模型包含2200万个参数,在标准CPU上处理批次耗时 <50ms)。通过利用预训练的语义嵌入空间,我们能够对未见项目实现零样本泛化,直接缓解纯协同过滤方法中常见的冷启动问题。
### III-B 问题形式化
我们将序列推荐任务形式化为一个多目标马尔可夫决策过程(MOMDP),由元组 \(\langle \mathcal{S}, \mathcal{A}, \mathcal{P}, \mathbf{R}, \gamma \rangle\) 定义。其中,\(\mathcal{S}\) 表示用户偏好配置文件的状态空间,\(\mathcal{A}\) 定义候选项目的动作空间,\(\mathcal{P}: \mathcal{S} \times \mathcal{A} \rightarrow \mathcal{S}\) 支配用户偏好漂移的确定性转移动力学,\(\gamma \in [0,1)\) 是折扣因子。至关重要的是,环境产生一个向量化奖励函数 \(\mathbf{R}: \mathcal{S} \times \mathcal{A} \times \mathcal{S} \rightarrow \mathbb{R}^3\),发出一个多维信号,捕捉参与度、多样性和公平性。保留这种向量化结构能够实现原则性的后验多目标优化,避免了先验静态标量化的需求。
#### III-B1 状态空间
状态 \(\mathbf{s}_t \in \mathbb{R}^{384}\) 将用户的偏好配置文件编码为其历史喜欢项目嵌入的质心:
\[
\mathbf{s}_t = \frac{1}{|H_u|} \sum_{i \in H_u} \mathbf{v}_i
\]
其中,\(H_u\) 表示用户 \(u\) 评分 \(\geq 4.0\) 的项目集合,\(\mathbf{v}_i \in \mathbb{R}^{384}\) 是项目 \(i\) 的 \(L_2\) 归一化语义嵌入。
与先前的深度RL模型(如DRR-ave[18 (https://arxiv.org/html/2606.24042#bib.bib18)] 依赖于辅助参数化交互模块)不同,我们直接部署此质心作为基于内容的用户配置文件[7 (https://arxiv.org/html/2606.24042#bib.bib7)]。将用户和项目共置于相同的高保真 Sentence-BERT 潜在空间[6 (https://arxiv.org/html/2606.24042#bib.bib6)] 中,可确保标准内积自然地产生语义相关性。
#### III-B2 动作空间
在超过 \(\mathcal{I} \geq 9,000\) 个项目的完整目录上评估Q值在计算上不可行。我们采用分层候选池化来构建一个大小为 \(K=100\) 的有界动态动作空间 \(\mathcal{C}_t \subset \mathcal{A}\)。
在每个时间步 \(t\),\(\mathcal{C}_t\) 通过合并两个不同的集合来构建:\(K(1-\rho)\) 个项目通过围绕状态质心 \(\mathbf{s}_t\) 的余弦距离最近邻(KNN)搜索检索得到,以及 \(K\rho\) 个项目从按曝光排序的长尾中注入,其中 \(\rho = 0.3\)。合并后的候选池随后被随机打乱以消除位置偏差。
注入参数 \(\rho\) 对我们的多目标优化(MOO)公式在理论上至关重要。纯KNN检索策略会将智能体的动作空间完全限制在高亲和度、已流行的项目上。为动作空间保留 \(\rho\) 比例的长尾项目,为优化提供者公平性提供了可行的途径。
#### III-B3 转移动力学
为了对用户兴趣的时间演变以及已被充分记录的信息茧房效应[2 (https://arxiv.org/html/2606.24042#bib.bib2)] 进行数学建模,我们实现了一种偏好漂移机制。在推荐具有嵌入 \(\mathbf{v}_{a_t}\) 的动作 \(a_t\) 后,用户状态通过归一化的指数移动平均进行转换:
\[
\mathbf{s}_{t+1} = \frac{(1-\alpha)\mathbf{s}_t + \alpha \mathbf{v}_{a_t}}{\| (1-\alpha)\mathbf{s}_t + \alpha \mathbf{v}_{a_t} \|_2}
\]
这里,超参数 \(\alpha \in [0,1]\) 控制用户的语义敏感性。它决定了状态转移的步长,控制一次交互如何将用户的整体偏好质心拉向推荐项目的向量。该公式将信息茧房现象直接嵌入到MOMDP动力学中。如果策略贪婪地利用高亲和度项目以最大化即时参与度,\(\alpha\) 加权更新的递归应用会导致 \(\mathbf{s}_t\) 迅速坍缩到狭窄的语义子空间中。因此,KNN检索的候选池 \(\mathcal{C}_{t+1}\) 变得同质化,严格削弱了智能体累积未来多样性奖励的能力。
#### III-B4 向量化奖励函数
环境产生一个多目标奖励向量 \(\mathbf{r}_t = [r_{\text{eng}}, r_{\text{div}}, r_{\text{fair}}]^\top \in \mathbb{R}^3\),其中每个分量代表一个独立目标:
**参与度**:我们通过sigmoid函数将状态与动作嵌入之间的语义相关性进行映射:
\[
r_{\text{eng}} = \sigma(\mathbf{s}_t \cdot \mathbf{v}_{a_t}) = \frac{1}{1 + e^{-(\mathbf{s}_t \cdot \mathbf{v}_{a_t})}}
\]
它将奖励限定在 \((0,1)\) 范围内,并为Q值更新确保平滑梯度,同时假设语义邻近性驱动用户参与。
**多样性**:衡量语义距离以防止信息茧房:
\[
r_{\text{div}} = 1 - S_c(\mathbf{s}_t \cdot \mathbf{v}_{a_t})
\]
其中 \(S_c\) 是相对于用户偏好质心的余弦相似度。这直接激励语义上不相关的推荐,对抗同质化。
**公平性**:为了激励对长尾的探索:
\[
r_{\text{fair}} = \frac{1}{\log(1 + C(a_t))}
\]
一个单调递减的曝光奖励,其中 \(C(a_t) \geq 1\) 跟踪项目 \(a_t\) 的平台累积曝光量。分母为新颖项目提供陡峭的探索梯度,在无需破坏网络收敛稳定性的情况下提供强初始公平性信号。
### III-C 标准DQN智能体(基线)
我们实现了一个单目标 Deep Q-Network(标准DQN)。奖励值仅为 \(r_{\text{eng}}\)。训练期间,智能体摄入拼接后的状态和候选项目嵌入 \([\mathbf{s}_t \| \mathbf{v}_{a_i}] \in \mathbb{R}^{768}\),并通过标准时序差分学习基于 \(r_{\text{eng}}\) 信号进行优化。相应地,动作选择使用严格基于预测参与度的贪婪最大化来评估候选:
\[
a_t^* = \arg\max_{a_i \in \mathcal{C}_t} Q(\cdot)
\]相似文章
对话推荐系统中用户模拟的提示优化:一个多目标框架
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。
LEMUR:从偏好反馈中学习与多目标强化学习对齐
本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。
从正确性到偏好:个性化智能体强化学习框架
本文提出了一个统一的个性化智能体强化学习框架,将通用任务奖励与个性化偏好奖励解耦,引入了PARPO和PSGM用于偏好对齐的策略优化和技能检索。
Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL
This paper proposes PRISM, a multi-reward RL framework that decomposes policy space rather than mixing rewards, improving multi-reward optimization and enabling inference-time controllability. Experiments on reasoning and alignment tasks show it outperforms existing baselines.
面向多目标强化学习的确定性帕累托最优策略综合
本文引入了一种基于切比雪夫标量化的新颖偏好条件贝尔曼算子,用于计算多目标马尔可夫决策过程中的确定性帕累托最优策略,并证明了该算子的收敛性及其在捕获完整帕累托前沿方面的有效性。