扩展更多,收缩更少:为推荐系统中密集扩展塑造有效秩动态

arXiv cs.LG 论文

摘要

本文提出RankElastor,一种新颖的架构,通过引入参数化全混合和GLU改进的P-FFN,缓解推荐模型密集扩展中的嵌入坍塌,实现鲁棒扩展并在大规模数据集上提升性能。

arXiv:2605.23191v1 Announce Type: new 摘要:扩展推荐模型是推荐系统中的核心挑战。最近,RankMixer作为一种有效的解决方案出现,它基于统一的令牌表示,并通过交替进行令牌混合和每个令牌的前馈网络(P-FFN)来实现可扩展的性能。然而,RankMixer存在\textit{嵌入坍塌}问题,即学习到的表示具有较低的有效秩,限制了表达能力并未能充分利用扩展的表示空间。通过实证分析和理论洞见,我们确定刚性的令牌混合和P-FFN模块是这一现象的主要原因,它们共同在跨层的有效秩演化中引起\textbf{阻尼振荡轨迹}。为了解决这个问题,我们提出RankElastor,一种新颖的架构,能够产生频谱鲁棒的表示,并具有可证明的坍塌缓解能力。RankElastor引入两个组件:(i) \textbf{参数化全混合},实现具有改进频谱鲁棒性的表达性令牌混合;(ii) \textbf{GLU改进的P-FFN},通过GLU风格的FFN模块稳定表示频谱。在大规模工业数据集上的大量实验表明,RankElastor一致地提升了推荐性能,缓解了嵌入坍塌,并展现出鲁棒的扩展行为。代码可在此GitHub仓库获取:https://github.com/vasile-paskardlgm/RankElastor
查看原文
查看缓存全文

缓存时间: 2026/05/25 09:02

# 扩展更多,收缩更少:塑造有效秩动态以实现推荐系统的稠密缩放 来源:https://arxiv.org/html/2605.23191 (2026)

###### 摘要。扩展推荐模型是推荐系统中的一个核心挑战。最近,RankMixer 作为一种有效解决方案出现,它基于统一的令牌表示,通过交替进行令牌混合和逐令牌前馈网络(P-FFN)来实现可扩展的性能。然而,RankMixer 存在嵌入坍缩问题,即学习到的表示具有低有效秩,限制了表达能力,并未能充分利用扩展后的表示空间。通过实证分析和理论洞察,我们确定僵化的令牌混合和 P-FFN 模块是这一现象的主要原因,它们共同在层与层之间的有效秩演化中诱导出一种阻尼振荡轨迹。为了解决这个问题,我们提出了 RankElastor,一种新颖的架构,能够产生频谱鲁棒的表示,并具有可证明的坍缩缓解能力。RankElastor 引入了两个组件:(i) 参数化全混合,通过更具表达能力的令牌混合和改进的频谱鲁棒性;(ii) GLU 改进的 P-FFN,通过 GLU 风格的 FFN 模块稳定表示频谱。在大规模工业数据集上的广泛实验表明,RankElastor 持续提升推荐性能,缓解嵌入坍缩,并展现出鲁棒的扩展行为。代码可在以下 GitHub 仓库获取:https://github.com/vasile-paskardlgm/RankElastor

推荐系统,CTR 预测,维度坍缩

††期刊年份:2026
††版权:cc
††会议:第 32 届 ACM SIGKDD 知识发现与数据挖掘会议 V.2;2026 年 8 月 9–13 日;韩国济州岛
††书刊名:第 32 届 ACM SIGKDD 知识发现与数据挖掘会议 V.2 (KDD '26),2026 年 8 月 9–13 日,韩国济州岛
††DOI:10.1145/3770855.3818049
††ISBN:979-8-4007-2259-2/2026/08
††CCS:计算方法 机器学习

## 1. 引言

推荐系统是机器学习的一项核心应用,旨在从海量多字段分类数据中预测用户与物品的交互(Zhang et al., 2016)。它们已成为现代数字平台不可或缺的一部分,驱动着电子商务、社交媒体和内容推荐等应用。近期基于深度学习的推荐器的发展,使得灵活的特征表示学习和复杂的特征交互建模成为可能,从而在大规模工业部署中取得了强劲性能。受大型基础模型成功(Radford et al., 2021; Achiam et al., 2023; Rombach et al., 2022; Kirillov et al., 2023)的启发,扩展模型容量已成为推荐系统的自然方向(Zhang et al., 2024b, a; Guo et al., 2024b; Wang et al., 2025a)。在近期面向扩展的架构中,RankMixer (Zhu et al., 2025) 引起了广泛关注。

RankMixer 架构可理解为三个核心组件:(i) 令牌化模块,将来自多个字段的异构嵌入映射到统一的令牌表示空间;(ii) 令牌混合模块,通过将原始令牌矩阵与其块转置视图结合来增强令牌表示;(iii) 逐令牌 FFN(P-FFN)模块,利用应用于每个令牌的独立前馈网络来建模特征交互(Kira and Rendell, 1992; Batory et al., 2011)。通过迭代交替令牌混合和 P-FFN 模块,RankMixer 形成了一种深度且可扩展的推荐架构,在多个基准测试和实际部署中均达到了最先进的性能。

尽管在经验上取得了成功,RankMixer 尚未从嵌入坍缩(Guo et al., 2024a)的角度进行审视。嵌入坍缩最近被确定为扩展推荐系统的一个基本障碍(Guo et al., 2024a; Pan et al., 2024; Chen et al., 2024; Zhang et al., 2025; Yin et al., 2025),其中学习到的表示集中在低秩子空间中,限制了表示多样性并降低了模型扩展带来的益处。虽然先前的工作尝试通过架构修改(Guo et al., 2024a)或优化策略(Lin et al., 2025; Wang et al., 2025b)来缓解坍缩,但这些解决方案通常针对特定推荐器设计。对 RankMixer 中嵌入坍缩的系统性理解仍然缺失。

在本文中,我们通过有效秩(Roy and Vetterli, 2007; Vershynin, 2011)的视角研究 RankMixer。有效秩是一种谱度量,超越了代数秩来捕捉表示能力,并泛化了推荐器中先前的坍缩分析工具(Guo et al., 2024a; Yin et al., 2025)。实证上,我们观察到 RankMixer 在跨层的秩演化中展现出独特的阻尼振荡轨迹:令牌混合模块略微增加有效秩,而 P-FFN 模块则收缩有效秩。尽管这种交替行为相比传统推荐器(例如 DCNv2 (Wang et al., 2021))有一定改进(传统推荐器通常呈现单调秩衰减),但增益有限,并且随着模型深度增加,并不能可靠地防止表示坍缩。作为这些观察的补充,我们的理论分析表明,RankMixer 中的原始令牌混合和 P-FFN 模块共同限制了频谱鲁棒性,这解释了为何坍缩缓解仍然不完整。

为了解决这一缺陷并释放基于令牌变换的推荐器的潜力,我们提出了 RankElastor,一种新颖的架构,旨在生成具有可证明的坍缩缓解能力的频谱鲁棒表示。RankElastor 引入了两个关键组件:(i) 参数化全混合,对令牌执行可学习的细粒度混合以提升频谱表达能力;(ii) GLU 改进的 P-FFN,采用门控激活函数(Shazeer, 2020)来防止原始 RankMixer P-FFN 所放大的坍缩。这两个模块共同产生更稳定的表示频谱和更好的扩展行为。

我们在工业级基准测试 Criteo (Jean-Baptiste Tien, 2014) 和 Avazu (Steve Wang, 2014) 上评估了 RankElastor 与强基线推荐器(包括 RankMixer)的对比,实现了与实践对齐的比较。实验结果表明,RankElastor 持续提升下游 CTR 预测性能,相对于最强基线实现了超过 0.001 AUC 的提升——根据 (Zhou et al., 2018) 的标准,这是一个显著的改进。除了准确率提升,RankElastor 生成的表示具有明显更高的有效秩,表明对表示坍缩的缓解更强。此外,RankElastor 展现出比 RankMixer 更好的参数扩展行为,证实了其作为可扩展推荐架构的优势。

我们的贡献总结如下:

- • 我们从嵌入坍缩的角度分析了 RankMixer,提供了经验证据和理论依据,表明该架构中的坍缩问题尚未得到充分解决。
- • 我们提出了 RankElastor,一种新颖的深度推荐架构,通过参数化全混合和 GLU 改进的 P-FFN 缓解表示坍缩,并具有频谱鲁棒性的理论保证。
- • 我们在工业级基准测试上进行了大量实验,证明 RankElastor 提升了推荐性能、表示多样性和参数扩展行为,为扩展推荐架构提供了新方向。

## 2. 研究背景

### 2.1. 符号与预备知识

推荐模型旨在根据来自多个字段的特征来预测用户行为(Zhang et al., 2016)。与本文考虑的应用场景(即 CTR/排序预测 (McMahan et al., 2013))一致,我们考虑 n 个字段,其中第 i 个字段记为 $\mathcal{X}_i$,并定义联合特征空间为 $\mathcal{X} = \mathcal{X}_1 \times \mathcal{X}_2 \times \dots \times \mathcal{X}_n$。令 $\mathcal{Y}$ 表示预测空间;推荐模型的目标是学习从 $\mathcal{X}$ 到 $\mathcal{Y}$ 的映射。我们专注于遵循“嵌入-交互”架构的推荐器。这类模型首先将输入样本 $X \in \mathcal{X}$ 转换为特征嵌入 $E \in \mathbb{R}^{n \times k}$,其中 k 是嵌入维度,第 i 行 $E_i$ 表示字段 i 的嵌入向量。然后,嵌入矩阵由特征交互模块 (Kira and Rendell, 1992; Batory et al., 2011) 处理,该模块建模字段间的相关性并生成用于预测的信息表示。由于其在实践中的强劲性能(Wang et al., 2021; Lian et al., 2018; Song et al., 2019; Rendle, 2010),该架构被广泛应用于真实的推荐系统。

#### 嵌入坍缩 (Guo et al., 2024a)。
在一般的机器学习设置中,维度坍缩指模型退化为将输入映射到几乎恒定输出的平凡表示(Hua et al., 2021),这可以通过学习表示的频谱分析来表征(Jing et al., 2022)。在推荐系统中,最近识别出一个相关现象称为嵌入坍缩:嵌入矩阵变得近似低秩,具有多个接近零的奇异值(Guo et al., 2024a; Pan et al., 2024; Chen et al., 2024; Zhang et al., 2025)。该现象通常使用有效秩(Roy and Vetterli, 2007)来度量,它表征了超越代数秩的矩阵谱分布。在多种形式中,我们采用一种广泛使用的基于范数的定义(Vershynin, 2011; Balduzzi et al., 2017; Bartlett et al., 2020),也称为稳定秩(Cohen et al., 2016):

\[
\operatorname{erank}(X) = \frac{\sum_i \sigma_i^2}{\max_i \sigma_i^2} = \frac{\|X\|_F^2}{\|X\|_2^2}
\]

其中 $\sigma_i$ 表示 $X$ 的奇异值。

#### RankMixer (Zhu et al., 2025)。
作为一种近期的深度推荐架构,RankMixer 因其简洁的设计、强劲的经验性能和良好的扩展行为而受到广泛关注。其架构由三个模块组成:(i) 令牌化;(ii) 令牌混合;(iii) 逐令牌 FFN(P-FFN)。下面我们简要总结:

- • **令牌化**。令牌化模块接收嵌入矩阵 $E$,将嵌入向量分组为 T 个聚类,然后通过统一的投影(例如线性映射或 MLP)到一个共享的 D 维空间,生成令牌矩阵 $X^{(0)} \in \mathbb{R}^{T \times D}$。每一行 $X_t^{(0)} \in \mathbb{R}^D$ 称为一个令牌嵌入。该模块主要用于对齐来自异构源的嵌入。在本文中,我们重点关注后续的核心模块。

- • **令牌混合**。令牌混合模块将列维度 D 分成 H 个相等的段,每段大小 $d = D/H$,形成一个 $T \times T$ 的块网格,每个块在 $\mathbb{R}^{1 \times d}$ 中。在第 l 个 RankMixer 块中,首先对输入 $X^{(l)}$ 应用块转置操作,交换块对 $X_{i,j}^{(l)}$ 和 $X_{j,i}^{(l)}$。然后,变换后的表示通过残差连接与原始令牌矩阵结合,随后进行输出层归一化,从而生成具有跨令牌信息混合的增强令牌表示。

- • **P-FFN**。RankMixer 随后将混合后的令牌送入令牌特定的 FFN 模块,称为 P-FFN。该模块作为执行特征交互的函数,类似于典型的“嵌入-交互”型推荐器。在 RankMixer 中,P-FFN 配置为两层,使用 GELU (Hendrycks and Gimpel, 2023) 作为激活函数。堆叠令牌混合和 P-FFN 模块形成深度且可扩展的推荐架构。RankMixer 架构的概览如图 3(a) 所示。

(请参考图注)

(a) 原始嵌入 → 混合 1
(b) 混合 1 → FFN 1
(c) FFN 1 → 混合 2
(d) 混合 2 → FFN 2
**图 1.** RankMixer 中跨表示阶段的有效秩分布变化。在 Criteo(上)和 Avazu(下)上,从原始嵌入到连续模块输出的每个样本有效秩的分布。

(a) Criteo 上的对比。
(b) Avazu 上的对比。
**图 2.** RankMixer(阻尼振荡轨迹)与基线(单调衰减)在跨表示阶段的平均有效秩对比。

### 2.2. 关于 RankMixer 中的嵌入坍缩

尽管 RankMixer 展示了强大的可扩展性和有效性,但它在嵌入坍缩下的行为尚未被系统研究。现有的坍缩分析主要关注传统推荐器(Guo et al., 2024a; Yin et al., 2025),例如 DCNv2 (

相似文章

Tevatron-Elastic:训练弹性检索器与重排序器的统一抽象

arXiv cs.CL

Tevatron-Elastic 为训练弹性检索器和重排序器提供了统一抽象,使单个检查点能够在深度、token 和宽度轴上支持多种模型规模。它统一概括了 Matryoshka 嵌入和提前退出等先前方法,并引入了用于联合 token 压缩训练的 Matryoshka LTC。

面向大规模动态图的可扩展高效联合脉冲嵌入预测架构

arXiv cs.LG

提出 SG-JEPA,一种面向大规模动态图的联合脉冲嵌入预测架构,该架构沿时间维度将节点划分为上下文集和目标集,以学习预测性嵌入,在节点分类上取得有竞争力的性能,同时可扩展到拥有1300万条边的图,并避免了复杂的自监督机制。

LoopCTR:释放循环扩展威力,刷新点击率预测

Hugging Face Daily Papers

LoopCTR 将“循环扩展”引入推荐模型,通过基于 MoE 的专家融合与超连接残差,在提升 CTR 预测效果的同时实现 train-deep/infer-shallow 部署,满足低延迟在线服务需求。