ClockRoPE:用于时间例行建模的随机傅里叶旋转

arXiv cs.LG 论文

摘要

ClockRoPE引入随机傅里叶旋转来建模序列推荐中的时间周期性,具有理论基础,并通过一家主要视频分享平台的在线A/B测试得到验证。

arXiv:2607.26369v1 公告类型:新 摘要:旋转位置编码(RoPE)已被广泛用于基于Transformer的大语言模型中。然而,其对数线性频率调度原本设计用于产生长距离注意力衰减,这限制了它在具有更复杂距离相关模式(如序列推荐中的时间周期性)的领域中的应用。我们研究了通用查询/键旋转的表达能力,并发现任何归一化的连续正定注意力调制函数都可以通过其自身傅里叶变换诱导的随机旋转来近似,我们将其称为随机傅里叶旋转。基于这一理论,我们提出了ClockRoPE用于序列推荐中的例行建模,其中旋转频率源自周期性的注意力调制函数。在在线A/B测试中,ClockRoPE在关键参与指标上表现出一致的改进,并已成功部署在一家主要视频分享平台的生产级生成式检索系统中。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:58

# ClockRoPE:用于时序规律建模的随机傅里叶旋转

## 摘要

旋转位置编码(RoPE)已广泛应用于基于 Transformer 的大语言模型中。然而,其原本为产生长程注意力衰减而设计的对数线性频率调度方案,限制了其在具有更复杂距离-相关性模式(如序列推荐中的时间周期性)的领域中的应用。我们研究了通用查询/键旋转的表达能力,发现任何归一化连续正定注意力调制函数都可以通过由其自身傅里叶变换诱导的随机旋转来近似,我们将其称为随机傅里叶旋转。基于这一理论,我们提出了用于序列推荐中规律建模的 ClockRoPE,其中旋转频率源自周期性注意力调制函数。在在线 A/B 测试中,ClockRoPE 在价值参与指标上表现出一致的改进,并已成功部署在一家主要视频分享平台的生产规模生成式检索系统中。

## 1. 引言

随着 Transformer(Vaswani 等人,2017)和缩放定律(Kaplan 等人,2020;Hoffmann 等人,2022)在语言建模(Devlin 等人,2018;Brown 等人,2020)和图像生成(Peebles 和 Xie,2023)中取得了巨大成功,生成式推荐领域正趋向于采用 Transformer 风格的架构进行序列建模(Kang 和 McAuley,2018;Zhai 等人,2024)。然而,与语言建模不同,时间是序列推荐中一个关键且内在的信号。已有多种方法被探索用于在基于 Transformer 的序列推荐中融入时间信号,包括时间差输入特征(Chai 等人,2025)、加性时间注意力偏置(Zhai 等人,2024)以及注意力内部的相对时间嵌入(Li 等人,2020)。

另一方面,RoPE(Su 等人,2021)在基于 Transformer 的语言模型中表现出了优越的性能,具有平移不变性和长程注意力衰减等特性。尽管 RoPE 最初是为一维离散标记位置设计的,但它很快被应用于具有多维连续坐标的领域(Li 等人,2026;Schenck 等人,2025;Heo 等人,2024)。

自然地,最近的一些工作主张将 RoPE 扩展到序列推荐中用于编码时间(Wei 等人,2025;Hou 等人,2026):(Wei 等人,2025)采用了与标准 RoPE 类似的对数线性频率间隔,并用相对于锚定时间戳的时间戳增量取代了位置;ROTE(Hou 等人,2026)首先计算对数缩放的时间戳间隔,并基于它们构造旋转角度来捕捉时间邻近性。这两项工作都强调使用时间戳与顺序一起编码近因性。

然而,推荐系统中用户行为的一个重要特性是周期性。在一天中相同小时或一周中同一天发生的交互通常表现出高相关性。然而,标准 RoPE 中的对数线性频率调度会产生长程注意力衰减,难以捕捉包括周期性在内的更复杂的距离-相关性模式。

为解决这一局限性,我们利用傅里叶分析来研究通用查询/键旋转的表达能力。我们证明,任何连续归一化正定调制函数都可以通过从其自身的傅里叶变换分布中采样 RoPE 频率来进行无偏近似。总之,我们的工作贡献包括:

*   **随机傅里叶旋转(RFR):** 一种使用查询/键旋转来近似任意归一化正定注意力调制函数的通用采样方法。
*   **ClockRoPE:** 一种用于用户规律建模的时间周期性编码方法,通过应用随机傅里叶旋转来近似周期性注意力调制函数推导得出。
*   **生产规模评估:** ClockRoPE 在生产规模生成式检索系统中提高模型规律意识和整体观众价值的有效性的实证证据。

## 2. 相关工作

### 2.1. 相对位置编码

相对位置编码(RPE)技术(Shaw 等人,2018;Huang 等人,2019;Li 等人,2023;Choromanski 等人,2022;Raffel 等人,2020)是 Transformer 模型中使用的一类强大的位置编码方法。与将基于正弦的绝对位置嵌入添加/连接到内容嵌入的绝对位置编码(APE)(Vaswani 等人,2017;Kazemi 等人,2019)不同,它们通过(可学习的)相对位置/距离函数(在相应度量空间中,例如语言的一维线、图像的二维网格或视频的三维网格)更明确地调制注意力矩阵值。RPE 是一个丰富的技术类别,通常通过两个分支进行分类:(1)**加性机制**(Choromanski 等人,2024, 2022;Li 等人,2023),其在 logits 空间引入加性项(在逐元素 logits 指数化后在数值上等同于 Hadamard 乘积);以及(2)**乘性机制**(Su 等人,2021;Cheng 等人,2026;Heo 等人,2024;Schenck 等人,2025),其通过引入乘性项来调制查询-键点积(这两种策略也可以组合成混合方法)。RPE 被用于不同的模态:语言(Su 等人,2021)、图像(Choromanski 等人,2022;Heo 等人,2024;Schenck 等人,2025),以及最近的点云(Kim 等人,2026)。

RPE 通常可以高效实现,时间复杂度接近输入序列长度的线性(而非二次)。例如,众所周知(Choromanski 等人,2022;Luo 等人,2021),只要加性 RPE 机制中 Hadamard 乘法使用的掩码矩阵 \( \mathbf{M} \) 支持次二次(在序列长度上)矩阵-向量乘法,相应的 RPE 机制就可以应用于次二次时间的线性低秩注意力 Transformer(Choromanski 等人,2021)。类似地,乘性 RPE 机制通常支持高效实现(参见第 2.2 节)。

### 2.2. RoPE 与 STRING

旋转位置编码(RoPE)(Su 等人,2021;Heo 等人,2024;Reid 等人,2026;Li 等人,2026;Hua 等人,2024)是乘性 RPE 机制的一个实例,其中查询和键由依赖于其对应标记位置的旋转矩阵进行后处理。更具体地说,对应于标记的旋转矩阵被定义为不相交的二维(Givens)旋转的乘积,其旋转角度被定义为标记位置(一维或更高维)的线性函数,并具有可能可训练的参数(不同的变体包括轴向 RoPE、混合 RoPE 等)。这种对标记对应旋转矩阵的特定设计选择使得可以将调制后的注意力分数重写为:\( \mathbf{q}^\top \mathbf{R}(\delta\mathbf{r}) \mathbf{k} \),其中 \( \mathbf{R}(\delta\mathbf{r}) \) 是一个旋转矩阵,定义为不相交的二维旋转的乘积,其角度由相对位置的线性函数给出。

在 RoPE 机制中用于旋转查询和键的旋转矩阵的刚性结构导致了**平移不变性**(该机制仅依赖于相对位置),但在实践中可以在不牺牲此属性的情况下显著放宽。最近引入的 STRING 方法(Schenck 等人,2025)是 RoPE 的超集,其中旋转矩阵是通过对**斜对称**(反对称)矩阵求指数(在矩阵指数而非逐元素意义上)获得的。每个斜对称矩阵被定义为斜对称**生成元**(通常是可学习的)的线性组合,其系数由对应于查询/键的标记的坐标给出。如(Schenck 等人,2025)所示,只要生成元可交换,得到的机制就保持平移不变性,而 RoPE 提供了其特殊实例。此外,在查询和键通过旋转矩阵进行后处理并保持平移不变性的设置中,它是 RoPE 机制最通用的扩展。

STRING 和 RoPE 都容易支持使用高效注意力方法的快速计算,因为它们不需要显式实例化 logits 矩阵,而是在查询和键集上独立操作。

### 2.3. 序列建模中的傅里叶方法

傅里叶方法是序列建模中的常用工具。对于 Transformer 模型,一个早期例子是 FNet(Lee-Thorp 等人,2021),它用离散傅里叶变换替换了 Transformer 层中的自注意力机制。尽管缺乏可学习参数,离散傅里叶变换作为一种高效的标记“混合”机制来替代注意力,同时在 BERT(Devlin 等人,2018)模型中保留了许多质量。

傅里叶分析也被用于改进 RoPE 本身。FoPE(Hua 等人,2024)利用离散信号处理理论来改善长度泛化,而 nD-RoPE(Li 等人,2026)则推导出谱各向同性条件以将 RoPE 推广到更高维空间。两者都细化了 RoPE 现有的频率结构,而 ClockRoPE 则针对周期性注意力调制推导了一个新的频率采样分布。

### 2.4. 傅里叶特征

傅里叶特征在核近似和函数表示方面有着广泛的历史。随机傅里叶特征(RFF)(Rahimi 和 Recht,2007)通过从核的傅里叶变换中采样的随机正弦投影来近似平移不变核。这些特征已被证明有助于网络学习高频函数(Tancik 等人,2020)、在自注意力中编码连续时间(Xu 等人,2019),以及支持用于空间位置编码的可学习频率基(Li 等人,2021)。与这些构造基于傅里叶输入特征的方法不同,我们的随机傅里叶旋转建立在 RFF 之上,并将其从特征映射扩展到查询和键上的旋转算子,保留了 RoPE 的乘性结构和高效实现。

## 3. 方法论

### 3.1. 动机

(图 1:RoPE 的长程衰减)

RoPE(Su 等人,2021)为每个特征对构建了二维旋转,这本质上是周期性的。然而,正如原始论文(Su 等人,2021)中所证明的,当将这些二维旋转与标准的对数线性间隔频率调度 \( \theta_i = 10000^{-2i/d}, \quad i \in [0, 2, \ldots, d/2 - 1] \) 结合时,RoPE 强制注意力得分上界随相对距离衰减,呈现出如图 1 所示的具有随机振荡的单调递减趋势。这一属性在原始论文中被称为长程衰减。尽管长程衰减属性适合语言建模的本质,但它在具有自然周期性的领域(如生成式推荐)中,有过度简化距离如何影响相关性的风险。我们在第 4.4.1 节的图 2 中凭经验证实了这种效应,其中标准 RoPE 被显示将注意力集中在近期交互上,同时掩盖了日周期性模式。

在序列生成式推荐中,在一天中相同小时或一周中同一天发生的交互表现出高相关性。一个用于周期性建模的理想频率调度应为在相同小时或同一天发生的交互对提供比其他交互对更高的注意力得分上界。

### 3.2. 通过随机傅里叶旋转调制注意力 Logits

在进入我们用于周期性注意力调制的具体方法之前,我们首先介绍基于连续标记位置调制注意力分数的理论基础。

假设我们想要调制标准的注意力 logits,使得在位置 \( p_m \) 的查询 \( \boldsymbol{q}_m \) 和在位置 \( p_n \) 的键 \( \boldsymbol{k}_n \) 之间的相似度由一个正定核 \( f: \mathbb{R} \to \mathbb{R} \) 加权,且 \( f(0) = 1 \):

\( (1) \quad \boldsymbol{q}_m^\top \boldsymbol{k}_n \leadsto \boldsymbol{q}_m^\top \boldsymbol{k}_n f(p_m - p_n) \)

其中 \( p_m, p_n \in \mathbb{R} \)。例如,\( f \) 可以是高斯函数:\( f(x) = e^{-x^2} \),拉普拉斯函数:\( f(x) = e^{-|x|} \),或三角函数:\( f(x) = \cos(x) \)。

我们在以下命题中声称,任何归一化连续正定调制函数都可以通过从其自身的傅里叶变换分布中采样 RoPE 频率来无偏近似。

相似文章

RIG-RoPE: Relation- and Instance-Gated Rotary Positional Encoding with Duration-Aware Temporal Coordinates

arXiv cs.CL

This preliminary technical report proposes RIG-RoPE, a relation- and instance-gated rotary positional encoding with duration-aware temporal coordinates, aiming to address spatial interference and improper temporal scaling in multimodal LLMs. It introduces a gating mechanism for height/width rotations and duration-aware temporal coordinates, but leaves large-scale empirical validation to future work.

RoVE:面向相对位置依赖值路径的旋转值嵌入注意力机制

arXiv cs.LG

本文提出RoVE,一种无需参数的旋转位置嵌入改进方法,通过同时旋转值与键使值路径具备位置敏感性,将RoPE注意力转化为注意力卷积。在GPT-2模型上的实验表明,该机制在少样本上下文学习、分布外困惑度及长上下文检索方面持续提升性能。

RoPE在长上下文中既不能区分位置也不能区分标记,可证明

arXiv cs.CL

本文提供了理论证明,表明基于Transformer的语言模型中的旋转位置嵌入(RoPE)在长上下文中会失去其局部性偏差和区分标记顺序的能力,注意力分数变得不比随机更好。作者证明,增加RoPE基频会在位置区分和标记区分之间进行权衡,且多头、多层架构无法弥补这一基本限制。