稀缺神经数据的尺度感知注意力:基于Sleep-EDF EEG的RG-Flow Transformer

arXiv cs.LG 论文

摘要

本文介绍了RG-Flow Transformer,这是一种具有重正化群归纳偏置的模型,用于分析稀缺的脑电图数据。它在Sleep-EDF数据集上的睡眠分期任务中与普通Transformer进行对比,发现没有准确率优势,但通过恢复谱指数展示了更好的可解释性。

arXiv:2607.11950v1 公告类型:新 摘要:脑场电位是无尺度的:其功率谱遵循$1/f^{\beta}$律,非周期指数$\beta$追踪皮层状态,特别是睡眠深度表现为$\beta$的偏移。我们探究一个具有显式重正化群(RG)归纳偏置的Transformer——RG-Flow Transformer,它将普通自注意力与一个尺度感知流相结合,包含可学习反常维度$\gamma$、块自旋粗粒化和熵门控同步桥——在\emph{真实的、稀缺的}脑电图数据上是否优于参数匹配的普通Transformer。使用PhysioNet Sleep-EDF语料库,采用严格的无泄漏按受试者留出法,我们(i)在五类AASM睡眠分期上将RG-Flow与参数匹配的普通Transformer和仅层次消融模型进行基准测试,(ii)扫描每个受试者的数据预算以寻找数据稀缺时预期的归纳偏置交叉点,(iii)测试RG-Flow学习到的$\gamma$是否在样本外追踪测量到的谱指数$\beta$——这是普通模型所不具备的量。在留一受试者交叉验证下,跨越5名受试者和5个种子,RG-Flow和普通Transformer在五类分期上统计上无显著差异(准确率77.3\% vs 77.0\%;配对$p=0.294$),预期的稀缺数据交叉点并未出现:普通Transformer在每个数据有限预算下数值上领先。真正区分模型的是可解释性——RG-Flow在样本外恢复了连续谱指数($\beta$恢复$R^2 = 0.416$),这是普通架构所没有的能力。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:16

# 面向稀缺神经数据的尺度感知注意力:基于睡眠-EDF脑电图的RG-流变换器
来源:https://arxiv.org/html/2607.11950

###### 摘要

脑场电位是**无标度的**:其功率谱遵循\\(1/f^{\\beta}\\) 定律,其中的非周期性指数 \\(\\beta\\) 追踪皮层状态,尤其睡眠深度体现为 \\(\\beta\\) 的移动。我们研究一个赋予显式重正化群(RG)归纳偏置的变换器——**RG‑Flow Transformer**,它通过一个可学习的反常维度 \\(\\gamma\\)、块自旋粗粒化以及一个熵门控同步桥,将普通自注意力与一个尺度感知流耦合——在处理**真实、稀缺的**脑电图数据时,是否比参数匹配的普通变换器更具优势。利用 PhysioNet Sleep‑EDF 语料库,采用严格的按受试者划分的无泄漏留出法,我们 (i) 将 RG‑Flow 与参数匹配的普通变换器及仅含层次结构的消融模型在 5 类 AASM 睡眠分期上进行基准测试,(ii) 扫描每个受试者的数据量预算,寻找数据稀缺时预期的归纳偏置交叉点,以及 (iii) 测试 RG‑Flow 学习到的 \\(\\gamma\\) 是否能在样本外追踪测量的谱指数 \\(\\beta\\) ——而普通模型不具有这一量。在留一受试者交叉验证下,跨越 55 名受试者和 5 个随机种子,RG‑Flow 与普通变换器在 5 类分期上统计上无显著差异(准确率 77.3% 对比 77.0%;配对检验 \\(p=0.294\\)),并且预期的稀缺数据交叉点没有出现:在每一个数据受限的预算下,普通变换器在数值上均领先。区分两个模型的是可解释性——RG‑Flow 能够在样本外恢复连续的谱指数(\\(\\beta\\) 恢复 \\(R^2=0.416\\)),而普通架构没有与之对应的能力。

## I. 引言

皮层动力学是**无标度的**。脑电图、脑磁图、局部场电位以及皮层电图的所有功率谱都在宽频带上遵循非周期的 \\(1/f^{\\beta}\\) 定律 [5](https://arxiv.org/html/2607.11950#bib.bib1),并且这个非周期性指数 \\(\\beta\\) 并非无关紧要:它追踪兴奋-抑制平衡、觉醒、麻醉,以及最清晰地追踪睡眠深度 [9](https://arxiv.org/html/2607.11950#bib.bib2), [3](https://arxiv.org/html/2607.11950#bib.bib3)。更深的非快速眼动(NREM)睡眠产生更陡峭的谱(更大的 \\(\\beta\\)),因此睡眠阶段标签在物理上是一个关于谱标度指数的粗粒度标签。与 \\(1/f\\) 谱一起,皮层还表现出接近临界点运作的其他标志——具有幂律大小和持续时间分布的神经元雪崩 [1](https://arxiv.org/html/2607.11950#bib.bib4) 以及接近单位的分支比 [13](https://arxiv.org/html/2607.11950#bib.bib5)——这正是尺度不变性是数据的真实属性而非强加先验的情形。

这使得神经数据成为一个异常有原则的测试平台,用于检验其归纳偏置**就是**尺度不变性的模型。重正化群(RG)是物理学用于关联跨尺度系统描述的理论框架 [6](https://arxiv.org/html/2607.11950#bib.bib9), [14](https://arxiv.org/html/2607.11950#bib.bib10),它与深度学习之间存在着日益增长的对应关系 [12](https://arxiv.org/html/2607.11950#bib.bib11), [10](https://arxiv.org/html/2607.11950#bib.bib12), [8](https://arxiv.org/html/2607.11950#bib.bib13), [11](https://arxiv.org/html/2607.11950#bib.bib14)。RG‑Flow Transformer 将这种对应关系付诸实践:它并行运行普通的关联自注意力与一个由可学习的反常维度 \\(\\gamma\\) 控制的尺度感知流,通过块自旋池化对其表示进行粗粒化,并使用熵阈值对两个流进行门控。

期望归纳偏置优势的第二个、更实用的原因是:神经数据是**稀缺的**。单个夜晚、单个会话、单个受试者的标注数据有限,而正确的先验恰恰在数据太少以至于灵活模型无法自行发现结构时才能发挥作用。一项关于丰富合成数据的伴随研究发现 RG‑Flow 相对于参数匹配的普通变换器没有精度优势;稀缺性正是本研究旨在探索的情景。

因此,我们在真实的 PhysioNet Sleep‑EDF 语料库上,采用严格的按受试者划分的无泄漏留出法,做出三项贡献:

1. 1. 对 RG‑Flow 与普通变换器及仅含层次结构的消融模型在 5 类 AASM 睡眠分期上进行参数匹配的基准测试;
2. 2. 进行每个受试者数据量预算的扫描,以寻找数据稀缺时预期的交叉点;
3. 3. 测试 RG‑Flow 学习到的 \\(\\gamma\\) 是否能在样本外追踪测量的非周期性指数 \\(\\beta\\) ——这是一个可解释的、有物理基础的量,而普通模型没有与之对应的量。

分析协议是固定且完全确定性的,因此本报告的低效能研究可以在不改变周围论证的情况下被更大规模的试验所取代。

## II. 理论框架

### II.1 作为场的无标度大脑

我们将原始脑电图时段映射到一个微观场构型 \\(\\phi(t)\\),该构型定义在最短可分辨晶格间距(采样间隔)上。遵循统计力学形式,这些构型的底层分布由类似于配分函数的有效数据生成分布所支配:

\\[
P(\\phi)=\\frac{1}{Z}\\, e^{-\\mathcal{H}\_{0}[\\phi]},\\qquad Z=\\int \\mathcal{D}\\phi\\, e^{-\\mathcal{H}\_{0}[\\phi]},
\\tag{1}
\\]

其中 \\(\\mathcal{H}\_{0}[\\phi]\\) 是一个有效微观哈密顿量,其耦合常数决定了短程相互作用。高频涨落扮演着大动量下紫外(UV)模的角色;低频结构则扮演着红外(IR)稳定态的角色。这种类比对于皮层数据而言异常合理:脑电图功率谱是无标度的,遵循非周期的 \\(1/f^{\\beta}\\) 定律 [5](https://arxiv.org/html/2607.11950#bib.bib1),并且皮层处于临界点附近,具有幂律神经元雪崩 [1](https://arxiv.org/html/2607.11950#bib.bib4) 和接近单位的分支比 [13](https://arxiv.org/html/2607.11950#bib.bib5)。因此,尺度不变性是数据的一个属性,而非强加的先验——这正是 RG 激励模型旨在利用的特性。

### II.2 潜在卡丹诺夫块自旋变换

为了跨观察尺度移动,神经表示必须系统地整合掉直到缩放因子 \\(s\\) 的短程涨落。设 \\(\\Lambda\\) 为对应于最高分辨频率的紫外截止。卡丹诺夫块自旋变换通过对 \\(k>\\Lambda'\\)(其中 \\(\\Lambda' < \\Lambda\\))的模式进行积分来粗粒化场:

\\[
P_{\\text{macro}}(\\Phi)=\\int \\mathcal{D}\\phi\\, T[\\Phi,\\phi]\\, P_{\\text{micro}}(\\phi).
\\tag{2}
\\]

在我们的架构中实现的离散潜在映射为:

\\[
\\Phi\_{T}=\\sigma\\!\\left(\\mathbf{W}\_{\\text{macro}} \\sum\_{t\\in\\text{block}}\\big(V\_{t}\\cdot\\mathbf{W}\_{\\text{dis}}\\,\\phi\_{t}\\big)\\right),
\\tag{3}
\\]

其中 \\(\\mathbf{W}\_{\\text{dis}}\\) 是一个可学习的解纠缠矩阵,用于在空间投影之前正交化紫外噪声,\\(V\_{t}\\) 是步骤 \\(t\\) 的尺度权重。由于深度 NREM 睡眠使 \\(1/f^{\\beta}\\) 谱变陡,块粗粒化正好抑制了那些相对权重区分睡眠阶段的高频模式——这正是标签所依赖的操作。

### II.3 卡伦-西曼奇克不变性条件

该架构的一个核心前提是,一个真正的结构机制应当在观察尺度参数 \\(\\mu\\) 的调整下保持不变。这由关于 \\(n\\) 点潜在关联函数 \\(G^{(n)}\\) 的卡伦-西曼奇克(CS)方程表示:

\\[
\\left[\\mu\\frac{\\partial}{\\partial\\mu}+\\beta(g)\\frac{\\partial}{\\partial g}+n\\,\\gamma(g)\\right] G^{(n)}(p\_{i};\\mu,g)=0.
\\tag{4}
\\]

我们并没有将该方程作为硬性不变性来实施;相反,我们将其用作两个软性、可微分机制的动机(第二个机制对损失贡献一个**卡伦-西曼奇克漂移惩罚**,而不是对前向传递施加约束):

1. **贝塔函数代理 \\(\\beta(g)\\)**。在可重正化场论中,贝塔函数 \\(\\beta(g)\\equiv \\mu\\,\\partial g/\\partial\\mu\\) 控制着耦合随尺度的流动,其零点即为重正化群不动点 [14](https://arxiv.org/html/2607.11950#bib.bib10)。我们**不**声称计算了这个对象。我们使用一个有界的逻辑斯蒂代理 \\(\\beta\_{\\mathrm{s}}(g)=g(1-g)\\),作用于 sigmoid 归一化的注意力耦合 \\(g\\in(0,1)\\);它共享了我们所利用的两个定性性质——在 \\(g=0\\)(无关/解耦)和 \\(g=1\\)(边缘/保留)处的不动点,以及它们之间的单一相关最大值——并定义了一个可微分的相关滤波器 \\(R(g)=1-|\\beta\_{\\mathrm{s}}(g)|\\),该滤波器会衰减远离不动点的耦合。这是一种受 RG 启发的归纳偏置,而非 RG 流的数值解。
2. **反常维度参数 \\(\\gamma\\)**。与场论中的反常维度类比,后者设定了场在粗粒化下获得的标度修正,我们为每个注意力头引入一个可学习的标量 \\(\\gamma\\),它根据尺度计划 \\(\\mu\_\\ell\\) 通过 \\(\\mu^{-\\gamma}\\) 重新加权注意力分数。它是一个可训练的尺度敏感性参数,其动机来自——但不等同于——\\(\\gamma(g)\\)。

我们强调这些组成部分的认识论地位。在特定情况下,深度网络中的粗粒化与重正化群之间的映射具有严格的基础——变分 RG 与受限玻尔兹曼机之间的精确对应 [12](https://arxiv.org/html/2607.11950#bib.bib11)、由神经网络学习的信息论实空间 RG [8](https://arxiv.org/html/2607.11950#bib.bib13)、归一化流 RG [10](https://arxiv.org/html/2607.11950#bib.bib12),以及使“廉价”深度学习有效的层次结构 [11](https://arxiv.org/html/2607.11950#bib.bib14)。我们的架构将相同的直觉实现为一组软性、可微分的偏置(有界耦合流、尺度加权注意力、熵门控同步以及卡伦-西曼奇克漂移惩罚),而非精确的 RG 变换。这些偏置是否对真实神经数据有帮助,是本文所要探究的经验性问题。

### II.4 为什么睡眠脑电图与偏置匹配

皮层功率谱的非周期性指数 \\(\\beta\\) 是一个真正的标度指数,而睡眠深度会影响它:深度 NREM 睡眠具有最陡峭的 \\(1/f^{\\beta}\\) 谱(第 III 节)。由此产生两个后果。首先,5 类睡眠分期标签部分地是 \\(\\beta\\) 的一个粗粒度读出,因此显式表示尺度的模型有真实的内容需要表示。其次,\\(\\beta\\) 为模型学习到的尺度敏感性参数 \\(\\gamma\\) 提供了一个外部的、物理上有意义的参照:如果 RG 偏置如其所声称的那样工作,学习到的 \\(\\gamma\\) 应该携带关于测量所得 \\(\\beta\\) 的信息。普通变换器没有可比的内部量,因此这个可解释性测试对于 RG‑Flow 是独一无二的——并且无论其是否提高精度,都会在第 V 节中报告。

## III. 方法

### III.1 数据:Sleep‑EDF

我们使用 PhysioNet Sleep‑EDF 扩展语料库(睡眠卡带研究)[7](https://arxiv.org/html/2607.11950#bib.bib7), [4](https://arxiv.org/html/2607.11950#bib.bib8),包含整夜多导睡眠图与专家睡眠分期注释。本稿使用 55 名受试者(第 1 晚)。从每个记录中,我们以 100 Hz 采样率选取两个脑电图导联(Fpz–Cz 和 Pz–Oz),带通滤波至 0.3–35 Hz,裁剪至注释的睡眠周期(醒来前后各 ±30 分钟)以去除长时间的开灯填充,并分成长度为 30 秒、与睡眠分期图对齐的时段。AASM 分期映射为五个类别(W、N1、N2、N3(将 S3 和 S4 合并)、REM);我们还额外定义了一个简单的两类划分:高 \\(\\beta\\)(深度 NREM,N2/N3)与低 \\(\\beta\\),以反映谱深度轴。每个时段携带其受试者标识符,以便进行无泄漏分组。

### III.2 谱指数 \\(\\beta\\)

对于每个时段,我们使用 **specparam**(FOOOF)谱参数化模型在固定膝点自由模式下,从 Fpz–Cz 通道的 Welch 功率谱密度估计非周期性指数 \\(\\beta\\),频率范围为 1–35 Hz [2](https://arxiv.org/html/2607.11950#bib.bib6)。拟合优度 \\(R^2 < 0.90\\) 的时段被排除在回归目标之外;97% 的时段通过了此筛选。所得 \\(\\beta\\) 随睡眠深度单调增加——中位 \\(\\beta\\) 从 1.58(N1)和 1.67(清醒)经过 1.84(REM)上升到 2.43(N2)和 3.17(N3)——确认了它是一个真实的、与标签关联的标度指数(图 2):深度 NREM 谱明显比浅睡眠阶段更陡峭,这正是粗粒度两类划分所针对的谱深度轴。它既作为连续回归目标,也作为学习到的 \\(\\gamma\\) 的参照。

### III.3 双尺度块架构

RG‑Flow 引擎由多个**双尺度块**堆叠而成。尺度度量 \\(\\mu\_\\ell\\) 随块深度 \\(\\ell\\) 呈指数增长(\\(\\mu\_\\ell = \\mu\_0 \\rho^\\ell\\))。在每个块内部,输入表示 \\(\\mathbf{X}\_{\\ell-1}\\) 由两个并行流同时处理(图 1)。

| 输入隐藏状态:\\(\\mathbf{X}\_{\\ell-1}\\) |
|---|
| **系统 1:关联(水平注意力)** | **系统 2:RG 流(垂直注意力)** |
| 标准多头注意力(MHA) | 尺度感知注意力(SAA)头(\\(\\mu\_\\ell^{-\\gamma}\\)) |
| 上下文权重分布 | 贝塔函数滤波器 \\(\\beta(\\mathbf{g}) \\to 0\\) |
| **拓扑同步桥(TSB)** |
| 使用系统 2 吸引子钳制系统 1 漂移(若 \\(H > \\tau\\)) |
| **层归一化(LN)** |
| **前馈网络(GELU)** |
| **输出隐藏状态:\\(\\mathbf{X}\_{\\ell}\\)** |

**图 1:双尺度块。** 系统 1 通过标准多头注意力处理快速上下文处理;系统 2 是一个尺度感知流,其中注意力分数由 \\(\\mu\_\\ell^{-\\gamma}\\) 重新加权,并由有界耦合流过滤。当系统 1 的注意力熵超过阈值 \\(\\tau\\) 时,拓扑同步桥融合两个流,防止高频漂移在深层积累。

**系统 1(关联注意力)** 通过多头注意力(MHA)计算标准上下文权重。

**系统 2(尺度感知 RG 流)** 通过观察尺度 \\(\\mu\_\\ell\\) 的可学习反常维度 \\(\\gamma\\) 次方来惩罚查询-键点积:

\\[
\\mathbf{S} = \\frac{\\mathbf{Q}\\mathbf{K}^{\\!\\top}}{\\sqrt{d\_k} \\cdot \\mu\_\\ell^{\\gamma}},
\\tag{5}
\\]

并且一个相关滤波器 \\(\\mathbf{R} = 1 - |\\beta(\\mathbf{g})|\\) 作为软噪声门控。两个流通过拓扑同步桥合并,该桥计算系统 1 注意力分布的香农熵 \\(H\\),当 \\(H > \\tau\\) 时,将系统 2 的稳定宏观吸引子注入回该流。训练使用一个复合目标函数,平衡交叉熵、\\(\\beta\\) 回归均方误差以及多尺度卡伦-西曼奇克漂移惩罚:

\\[
\\mathcal{L}\_{\\text{Total}} = \\mathcal{L}\_{\\text{CE}} + w\_{\\text{reg}} \\mathcal{L}\_{\\beta} + w\_{\\text{CS}} \\mathcal{L}\_{\\text{CS}}.
\\tag{6}
\\]

相似文章

使用稀疏Transformer进行生成建模

OpenAI Blog

OpenAI推出了稀疏Transformer,一种深度神经网络,将注意力机制的复杂度从O(N²)优化到O(N√N),使得能够对长度超过以前30倍的序列进行建模,适用于文本、图像和音频领域。该模型采用稀疏注意力模式和基于检查点的内存优化技术,可以训练深达128层的网络,在多个领域实现了最先进的性能。

面向边缘计算流量智能的时空图Transformer

arXiv cs.LG

本文提出了一种用于边缘计算中流量预测的时空图Transformer框架,结合图神经网络捕捉空间相关性,以及Transformer自注意力捕捉长程时间依赖。在真实蜂窝数据上的实验表明,它优于基于循环图的基线模型,如GCN-LSTM和GCN-GRU。