用于分块视觉-语言-动作模型的时频几何交叉注意力
摘要
本文提出时频几何交叉注意力(TFGCA),这是一种即插即用模块,用于分块视觉-语言-动作模型,通过将分块分解为时频表示并捕捉几何关系来改进动作轨迹预测,从而在基准测试和真实机器人任务中实现显著性能提升。
arXiv:2609.09925v1 公告类型:新
摘要:现代的视觉-语言-动作(VLA)策略预测整个动作分块:在单次前向传播中发出一到两秒的协调运动。然而,动作分块本质上是一个短期多变量轨迹,但在这些模型中,它是由线性头解码的每个时间步长通用隐藏令牌序列。这忽略了两种运动结构。第一,频率:一个分块叠加了跨时间尺度的平滑全局趋势和精细纠正运动,而单个令牌将它们纠缠在一起。第二,跨相位几何:不同相位(到达、接触、抓握调整、稳定)的运动在表示空间中沿着非常不同、近乎正交的方向展开,但对于任务紧密相关,并跨越时间轴出现。点积注意力分数通过内积对齐,因此它偏好对齐的令牌,在接近正交性时最不敏感,将这些关系留给网络通过迂回恢复。
我们引入时频几何交叉注意力(TFGCA),这是一个修复两个盲点的即插即用模块。TFGCA使用每个维度可学习的平稳小波变换将动作分块分解为时频令牌,每个时间令牌通过一个交叉注意力从它们中检索信息,该交叉注意力通过可学习权重融合点积(相似性)和楔积幅度(对接近正交性敏感)。零初始化残差在初始化时重现基础行为,因此它可以被添加到预训练的VLA上并联合微调。与同一来源的基础模型相比,TFGCA在分布内LIBERO上平均提高+1.5,在分布外LIBERO-Plus上提高+6.3,在RoboTwin领域随机化下随机平均提高+28.5,在三个真实机器人AgiBot A2任务上的总体成功率提高+11.67个百分点,分布外增益更大。
查看缓存全文
缓存时间: 2026/09/11 08:42
# 时间-频率几何交叉注意力模块在分块视觉-语言-动作模型中的应用
来源:https://arxiv.org/html/2609.09925
###### 摘要
现代视觉-语言-动作 \(VLA\) 策略能预测一个完整的*动作块*:即通过一次前向传播生成一到两秒的协调运动。然而,一个动作块本质上是一个短暂的多元轨迹,在这些模型中,它被表示为一系列通用的按时间步隐藏的标记,并通过线性头部进行解码。这种表示方式倾向于未能充分利用运动的两种结构。其一是**频率**:一个动作块叠加了跨多个时间尺度的平滑全局趋势和精细修正运动,而单个标记会将它们纠缠在一起。其二是**跨相位几何关系**:在一个动作块内,不同相位(接触、抓取、调整、稳定)的运动沿着非常不同的方向展开——在表示空间中近乎正交,但对于任务却紧密相关,并且是跨越*时间轴*(相位之间)而非在同一时刻出现。点积注意力分数通过内积进行对齐,因此它偏好相似(对齐)的标记,而对正交性附近的情况最不敏感,这迫使网络需要通过迂回的方式来恢复这些跨相位关系。
我们提出了**时间-频率几何交叉注意力(TFGCA)**,这是一个即插即用的模块,用于修复这两个盲点。TFGCA 使用一个*逐维度的可学习平稳小波变换(SWT)*将动作块分解为时间-频率标记,然后每个时间标记通过一个交叉注意力从中检索信息,该注意力通过一个可学习的权重融合点积(相似性)和*楔积*幅值(对正交性敏感)。该模块使用零初始化残差,因此在初始化时能精确复制基础行为,可以附加到预训练的 VLA 上并与之联合微调。与同源基础模型相比,TFGCA 在分布内任务 LIBERO 上平均提升 +1.5,在分布外基准 LIBERO-Plus 上提升 +6.3,在 RoboTwin 域随机化下的随机平均成功率提升 +28.5,并将三个真实机器人 AgiBot A2 任务的整体成功率提升了 +11.67 个百分点——在分布外条件下增益更大。
## 1 引言
视觉-语言-动作模型已趋同于一种通用的输出接口:它们不是逐步预测单个动作,而是一次预测一个包含未来 \(T\) 个动作的*块*,并在重新规划前执行其中的某个前缀。基于流匹配和扩散的策略,如 \(\pi_{0}\)(Black 等人 2024(https://arxiv.org/html/2609.09925#bib.bib4))、\(\pi_{0.5}\)(Physical Intelligence 等人 2025(https://arxiv.org/html/2609.09925#bib.bib23))、RDT-1B(Liu 等人 2025(https://arxiv.org/html/2609.09925#bib.bib17))以及动作分块 Transformer ACT(Zhao 等人 2023(https://arxiv.org/html/2609.09925#bib.bib31))都在一次前向传播中承诺一个 \(T \times D\) 的轨迹,其中 \(T\) 是块的时间范围,\(D\) 是动作维度数。分块预测提高了时间一致性,使策略能够规划短期的协调运动,而不是逐步反应。
因此,动作块是一个*结构化对象*:一个短暂的多元轨迹,其价值在于其维度如何随时间协同运动。然而,当前的 VLA 将其视为非结构化数据。离开 Transformer 的动作标记是通用的隐藏向量,每个标记由一个线性头部映射到一个动作。轨迹模型应利用的运动的两个属性被隐含地忽略了。
#### 频率结构。
一个操控动作块叠加了多个时间尺度上的运动。一个缓慢的运输分量将末端执行器移动到工作区,而更快的分量则执行接触时间修正、抓取调整和稳定。当每个时间步都被打包进一个隐藏标记时,这些尺度被纠缠在一起,模型没有明确的处理方式来区分“趋势”与“修正”。
#### 跨相位几何关系。
熟练的操控在时间上展开为多个相位——接触、抓取、调整、稳定——这些相位在任务上相关,但在表示空间中可能沿非常不同的方向作用,极限情况下近乎正交。这种近乎正交的“分工”发生在哪里?我们对 RoboTwin 2.0 双臂数据的分析表明,它几乎不在同一时刻出现,而是沿*时间轴*顺序展开——轨迹在有序的相位中相继占据一组近乎正交的子空间,我们称之为**时间正交分工(TO-DoL)**(指标和稳健性见附录 H)。然而,点积注意力仅测量*对齐程度*,在正交性附近最不敏感,因此必须花费额外容量将此类跨相位关系重新编码为相似性。这催生了一个归纳假设:赋予注意力一个对近乎正交分量敏感的额外评分通道(楔积),可能使每个时间标记更直接地从整个块的时间-频率证据中检索此类*跨相位*关系(第4节(https://arxiv.org/html/2609.09925#S4))。
频率结构和几何注意力在时间序列预测中有先例(例如,将小波变换与几何注意力相结合的紧凑预测器)。VLA 的情境则有本质不同:动作块是在*真实控制自由度*上的短时、非周期轨迹,并且任何添加的模块都搭载在预训练的、数十亿参数的骨干网络上,其初始权重不应被扰动。因此,我们设计了一个专为 VLA 动作预测构建的时间-频率几何注意力模块 TFGCA;其设计部分和贡献如下。
#### 贡献。
我们引入了 TFGCA,这是一个用于 VLA 动作预测的时间-频率几何交叉注意力模块,它为分块策略提供了它们先前忽略的两种运动结构:多尺度频率内容,以及块内沿近乎正交方向分布的跨相位几何关系。它的两个核心部分如下(完整方法见第4节(https://arxiv.org/html/2609.09925#S4))。
- • \(C1\)(频率):逐控制维度动作空间小波标记化。我们隐藏的动作标记投影到动作空间,并应用一个*逐维度可学习*的平稳小波变换(SWT),将每个控制维度的轨迹转换为保持长度、多分辨率的频率标记——提供了基础 VLA 所忽略的多尺度频率结构。
- • \(C2\)(几何):一个时间到时间-频率的几何交叉注意力。每个时间标记通过点积(相似性)和楔积的*可学习*混合,从整个块的时间-频率标记中检索信息。命题1(https://arxiv.org/html/2609.09925#Thmproposition1)表明楔积对表示空间中的正交方向敏感,并能实现仅靠点积通道无法实现的排序;由此我们提出了一个*几何敏感的归纳假设*——块内跨相位、跨时间尺度的相关性通常落在点积不敏感的正交方向上,楔积通道可以为其提供直接的评分——其实际任务收益在第5节(https://arxiv.org/html/2609.09925#S5)中得到了实证回答。
请参见标题图 1:TFGCA 架构:一个位于 VLA Transformer 输出和动作头部之间的即插即用模块。频率分支(动作空间投影→逐维度 SWT→频率标记)为几何交叉注意力提供键/值,而查询是时间标记;其输出通过残差写回,并通过动作头部以生成速度 \(v_{\theta}\)。(蓝色:数据张量;琥珀色:新模块;灰色:骨干网络。)
## 2 相关工作
#### 视觉-语言-动作模型与动作分块。
VLA 通过适配大规模预训练的视觉-语言骨干网络,将指令和观测映射到机器人动作。离散标记方法如 RT-2(Brohan 等人 2023(https://arxiv.org/html/2609.09925#bib.bib7))和 OpenVLA(Kim 等人 2024(https://arxiv.org/html/2609.09925#bib.bib14))自回归地预测动作标记,而 Octo(Octo Model Team 2024(https://arxiv.org/html/2609.09925#bib.bib21))、扩散策略(Chi 等人 2023(https://arxiv.org/html/2609.09925#bib.bib10))、\(\pi_{0}\)(Black 等人 2024(https://arxiv.org/html/2609.09925#bib.bib4))、\(\pi_{0.5}\)(Physical Intelligence 等人 2025(https://arxiv.org/html/2609.09925#bib.bib23))和 RDT-1B(Liu 等人 2025(https://arxiv.org/html/2609.09925#bib.bib17))使用扩散或流匹配(Lipman 等人 2023(https://arxiv.org/html/2609.09925#bib.bib15))预测连续动作块。动作分块最初用于 ACT(Zhao 等人 2023(https://arxiv.org/html/2609.09925#bib.bib31))的模仿学习,它预测一个未来的动作块并执行前缀,提高了时间连贯性,通常通过跨重叠块的时间集成来减少不连续性。TFGCA 在此分块预测接口内运行:它是位于骨干网络和动作头部之间的一种块表示,与块的监督方式(流匹配、扩散或回归)正交。
#### 用于序列和动作的频域方法。
频域归纳偏差在预测中已被充分研究:Autoformer(Wu 等人 2021(https://arxiv.org/html/2609.09925#bib.bib25))和 FEDformer(Zhou 等人 2022(https://arxiv.org/html/2609.09925#bib.bib33))引入了季节-趋势分解和傅里叶注意力,FreTS(Yi 等人 2023(https://arxiv.org/html/2609.09925#bib.bib26))在频域中学习,SimpleTM(Chen 等人 2025a(https://arxiv.org/html/2609.09925#bib.bib8))将平稳小波变换与几何注意力相结合。在 VLA 内部,FAST(Pertsch 等人 2025(https://arxiv.org/html/2609.09925#bib.bib22))对动作块应用 DCT,为自回归策略生成紧凑的离散标记,使用频率进行*标记化和压缩*。我们的用法不同:我们将频率视为一种多分辨率、时间局部化的*特征*,供注意力参考,应用于连续的流匹配策略;平稳(不进行下采样)的小波保持了序列长度,因此每个频带与原始时间步保持对齐,并可直接作为注意力的键。
#### 注意力中的几何结构。
几何代数网络(如几何代数 Transformer(Brehmer 等人 2023(https://arxiv.org/html/2609.09925#bib.bib6));Clifford 神经层(Brandstetter 等人 2023(https://arxiv.org/html/2609.09925#bib.bib5)))将数据表示为多重向量,并对其进行等变操作。我们只借用一个标量——楔积幅值——并将其与内积一起用作注意力分数,使模块保持轻量,无需多重向量处理,同时捕捉了我们需要的属性:对正交性的敏感性。与 iTransformer(Liu 等人 2024(https://arxiv.org/html/2609.09925#bib.bib18))不同,后者将变量(维度)视为注意力标记,我们的频率标记在每个时间-频带位置联合编码多维动作,交叉注意力沿时间-频率进行检索,而不是在维度之间进行注意力。
## 3 预备知识
#### VLA 动作预测作为轨迹预测。
我们基于一个流匹配 VLA(\(\pi_{0.5}\))构建。给定观测(图像和语言指令)以及本体感觉状态,策略预测一个动作块 \(a \in \mathbb{R}^{T \times D}\),其中 \(T\) 是块的时间范围,\(D\) 是动作维度数。流匹配训练一个速度场:采样噪声 \(\epsilon\) 和时间 \(\tau \in [0,1]\),形成插值 \(x_{\tau} = \tau \epsilon + (1-\tau) a\),并回归网络输出 \(v_{\theta}(x_{\tau}, \cdot)\) 使其趋向目标速度 \(u = \epsilon - a\),损失函数为
\[\mathcal{L}_{\mathrm{FM}} = \mathbb{E}_{\tau, \epsilon} \left\lVert v_{\theta}(x_{\tau}, \cdot) - (\epsilon - a) \right\rVert^{2}. \tag{1}\]
骨干网络是一个解码器 Transformer,它联合处理多模态前缀(图像和语言标记)和动作后缀;最后 \(T\) 个后缀位置产生隐藏动作标记 \(H \in \mathbb{R}^{T \times d}\)(其中 \(d\) 是模型宽度),一个线性动作头部将其映射到 \(v_{\theta}\)。TFGCA 是一个转换 \(H \mapsto \tilde{H}\),插入在此头部之前,在训练和推理中的每个去噪步骤中都以相同方式应用。
#### 点积注意力偏好相似性。
对于查询 \(Q\) 和键 \(K\),分割为维度 \(d_h\) 的头,注意力权重来自 \(q_i^\top k_j / d_h\),当 \(q_i\) 和 \(k_j\) 对齐时最大,正交时消失,因此*在给定表示中*两个正交的标记只获得很小的直接分数。深度网络当然可以重新学习特征,将正交关系重新编码为对齐状态,并通过相似性通道进行路由(这就是为什么现有的点积策略有效);但这消耗了表示容量,而一个显式的正交敏感信号消除了这种迂回(在命题1(https://arxiv.org/html/2609.09925#Thmproposition1)的范围注释中有形式化说明)。
#### 楔积衡量正交性。
楔积幅值是向量 \(q, k\) 张成的平行四边形的面积,通过柯西-施瓦茨恒等式有一个闭式解(不需要反对称张量构造):
\[\lVert q \wedge k \rVert^{2} = \lVert q \rVert^{2} \lVert k \rVert^{2} - (q^\top k)^{2}. \tag{2}\]
它在几何上与内积互补:当 \(q \parallel k\) 时为零,当 \(q \perp k\) 时(在固定范数下)最大。同时使用两种分数使注意力能够同时获得*对齐度*和*正交性*。
## 4 方法
TFGCA 将隐藏动作标记 \(H \in \mathbb{R}^{T \times d}\) 转换为精炼的标记 \(\tilde{H} \in \mathbb{R}^{T \times d}\),分为三个阶段(整体结构见图1(https://arxiv.org/html/2609.09925#S1.F1)):投影到逐维度控制空间(第4.1节(https://arxiv.org/html/2609.09925#S4.SS1))、逐维度小波标记化(第4.2节(https://arxiv.org/html/2609.09925#S4.SS2))、以及融合两者的几何交叉注意力(第4.3节(https://arxiv.org/html/2609.09925#S4.SS3))。第4.4节(https://arxiv.org/html/2609.09925#S4.SS4)涵盖了使模块能安全附加到预训练策略的初始化恒等结构,第4.5节(https://arxiv.org/html/2609.09925#S4.SS5)介绍了楔积的理论性质和机制解释。
### 4.1 动作空间投影
Transformer 的动作标记存在于一个抽象的 \(d\) 维空间中,没有明确的逐控制维度意义,而我们想要建模的结构——每个动作维度的频率内容及其协调性——是根据策略实际输出的动作坐标定义的。因此,我们首先将每个标记投影到一个*逐维度的控制空间视图*,
\[Z^{\mathrm{act}} = \mathrm{ActionProj}(H) \in \mathbb{R}^{T \times D}, \tag{3}\]
使用一个专用的线性映射。\(D\) 个输出通道的物理含义取决于具体执行器的动作参数化:在 RoboTwin 2.0 和 AgiBot A2 中,它们对应于关节空间动作;在 LIBERO 中,7 个通道对应于笛卡尔末端执行器增量(3 个平移,3 个旋转,1 个抓取状态)。这个投影是必要的,因为骨干网络的隐藏维度 \(d\) 编码了所有模态信息,而频率分析需要每个控制通道清晰、独立的表示。相似文章
TBD-VLA: 时序块扩散视觉语言动作模型
TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。
N_0-VTLA:利用潜在触觉标记扩展视觉-触觉-语言-动作模型
介绍了N_0-VTLA,一种面向高接触操作的视觉-触觉-语言-动作基础模型,具备大规模触觉预训练和基于优势的离线策略改进功能,在真实机器人和仿真基准测试中表现优异。
StreamPI: 视觉-语言-动作模型的流式多模态时序建模
StreamPI 引入了一个流式多模态时序建模框架,用于视觉-语言-动作模型,通过指令锚定注意力和随机间隔训练来改进机器人操作,无需额外参数。
TANGO:基于全身视觉-语言-动作模型的人形机器人在杂乱环境中的导航
TANGO 是一个视觉-语言-动作框架,用于人形机器人在杂乱环境中导航,使用模拟训练数据,展示了最先进的性能和零样本真实世界部署。
V2TATC:一个用于空中交通管制员情境感知的联合语音-轨迹嵌入框架与数据集
本文介绍了V2TATC,一个用于空中交通管制员情境感知的联合语音-轨迹嵌入框架,并引入了一个用于拥挤空域跨模态检索实验的新型数据集。