Align-RAG:对齐是TSFM上下文学习的全部

arXiv cs.LG 论文

摘要

Align-RAG 引入了一种无需训练的闭式对齐方法,用于在冻结的时间序列基础模型上进行检索增强预测,在标准基准测试中超越了学习型融合适配器,且无需任何学习参数。

arXiv:2608.05571v1 公告类型:新 摘要:检索增强的预测有望在不进行微调的情况下将冻结的时间序列基础模型(TSFMs)适应到新领域,但近期方法通常依赖学习到的融合模块,即经过训练的适配器,将检索到的样例合并到骨干模型的预测中,其假设是冻结的骨干模型无法自行动态整合检索到的上下文。我们证明这一假设是不必要的。我们提出了 Align-RAG,一种无需训练的方法,它在检索到的过去-未来窗口进入冻结骨干模型的上下文之前,对其应用闭式(closed-form)的逐对幅度重缩放和整数滞后相移。在没有学习参数的情况下,Align-RAG 在标准基准的全部七个数据集上,超越了冻结的 Chronos-Bolt 上最先进的经过训练的检索适配器(平均 -3.75% 的 MSE),表明先前归因于学习融合的收益在无需任何训练的情况下即可获得。Align-RAG 还在另外四个具有不同架构的冻结 TSFM 上进一步提升了零样本 MSE,每个骨干模型提升 2.5% 到 13.7%,且无需针对每个骨干模型进行调参。为了探究对齐为何有帮助,我们将冻结骨干模型在对齐演示下的预测偏移与同一配对上的闭式岭回归预测偏移进行了比较。我们发现,对齐演示引起的预测偏移与同一配对上的闭式岭回归预测器的轨迹一致,而未来洗牌对照实验排除了未来平均的解释。总之,这些结果表明,冻结的 TSFM 已经支持检索内容的动态上下文使用,并且闭式对齐应成为训练任何融合模块之前检索增强预测的默认基线。代码可在以下网址获取:https://github.com/masadi-99/align-rag
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:51

# Align-RAG:对齐是TSFM上下文学习所需的一切

来源:https://arxiv.org/html/2608.05571
Mohammad Asadi¹, Soheil Hor², Bardiya Akhbari², Jack W. O’Sullivan¹, Tahoura Nedaee¹, Layne C. Price², Raviteja Anantha², Euan Ashley¹, Ehsan Adeli¹
¹斯坦福大学 ²亚马逊
[email protected]

###### 摘要

检索增强预测有望使冻结的时间序列基础模型(TSFM)无需微调即可适应新领域,但近期方法通常依赖学习得到的融合模块,即训练适配器将检索到的示例合并到骨干网络的预测中,其假设是冻结的骨干网络无法自行动态整合检索到的上下文。我们证明这一假设是不必要的。我们提出 **Align-RAG**,一种无需训练的方法,在检索到的历史-未来窗口进入冻结骨干网络的上下文之前,对其应用闭式逐对幅度重缩放和整数滞后相位平移。在没有任何学习参数的情况下,Align-RAG 在冻结的 Chronos-Bolt 上,于标准基准的全部七个数据集上超越了最先进的训练检索适配器(平均 MSE 降低 3.75%),表明先前归因于学习融合的收益无需任何训练即可获得。Align-RAG 进一步在四个额外的冻结 TSFM(架构各异)上将零样本 MSE 提升 2.5% 至 13.7%,且无需逐骨干网络调参。为探究对齐为何有效,我们将冻结骨干网络在对齐示范下的预测偏移与同一数据对上的闭式岭回归预测偏移进行比较。我们发现对齐示范引发的预测偏移与同一数据对上的闭式岭回归预测器轨迹一致,而未来打乱对照排除了“未来平均”的解释。综上,这些结果表明冻结的 TSFM 已经支持对检索结果的动态上下文使用,而闭式对齐应成为训练任何融合模块之前检索增强预测的默认基线。代码见:https://github.com/masadi-99/align-rag

## 1 引言

请参阅图注

图 1:Align-RAG 概览。(1) 对每个查询历史 \(\mathbf{q}\),从参考语料库中检索 top-K 个历史-未来窗口。(2) 对每个数据对应用两种闭式、无需训练的变换,使每个检索到的历史与查询匹配,同时保持历史-未来对应关系。(3) 使用 MMR 多样化和分层 token 预算布局,将对齐后的数据对打包为上下文示范。(4) 对冻结的时间序列基础模型进行一次前向传播。不引入任何学习融合模块。(5) 最终预测结合模型的上下文输出与基于检索到的对齐未来构建的距离加权先验。

时间序列预测支撑着能源管理、金融、医疗保健和气候科学等众多领域的决策制定。Chronos(Ansari 等,2024)、Chronos-2(Ansari 等,2025)、TimesFM(Das 等,2024)、Moirai(Woo 等,2024)和 Toto(Cohen 等,2024)等时间序列基础模型(TSFM)通过在异构语料库上学习共享的时间表示,建立了零样本预测范式。一旦预训练完成,冻结的 TSFM 无需进一步训练即可应用于未见过的序列,但其在目标分布上的准确性取决于预训练语料库所暴露的内容。

检索增强生成(Lewis 等,2020)通过推理时提供相关上下文,解决了大语言模型类似的问题。时间序列对应的做法是从参考集中检索历史-未来窗口,其动态特性与查询相似,并将其作为额外上下文提供给模型。例如,医院部署冻结的 TSFM 可能检索相关 ICU 轨迹中的模式,能源运营商可能检索相似负荷状态下的消费窗口。如果做得好,这无需标注数据或逐领域微调即可实现动态适应。

近期针对冻结 TSFM 的检索增强预测已汇聚到一种设计模式:将骨干网络与一个学习融合模块配对,该模块在检索结果与模型表示之间进行中介。TS-RAG(NeurIPS 2025)(Ning 等,2025)——据我们所知,是目前时间序列基础模型检索增强预测的最先进方法——明确阐述了这一立场,声称预训练的 TSFM“缺乏领域适应的内在机制,因为它们无法动态地纳入外部上下文知识”,并训练了一个自适应检索混合器(Adaptive Retrieval Mixer)来将编码后的检索结果与骨干网络融合。TimeRAF(Zhang 等,2025)训练端到端检索器和通道提示模块;RATD(Liu 等,2024)在扩散去噪器内部训练参考调制注意力模块;RAFT(Han 等,2025)在检索模式之上训练投影和预测头;TimesFM-ICF(Fa 等,2025)重新预训练基础模型本身以消费上下文检索示例。其基本假设是统一的:需要学习得到的临时组件才能使冻结的 TSFM 从检索上下文中受益。我们对这一假设提出质疑。

我们提出 Align-RAG,一种无需训练的检索增强预测方法,通过在检索到的历史-未来窗口进入骨干网络上下文之前将其在幅度和相位上与查询对齐,来扩展冻结的 TSFM。给定查询窗口,Align-RAG 从参考集的(历史、未来)对中检索最近邻,并应用闭式逐对幅度重缩放和相位平移,使每个检索到的历史与查询匹配。随后将对齐后的数据对作为上下文示范提供给骨干网络,其参数保持不变。

在 TS-RAG 基准协议(ETTh1、ETTh2、ETTm1、ETTm2、Weather、Exchange、Electricity;输入长度 512,预测长度 64)下,Align-RAG 在冻结的 Chronos-Bolt 骨干网络上于 7/7 个数据集的 MSE 和 6/7 个数据集的 MAE 上均优于 TS-RAG,平均 MSE 降低 3.75%,且在 6 个小数据集比较中的 5 个上,通过配对移动块自助法验证增益显著。相同流程可迁移至四个额外的冻结 TSFM(Chronos-2、TimesFM-2.0、Moirai、Toto),每个骨干网络的零样本 MSE 提升 2.5% 至 13.7%,其中 Moirai 上的增益最大(平均 -13.7%,ETTm1 上单格达到 -30%,Weather 上 -20%),且无需任何逐骨干网络调参。该比较并非无足轻重:TS-RAG 的自适应检索混合器在从 Chronos 预训练语料库采样的 2600 万个上下文-预测对上训练(Ning 等,2025),而 Align-RAG 完全不引入学习参数。

一个 \(2\times2\) 消融实验隔离了增益来源。固定骨干网络和基准,交叉组合检索器(训练好的 TS-RAG 检索器 vs. 随机检索)与对齐(开 vs. 关)。在开启对齐的情况下,从训练检索器切换到随机检索器平均仅损失 0.84 个百分点 MSE,且在 7 个数据集中的 4 个上仍胜过训练好的 TS-RAG 混合器。无论使用哪种检索器,关闭对齐都会造成超过 20 个百分点的 MSE 损失。检索窗口的排序仅占主要增益的不到一个百分点;所检索窗口的对齐贡献了其余部分。

我们还探究了这一增益背后的机制。对每个测试窗口,我们计算冻结骨干网络预测偏移(由将零样本上下文替换为对齐示范所引发)与同一示范对上的闭式岭回归预测偏移之间的余弦相似度 \(\rho_{\mathrm{GD}}\)。在 Chronos-Bolt 上,\(\rho_{\mathrm{GD}}\) 从无对齐时的 0.30 上升到对齐后的 0.45,且配对移动块自助法在 7/7 个数据集上排除了零。作为因果对照,我们打乱检索对中的未来部分,同时保持历史部分和对齐不变。在 ETTm1 上,对齐带来的 4.2% MSE 降低在未来打乱后翻转为 12.2% MSE 增加,其方向与闭式岭回归在相同打乱对上的预测一致,从而排除了骨干网络仅平均检索未来而忽略历史-未来关系的解释。

#### 贡献。

- • **Align-RAG**,一种无需训练的检索增强预测方法,在检索到的历史-未来窗口进入冻结 TSFM 上下文之前,将其在幅度和相位上与查询对齐,无需修改骨干网络或训练任何新组件。
- • 在标准七数据集基准上,以冻结的 Chronos-Bolt 为骨干网络,与训练好的 TS-RAG 混合器进行对比评估(第 4.2 节),并跨四个额外的冻结 TSFM 进行评估(第 4.4 节)。
- • 行为机制分析(第 5 节):在我们的闭式对齐下,冻结骨干网络的预测偏移与同一示范上的闭式岭回归预测偏移轨迹一致,且未来打乱因果对照证实模型是在(历史、未来)对上回归,而非对其未来取平均。

## 2 相关工作

#### TSFM 的检索增强预测。

越来越多的研究将训练组件附加到冻结的 TSFM 上以消费检索结果。TS-RAG(Ning 等,2025)在冻结的 Chronos-Bolt(Ansari 等,2024)之上训练自适应检索混合器;TimeRAF(Zhang 等,2025)训练端到端检索器和通道提示模块;RAFT(Han 等,2025)训练投影和预测头;RATD(Liu 等,2024)训练带学习参考调制注意力模块的扩散去噪器;TimeRAG(Yang 等,2025)插入学习重编程层;Advanced RAF(Tire 等,2024)端到端微调骨干网络(而 Naive RAF 虽然是不需要训练的变体,但性能显著逊于 TS-RAG(Ning 等,2025))。这些方法均依赖在检索与骨干网络之间插入的学习临时组件。我们与 TS-RAG 进行数值比较,它是最直接可比且在撰写本文时最强的训练融合基线;为公平比较,我们在整个过程中采用其协议。LLM 端对应的做法通常更简单。REPLUG(Shi 等,2024)、kNN-LM(Khandelwal 等,2020)和 In-Context RALM(Ram 等,2023)等方法直接将检索到的上下文与冻结的 LM 拼接或插值。

#### 作为隐式回归的上下文学习。

一系列理论工作将上下文学习框架化为隐式回归。Garg 等(2022)表明在线性函数上训练的 Transformer 匹配最小二乘估计器;Akyürek 等(2023)和 von Oswald 等(2023)证明此类 Transformer 实现的算法与上下文示范上的梯度下降或闭式岭回归一致。Fa 等(2025)通过重新预训练基础模型以消费上下文检索示例,将相关视角扩展到 TSFM。我们将这一系列工作用作行为参考:在第 5 节中,我们将冻结 TSFM 在我们对齐下的预测偏移与同一示范上闭式岭回归预测器的偏移进行比较。

#### 时间序列中的相位、幅度与结构相似性。

动态时间规整(Cuturi 和 Blondel,2017)及其形状变体(Zhao 和 Itti,2018)比较未对齐的序列;k-Shape(Paparrizos 和 Gravano,2015)基于相位不变的 Pearson 相似度进行聚类;矩阵轮廓(Yeh 等,2016)在 z 归一化距离下索引基序。这些方法将幅度和相位视为干扰方向,并在下游学习之前将其移除。

## 3 方法:Align-RAG

Align-RAG 在 token 化之前,对每个检索到的历史-未来窗口应用两种闭式变换。第一种通过正则化仿射拟合,对检索到的历史进行重缩放,使其一阶矩和二阶矩与查询一致。第二种通过互相关选择的整数采样平移,对检索到的历史进行时间移位,使其与查询的主滞后为零。两种变换都有对应的未来侧变换:将相同的仿射映射和相同的滞后应用于检索到的未来,使 \(( \mathbf{p}_i, \mathbf{f}_i )\) 对保持一致。邻居多样化、打包到骨干网络的上下文预算、未来混合以及一次无示范的第二次前向传播,是进一步无需训练的组件,它们补充了对齐并提升了零样本准确性。

设 \(\mathbf{q}\in\mathbb{R}^S\) 为长度为 \(S\) 的查询历史(Chronos-Bolt 的 \(S{=}512\)),\(\mathbf{y}\in\mathbb{R}^H\) 为其预测目标未来,预测长度 \(H\)。检索索引为每个查询通道返回一个包含 20 个(历史、未来、距离)三元组的池 \(\mathcal{P}=\{(\mathbf{p}_i,\mathbf{f}_i,d_i)\}_{i=1}^{20}\)。我们用 \(f_\theta(C)\) 表示冻结 TSFM 在给定上下文 \(C\) 时的预测。

### 3.1 幅度对齐

对于每个检索到的邻居(索引为 \(i\)),我们在历史上拟合一个仿射映射,并将其同时应用于历史和未来。设 \(\mu_q,\sigma_q\) 表示查询历史 \(\mathbf{q}\) 的均值和标准差,\(\mu_{p_i},\sigma_{p_i}\) 表示检索到的历史 \(\mathbf{p}_i\) 的均值和标准差。维纳式收缩斜率 \(a_i\) 和截距 \(b_i\) 为

\[
a_i \;=\; \frac{\sigma_q\,\sigma_{p_i}}{\sigma_{p_i}^{2}+(\sigma_q/M)^{2}},\qquad b_i \;=\; \mu_q-a_i\,\mu_{p_i}
\tag{1}
\]

其中 \(a_i\) 是插入式尺度比 \(\sigma_q/\sigma_{p_i}\) 的正则化对应物,其思想源于维纳滤波的噪声估计(Wiener,1949)。收缩参数 \(M\) 控制正则化强度:当 \(\sigma_{p_i}\to 0\) 时,\(a_i\) 平滑收缩到零,平坦的低方差邻居会坍缩到其自身均值而非放大噪声。我们设置 \(M=5\)。对齐后的历史和未来为

相似文章

LeapAlign:通过构建两步轨迹在任意生成步骤后训练流匹配模型

Hugging Face Daily Papers

LeapAlign是一种后训练方法,通过两步轨迹捷径降低计算成本,同时实现梯度稳定传播到早期生成步骤,从而改善流匹配模型与人类偏好的对齐。在微调Flux模型时,该方法在多种图像质量和文本对齐指标上均优于现有最先进方法。

平稳性感知的检索增强时间序列预测

arXiv cs.LG

SARAF是一种平稳性感知的检索增强预测框架,它自适应地平衡时间序列预测中检索的相关性与多样性,并基于数据集级别的平稳性调节多样化强度,以处理非平稳状态转移。该工作已被KDD 2026接收,在8个真实世界数据集上展现出了优于强基线的竞争性能。

面向鲁棒即插即用适配的解耦对齐

arXiv cs.CL

介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。