GALA: 生成感知跨模态对齐用于文本到时间序列合成

arXiv cs.CL 论文

摘要

本文介绍了GALA,这是一种用于文本到时间序列合成的两阶段方法,它使用生成感知跨模态对齐在TSFragment-600K基准测试中实现了最先进的结果,同时提高了保真度和标题一致性。

arXiv:2608.13741v1 Announce Type: new 摘要: 从自然语言合成时间序列正逐渐成为可控时间序列生成中最具表现力的形式。然而,现有的文本条件生成器要么使用从现成文本编码器中冻结的标题嵌入,要么端到端调整编码器,仅让去噪损失作为副产品来塑造嵌入。无论哪种情况,条件表示从未有意地与信号模态匹配,导致其不适合指导生成。我们通过引入GALA来解决这个问题:生成感知跨模态对齐用于文本条件时间序列生成。GALA是一种两阶段方法,首先将一个预训练的文本编码器与一个时间序列基础模型对比耦合到一个共享的嵌入空间中,两个编码器都通过辅助生成损失适应生成,然后冻结生成的标题嵌入以驱动一个流匹配生成器。在TSFragment-600K上,涵盖四个领域和三种片段长度,GALA设立了新的最先进水平,在36个指标列中排名30次第一,并在长度24/48/96上达到平均排名1.08/1.08/1.42,而最强基线为1.92/2.00/1.75。我们进一步发现,生成器内部的文本编码器迫使在保真度和标题一致性之间进行权衡,而基于对齐嵌入的条件化打破了这一局面:FID、CTTP和JFTSD同时改进。消融辅助损失会同时降低FID、CTTP和JFTSD,这表明生成项是必要的组成部分,而非附加项。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:45

# 1 引言
来源:https://arxiv.org/html/2608.13741
页边距解析已更改。上边距已更改。页边距推挤已更改。

页面布局违反了 ICML 样式。

请不要更改页面布局,或包含 geometry、savetrees 或 fullpage 等会为您更改布局的包。

我们无法可靠地撤销对样式的任意更改。请移除有问题的包或更改布局的命令,然后重试。

# GALA:面向文本到时间序列合成的生成感知跨模态对齐
Haochen Zhang¹,Gengwei Zhang¹,Laura Yao¹,Nicholas Konz¹,以及 Tianlong Chen✉️¹
¹UNITES Lab, University of North Carolina at Chapel Hill
{haochenz, gengweiz, lyao, nick124, tianlong}@cs.unc.edu
✉️通讯作者

从自然语言合成时间序列正成为可控时间序列生成最具表达力的形式。然而,现有的文本条件生成器要么使用从现成文本编码器中冻结的标题嵌入,要么端到端地调整编码器,让去噪损失仅作为副产品塑造嵌入。在这两种情况下,条件表示从未刻意与信号模态匹配,导致其不适合指导生成。我们通过引入 GALA:面向文本条件时间序列生成的生成感知跨模态对齐 来解决这一问题。GALA 是一种两阶段方法,首先通过对比学习将预训练的文本编码器和时间序列基础模型耦合到共享嵌入空间,两个编码器都通过辅助生成损失适应生成任务,然后冻结生成的标题嵌入以驱动基于流匹配的生成器。在跨越四个领域和三种片段长度的 TSFragment-600K 数据集上,GALA 设定了新的最先进水平,在 36 个指标列中的 30 列排名第一,在长度为 24/48/96 时达到平均排名 1.08/1.08/1.42,而最强基线为 1.92/2.00/1.75。我们进一步发现,生成器内部的文本编码器迫使在保真度和标题依从性之间进行权衡,而使用对齐的嵌入进行条件化则打破了这种权衡:FID、CTTP 和 JFTSD 同时得到改善。消融辅助损失会导致 FID、CTTP 和 JFTSD 一同下降,这表明生成项是对齐的必要组成部分而非附加组件。

00footnotetext:✉️通讯作者:{tianlong}@cs.unc.edu
预印本,正在审稿中。

### 1 引言

时间序列生成在能源、交通和医疗保健等领域发挥着重要作用,其中高质量的合成序列可以支持数据增强、隐私保护的数据共享和模拟(40 (https://arxiv.org/html/2608.13741#bib.bib6);23 (https://arxiv.org/html/2608.13741#bib.bib14))。然而,生成器的可直接决定其实用价值。无条件生成方法(4 (https://arxiv.org/html/2608.13741#bib.bib8);16 (https://arxiv.org/html/2608.13741#bib.bib9);42 (https://arxiv.org/html/2608.13741#bib.bib7);27 (https://arxiv.org/html/2608.13741#bib.bib11);12 (https://arxiv.org/html/2608.13741#bib.bib10))是不可控的。基于类标签或属性向量等结构化信号进行条件化(19 (https://arxiv.org/html/2608.13741#bib.bib15);28 (https://arxiv.org/html/2608.13741#bib.bib18);34 (https://arxiv.org/html/2608.13741#bib.bib17);15 (https://arxiv.org/html/2608.13741#bib.bib16))将用户限制在预定义的条件模式内,不支持超出该模式的任何场景。相比之下,自然语言描述既对用户灵活,又对描述时间序列具有语义意义。例如,临床医生可以通过临床报告指定 12 导联心电图(17 (https://arxiv.org/html/2608.13741#bib.bib4))。这使得文本成为描述时间序列形态最有前景的接口(18 (https://arxiv.org/html/2608.13741#bib.bib13))。因此,文本条件时间序列生成已成为条件时间序列生成的前沿领域(6 (https://arxiv.org/html/2608.13741#bib.bib1);9 (https://arxiv.org/html/2608.13741#bib.bib2);21 (https://arxiv.org/html/2608.13741#bib.bib3))。

参考标题 图1:GALA 通过首先将文本和序列对齐到共享的、生成感知的嵌入空间,然后以冻结的文本嵌入为条件来生成器,从而从自由形式的标题合成时间序列。

现有的文本条件生成器主要区别在于生成执行的位置。一条工作线先训练一个自编码器来压缩时间序列,然后在潜在空间中训练生成器(6 (https://arxiv.org/html/2608.13741#bib.bib1);17 (https://arxiv.org/html/2608.13741#bib.bib4)),而另一条工作线直接在观测空间中生成原始序列(9 (https://arxiv.org/html/2608.13741#bib.bib2);21 (https://arxiv.org/html/2608.13741#bib.bib3))。尽管存在这种差异,这两种方法对文本条件的处理方式相同,且缺乏对条件路径的刻意设计。T2S(6 (https://arxiv.org/html/2608.13741#bib.bib1))、DiffuSETS(17 (https://arxiv.org/html/2608.13741#bib.bib4))和 BRIDGE(21 (https://arxiv.org/html/2608.13741#bib.bib3))从现成的语言嵌入模型获取固定的标题表示并将其提供给生成器,而 VerbalTS(9 (https://arxiv.org/html/2608.13741#bib.bib2))学习一个适配器,将冻结的文本编码器输出重编程为多分辨率特征。在所有这些方法中,文本表示要么从纯文本编码器保持冻结,要么仅由去噪目标塑造,从未与时间序列模态明确对齐。

然而,显式的跨模态对齐在其他时间序列任务中是有效的。对于预测,TimesCLIP(5 (https://arxiv.org/html/2608.13741#bib.bib26))对比对齐序列的视觉和文本视图,BALM-TSF(44 (https://arxiv.org/html/2608.13741#bib.bib38))使用对比语义对齐损失平衡这两种模态,而 Time-MMD(26 (https://arxiv.org/html/2608.13741#bib.bib39))表明对齐的文本上下文显著减少了预测误差;对于理解和推理,TEST(35 (https://arxiv.org/html/2608.13741#bib.bib28))和 ChatTS(39 (https://arxiv.org/html/2608.13741#bib.bib27))通过文本原型或合成标题将序列与 LLM 对齐。类似的观察结果在时间序列之外也成立(32 (https://arxiv.org/html/2608.13741#bib.bib19);33 (https://arxiv.org/html/2608.13741#bib.bib40))。将语义对应关系转换为显式几何关系可改善下游性能。

然而,在文本条件时间序列生成中,开发良好的跨模态对齐并非简单地插入现有方法。我们在实验中观察到两个挑战。
1):微调生成器内部的文本编码器在保真度方面代价高昂地改善了标题依从性(表2 (https://arxiv.org/html/2608.13741#S3.T2)),这表明仅靠生成损失不足以塑造共享潜在空间。
2):现有的跨模态对齐方法为排序和检索优化了共享空间,但不一定保留生成器所需的细粒度、与重建相关的细节。

我们通过学习生成感知的文本-时间序列共享嵌入空间(图1 (https://arxiv.org/html/2608.13741#S1.F1))来解决这两个挑战,该空间使文本嵌入足够忠实,能够在不牺牲保真度的情况下更好地驱动生成器以改善标题依从性。

在这项工作中,我们提出了 GALA(生成感知跨模态对齐),一种两阶段的文本到时间序列生成方法。在第一阶段,GALA 通过对比学习将预训练的文本编码器和时间序列基础模型对齐到共享嵌入空间,并使用幅度感知编码来保留标题经常提及的绝对水平和尺度。为了使对齐具有生成感知性,我们添加了一个辅助生成损失,要求文本嵌入仍足以合成其配对的序列;编码器本身通过低秩更新进行调整。辅助损失同时提升了标题依从性和保真度,而不是在两者之间进行权衡,它是必要的组成部分而非附加组件,并且它对任何深入骨干网络的适应都有效,唯一的失败情况是在冻结特征上使用可训练头部。

在第二阶段,对齐的文本编码器被冻结,其嵌入作为流匹配生成器的条件。

总之,我们的贡献有三方面:
- 我们指出了文本到时间序列生成器中被忽视的一个差距:条件表示要么是冻结的纯文本特征,要么仅通过生成目标进行调整;在这两种情况下,它都未与时间序列模态对齐,因此条件信号未针对生成进行充分优化。
- 我们提出了 GALA,一种两阶段方法,它将跨模态对齐与生成解耦,并使对齐具有生成感知性:对比目标与辅助生成损失相结合,该损失使文本嵌入足以合成时间序列。
- 我们在跨越四个领域和三种片段长度的 TSFragment-600K 上进行了广泛实验,证明 GALA 在生成保真度方面匹配或超越了最先进方法,同时大幅改善了标题依从性。消融研究、探测分析以及与替代对齐方案的比较进一步解释了收益的来源。

### 2 方法

#### 2.1 问题设置

标题 C 属于标题空间 C,时间序列 X 属于时间序列空间 X,其具有 V 个变量和长度 L;配对 (C, X) 从未知联合分布 μ 中抽取,其边缘分布分别为 μ_C 和 μ_X,训练数据集 {(c_i, x_i)}_{i=1}^N 由独立同分布的样本组成。文本条件时间序列生成的目标是学习一个由参数 θ 参数化的条件分布 p_θ(·|c),使其近似于典型标题的 μ(·|c),即求解:

min_θ E_{c∼μ_C} [ D(μ(·|c) ∥ p_θ(·|c)) ],

其中 D 是任意分布间的差异度量。该目标明确了我们评估的两个质量维度:1)保真度要求生成的序列看起来真实,即 p_θ 在标题上的边缘分布与 μ_X 匹配;2)标题依从性要求每个 p_θ(·|c) 将其质量集中在形态与标题 c 匹配的序列上,而不是退化到与标题无关的边缘分布。

#### 2.2 技术动机

在描述 GALA 之前,我们简要给出其两个设计决策的信息论论证:将对齐与生成分离,以及在对齐目标中添加生成项。这不是一个紧的界或新的理论结果,而是解释为什么这两个决策是自然的。预期设计,令 E 表示将标题映射到其嵌入的文本编码器,U=E(C) 表示该嵌入,μ(·|u) 表示由 μ 诱导的给定 U=u 时 X 的条件分布。GALA 在第一阶段在对比损失 L_align 和下面定义的辅助生成损失 L_gen 下拟合 E,并在第二阶段拟合生成器。

##### 显式特征对齐作为误差分解

在 GALA 中,生成器通过文本编码器读取标题:p_θ(·|c) = p_θ(·|E(c))。对于任何这样的模型,在学习目标 (2.1) 中取 D 为 KL 散度,可得到精确的恒等式:

E_c[KL(μ(·|c) ∥ p_θ(·|c))] (端到端目标)
= E_c[KL(μ(·|c) ∥ μ(·|u))] (R(E):表示误差) + E_u[KL(μ(·|u) ∥ p_θ(·|u))] (生成误差),

这源于 log(μ(x|c)/p_θ(x|u)) = log(μ(x|c)/μ(x|u)) + log(μ(x|u)/p_θ(x|u)) 并取期望;由于 U=E(C) 是确定性的且 X|U ∼ μ(·|u),第二项通过塔性质简化为 E_u[...]。在这种分解下,R(E) 仅取决于编码器;对于任何编码器,生成项在第二阶段单独最小化。

##### 对齐需要生成项以用于生成

因为 U=E(C) 是 C 的确定性函数,对齐误差恰好是条件互信息,R(E)=I(X;C|U)=I(X,C)-I(X,U),其中 I(X,C) 是数据的常数;因此最小化 R(E) 等价于最大化 I(X,U),并且 R(E) 达到零当且仅当 U 是标题关于时间序列的充分统计量。因此,第一阶段的目标是使标题嵌入包含其时间序列的信息,而不仅仅是擅长检索。这种看似无害的区别对于文本条件生成很重要。

对比损失 L_align 最大化了 I(X,U) 的一个下界(29 (https://arxiv.org/html/2608.13741#bib.bib32);31 (https://arxiv.org/html/2608.13741#bib.bib33)),即 I(X,U) ≥ log B - L_align;但该界在 log B 处饱和,因此一旦负样本容易排序,目标就无法再推动获取更多信息。这产生了判别性但未必生成就绪的嵌入,仅包含关于序列的粗略线索。

生成感知的辅助损失从生成侧对同一 I(X,U) 施加压力。将辅助扩散去噪器 g_ξ 写为条件密度估计 q_ξ(x|u),其期望对数似然是变分下界 I(X,U) ≥ H(X) + E_{(x,u)}[log q_ξ(x|u)],其中 H(X) 对于 E 是常数,而 -L_gen 作为此对数似然项的可计算代理。与 L_align 不同,L_gen 持续奖励 u 所需的更细粒度信息以进行重建,而不仅仅是为了排序。因此,辅助生成损失提供了更好的嵌入,同时提升了文本依从性和保真度,前提是编码器有足够的能力被它重塑,我们的消融研究(图5 (https://arxiv.org/html/2608.13741#S3.F5))证实了这一点。

相似文章

原生视听对齐生成

Hugging Face Daily Papers

NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。

GigaChat Audio: 时间感知的大型音频语言模型

Hugging Face Daily Papers

本文介绍了 GigaChat Audio,一个时间感知的大型音频语言模型,能够对长达120分钟的音频回答问题并给出明确的时间戳,使用交错周期性时间标记和合成监督。该模型在基准测试中实现了强时间定位准确性,作者已发布模型权重和数据集。

GEAR:引导式端到端自回归图像合成

Hugging Face Daily Papers

GEAR提出了一种通过表示对齐共同训练向量量化分词器和自回归生成器的方法,实现端到端训练,在ImageNet gFID上相比强基线实现高达10倍的收敛速度提升。