文本何时具有信息性?多模态时间序列预测的信息论度量基准测试
摘要
本文提出一个合成基准,旨在评估信息论度量在多模态时间序列预测中衡量文本标注信息性的能力,并证明其可用于无需模型训练的标注审核。
arXiv:2609.11282v1 Announce Type: new
摘要:多模态预测模型通过结合时间序列与文本标注,承诺通过文本上下文实现更丰富的预测,但如何判断文本标注是否对预测者的预测有实质性贡献?这是一个信息论问题,但要评估信息论度量能否可靠地衡量标注提供的预测价值,需要一个真实基准,而目前尚不存在。我们创建了一个带有三类标注的合成时间序列信号:语义正确、错误和无关。由于数据生成过程完全可控,真实信息内容已知,从而能够对六种互补的互信息估计器(KSG、MINE、InfoNCE、CCA、PID 和 V-information)进行原则性评估。我们展示所有六种估计器都将正确标注识别为最具信息性,并能够审核混合文本语料库的质量,无需模型训练即可选择导致最佳下游预测结果的标注。我们的基准识别了每种估计器的局限性,并在七个真实世界数据集上进行了验证,这些数据集展示了估计器在弱信号下的性能差异。最后,我们建立了实施这些度量用于标注审核和融合选择的实用规则。
查看缓存全文
缓存时间: 2026/09/12 08:26
# 文本何时提供信息?多模态时间序列预测的信息论度量基准测试 来源:https://arxiv.org/html/2609.11282 Gianmarco Mengaldo 附属机构:新加坡国立大学 邮箱:[[email protected]](mailto:) ###### 摘要 结合时间序列与文本注释的多模态预测模型有望通过文本上下文提供更丰富的预测,但我们如何判断文本注释是否对预测器的预测有实质性贡献?这是一个信息论问题。然而,要评估信息论度量能否可靠衡量注释提供的预测价值,需要一个真实基准,而目前尚无此类基准。我们创建了一个带有三类注释(语义上*正确*、*错误*和*无关*)的合成时间序列信号。由于数据生成过程完全可控,真实信息含量是精确已知的,从而能够对六种互补的互信息估计器(KSG、MINE、InfoNCE、CCA、PID和V-信息)进行原则性评估。研究表明,所有六种估计器都能将正确注释识别为最具信息量的,并能审计混合文本语料库的质量,无需模型训练即可选择能带来最佳下游预测结果的注释。我们的基准测试指出了每种估计器的局限性,并在七个真实世界数据集上进行了验证,展示了估计器在弱信号下的性能差异。最后,我们为实现这些度量以用于注释审计和融合选择制定了实用规则。 ## 1 引言 多模态时间序列预测——将数值信号与自然语言注释相结合——已成为预测建模中最有前景的前沿领域之一。从医疗保健(Chan等人,2024)到气候预测(Li等人,2025;Kim等人,2025),语言模型与时间序列架构的整合在各领域日益普遍,但这一进展建立在融合的文本确实有帮助的关键假设之上。实践中,情况很少如此。文本可能描述了信号本身无法预见的即将到来的机制变化,或者它可能是完全错误的,或者与手头任务无关。从业者在训练之前,没有原则性的方法来知道哪些注释正在推动性能提升,哪些正在增加噪声。这不是罕见的情况,而是任何真实世界多模态数据集中的常见情况,其中文本与任何特定未来值的关联性是未知且未经验证的。如果没有可靠的度量来衡量文本相对于信号的信息量,从业者在投入昂贵的模型训练之前,无法审计注释质量,无法识别哪些领域或时间段受益于文本融合,也无法区分一个从文本中学习的模型与一个尽管有文本但独立学习的模型。随着多模态预测扩展到更高风险的应用,融合无信息或误导性文本的成本也相应增加。信息论度量提供了一种自然的解决方案。互信息(MI)及相关度量量化了文本与未来信号值之间的统计依赖性,而无需假设特定的模型结构,这使它们成为理想的训练前诊断工具:在模型训练之前,在训练数据上计算一次以估计文本是否值得融合。能够可靠地做到这一点将提供一个原则性的注释审计步骤,从而改变多模态时间序列系统的构建方式。MI估计已显示出预测多模态模型性能的潜力(Liang等人,2023a;Liang等人,2023b),并且作为平衡模态贡献的训练目标(Kontras等人,2025)。但一个根本性障碍仍然存在:在文本-时间序列设置中,无法评估这些MI估计器,因为真实世界数据集从不提供真实的信息内容。所有现有评估都是基于人类判断来验证这些度量的,而真实的信息内容通常是未知的,这就造成了循环依赖。Czyż等人(2023)针对连续单峰数值分布解决了这个问题,构建了具有已知真实MI的合成基准,但未考虑多模态输入(如自然语言)或模态之间相互支持或矛盾的程度。此外,注释*质量*的概念——正确、错误或无关——在现有的数值分布中没有类似物。我们为填补这一空白所做的贡献是MMTT-Bench:一个具有“先知”真实基准的合成基准,使得在文本-时间序列多模态设置中首次对MI估计器进行原则性评估成为可能。具体而言: - • 我们构建了一个合成数据集,MMTT-Bench(多模态文本-时间序列基准测试):一个正弦波,其中随机插入恒定值段,每个段都有三个标记的注释类别(正确、错误、无关)。我们在真实世界数据集Time-MMD(Liu等人,2024)和FinTexTS(Lee等人,2026a)上验证了我们的发现。我们的代码和数据集已在GitHub111https://github.com/MathEXLab/MMTT-Bench和HuggingFace222https://huggingface.co/datasets/WhenDoesTextInform/MMTT-Bench上发布。 - • 我们评估了六种互补的MI估计器,证明信息度量可以预测各种模型架构下的下游预测性能,验证了它们作为训练前诊断工具的使用价值。 - • 我们展示了信息度量在多大程度上可用于评估语料库中文本注释的质量,并将我们的结果呈现为在不同信号和使用场景中实施这些度量的实用规则。 ## 2 MMTT-Bench设计 参见标题图1:MMTT-Bench中的示例文本注释 我们构建了一个合成基准测试——多模态文本-时间序列基准测试(MMTT-Bench),将时间序列信号与受控的自然语言注释配对。合成数据让我们能够精确控制每个注释携带多少关于未来信号值的信息,从而能够对现有多模态数据集不支持的注释类别进行原则性的信息论度量评估。MMTT-Bench建立在一个带有随机放置的恒定值(平坦线段)的正弦波之上。具体来说,可观测值为y(t) = { sin(t) 若 t ∉ S; -0.5 若 t ∈ S },其中S是一个随机采样的区间集,覆盖时间轴约30%,每个区间的长度均匀采样自[π/2, 2π - π/2]。平坦线值-0.5与sin(t)在注释点取的任何值都不重合:y ∈ [-1, 0, 1],确保两种机制是明确的。这创造了“过渡状态”,在图1中以橙色描绘,其中信号下降到-0.5。在这些点上,时间序列信号值y(t)没有提供关于未来值Y_future的确定性信息,正确的文本注释成为预测信息的主要来源。数据集按时间顺序划分为非重叠的时间段(训练集62.5%,验证集18.75%,测试集18.75%),以防止数据泄露并反映现实的预测设置,即模型在历史数据上训练并在未来观测值上评估。每个时间点检索三个注释变体:*正确*、*错误*和*无关*文本,基于底层信号的已知未来状态。完整的数据集生成细节见附录A。为了确保错误文本语料库的文本多样性与正确文本相同,我们为30%的错误注释点随机选择这些过渡模板,数量等于信号中真实过渡点的数量,这样正确和错误文本语料库在没有额外时间序列信息的情况下是不可区分的。这在附录C中得到确认,并防止度量利用词汇线索而非语义内容及其与未来预测的关系。无关文本由单独的模板生成,文本描述信号的一般属性,没有任何方向性或预测信息。一个校准良好的信息度量应将*正确*注释排在最高,*无关*注释接近零,*错误*注释介于两者之间,因为70%的错误注释提供了与正确注释直接相反的信息,它们仍然与Y_future的值相关。模型可以学会做与错误注释建议完全相反的事情,从而正确率高达70%。核心问题是MI及相关度量能否区分并正确排列这些文本变体,以及相关度量是否能预测将每种注释类型提供给预测模型时的性能增益。 ## 3 估计互信息 ### 3.1 符号与背景 我们将多模态预测任务设置如下:在每个注释点t,我们观察三个量。X_ts是时间序列输入:由n_lookback个先前信号值组成的向量(可选地使用PatchTST进行分词)。X_text是文本输入:t时刻的自然语言注释,经嵌入并通过PCA降维至d_text维。Y是目标:t + horizon时刻的信号值。我们报告的每个量都是(X_ts, X_text, Y)联合分布上的互信息(或类互信息)泛函,从注释点的有限样本估计而来。对于每个注释类别,我们计算四个量:每个模态的边际MI,I(X_ts; Y)和I(X_text; Y),衡量每个模态与Y_future共享多少信息;联合MI,I(X_ts, X_text; Y),衡量两个模态的组合信息;以及条件MI,I(X_text; Y | X_ts) = I(X_ts, X_text; Y) - I(X_ts; Y),分离出文本在时间序列之外的独特贡献。这是我们的主要关注量,因为它是从业者在决定是否融合文本值得成本之前实际需要的量。但为什么MI必须被*估计?*对于具有未知密度的连续高维变量,互信息没有闭式解:精确计算它需要对真实联合密度p(X_ts, X_text, Y)进行积分,这在实践中永远不可用。即使在我们的合成设置中也是如此,尽管注释的信息内容是已知的(设计上),从原始文本通过嵌入模型和PCA到可用表示的映射在解析上是不可处理的。因此,我们报告的每个数字都是一个具有自身偏差和方差特性的估计值,而非真实值。这正是为什么一个将估计器误差与未知真实值不确定性区分开来的“先知”基准是必要的。MI估计在文本-时间序列设置中尤其困难,这促使需要量化不同估计器的性能和局限性。 ### 3.2 估计器 我们评估了六种互补的MI估计器,涵盖了测量文本-时间序列信息内容的所有方法空间。K-最近邻估计器(KSG)(Kraskov等人,2004)、互信息神经估计器(MINE)(Ishmael Belghazi等人,2018)、InfoNCE(Rusak等人,2024)和典型相关分析估计器(CCA)(Murphy,2023)都针对相同的香农MI量I(X; Y)(单位为奈特),在尺度上可直接比较,但假设和实际行为不同。部分信息分解(PID)(Williams和Beer,2010)将联合信息直接分解为非负的冗余、唯一和协同分量,因此感兴趣的条件量是其Unique(X_text)分量,而不是减法。V-可用信息(V-信息)(Xu等人,2020)完全偏离了香农熵,衡量了岭回归可以从给定嵌入中利用的信息,报告为ΔR²,即在固定预测族中添加X_text后解释方差的增益。完整的推导和实现细节见附录B。这些估计器都有局限性,我们的目标是在文本-时间序列设置中量化它们。估计器的方差和所需样本量都随着被估计量的量级而缩放,因此文本贡献有限附加信息的弱信号机制本质上更难估计。这对于KSG尤其成问题,它通过最近邻距离局部估计密度,因此当联合维度d超过√(N/2)(对于样本量N)时变得不可靠(Gao等人,2017)。这促使我们对X_text进行降维(见第3.4节)。KSG的方差使用Holmes和Nemenman(2019)推荐的程序估计,而不是用于所有其他估计器的简单自举法。MINE和InfoNCE通过梯度下降学习一个评论网络,对维度不敏感,但需要超参数调整和足够的信号强度才能可靠训练。它们也产生边界而不是真正的估计器。MINE是一个通过Donsker-Varadhan表示获得的下界(Ishmael Belghazi等人,2018),而InfoNCE是一个在批次大小为N时饱和于logN奈特的下界(Rusak等人,2024)。因此,两者都可能系统性地低估真实MI。将条件估计为两个单独有偏估计的差值,可能留下比被测量量更大的残差。由于每个项都携带其特定估计器的偏差,这两个偏差通常不会抵消。当边际I^(X_ts; Y)相对于真实条件MI较大时,这种偏差可能主导差值,并为一个定义上非负的量产生负估计。
相似文章
重新思考多模态时间序列预测评估
介绍了TimesX,这是一个新的多模态时间序列预测基准,包含多样化的真实世界数据和文本上下文,解决了泛化、数据泄露和上下文多样性问题。
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。
时空预测基准数据集与基线的批判性审查
本文批判性审查了时空预测的基准数据集与基线,表明经典线性模型常与图神经网络 (GNNs) 相媲美,突出了区分可靠性问题,并倡导更严格的评估。
时间序列基础模型基准测试是否隐藏了依赖状态的失败?来自交通速度预测的证据
本文提出了面向时间序列基础模型的状态分层评估方法,揭示出聚合指标会掩盖交通状态转换期间的严重失败,并提出了双峰混合增强方法,在保持整体准确性的同时改善覆盖范围。
Obshazard-bench:基于原始地球观测流的多模态基础模型实时灾害智能基准评测
介绍了Obshazard-bench,这是一个实时、观测驱动的基准,用于评估多模态基础模型从原始地球观测流中获取灾害智能的能力,涵盖60多个国家的8个灾害类别。