神经网络中的潜在状态:从模型权重恢复漂移数据的时间结构
摘要
本文研究是否可以通过将隐马尔可夫模型拟合到在连续时间窗口上训练的神经网络权重的轨迹,将随时间漂移的数据流划分为离散状态,结果表明恢复出的潜在状态与两个数据集上的迁移性能相关。
arXiv:2607.27482v1 公告类型:新
摘要:随时间漂移的数据流可能经历离散状态,而非连续变化。我们提出一个问题:是否可以使用隐马尔可夫模型(HMM)拟合这些权重的按时间排序的轨迹,从在该数据流上训练的模型权重中恢复出这些状态。我们在两个已知会随时间漂移的领域研究该问题:使用 Fakeddit 数据集的多模态虚假信息检测,以及使用 Yelp 数据集的情感分析。我们在连续的时间窗口上训练分类器,并将 HMM 拟合到它们对齐后的权重轨迹上,从而恢复出将每个时间线划分为连贯阶段的潜在状态。在两个数据集上,分类器对与其训练窗口共享状态的数据的泛化能力优于跨状态边界的数据。这种状态内迁移优势在控制时间邻近性后仍然存在,并且略高于通过将连续等大小状态进行朴素划分所获得的优势。尽管状态仅从模型权重估计而来,但它们与数据类别分布的变化之间的相关性要强于与用于估计它们的权重空间几何之间的相关性。在对类别发散和滞后进行残差化处理后,状态内优势在两个任务上都超过了其置换零分布,表明这些状态恢复了与迁移相关的、超出数据分布的结构。所有效应在两个任务上均得到重复,但在 Yelp 上有所减弱,因为其标签分布在时间上更稳定。
查看缓存全文
缓存时间: 2026/07/31 10:02
###### 摘要 随时间漂移的数据流可能经历离散的状态,而不是连续变化。我们提出这样一个问题:通过将隐马尔可夫模型(HMM)拟合到这些权重按时间顺序排列的轨迹上,是否可以从在该数据流上训练的模型权重中恢复这些状态。我们在两个已知会随时间漂移的领域中研究这一问题:使用 Fakeddit 数据集的多模态虚假信息检测,以及使用 Yelp 数据集的情感分析。我们在连续的时间窗口上训练分类器,并将 HMM 拟合到其对齐权重的轨迹上,从而恢复将每个时间线划分为连贯阶段的潜在状态。在两个数据集上,分类器对与其训练窗口共享状态的数据的泛化能力,都优于对跨越状态边界的数据。这种状态内迁移优势能够通过时间邻近性的控制检验,并且适度超过了通过朴素的等大小连续状态划分所获得的优势。尽管这些状态仅从模型权重中估计得到,但它们与数据类别分布的变化之间的相关性,强于与用于估计它们的权重空间几何之间的相关性。在去除类别发散和滞后的影响后,状态内优势在两个任务上均超过了其置换零分布,表明这些状态恢复了与数据分布之外的迁移相关的结构。所有效应在两个任务上均得到重复,但在 Yelp 上有所减弱,因为其标签分布随时间更为稳定。 ## 1 引言 学习系统中的训练动态经常以相变而非连续演化为特征。这种相同的结构也出现在生物学习者中:当人类感知连续经验时,他们会自发地将其划分为由边界分隔的离散事件。Baldassano 等人(2017)证明,通过拟合一个将边界定位为潜在状态之间转换的隐马尔可夫模型(HMM),可以在不参考刺激的情况下从皮层活动中恢复这种事件结构。这些边界还具有行为后果:事件内部的表征相互一致并易于迁移,而跨越边界的表征则较难绑定(DuBrow and Davachi, 2013; Ezzyat and
相似文章
漂移发生:关于神经架构对时间分布偏移鲁棒性的实证研究
本文介绍了一项实证研究,比较不同神经架构(MLPs、CNNs、RNNs、预训练transformer)在图像和文本领域的时间分布偏移下的性能退化,发现利用局部特征的模型退化最快,而预训练编码器的漂移较为缓慢。
遗忘并非擦除:通过传输键恢复潜在知识
本文认为神经网络中的灾难性遗忘并非擦除,而是一个接口对齐问题。它提出了'传输键'来从顺序训练的模型中恢复潜在的任务特定特征,展示了在分割CIFAR-100上的显著性能恢复。
StateFlow: 用于长时域时间序列预测的双状态循环建模
本文介绍了StateFlow,一种循环预测框架,它通过使用双状态循环主干和基于块的解码器,将变异性感知递归神经网络(VARNN)扩展到长期多变量时间序列预测,在强基线方法中取得了竞争性性能。
潜意识时钟:扩散语言模型中的潜在时间建模
本文证明,扩散语言模型(DLM)在其残差流中内部将去噪进度表示为潜在时间步信号,可通过探针检测并引导来调节模型的置信度和熵。
随机动力系统中嵌入潜在转移算子的深度谱学习
提出了一种利用深度特征空间和基于算子的潜在状态空间模型的随机非线性动力系统的谱学习方法,在预测和滤波任务中表现出稳定的性能。