你不需要强假设:基于时间差分的视觉表征学习
摘要
本文介绍了视觉时间差分法(TDV),这是一种用于视频的自监督学习方法,仅依赖于过去导致未来的因果假设,避免了强归纳偏差,同时在密集空间任务上达到最新技术水平。
查看缓存全文
缓存时间: 2026/06/16 19:33
论文页面 - 你不需要强假设:通过时间差进行视觉表征学习
来源:https://huggingface.co/papers/2606.15956
摘要
视觉时间差(TDV)提出了一种新颖的视频数据自监督学习方法,通过利用过去帧与未来帧之间的因果关系,消除了传统的归纳偏置。
人工智能的进步很大程度上是由假设更少的方法推动的。随着计算量和数据量的增加,具有较弱的归纳偏置(https://huggingface.co/papers?q=inductive%20biases)的方法通常优于那些具有更强假设的方法。这在视觉表征学习(https://huggingface.co/papers?q=Visual%20Representation%20Learning)领域尤为典型:方法从监督学习主导,到弱监督学习,再到如今无需人工标注的自监督学习(https://huggingface.co/papers?q=Self-Supervised%20Learning)的广泛成功。然而,即使是现代的自监督学习(https://huggingface.co/papers?q=Self-Supervised%20Learning)方法,仍然依赖于如扩充、掩码或裁剪等强归纳偏置(https://huggingface.co/papers?q=inductive%20biases)。如果这一趋势成立,那么这些剩余的偏置在规模扩大时也将成为瓶颈——我们的实验证实了这一点:随着数据增长,归纳偏置(https://huggingface.co/papers?q=inductive%20biases)的最佳强度会降低。这促使我们寻找依赖更少假设的方法。为此,我们提出了视觉时间差(https://huggingface.co/papers?q=Temporal%20Difference)方法(TDV),这是一种从视频中进行自监督学习(https://huggingface.co/papers?q=self-supervised%20learning)的新范式,它避免了现有的归纳偏置(https://huggingface.co/papers?q=inductive%20biases),而是依赖于一个因果假设(https://huggingface.co/papers?q=causal%20assumption):过去导致未来。TDV通过联合训练一个图像编码器(https://huggingface.co/papers?q=image%20encoder)和一个运动编码器(https://huggingface.co/papers?q=motion%20encoder),使得当前帧的表示加上编码后的运动等于下一帧的表示。尽管没有利用任何强归纳偏置(https://huggingface.co/papers?q=inductive%20biases),TDV在密集空间任务(https://huggingface.co/papers?q=dense%20spatial%20tasks)上达到了最先进的水平,为无需强假设的表征学习奠定了基础。
查看 arXiv 页面(https://arxiv.org/abs/2606.15956)查看 PDF(https://arxiv.org/pdf/2606.15956)项目页面(https://temporal-difference-vision.github.io/)GitHub3(https://github.com/ninaddaithankar/tdv)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.15956)
在您的代理中获取此论文:
hf papers read 2606\.15956
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.15956 以从本页链接它。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.15956 以从本页链接它。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.15956 以从本页链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页链接它。
相似文章
@AlexiGlad: 人工智能的进步源于采用更弱假设的方法,这使其能够更好地扩展。但表示…
引入了视觉时域差分(TDV),这是一种全新的表示学习范式,仅依赖于因果关系,无需数据增强、掩码或裁剪,并在密集空间任务上达到了与DINO和iBOT等最先进方法相当的性能。
@ninaddaithankar: 视觉模型能否在没有数据增强、掩码、裁剪或重建的情况下学会观察?它可以!介绍……
介绍了时间差视觉表征学习范式(Temporal Difference in Vision, TDV),这是一种新颖的视觉表征学习范式,无需数据增强、掩码、裁剪或重建即可学习有用的表征,并在密集空间任务上达到与最先进方法相当的性能。
扩散模型的时间差分学习
本文提出了一种用于扩散模型的时间差分(TD)学习目标,该目标在去噪轨迹上强制跨时间一致性。它将去噪重新表述为强化学习中的策略评估问题,展示了在样本质量(FID)上的显著改进,尤其适用于少步采样器。
面向以对象为中心的视觉推理的弱监督概念学习
本文提出了一种两阶段的神经符号框架,利用弱监督(仅需 1% 的标签)结合基于 Slot 的变分自编码器(VAE),学习用于以对象为中心的视觉推理的可解释符号,在领域泛化方面优于基础模型。
Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning
Introduces Latent Dynamics Reasoning (LDR), a video world model that integrates kinematic dynamics in a structured latent space, enabling extrapolation of learned dynamics far beyond training distributions while using far fewer parameters and running much faster than video diffusion baselines.