你不需要强假设:基于时间差分的视觉表征学习

Hugging Face Daily Papers 论文

摘要

本文介绍了视觉时间差分法(TDV),这是一种用于视频的自监督学习方法,仅依赖于过去导致未来的因果假设,避免了强归纳偏差,同时在密集空间任务上达到最新技术水平。

人工智能的进展很大程度上是由假设较少的方法推动的。随着计算量和数据的增加,具有较弱归纳偏差的方法通常优于那些具有较强假设的方法。这在视觉表征学习领域尤为典型,该方法已从监督学习主导,经过弱监督学习,发展到如今无需人类标注的自监督学习的广泛成功。然而,即使现代自监督学习方法仍然依赖于强归纳偏差,如数据增强、掩码或裁剪。如果这一趋势成立,那么这些剩余的偏差在更大规模上将变成瓶颈——我们的实验证实了这一点:归纳偏差的最佳强度随着数据增长而降低。这激发了寻找依赖更少假设的方法的动力。为此,我们提出了视觉时间差分法(TDV),这是一种全新的视频自监督学习范式,避免了现有的归纳偏差,转而依赖过去导致未来的因果假设。TDV通过联合训练图像编码器和运动编码器,使得当前帧的表征加上编码的运动等于下一帧的表征。尽管没有利用任何强归纳偏差,TDV在密集空间任务上匹配了最先进的方案,为无强假设的表征学习奠定了基础。
查看原文
查看缓存全文

缓存时间: 2026/06/16 19:33

论文页面 - 你不需要强假设:通过时间差进行视觉表征学习

来源:https://huggingface.co/papers/2606.15956

摘要

视觉时间差(TDV)提出了一种新颖的视频数据自监督学习方法,通过利用过去帧与未来帧之间的因果关系,消除了传统的归纳偏置。

人工智能的进步很大程度上是由假设更少的方法推动的。随着计算量和数据量的增加,具有较弱的归纳偏置(https://huggingface.co/papers?q=inductive%20biases)的方法通常优于那些具有更强假设的方法。这在视觉表征学习(https://huggingface.co/papers?q=Visual%20Representation%20Learning)领域尤为典型:方法从监督学习主导,到弱监督学习,再到如今无需人工标注的自监督学习(https://huggingface.co/papers?q=Self-Supervised%20Learning)的广泛成功。然而,即使是现代的自监督学习(https://huggingface.co/papers?q=Self-Supervised%20Learning)方法,仍然依赖于如扩充、掩码或裁剪等强归纳偏置(https://huggingface.co/papers?q=inductive%20biases)。如果这一趋势成立,那么这些剩余的偏置在规模扩大时也将成为瓶颈——我们的实验证实了这一点:随着数据增长,归纳偏置(https://huggingface.co/papers?q=inductive%20biases)的最佳强度会降低。这促使我们寻找依赖更少假设的方法。为此,我们提出了视觉时间差(https://huggingface.co/papers?q=Temporal%20Difference)方法(TDV),这是一种从视频中进行自监督学习(https://huggingface.co/papers?q=self-supervised%20learning)的新范式,它避免了现有的归纳偏置(https://huggingface.co/papers?q=inductive%20biases),而是依赖于一个因果假设(https://huggingface.co/papers?q=causal%20assumption):过去导致未来。TDV通过联合训练一个图像编码器(https://huggingface.co/papers?q=image%20encoder)和一个运动编码器(https://huggingface.co/papers?q=motion%20encoder),使得当前帧的表示加上编码后的运动等于下一帧的表示。尽管没有利用任何强归纳偏置(https://huggingface.co/papers?q=inductive%20biases),TDV在密集空间任务(https://huggingface.co/papers?q=dense%20spatial%20tasks)上达到了最先进的水平,为无需强假设的表征学习奠定了基础。

查看 arXiv 页面(https://arxiv.org/abs/2606.15956)查看 PDF(https://arxiv.org/pdf/2606.15956)项目页面(https://temporal-difference-vision.github.io/)GitHub3(https://github.com/ninaddaithankar/tdv)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.15956)

在您的代理中获取此论文:

hf papers read 2606\.15956

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.15956 以从本页链接它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.15956 以从本页链接它。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.15956 以从本页链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页链接它。

相似文章

扩散模型的时间差分学习

arXiv cs.LG

本文提出了一种用于扩散模型的时间差分(TD)学习目标,该目标在去噪轨迹上强制跨时间一致性。它将去噪重新表述为强化学习中的策略评估问题,展示了在样本质量(FID)上的显著改进,尤其适用于少步采样器。

面向以对象为中心的视觉推理的弱监督概念学习

arXiv cs.LG

本文提出了一种两阶段的神经符号框架,利用弱监督(仅需 1% 的标签)结合基于 Slot 的变分自编码器(VAE),学习用于以对象为中心的视觉推理的可解释符号,在领域泛化方面优于基础模型。