Selective Synergistic Learning 用于视频目标中心学习
摘要
Selective Synergistic Learning (SSync) 通过伪标签和传递合并选择性地提取可靠线索,从而改进视频目标中心学习,避免了不加区分的密集对齐带来的错误传播。
查看缓存全文
缓存时间: 2026/06/20 14:29
论文页面 - 面向视频目标中心学习的选择性协同学习
来源:https://huggingface.co/papers/2606.15527
摘要
选择性协同学习(SSync)通过伪标签和传递式合并策略,选择性蒸馏出可靠线索,从而提升视频目标分解质量与鲁棒性,解决了视频目标中心学习中的局限性。
典型的视频目标中心学习(VOCL)方法采用基于槽的框架,该框架依赖重建驱动的编码器-解码器架构,其学习过程由两个空间图协调:来自编码器的注意力图和来自解码器的目标图。由于这两种图具有不同特性,近期一种密集对齐策略试图通过对比学习强制所有时空补丁达成一致来弥合这一差异。然而,这种无差别对齐会不经意地传播各个模块固有的弱点,例如编码器的噪声预测和解码器的模糊边界。此外,计算所有补丁对之间的密集相似性会带来与时空补丁总数成二次方的计算成本,严重限制了可扩展性。受此启发,我们提出选择性协同学习(SSync)。与穷举的补丁到补丁对齐不同,SSync 通过选择性蒸馏仅保留最可靠的线索来防止误差传播:利用编码器严格进行边界细化,利用解码器进行内部去噪。这是通过线性复杂度的伪标签实现的,消除了二次空间比较的需求。此外,为防止强化架构偏差(如槽冗余),我们引入了一种基于时空激活一致性的传递式伪标签合并,以整合重叠的槽。大量研究表明,SSync 不仅提升了分解质量,作为一种即插即用模块具有出色通用性,同时对槽配置表现出极强的鲁棒性。代码已开源至 github.com/wjun0830/SSync。
查看 arXiv 页面(https://arxiv.org/abs/2606.15527)查看 PDF(https://arxiv.org/pdf/2606.15527)项目页面(https://wjun0830.github.io/SSync/)GitHub4(https://github.com/wjun0830/SSync)加入收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.15527)
在您的智能体中获取此论文:
hf papers read 2606\.15527
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型1
WJ0830/SSync 更新于1天前(https://huggingface.co/WJ0830/SSync)
引用本论文的数据集0
没有数据集链接本论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.15527 以从本页面链接。
引用本论文的Spaces0
没有Space链接本论文
在Space的 README.md 中引用 arxiv.org/abs/2606.15527 以从本页面链接。
包含本论文的收藏集0
没有收藏集包含本论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页面链接。
相似文章
面向以对象为中心的视觉推理的弱监督概念学习
本文提出了一种两阶段的神经符号框架,利用弱监督(仅需 1% 的标签)结合基于 Slot 的变分自编码器(VAE),学习用于以对象为中心的视觉推理的可解释符号,在领域泛化方面优于基础模型。
少样本学习中样本选择策略的自动组合
本文提出 ACSESS 方法,用于自动组合多种样本选择策略来改进少样本学习的性能,涵盖上下文学习和梯度优化两种方法。该工作在包含文本和图像两种模态的 14 个数据集上证明,策略组合的效果始终优于单个选择方法。
看我之意:面向视频细粒度对象理解的视觉与语言表征对齐
SWIM是一种新颖的训练策略,仅使用文本提示即可对齐视觉和语言表征以实现细粒度对象理解,并在训练期间利用掩码监督来改善跨模态注意力。该方法引入了NL-Refer数据集,并在细粒度对象理解基准测试中取得了优于基于视觉提示的方法的性能。
SOCO:视觉基础模型中语义对象对应性的基准测试
SOCO基准通过一致的部件级标注和关键点描述来评估视觉模型中的结构化对象理解,揭示了语言驱动定位与视觉对应之间的差距,同时证明了其对下游任务性能的强大预测能力。
ViSAGE:构建用于长视频理解的自我纠正记忆
ViSAGE是一个用于长视频理解的多模态智能体记忆框架,通过跨模态绑定、双向记忆精炼和多智能体交叉验证来构建自我纠正、以实体为中心的记忆,相比基线实现了5.9%的准确率提升。