为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径

Hugging Face Daily Papers 论文

摘要

本文研究了阻碍零样本组合动作识别中组合泛化能力的物体驱动捷径,提出了RCORE来缓解动词塌缩并提升未见组合的泛化能力。

零样本组合动作识别(ZS-CAR)要求识别由先前观察到的原始元素组成的新颖动词-物体组合。在本工作中,我们解决一个关键失败模式:模型通过物体驱动捷径(即依赖标注的物体类别)而非时间证据来预测动词。我们认为,稀疏的组合监督和动词-物体学习不对称性可能促进物体驱动捷径学习。我们通过提出的诊断指标进行的分析表明,现有方法过拟合于训练共现模式,并且未充分利用时间动词线索,导致对未见组合的泛化能力较弱。为了解决物体驱动捷径,我们提出了鲁棒组合表示(RCORE),包含两个组件。共现先验正则化(CPR)为未见组合添加显式监督,并通过将频繁共现先验视为硬负例来正则化模型。组合时间顺序正则化(TORC)强制时间顺序敏感性以学习时间上锚定的动词表示。在Sth-com和EK100-com上,RCORE减少了捷径诊断指标,从而提升了组合泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:15

论文页面 - 为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径

来源:https://huggingface.co/papers/2601.16211 TL;DR:我们量化了物体驱动捷径如何破坏视频理解中的组合泛化能力。

一个看到过“打开窗户”和“关闭抽屉”的模型,应该能够识别出“打开抽屉”——这是一种未见过的、但合理的动词-物体组合。但我们发现,当现有模型失败时,主要表现为动词崩溃现象:它们能正确识别物体,但动词判断错误。模型简单地假设了训练中与该物体最常搭配的动词,从而无法泛化到未见过的组合。

我们证明,这些物体驱动捷径并非模型容量不足或预训练知识欠缺所致。它们源于两个相互交织的结构性问题:(i) 稀疏的组合监督,以及 (ii) 动词与物体之间的学习不对称性(物体比动词更容易学习)。我们通过实验验证了这一点,并进一步提出了一套诊断工具,能够精确测量模型对共现统计数据的过拟合程度。

基于诊断的修复方案——RCORE(鲁棒组合表征)——直接缓解了这两个根本原因,并在多个基准测试中为未见过的组合泛化带来了持续的性能提升。

相似文章