为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径
摘要
本文研究了阻碍零样本组合动作识别中组合泛化能力的物体驱动捷径,提出了RCORE来缓解动词塌缩并提升未见组合的泛化能力。
查看缓存全文
缓存时间: 2026/07/10 06:15
论文页面 - 为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径
来源:https://huggingface.co/papers/2601.16211 TL;DR:我们量化了物体驱动捷径如何破坏视频理解中的组合泛化能力。
一个看到过“打开窗户”和“关闭抽屉”的模型,应该能够识别出“打开抽屉”——这是一种未见过的、但合理的动词-物体组合。但我们发现,当现有模型失败时,主要表现为动词崩溃现象:它们能正确识别物体,但动词判断错误。模型简单地假设了训练中与该物体最常搭配的动词,从而无法泛化到未见过的组合。
我们证明,这些物体驱动捷径并非模型容量不足或预训练知识欠缺所致。它们源于两个相互交织的结构性问题:(i) 稀疏的组合监督,以及 (ii) 动词与物体之间的学习不对称性(物体比动词更容易学习)。我们通过实验验证了这一点,并进一步提出了一套诊断工具,能够精确测量模型对共现统计数据的过拟合程度。
基于诊断的修复方案——RCORE(鲁棒组合表征)——直接缓解了这两个根本原因,并在多个基准测试中为未见过的组合泛化带来了持续的性能提升。
相似文章
CORE:面向冲突的通用多模态篡改检测推理
提出了CORE框架,赋予多模态大语言模型显式的冲突捕获能力,以实现可泛化的篡改检测,能够通过少量或零样本适应未见过的篡改类型。
以对象为中心的残差强化学习用于零样本Sim-to-Real VLA增强
一个以对象为中心的残差强化学习框架提升了视觉-语言-动作模型的零样本模拟到真实迁移能力,在无需真实世界训练的情况下,将操作任务的成功率从42%提高到76%。
Transformer模型学习中产生的捷径策略损害其持续组合推理能力
本研究论文探讨了Transformer模型(特别是BERT)在学习过程中产生的捷径策略如何削弱其持续组合推理能力。研究将BERT与ALBERT进行对比,发现ALBERT的循环特性为持续学习任务提供了更好的归纳偏置。
全息记忆用于知识图谱中的零样本组合推理:失败位置与原因的机制研究
本文研究了全息约简表示在知识图谱中零样本组合推理的应用,发现虽然单跳性能强劲,但组合推理仍因叠加记忆中的检索容量和干扰效应而失败,而非绑定-解绑代数的问题。
HRO:基于大型语言模型的零样本物体目标导航层次化房间到物体框架
提出了HRO,一种由大型语言模型驱动的层次化框架,用于零样本物体目标导航,模拟人类从粗到细的空间推理,在Gibson和HM3D数据集上实现了卓越的成功率和泛化能力。