论视觉推理中的局部性与长度泛化

Hugging Face Daily Papers 论文

摘要

本文表明,最先进的视觉-语言模型在视觉推理中的长度泛化任务上因“全局捷径”而失败,并证明将局部中央凹感知与递归相结合能够实现鲁棒的分布外泛化。

人类视觉系统的一个显著特征是,它通过一系列局部中央凹瞥视来摄取视觉信息,而非单一的全局计算。这使得人类视觉与目前大多数流行的计算机视觉模型截然不同,后者通常以单次全局方式输入图像。因此,一个自然的问题是:局部、顺序的视觉模型除了在生物学上比全局模型更合理之外,是否还能提供根本性的计算优势?在这项工作中,我们从视觉状态追踪和长度泛化的角度研究了这一问题。受近期关于语言模型长度泛化研究的启发,我们研究了在需要跨图像聚合局部信息的简单视觉任务上训练的视觉模型的行为。我们的实验揭示,与语言模型类似,视觉模型可以学会利用全局捷径,从而在任务长度或复杂度上无法泛化。我们还表明,基于严格局部感知的递归视觉策略可以缓解这些失败,从而使模型能够在这些任务上实现泛化。我们的结果表明,局部注意力可能是鲁棒组合泛化中被忽视的一个基本要求。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:41

论文页面 - 视觉推理中的局部性与长度泛化

来源:https://huggingface.co/papers/2607.09061

你的眼睛并不会一下子看清整个场景——它们通过一系列中央凹注视快速扫视。现代视觉模型则一次性摄入整张图像。这种差异决定了模型能否泛化到分布外的场景。

Adobe Express - ACzVXh45Nj4LA_b8 (https://cdn-uploads.huggingface.co/production/uploads/648a1075e8bee5332919e0ab/r4r6yqLVbkSec15s-XtIj.gif)

我们构建了简单的视觉谜题(例如“读取这些开关、导航、追踪状态”),并在测试时让它们比训练时更长。SOTA VLM——GPT-5.4、Claude Sonnet 4.6、Qwen——能轻松解决短谜题……但一旦谜题变长,性能便断崖式下跌。一个小型循环智能体(绿色)能在测试时外推性能。即使经过任务特定训练,全局模型(Qwen)在分布外仍然失效。

image (https://cdn-uploads.huggingface.co/production/uploads/648a1075e8bee5332919e0ab/haw5xrN8qgr9zSgpCH1hd.png)

这种失败有一个名字:全局捷径。 当模型一次性看到整张图像时,它能记住一种并行的“技巧”,这种技巧在它见过的长度上有效——但并没有真正实现逐步计算。因此它在分布外失效。LLM 在奇偶校验/状态追踪任务上也出现了同样的问题。我们证明视觉领域也有同样的问题。

你可能会认为让模型变成循环模型(给它一个逐步更新的记忆)就是解决办法。但并非如此——单靠循环模型还不够。同一个循环 LSTM,采用三种方式观看图像:

  • 全局 — 一次性看到整张图像 → 性能崩溃
  • 局部 + 全局 — 添加小的高分辨率裁剪区域但保留全局视图 → 仍然崩溃
  • 中央凹注视 — 仅有小的局部一瞥,没有全局视图 → 在分布外实现了泛化。即使给循环网络整张图像,它仍然会记住捷径。局部性是必要的组成部分。

image (https://cdn-uploads.huggingface.co/production/uploads/648a1075e8bee5332919e0ab/H29jy3E70UGZAByM5FvNV.png)

现在反过来:固定局部一瞥,只更换骨干网络。严格的循环网络(LSTM/GRU/RNN)能泛化。Transformer、Mamba、xLSTM — 性能都会下降。因此配方是两者兼有:局部感知 + 循环。单独哪一项都不够,但结合起来就足够了。🔑

image (https://cdn-uploads.huggingface.co/production/uploads/648a1075e8bee5332919e0ab/ZEciJvAFuuC2NmMGbwatN.png)

这里有一个真正的权衡。小/低分辨率的一瞥 → 能泛化但探索缓慢。大/高分辨率的一瞥 → 易于探索但容易引入捷径。通过正确的一瞥设置,我们展示 FoveAgentLSTM 能在远超训练分辨率的条件下保持准确性——而全局模型仅在其训练的分辨率附近有效。

image (https://cdn-uploads.huggingface.co/production/uploads/648a1075e8bee5332919e0ab/wFn_RVTGTqfTGADq7BqDH.png)

但局部性 + 循环并非在所有地方都是免费的午餐——而了解何时它有帮助才是关键。在回忆任务中,全局 VLM 获胜,而我们的局部智能体落后。状态追踪需要循环 + 局部性。纯检索则不需要。这两者的分野与语言模型中的情况完全一致。

image (https://cdn-uploads.huggingface.co/production/uploads/648a1075e8bee5332919e0ab/ez6fFfLB1BVcjGzRJjOzn.png)

合成任务将机制分离出来。它能否迁移到真实任务?我们测试了对数学图表进行推理——寻找函数的根。在相同的视觉计算预算下,中央凹注视 Qwen 相比全局基线准确率提高了 +29 分(约 100%)。统一将分辨率提升 10 倍几乎没什么收益(+3.8 分)。与合成任务相同的教训:局部性 + 循环胜过暴力缩放。你如何花费视觉计算 > 你投入多少视觉计算。

image (https://cdn-uploads.huggingface.co/production/uploads/648a1075e8bee5332919e0ab/w8jext-ThQgMiH8oB5sGC.png)

X 帖子 (https://x.com/m_pulkit/status/2076839055640150474)

相似文章

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

更多推理,更低准确性?论视觉语言模型中推理的双重性

Papers with Code Trending

本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。