JigShape:通过拼图评估视觉语言模型中的视觉-几何推理

Hugging Face Daily Papers 论文

摘要

介绍了 JigShape,一个带有互锁拼图块的拼图基准,用于评估视觉语言模型中的视觉-几何推理。研究发现,前沿视觉语言模型在几何推理方面大多失败,且所有模型在更大拼图尺寸下都会崩溃,揭示了约束满足方面的“扩展悬崖”。

拼图求解需要同时推理视觉内容和几何约束,然而现有基准使用矩形切割,在纹理重复区域会产生模糊的真值。我们引入了 \ours{}——一个具有榫槽互锁拼图块的基准,其中几何约束提供了强大的局部兼容性要求,与视觉内容结合后可产生无歧义的真值。在 95K 个实例、四种网格密度(4×4 到 16×16)上,我们发现零样本视觉语言模型大多缺乏几何推理能力:五个前沿模型中只有一个(GPT-5.5)在 4×4 拼图上超过随机基线,其余模型均处于随机水平。虽然监督微调在 4×4 上达到 >97% 的准确率,但所有模型在更大网格上均崩溃:GPT-5.5 在 8×8 上从 70% 跌至接近随机,甚至微调模型在 12×12 上也低于 5%。这种“扩展悬崖”表明,当前架构无法随着拼图块数量的增加而保持一致的约束满足能力。这使可扩展的几何推理成为视觉语言模型面临的一个开放挑战。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:19

论文页面 - JigShape:通过拼图评估视觉语言模型中的视觉-几何推理

来源:https://huggingface.co/papers/2607.27670

作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

一项采用互锁拼块的新型拼图基准揭示,视觉语言模型在几何推理上表现不佳,并且随着拼图尺寸增大,性能急剧下降。

拼图求解需要对视觉内容和几何约束进行联合推理,然而现有基准使用矩形切割,在纹理重复区域会产生模糊的真实标签。我们引入了JigShape,这是一个采用凸凹互锁拼块(https://huggingface.co/papers?q=tab-and-blank%20interlocking%20pieces)的基准,其几何约束提供了强大的局部兼容性要求,与视觉内容相结合,可产生无歧义的真实标签。在四种网格密度(4×4 到 16×16)的 95K 个实例中,我们发现零样本视觉语言模型在很大程度上缺乏几何推理(https://huggingface.co/papers?q=geometric%20reasoning):五个前沿模型中只有一个(GPT-5.5)在 4×4 拼图上超过随机基线,其他模型均表现接近随机水平。尽管有监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning)在 4×4 上达到了 97% 以上的准确率,但所有模型在更大网格上均崩溃:GPT-5.5 在 8×8 上从 70% 降至接近随机水平,即使是微调后的模型在 12×12 上也低于 5%。这种“scaling cliff”(扩展悬崖)(https://huggingface.co/papers?q=scaling%20cliff)表明,随着拼块数量增加,当前架构无法保持一致的约束满足。这为视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)确立了可扩展几何推理(https://huggingface.co/papers?q=geometric%20reasoning)这一开放性挑战。

查看 arXiv 页面(https://arxiv.org/abs/2607.27670)查看 PDF(https://arxiv.org/pdf/2607.27670)项目页面(https://huggingface.co/datasets/ShawnLi02/JigShape-Train)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.27670)

在您的代理中获取此论文:

hf papers read 2607\.27670

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27670 即可在页面中链接该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.27670 即可在页面中链接该数据集。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27670 即可在页面中链接该 Space。

包含此论文的 Collections 0

没有包含此论文的 Collection

将此论文添加到收藏集(https://huggingface.co/new-collection)即可在页面中链接该论文。

相似文章

棋盘是捕捉VLM仍然出错之处的极好方法

Reddit r/artificial

一项非正式实验使用棋盘揭示了视觉语言模型尽管能正确识别棋子,但在空间推理和精确结构化输出方面常常失败,突显了VLM评估中的一个关键差距。

MentalThink:在Mental SVG World中塑造思维

arXiv cs.AI

MentalThink 引入了一种视觉-符号推理范式,用于多模态大语言模型(MLLMs),该范式使用SVG代码作为中间视觉表示进行多轮推理。通过SFT和RL的两阶段训练,在空间推理基准上取得了出色表现。