JigShape:通过拼图评估视觉语言模型中的视觉-几何推理
摘要
介绍了 JigShape,一个带有互锁拼图块的拼图基准,用于评估视觉语言模型中的视觉-几何推理。研究发现,前沿视觉语言模型在几何推理方面大多失败,且所有模型在更大拼图尺寸下都会崩溃,揭示了约束满足方面的“扩展悬崖”。
查看缓存全文
缓存时间: 2026/08/12 08:19
论文页面 - JigShape:通过拼图评估视觉语言模型中的视觉-几何推理
来源:https://huggingface.co/papers/2607.27670
作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一项采用互锁拼块的新型拼图基准揭示,视觉语言模型在几何推理上表现不佳,并且随着拼图尺寸增大,性能急剧下降。
拼图求解需要对视觉内容和几何约束进行联合推理,然而现有基准使用矩形切割,在纹理重复区域会产生模糊的真实标签。我们引入了JigShape,这是一个采用凸凹互锁拼块(https://huggingface.co/papers?q=tab-and-blank%20interlocking%20pieces)的基准,其几何约束提供了强大的局部兼容性要求,与视觉内容相结合,可产生无歧义的真实标签。在四种网格密度(4×4 到 16×16)的 95K 个实例中,我们发现零样本视觉语言模型在很大程度上缺乏几何推理(https://huggingface.co/papers?q=geometric%20reasoning):五个前沿模型中只有一个(GPT-5.5)在 4×4 拼图上超过随机基线,其他模型均表现接近随机水平。尽管有监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning)在 4×4 上达到了 97% 以上的准确率,但所有模型在更大网格上均崩溃:GPT-5.5 在 8×8 上从 70% 降至接近随机水平,即使是微调后的模型在 12×12 上也低于 5%。这种“scaling cliff”(扩展悬崖)(https://huggingface.co/papers?q=scaling%20cliff)表明,随着拼块数量增加,当前架构无法保持一致的约束满足。这为视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)确立了可扩展几何推理(https://huggingface.co/papers?q=geometric%20reasoning)这一开放性挑战。
查看 arXiv 页面(https://arxiv.org/abs/2607.27670)查看 PDF(https://arxiv.org/pdf/2607.27670)项目页面(https://huggingface.co/datasets/ShawnLi02/JigShape-Train)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.27670)
在您的代理中获取此论文:
hf papers read 2607\.27670
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.27670 即可在页面中链接该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.27670 即可在页面中链接该数据集。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.27670 即可在页面中链接该 Space。
包含此论文的 Collections 0
没有包含此论文的 Collection
将此论文添加到收藏集(https://huggingface.co/new-collection)即可在页面中链接该论文。
相似文章
棋盘是捕捉VLM仍然出错之处的极好方法
一项非正式实验使用棋盘揭示了视觉语言模型尽管能正确识别棋子,但在空间推理和精确结构化输出方面常常失败,突显了VLM评估中的一个关键差距。
MentalThink:在Mental SVG World中塑造思维
MentalThink 引入了一种视觉-符号推理范式,用于多模态大语言模型(MLLMs),该范式使用SVG代码作为中间视觉表示进行多轮推理。通过SFT和RL的两阶段训练,在空间推理基准上取得了出色表现。
LVLMs 能否揭示视觉错觉背后的真相?感知与推理能力分析
本文介绍了 IllusionReasoning,一个使用真实世界视觉错觉的基准,用于联合评估大型视觉语言模型(LVLMs)的感知和推理能力,发现当前模型的推理能力并不像声称的那样先进。
求解非绘制:奥赛几何中图表推理的基准
本文介绍了一个用于评估几何中图表推理的开源基准,揭示了尽管基础模型如GPT和Claude在解决问题上表现出色,但它们难以生成忠实的图表。
从符号感知到逻辑推理:一个引导语言模型进行几何推理的框架
本文提出一个框架,通过几何视觉解析和符号求解来增强大型语言模型,使其在复杂几何问题上达到先进多模态模型的水平,并使用来自2025年中国中考的新基准进行评估。