CurveBench:嵌套约旦曲线精确拓扑推理基准
摘要
我们推出CurveBench,一个用于测试视觉语言模型是否能从不相交约旦曲线图像中恢复层次化区域包含树的基准。
查看缓存全文
缓存时间: 2026/05/15 08:24
论文页面 - CurveBench: 用于嵌套若尔当曲线精确拓扑推理的基准测试
来源: https://huggingface.co/papers/2605.14068 我们提出了 CurveBench 基准测试,用于检验视觉-语言模型能否从不相交若尔当曲线的图像中恢复层次化区域包含树。该任务针对视觉拓扑和结构化推理,超越简单的物体识别、计数或 OCR。
Hugging Face 集合包含论文、CurveBench 及 CurveBench-Easy 数据集、评估代码、真实标注生成资源以及微调产物。我们的结果表明,即使是强大的前沿 VLM 在较困难设定下也表现不佳,而经过微调的开源模型虽有改进,但仍远未解决该任务。
相似文章
ShapeCodeBench:合成形状场景中感知到程序重建的可再生基准
ShapeCodeBench是一个用于感知到程序重建的合成基准,模型需从光栅图像生成可执行的绘图程序,评估指标包括精确匹配和像素准确率。该基准通过种子随机数生成器实现可再生性,当前模型仍获得较低的精确匹配率,表明还有改进空间。
VCG-Bench:面向统一视觉中心的生成与编辑结构化基准
VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。
PlanBench-V: 面向视觉语言模型的空间规划地图基准
本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。
MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准
MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。
Flat-Pack Bench:通过家具组装评估大型视觉-语言模型的时空理解能力
介绍了Flat-Pack Bench,一个通过家具组装任务评估大型视觉-语言模型细粒度时空推理能力的基准测试。实验表明,当前的LVLMs在跟踪和空间交互方面存在困难。