CurveBench:嵌套约旦曲线精确拓扑推理基准

Hugging Face Daily Papers 论文

摘要

我们推出CurveBench,一个用于测试视觉语言模型是否能从不相交约旦曲线图像中恢复层次化区域包含树的基准。

我们推出CurveBench,一个用于从视觉输入进行层次化拓扑推理的基准。CurveBench包含756张图像,图像中的约旦曲线两两不相交,涵盖简单、多边形、地形启发、迷宫式和密集计数等配置。每张图像都标注有一个有根树,编码平面区域之间的包含关系。我们将任务形式化为结构化预测:给定一张图像,模型必须恢复由曲线诱导的完整有根包含树。尽管任务在视觉上很简单,但评估的最强模型Gemini 3.1 Pro在CurveBench-Easy上仅达到71.1\%的树生成准确率,在CurveBench-Hard上为19.1\%。我们进一步通过RLVR风格的微调开放权重视觉语言模型展示了基准的实用性。我们训练的Qwen3-VL-8B模型在CurveBench-Easy上的树生成准确率从Qwen-3-VL-8B-Thinking的2.8\%提升至33.3\%,在我们的评估协议下超过了GPT-5.4和Claude Opus 4.5。剩余的差距,尤其是在CurveBench-Hard上,表明精确的拓扑感知视觉推理仍远未解决。
查看原文
查看缓存全文

缓存时间: 2026/05/15 08:24

论文页面 - CurveBench: 用于嵌套若尔当曲线精确拓扑推理的基准测试

来源: https://huggingface.co/papers/2605.14068 我们提出了 CurveBench 基准测试,用于检验视觉-语言模型能否从不相交若尔当曲线的图像中恢复层次化区域包含树。该任务针对视觉拓扑和结构化推理,超越简单的物体识别、计数或 OCR。

Hugging Face 集合包含论文、CurveBench 及 CurveBench-Easy 数据集、评估代码、真实标注生成资源以及微调产物。我们的结果表明,即使是强大的前沿 VLM 在较困难设定下也表现不佳,而经过微调的开源模型虽有改进,但仍远未解决该任务。

相似文章

ShapeCodeBench:合成形状场景中感知到程序重建的可再生基准

Hugging Face Daily Papers

ShapeCodeBench是一个用于感知到程序重建的合成基准,模型需从光栅图像生成可执行的绘图程序,评估指标包括精确匹配和像素准确率。该基准通过种子随机数生成器实现可再生性,当前模型仍获得较低的精确匹配率,表明还有改进空间。

VCG-Bench:面向统一视觉中心的生成与编辑结构化基准

arXiv cs.CL

VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。

PlanBench-V: 面向视觉语言模型的空间规划地图基准

arXiv cs.CL

本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。