CoVA-SFT: 用于视觉抽象链的大规模数据集
摘要
CoVA-SFT是一个大规模数据集与基准,专为训练多模态语言模型在视觉抽象链上构建,以提升视觉推理任务中超越基线的性能。
arXiv:2608.28958v1 公告类型:新
摘要:思维链(CoT)推理通过允许大语言模型(LLMs)将问题分解为中间步骤,极大地提升了其性能。尽管CoT在语言任务上广泛有效,但纯文本的CoT迫使模型将视觉问题序列化为笨拙的文本。尽管存在处理视觉输入的架构解决方案,但社区缺乏一个大规模、多步骤、自我纠正的数据集,来教模型在解决纯文本推理问题时如何构建和维护内部视觉工作空间。为了解决这一局限,我们推出了CoVA-SFT,这是一个高度结构化的语料库,包含51,900个样本,超过222,000个多模态推理步骤,涵盖5种不同的布局家族和17个复杂任务,以及CoVA-Bench,这是一个配套基准,包含1,700个保留测试样本,覆盖相同任务,以实现可重复评估。通过提供明确的推理公式、代理渲染和验证循环,CoVA-SFT教多模态语言模型交替使用文本和视觉抽象。我们通过展示在CoVA-SFT上微调的模型在CoVA-Bench上平均性能超过所有交错CoT基线两倍以上来验证数据集,尽管它们仍然落后于强大的纯文本CoT基线,凸显了未来工作的开放挑战。
查看缓存全文
缓存时间: 2026/09/01 12:12
# CoVA-SFT:用于视觉抽象链的大规模数据集 来源:https://arxiv.org/abs/2608.28958 查看PDF(https://arxiv.org/pdf/2608.28958) > 摘要:思维链推理通过允许大语言模型将问题分解为中间步骤,显著提升了其性能。虽然思维链在语言任务中广泛应用,但纯文本思维链迫使模型将视觉问题转化为笨拙的文本描述。尽管已有架构方案处理视觉输入,但社区缺乏大规模、多步骤、带自纠正的数据集,来指导模型在解决纯文本推理问题时如何构建和维护内部视觉工作区。为解决此局限,我们推出CoVA-SFT——一个高度结构化的语料库,包含51.9K样本,涵盖5种不同布局族和17项复杂任务中的超过222K多模态推理步骤;同时推出配套基准CoVA-Bench,包含1700个独立测试样本,覆盖相同任务以实现可复现评估。通过提供明确的推理公式化、智能体渲染和验证循环,CoVA-SFT能够教会多模态语言模型交错使用文本与视觉抽象。我们验证了该数据集,表明在CoVA-SFT上微调的模型在CoVA-Bench上平均性能超过所有交错思维链基线2倍以上,但仍不及强文本思维链基线,凸显了未来工作的开放挑战。 ## 提交历史 来自:吴宗汉 [查看邮件(https://arxiv.org/show-email/60a8652c/2608.28958)] **[v1]** 2026年8月29日(周六)00:03:13 UTC(4,657 KB)
相似文章
IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成
IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。
OpenCoF:通过视频生成学习推理
OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。
SOCO:视觉基础模型中语义对象对应性的基准测试
SOCO基准通过一致的部件级标注和关键点描述来评估视觉模型中的结构化对象理解,揭示了语言驱动定位与视觉对应之间的差距,同时证明了其对下游任务性能的强大预测能力。
超大视频推理套件
本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。
CaVe-VLM-CoT:一个可解释的视觉-语言模型框架
CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。