DICS:探索视觉指令选择中的数据内在一致性

Hugging Face Daily Papers 论文

摘要

DICS引入了一种自评分指标用于视觉指令数据选择,通过确保样本内一致性,以显著更少的数据提升视觉语言模型性能,优于最先进方法。

视觉指令微调对于提升视觉语言模型 (VLMs) 的视觉语言对齐和指令遵循能力至关重要。然而,在快速增长的大型数据集中,在固定比例约束下识别最优子集仍然是一个重大瓶颈。虽然现有方法主要依赖于分布多样性或启发式过滤,但它们常常忽视单个样本内部的一致性。为了弥合这一差距,我们提出了数据内在一致性 (DIC),这是一种自评分指标,旨在量化样本级的组件间一致性。DIC由两个模块组成:视觉信息一致性 (VIC),评估视觉内容与指令之间的对齐;以及响应信息一致性 (RIC),评估响应相对于指令的一致性。基于DIC,我们引入了数据内在一致性选择 (DICS),这是一种自适应数据选择方法,能够在不同的数据预算下优化高样本内一致性与全局分布多样性之间的权衡。大量实验表明,DICS在不同的数据集规模和模型架构上始终优于最先进方法,仅使用LLaVA-1.5-665K数据的25%就超越了全数据集微调。我们进一步整理了DICS-6M,这是一个包含600万样本的多模态指令语料库,使得迄今最大规模的视觉指令选择研究成为可能;值得注意的是,DICS仅使用不到官方InternVL3-8B-Instruct报告训练数据的25%,就达到了其94.52%的性能。代码可在 https://github.com/cqu-student/DICS 查看。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:46

论文页面 - DICS:探索视觉指令选择中的数据内在一致性

来源:https://huggingface.co/papers/2608.30209

摘要

DICS 通过衡量样本内部一致性来筛选高质量视觉指令数据,能够以极少的训练数据显著提升模型性能。

视觉指令微调 (https://huggingface.co/papers?q=Visual%20instruction%20tuning) 对于提升视觉-语言模型 (VLMs) (https://huggingface.co/papers?q=Vision-Language%20Models) 的视觉-语言对齐与指令遵循能力至关重要。然而,在数据集规模快速增长的情况下,如何根据固定比例约束识别最优子集仍是主要瓶颈。现有方法大多依赖分布多样性或启发式过滤,往往忽略了单个样本内部的连贯性。为弥补这一不足,我们提出数据内在一致性 (DIC) (https://huggingface.co/papers?q=Data%20Intrinsic%20Consistency),这是一种用于量化样本级组件一致性的自评分指标。DIC包含两个模块:视觉信息一致性 (VIC) (https://huggingface.co/papers?q=Visual%20Information%20Consistency),评估视觉内容与指令的对齐程度;响应信息一致性 (RIC) (https://huggingface.co/papers?q=Response%20Information%20Consistency),评估响应相对于指令的连贯性。基于DIC,我们引入了数据内在一致性选择 (DICS) (https://huggingface.co/papers?q=Data%20Intrinsic%20Consistency%20Selection),这是一种自适应数据选择方法,可在不同数据预算下优化高样本内一致性与全局分布多样性之间的权衡。大量实验证明,DICS在不同数据集规模和模型架构上均持续优于现有最优方法,仅使用LLaVA-1.5-665K数据集的25%数据,其性能就超越了全数据集微调。我们进一步构建了DICS-6M,这是一个包含600万样本的多模态指令语料库 (https://huggingface.co/papers?q=multi-modal%20instruction%20corpus),使得迄今为止最大规模的视觉指令选择研究成为可能;值得注意的是,DICS仅使用不到InternVL3-8B-Instruct官方报告训练数据量的25%,就达到了其94.52%的性能。代码详见 https://github.com/cqu-student/DICS

查看arXiv页面 (https://arxiv.org/abs/2608.30209) 查看PDF (https://arxiv.org/pdf/2608.30209) 项目页面 (https://cqu-student.github.io/DICS/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30209)

在您的代理中获取本文:

hf papers read 2608\.30209

没有最新的CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接本文

在模型README.md中引用 arxiv.org/abs/2608.30209 以从此页面链接。

引用本文的数据集 0

无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2608.30209 以从此页面链接。

引用本文的Spaces 0

无Space链接本文

在Space README.md中引用 arxiv.org/abs/2608.30209 以从此页面链接。

包含本文的集合 0

无集合包含本文

将本文添加到一个集合 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

视觉对比自蒸馏

Hugging Face Daily Papers

VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。

利用自监督指南提升视觉指令调优

Hugging Face Daily Papers

本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。

DataComp-VLM:面向视觉语言模型的改进型开放数据集

Hugging Face Daily Papers

本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。