DICS:探索视觉指令选择中的数据内在一致性
摘要
DICS引入了一种自评分指标用于视觉指令数据选择,通过确保样本内一致性,以显著更少的数据提升视觉语言模型性能,优于最先进方法。
查看缓存全文
缓存时间: 2026/09/01 11:46
论文页面 - DICS:探索视觉指令选择中的数据内在一致性
来源:https://huggingface.co/papers/2608.30209
摘要
DICS 通过衡量样本内部一致性来筛选高质量视觉指令数据,能够以极少的训练数据显著提升模型性能。
视觉指令微调 (https://huggingface.co/papers?q=Visual%20instruction%20tuning) 对于提升视觉-语言模型 (VLMs) (https://huggingface.co/papers?q=Vision-Language%20Models) 的视觉-语言对齐与指令遵循能力至关重要。然而,在数据集规模快速增长的情况下,如何根据固定比例约束识别最优子集仍是主要瓶颈。现有方法大多依赖分布多样性或启发式过滤,往往忽略了单个样本内部的连贯性。为弥补这一不足,我们提出数据内在一致性 (DIC) (https://huggingface.co/papers?q=Data%20Intrinsic%20Consistency),这是一种用于量化样本级组件一致性的自评分指标。DIC包含两个模块:视觉信息一致性 (VIC) (https://huggingface.co/papers?q=Visual%20Information%20Consistency),评估视觉内容与指令的对齐程度;响应信息一致性 (RIC) (https://huggingface.co/papers?q=Response%20Information%20Consistency),评估响应相对于指令的连贯性。基于DIC,我们引入了数据内在一致性选择 (DICS) (https://huggingface.co/papers?q=Data%20Intrinsic%20Consistency%20Selection),这是一种自适应数据选择方法,可在不同数据预算下优化高样本内一致性与全局分布多样性之间的权衡。大量实验证明,DICS在不同数据集规模和模型架构上均持续优于现有最优方法,仅使用LLaVA-1.5-665K数据集的25%数据,其性能就超越了全数据集微调。我们进一步构建了DICS-6M,这是一个包含600万样本的多模态指令语料库 (https://huggingface.co/papers?q=multi-modal%20instruction%20corpus),使得迄今为止最大规模的视觉指令选择研究成为可能;值得注意的是,DICS仅使用不到InternVL3-8B-Instruct官方报告训练数据量的25%,就达到了其94.52%的性能。代码详见 https://github.com/cqu-student/DICS
查看arXiv页面 (https://arxiv.org/abs/2608.30209) 查看PDF (https://arxiv.org/pdf/2608.30209) 项目页面 (https://cqu-student.github.io/DICS/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.30209)
在您的代理中获取本文:
hf papers read 2608\.30209
没有最新的CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接本文
在模型README.md中引用 arxiv.org/abs/2608.30209 以从此页面链接。
引用本文的数据集 0
无数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2608.30209 以从此页面链接。
引用本文的Spaces 0
无Space链接本文
在Space README.md中引用 arxiv.org/abs/2608.30209 以从此页面链接。
包含本文的集合 0
无集合包含本文
将本文添加到一个集合 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
视觉对比自蒸馏
VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。
利用自监督指南提升视觉指令调优
本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。
DataComp-VLM:面向视觉语言模型的改进型开放数据集
本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。
idSCD:通过语义相关描述符识别训练数据集
本文介绍了 idSCD,一种使用语义相关描述符来识别数据集是否用于模型训练的白盒方法,在多种设置下均优于现有基线。
CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning
Introduces CODS, an iterative critic-guided data selection method for offline reinforcement learning that retains task performance at low data budgets by selecting high-residual transitions over multiple rounds.