自我演进的视觉提问器
摘要
本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。
查看缓存全文
缓存时间: 2026/06/17 19:52
论文页面 - 自我进化的视觉提问器
来源:https://huggingface.co/papers/2606.13929
摘要
一种视觉语言模型通过自我进化自主提升其问题生成能力,在不依赖外部监督的情况下,既提高了问题质量,也增强了回答者的性能。
视觉语言模型(Vision-language models,简称VLMs)通常被训练为被动的回答者,而其主动提出多样化、非 trivial、以视觉为中心且接地气问题的能力尚未得到充分探索。现有视觉提问器(visual questioner)的性能受限于高质量训练数据(training data)的可用性或数据整理成本。我们证明,VLM可以在没有任何外部监督的情况下,作为视觉提问器(visual questioner)持续自我改进。我们提出了一种自我进化框架(self-evolving framework),该框架利用VLM自身同时作为提议者和过滤器,生成更具难度、信息更丰富且以视觉为中心的问题(visual-centric questions),同时保持探索多样性以避免训练崩溃(training collapse)。这些问题随后被用于训练VLM的提问器模式和回答器模式(answerer mode)。为了评估提问器,我们引入了一种代理协议(agentic protocol),该协议从感知、推理和多样性三个维度评估问题。在多种骨干VLM上的实验表明,我们的方法显著提升了自主问题生成(question generation)的质量,并大幅扩展了其难度边界。在相同预算下,我们的自监督方法比在静态源数据上训练更为有效。此外,自我进化的提问器仍然是一个有竞争力甚至更好的回答器。
查看arXiv页面(https://arxiv.org/abs/2606.13929)查看PDF(https://arxiv.org/pdf/2606.13929)项目页面(https://joliang17.github.io/SelfEvolvingVQG/)GitHub0(https://github.com/tianyi-lab/SeeQ)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.13929)
在你的代理中获取这篇论文:
hf papers read 2606.13929
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
请在模型README.md文件中引用arxiv.org/abs/2606.13929以将其链接至此页面。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集README.md文件中引用arxiv.org/abs/2606.13929以将其链接至此页面。
引用此论文的Spaces0
没有Space链接到此论文
请在Space README.md文件中引用arxiv.org/abs/2606.13929以将其链接至此页面。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以将其链接至此页面。
相似文章
程序验证的视觉-语言模型自进化
本文介绍了VQS,一种用于自进化视觉-语言模型的方法,它使用程序验证从图像中生成和标注问题,显著提高了准确性和模型性能,优于现有基线。
基于视觉基础模型引导的注意力一致性纵向医学视觉问答
提出了一种用于纵向医学视觉问答的注意力引导编码器-解码器,使用冻结的基于DINO的掩码生成器和辅助损失函数来提高一致性和可解释性,在Medical-Diff-VQA基准上取得了强劲的结果。
ReVA: 用于视觉定位问答的区域感知视觉助手
ReVA 引入了一个区域感知的视觉助手,通过整合全图和区域级表示,增强了视觉定位问答,并减少了多模态大语言模型中的幻觉问题。
VLD-RAG:面向长篇幅、视觉丰富多页文档的智能视觉语言检索增强生成
本文提出 VLD-RAG,一种用于在长篇幅、视觉丰富文档上进行问答的智能多模态检索增强生成框架。它使用保留页面的索引和验证器引导的智能体工作流,改进跨页证据检索和推理,在 LongDocURL 和 MMLongBench-Doc 等基准测试上优于以往的基于视觉的基线方法。
SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准
SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。