自我演进的视觉提问器

Hugging Face Daily Papers 论文

摘要

本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。

视觉语言模型(VLMs)通常被训练为被动的回答者,而其主动提出多样化、非平凡、以视觉为中心且具有依据的问题的能力尚未得到充分探索。现有视觉提问器的性能受限于高质量训练数据的可用性或整理数据的成本。我们证明,无需任何外部监督,VLM 可以持续自我改进为视觉提问器。我们提出了一种自我演进框架,利用 VLM 自身同时作为提议者和过滤器,生成更难、更具信息性且以视觉为中心的问题,同时保持探索多样性以避免训练崩溃。随后,这些问题被用于以提问器和回答器两种模式训练 VLM。为评估提问器,我们引入了一种智能体协议,从感知、推理和多样性三个维度评估问题。在各种骨干 VLM 上的实验表明,我们的方法显著提升了自主问题生成的质量,并大幅扩展了其难度边界。在相同预算下,我们的自我监督比在静态源数据上训练更有效。此外,自我演进的提问器在作为回答器时仍保持竞争性甚至更优的表现。
查看原文
查看缓存全文

缓存时间: 2026/06/17 19:52

论文页面 - 自我进化的视觉提问器

来源:https://huggingface.co/papers/2606.13929

摘要

一种视觉语言模型通过自我进化自主提升其问题生成能力,在不依赖外部监督的情况下,既提高了问题质量,也增强了回答者的性能。

视觉语言模型(Vision-language models,简称VLMs)通常被训练为被动的回答者,而其主动提出多样化、非 trivial、以视觉为中心且接地气问题的能力尚未得到充分探索。现有视觉提问器(visual questioner)的性能受限于高质量训练数据(training data)的可用性或数据整理成本。我们证明,VLM可以在没有任何外部监督的情况下,作为视觉提问器(visual questioner)持续自我改进。我们提出了一种自我进化框架(self-evolving framework),该框架利用VLM自身同时作为提议者和过滤器,生成更具难度、信息更丰富且以视觉为中心的问题(visual-centric questions),同时保持探索多样性以避免训练崩溃(training collapse)。这些问题随后被用于训练VLM的提问器模式和回答器模式(answerer mode)。为了评估提问器,我们引入了一种代理协议(agentic protocol),该协议从感知、推理和多样性三个维度评估问题。在多种骨干VLM上的实验表明,我们的方法显著提升了自主问题生成(question generation)的质量,并大幅扩展了其难度边界。在相同预算下,我们的自监督方法比在静态源数据上训练更为有效。此外,自我进化的提问器仍然是一个有竞争力甚至更好的回答器。

查看arXiv页面(https://arxiv.org/abs/2606.13929)查看PDF(https://arxiv.org/pdf/2606.13929)项目页面(https://joliang17.github.io/SelfEvolvingVQG/)GitHub0(https://github.com/tianyi-lab/SeeQ)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.13929)

在你的代理中获取这篇论文:

hf papers read 2606.13929

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

请在模型README.md文件中引用arxiv.org/abs/2606.13929以将其链接至此页面。

引用此论文的数据集0

没有数据集链接到此论文

请在数据集README.md文件中引用arxiv.org/abs/2606.13929以将其链接至此页面。

引用此论文的Spaces0

没有Space链接到此论文

请在Space README.md文件中引用arxiv.org/abs/2606.13929以将其链接至此页面。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以将其链接至此页面。

相似文章

程序验证的视觉-语言模型自进化

Hugging Face Daily Papers

本文介绍了VQS,一种用于自进化视觉-语言模型的方法,它使用程序验证从图像中生成和标注问题,显著提高了准确性和模型性能,优于现有基线。

SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准

Hugging Face Daily Papers

SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。