视频模型的视觉提示工程

Hugging Face Daily Papers 论文

摘要

本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。

在基础模型时代,模型的质量取决于其提示的质量。因此,提示工程已成为提升语言模型性能的重要技术。由于视频模型目前正成为视觉任务(如视觉推理)的基础模型,我们在此探究它们是否同样受益于视觉提示工程:自动修改任务图像以提升模型性能。例如,对于一个视觉物理推理任务(“球在穿过一组障碍物后落在哪里?”),一个抽象的草图式场景可以通过简单调用图像编辑模型变成照片级真实版本。我们发现,视觉提示工程(简称VIPE)能提升跨任务的视频推理性能。事实上,对于视频模型,视觉提示工程甚至比经典的基于文本的提示工程或测试时缩放更有效。最终,正如基于文本的提示工程系统性地提升语言模型性能一样,视觉提示工程可作为简单、计算高效的方法,从视频模型中引发更好的视觉推理性能。示例视频见项目页面:https://visual-prompt-engineering.github.io/。
查看原文
查看缓存全文

缓存时间: 2026/07/29 03:50

论文页 - 视频模型的视觉提示工程

来源: https://huggingface.co/papers/2607.25537

摘要

在基础模型时代,模型的表现完全取决于其提示的质量。因此,提示工程已成为提升语言模型性能的关键技术。鉴于视频模型目前正成为视觉任务(如视觉推理)的基础模型,我们在此探究它们是否同样能从视觉提示工程中受益:即通过自动修改任务图像来提升模型性能。例如,对于一个视觉物理推理任务(“球经过一组障碍物后落在哪里?”),通过简单调用图像编辑模型,可以将抽象草图风格的场景转化为照片级真实感版本。我们发现,视觉提示工程(简称VIPE)能提升视频模型在各类任务中的推理性能。事实上,对于视频模型,视觉提示工程比传统的文本提示工程或测试时扩展(test-time scaling)更为有效。最终,正如基于文本的提示工程能系统性地提升语言模型性能,视觉提示工程可作为简单、计算高效的方法,从视频模型中激发更好的视觉推理性能。示例视频请访问我们的项目页面:https://visual-prompt-engineering.github.io/。

查看 arXiv 页面 (https://arxiv.org/abs/2607.25537) 查看 PDF (https://arxiv.org/pdf/2607.25537) 项目页面 (https://visual-prompt-engineering.github.io/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25537)

引用本论文的模型

无模型链接本论文

请在模型 README.md 中引用 arxiv.org/abs/2607.25537 以从此页面链接。

引用本论文的数据集

无数据集链接本论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.25537 以从此页面链接。

引用本论文的 Spaces

无 Space 链接本论文

请在 Space README.md 中引用 arxiv.org/abs/2607.25537 以从此页面链接。

包含本论文的收藏

无收藏包含本论文

请将本论文添加到一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

当提示变成像素:面向多模态推理的提示区域对齐

arXiv cs.AI

本文介绍了可视化任务语义(VTS),一种受控干预方法,用于研究多模态大语言模型在图像中而非文本中被提问时的情况。研究显示,在所有测试模型和任务上,准确率均出现一致下降,并提出了提示区域对齐(prompt-region grounding)以恢复干净的任务表示,将VTS准确率从58.0提升至66.3。