视频模型中的视觉提示(阅读时间8分钟)

TLDR AI 论文

摘要

视觉提示工程(VIPE)自动修改任务图像以提升视频模型的推理性能,通常比基于文本的提示或测试时缩放更为有效。

DeepMind研究人员提出,视觉提示工程通过在推理前转换任务图像(例如将抽象草图转换为逼真场景)来提升视频模型的推理能力。
查看原文
查看缓存全文

缓存时间: 2026/07/30 18:26

# 视频模型的视觉提示工程 来源:https://visual-prompt-engineering.github.io/ Google DeepMind 标志 (https://deepmind.google/) \*核心团队 **太长不看版:** 正如基于文本的提示工程能系统性地提升语言模型性能,视觉提示工程(VIPE)作为一种简单且计算高效的方法,通过改造输入任务图像(例如,将抽象草图变得逼真),能激发视频模型更好的视觉推理能力。 物理 VPCT 原图 联合搜索 原图 连接点 原图 排序3个数 原图 迷宫 原图 RushHour 原图 物理 VPCT 联合搜索 连接点 排序3个数 迷宫 RushHour 物理 VPCT VIPE 联合搜索 VIPE 连接点 VIPE 排序3个数 VIPE 迷宫 VIPE RushHour VIPE 物理 VPCT 联合搜索 连接点 排序3个数 迷宫 RushHour ## 摘要 在基础模型时代,模型的好坏取决于其提示词。因此,提示工程已成为提升语言模型性能的关键技术。由于视频模型正逐渐成为视觉任务(如视觉推理)的基础模型,我们在此探究它们是否同样能从*视觉*提示工程中受益:即自动修改任务图像以提升模型性能。例如,对于一个视觉物理推理任务(“小球经过一组障碍物后,会落在哪里?”),抽象草图般的场景可以通过简单调用图像编辑模型转变为逼真的版本。我们发现视觉提示工程(简称 VIPE)能提升多项视频推理任务的性能。事实上,对于视频模型,视觉提示工程甚至比传统的基于文本的提示工程或测试时扩展更有效。最终,正如基于文本的提示工程系统性地改进语言模型性能一样,视觉提示工程可以作为一种简单且计算高效的方法,来激发视频模型更好的视觉推理能力。 ## 播客 收听 NotebookLM 生成的我们论文的播客概览: 您的浏览器不支持音频元素。 ## 任务示例 下面,我们展示每个任务及其不同难度的示例。我们展示了在原始图像上的尝试(通常失败)、在该任务和难度下最成功的 VIPE 变体上的尝试,以及通过自由式 VIPE 或原子概念编辑(ACE)VIPE 获得的其他 VIPE 变体。 ### 物理 VPCT (https://huggingface.co/datasets/camelCase12/vpct-1) 预测小球滚下斜坡后会落入哪个桶中。 **文本提示:**“小球以物理上合理的方式移动,滑下障碍物,最终落入底部三个容器之一。[...]” 原始尝试失败 物理 原图 工业工厂溜槽 成功 物理 VIPE #### 其他变体 变体 古代石遗迹 变体 烘焙厨房准备 变体 台球技巧击球 变体 糖果甜品景观 变体 粘土动画定格 变体 建筑工地钢材 变体 车库鲁布·戈德堡机械 变体 宏观森林自然 变体 弹珠轨道玩具 变体 迷你高尔夫球场 变体 霓虹赛博朋克街机 变体 办公桌用品 变体 复古弹珠机 变体 科学化学实验室 变体 蒸汽朋克黄铜机构 变体 水上乐园滑梯 变体 冬季冰坡 变体 木质物理谜题 变体 禅宗花园竹子 ### 联合搜索 定位由多个特征(如颜色和形状)共同定义的目标对象。 **文本提示:**“两个蓝色球开始发光。” 原始尝试失败 联合 原图 球形灯泡案例 成功 联合 VIPE #### 其他变体(自由式) 变体 街机摇杆面板 变体 台球桌绒布 变体 糖果组合台面 变体 深海生物发光 变体 DJ 混音器界面 变体 奇幻水晶球 变体 宝石首饰天鹅绒 变体 健身器材木地板 变体 节日装饰品雪地 变体 实验室等离子球 变体 宏观弹珠与骰子 变体 霓虹迷你高尔夫 变体 夜间泳池 LED 浮具 变体 逼真 3D 形状 变体 弹球街机缓冲器 变体 科幻能量核心 变体 合成波霓虹网格 变体 暮光 LED 博彩球 变体 复古玩具硬木 #### 其他变体(ACE) 变体 将两个蓝色圆圈的平面颜色替换为3D光泽材质 变体 将蓝色圆圈的平面渲染替换为3D光泽体积材质 变体 将两个蓝色球的边框设置为粗白边 变体 将蓝色球的平面颜色替换为3D光泽材质 变体 将蓝色圆圈的平面材质替换为光泽3D渲染 变体 将两个蓝色圆圈的材质设置为光泽3D玻璃 变体 将蓝色圆圈的渲染材质设置为3D光泽 变体 将蓝色球的材质设置为光泽3D球体 变体 将两个蓝色圆圈的材质设置为3D光泽球体 变体 将蓝色圆圈的尺寸替换为显著更大的比例 变体 将蓝色圆圈的尺寸设置为显著放大 变体 将蓝色圆圈的材质设置为光泽3D 变体 将非目标形状的颜色饱和度设置为完全去灰的灰度 变体 从所有非目标对象中移除颜色饱和度 变体 将所有红色圆圈和蓝色正方形的颜色替换为灰度 变体 将蓝色圆圈的材质设置为光泽3D球体 变体 将蓝色圆圈的材质设置为光泽3D球体 变体 将两个蓝色圆圈的平面着色替换为光泽3D材质 变体 将蓝色圆圈的材质设置为光泽3D ### 连接点 连接相同颜色的点。 **文本提示:**“使用线条连接每一对相同颜色的圆圈。” 原始尝试失败 连接点 原图 粗黑描边 成功 连接点 VIPE #### 其他变体(自由式) 变体 空中花圃 变体 积木板基板 变体 粉笔街头艺术 变体 软木板图钉 变体 刺绣箍 变体 结霜饼干烤盘 变体 发光霓虹节点 变体 健身房地板乙烯基点 变体 手机拼图界面 变体 PCB 终端节点 变体 复古街机 CRT 变体 圆形贴纸纸板 变体 缝纫纽扣布料 变体 合成器跳线板插孔 变体 蜡封羊皮纸 变体 湿丙烯颜料滴 变体 白板磁铁 变体 木制棋盘游戏筹码 变体 纱线钉板 变体 禅宗花园石头 #### 其他变体(ACE) 变体 将平面2D形状替换为体积3D球体 变体 将标准色调替换为高饱和霓虹色 变体 将每个圆圈边框设置为粗轮廓 变体 将纯白背景替换为深黑背景 变体 将圆圈的外边框设置为粗黑描边 变体 将当前背景色替换为高对比度深灰色 变体 将圆圈内部内容设置为匹配的文字标签 变体 将亮白背景替换为深石板背景 变体 将每个圆圈边框设置为粗黑描边 变体 将每个圆圈边框设置为粗白轮廓 变体 将圆圈的颜色饱和度设置为超鲜艳 变体 将圆圈的颜色饱和度设置为最大饱和霓虹色 变体 将圆圈的尺寸设置为显著更大 变体 将当前渲染风格替换为光泽3D球体 变体 将当前背景色替换为纯黑色 变体 将当前圆圈尺寸替换为放大40%的版本 变体 将圆圈的颜色饱和度设置为大幅提高 变体 将所有圆圈的尺寸设置为增大30% 变体 将纯白背景替换为纯黑背景 ### 排序3个数 将三个数字按升序排序。 **文本提示:**“数字按数值顺序依次弹出并消失,从最小的开始。” 原始尝试失败 排序 原图 复古街机精灵 成功 排序 VIPE #### 其他变体(自由式) 变体 AR 通知徽章 变体 泡泡糖气泡 变体 粉笔射击靶子 变体 干冰烟雾气泡 变体 巨形气泡膜 变体 玻璃灯泡 变体 光泽糖果滴 变体 发光烟花 变体 全息数据节点 变体 充气泳池浮具 变体 拿铁泡沫气泡 变体 编号气球 变体 纸浆皮纳塔 变体 波普艺术漫画斑点 变体 爆爆珠珍珠 变体 肥皂泡 变体 软胶果冻方块 变体 VR 瞄准训练目标 变体 水气球 #### 其他变体(ACE) 变体 将数字的渲染设置为3D浮雕 变体 将当前普通渲染替换为霓虹招牌美学 变体 将当前背景色替换为高对比度深色纯色 变体 将纯白背景替换为纯色高对比度深色 变体 将无菌环境替换为连贯的黑板纹理 变体 将每个数字的颜色设置为独特的鲜艳色调 变体 将每个数字的颜色设置为不同的饱和色调 变体 将2D平面字体替换为3D体积几何 变体 将当前平面字体替换为3D金属渲染文本 变体 将统一的黑色文本颜色替换为不同的饱和颜色 变体 将每个数字的空间边界设置为不同的几何框 变体 将数字的整体比例设置为统一放大 变体 将白色背景替换为深色高对比度背景 变体 将当前字体粗细替换为超粗重 变体 将当前统一的黑色文本颜色替换为不同的鲜艳颜色 变体 将数字的渲染设置为细微的体积3D几何 变体 将当前白色背景替换为深色纯色 变体 将场景的表面纹理设置为绿色黑板 变体 将数字的维度设置为微妙的浮雕3D ### 迷宫求解 在各种大小的迷宫中找到从起点到终点的路径。 **文本提示:**“基于提供的迷宫图像创建2D动画。红色圆圈沿白色路径平稳滑动,完美停在绿色圆圈上。[...]” #### 难度:5×5 迷宫 原始尝试失败 迷宫 5x5 原图 经典2D街机游戏 成功 迷宫 5x5 VIPE ##### 其他变体 变体 算法寻径可视化 变体 动画交通地图信息图 变体 经典 Flash 网页动画 变体 深色模式 GPS 追踪界面 变体 深色模式 UI 动画 变体 数字电路布线 变体 数字节奏游戏界面 变体 平面2D物理沙盒 变体 平面毡布定格动画 变体 光泽手机拼图界面 变体 工业 CAM 模拟 变体 分层2D动态图形 变体 哑光纸艺3D 变体 霓虹动态图形 变体 精确向量数学动画 变体 机器人吸尘器应用地图 变体 时尚2D向量拼图 变体 流畅街机桌面 变体 复古赛璐珞动画 #### 难度:7×7 迷宫 原始尝试失败 迷宫 7x7 原图 经典2D街机游戏 成功 迷宫 7x7 VIPE ##### 其他变体 变体 算法寻径可视化 变体 动画交通地图信息图 变体 经典 Flash 网页动画 变体 深色模式 GPS 追踪界面 变体 深色模式 UI 动画 变体 数字电路布线 变体 数字节奏游戏界面 变体 平面2D物理沙盒 变体 平面毡布定格动画 变体 光泽手机拼图界面 变体 工业 CAM 模拟 变体 分层2D动态图形 变体 哑光纸艺3D 变体 霓虹动态图形 变体 精确向量数学动画 变体 机器人吸尘器应用地图 变体 时尚2D向量拼图 变体 流畅街机桌面 变体 复古赛璐珞动画 #### 难度:9×9 迷宫 原始尝试失败 迷宫 9x9 原图 霓虹动态图形 成功 迷宫 9x9 VIPE ##### 其他变体 变体 算法寻径可视化 变体 动画交通地图信息图 变体 经典2D街机游戏 变体 经典 Flash 网页动画 变体 深色模式 GPS 追踪界面 变体 深色模式 UI 动画 变体 数字电路布线 变体 数字节奏游戏界面 变体 平面2D物理沙盒 变体 平面毡布定格动画 变体 光泽手机拼图界面 变体 工业 CAM 模拟 变体 分层2D动态图形 变体 哑光纸艺3D 变体 精确向量数学动画 变体 机器人吸尘器应用地图 变体 时尚2D向量拼图 变体 流畅街机桌面 变体 复古赛璐珞动画 #### 难度:不规则迷宫 原始尝试失败 迷宫 不规则 原图 数字节奏游戏界面 成功 迷宫 不规则 VIPE ##### 其他变体 变体 算法寻径可视化 变体 动画交通地图信息图 变体 经典2D街机游戏 变体 经典 Flash 网页动画 变体 深色模式 GPS 追踪界面 变体 深色模式 UI 动画 变体 数字电路布线 变体 平面2D物理沙盒 变体 平面毡布定格动画 变体 光泽手机拼图界面 变体 工业 CAM 模拟 变体 分层2D动态图形 变体 哑光纸艺3D 变体 霓虹动态图形 变体 精确向量数学动画 变体 机器人吸尘器应用地图 变体 时尚2D向量拼图 变体 流畅街机桌面 变体 复古赛璐珞动画 ### RushHour (https://jana-z.github.io/mentis-oculi/) 滑动方块,让红色汽车驶出网格。 **文本提示:**“[...] 规划释放红色汽车并使其驶出停车场所需的最少移动序列。输出:一个展示谜题完整解决方案的视频,一次移动一步。” #### 难度:第2关 原始尝试失败 RushHour L2 原图 阳极氧化金属拼图盒 成功 RushHour L2 VIPE ##### 其他变体 变体 3D游戏引擎视口 变体 自动化机械停车场 变体 雕刻木质拼图 变体 休闲手机游戏3D 变体 无人机沥青停车场 变体 宏观PCB电子 变体 磁性白板图表 变体 极简3D立体模型 变体 霓虹全息战术地图 变体 港口集装箱堆场 变体 复古像素艺术街机 变体 科幻磁悬浮列车库 变体 屏幕录制网页UI 变体 定格动画毡布手工 变体 带钉塑料积木玩具 变体 台球锦标赛桌 变体 玩具轨道车立体模型 变体 半透明冰块霜面 变体 复古纸板棋盘游戏 #### 难度:第3关 原始尝试失败 RushHour L3 原图 科幻磁悬浮列车库 成功 RushHour L3 VIPE ##### 其他变体 变体 3D游戏引擎视口 变体 阳极氧化金属拼图盒 变体 自动化机械停车场 变体 雕刻木质拼图 变体 休闲手机游戏3D 变体 无人机沥青停车场 变体 宏观PCB电子 变体 磁性白板图表 变体 极简3D立体模型 变体 霓虹全息战术地图 变体 港口集装箱堆场 变体 复古像素艺术街机 变体 屏幕录制网页UI 变体 定格动画毡布手工 变体 带钉塑料积木玩具 变体 台球锦标赛桌 变体 玩具轨道车立体模型 变体 半透明冰块霜面 变体 复古纸板棋盘游戏 ## 引用 `` @article{geirhos2026visual, title={Visual prompt engineering for video models}, author={Geirhos, Robert and Li, Yuxuan and Wiedemer, Thadd{\"a}us and Kalibhat, Neha and Wang, Zi and Malek, Mani and Tafjord, {\O}yvind and Swers ``

相似文章

视频模型的视觉提示工程

Hugging Face Daily Papers

本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。

当提示变成像素:面向多模态推理的提示区域对齐

arXiv cs.AI

本文介绍了可视化任务语义(VTS),一种受控干预方法,用于研究多模态大语言模型在图像中而非文本中被提问时的情况。研究显示,在所有测试模型和任务上,准确率均出现一致下降,并提出了提示区域对齐(prompt-region grounding)以恢复干净的任务表示,将VTS准确率从58.0提升至66.3。

LVLMs在指代通信中的隐式与显式提示策略

arXiv cs.CL

本文研究了关于大型视觉语言模型(LVLMs)能否协调高效指代表达的看似矛盾的发现。作者表明,当明确提示时,模型可以实现效率,但从隐式提示中无法推断出效率需求,揭示了人类与AI通信之间的关键差异。