面向视觉-语言模型的AdaBoost文本提示提升

arXiv cs.LG 论文

摘要

提出一种基于AdaBoost的文本提示提升(TPB)框架,通过顺序集成弱文本提示分类器来改进视觉-语言模型的少样本分类性能,并在跨模型迁移中保持增益。

arXiv:2607.00684v1 Announce Type: new 摘要:预训练的视觉-语言模型(VLM)的分类精度依赖于文本提示的质量。手工设计的模板和大语言模型(LLM)生成的描述不仅使预测更具可解释性,还使得相同的提示能够在异质VLM之间复用。最近的工作利用少量标注图像构建任务适应的文本提示。然而,现有的少样本文本提示方法在提示构建过程中并未明确关注误分类样本,导致即使增加样本量也只能带来边际改进。为了充分利用少样本监督,我们提出文本提示提升(TPB)——一种受AdaBoost启发的框架,将每个基于文本提示的分类器视为弱学习器,并通过明确针对困难、误分类样本来顺序聚合它们形成强集成。大量实验表明,TPB在文本空间中保留了任务内在的、模型无关的线索,从而实现稳健的跨模型迁移。在11个分类基准上,TPB提高了源模型的准确率,并在迁移到更大、能力更强的VLM时保持了样本驱动的增益,而现有方法难以维持这种改进。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:39

# AdaBoosting 文本提示用于视觉-语言模型  
来源:https://arxiv.org/html/2607.00684  

11institutetext:KT 公司,韩国  
22institutetext: 浦项科技大学 (POSTECH),韩国  
33institutetext: 国家人工智能研究实验室,韩国  
33email:[email protected], {changhwan.sung, mtablo, hoyoung.kim, jungseul.ok}@postech.ac.kr  
https://sung0503.github.io/TPB  

###### 摘要  

预训练视觉-语言模型(VLM)的分类精度依赖于文本提示的质量。手工制作的模板和大语言模型(LLM)生成的描述不仅使预测更具可解释性,还能在同一提示跨异构 VLM 复用。近期工作利用少量标注图像构建任务自适应的文本提示。然而,现有的少样本文本提示方法在构建提示时并未明确关注被错误分类的样本,导致即使增加更多样本,改进幅度也十分有限。为了充分利用少样本监督,我们提出文本提示提升(TPB),这是一个受 AdaBoost 启发的框架,将每个基于文本提示的分类器视为弱学习器,并通过显式针对困难、错误分类的样本来依次聚合它们形成一个强集成。大量实验表明,TPB 在文本空间中保留了任务固有且与模型无关的线索,从而实现了鲁棒的跨模型迁移。在十一个分类基准上,TPB 提升了源模型的精度,并在迁移到更大、更强大的 VLM 时保持了由样本驱动的增益,而现有方法难以维持这种改进。  

††脚注:⋆\star 这些作者对本文贡献均等。  
††脚注:†通讯作者。  

## 1 引言  

参见图注  

(a) VLM 推理 1 1 2 2 4 4 8 8 16 16 64 64 68 68 72 72 76 76 80 80 84 84 ViT-B/32 → ViT-L 样本数 平均精度 (%) TPB (我们的) ProAPO CoOp  

(b) 样本数量可扩展性  

图 1:TPB 的概念及其迁移鲁棒的样本可扩展性。  
(a) 软提示(例如 CoOp)通过反向传播优化连续提示向量,而基于文本的基线方法(例如 ProAPO)依赖于单组提示;TPB 则迭代构建一组提示库集合,形成强分类器。  
(b) 从 ViT-B/32 迁移到五个 ViT-L 规模 VLM 后的性能对比,其中虚线表示源模型性能,实线表示迁移后性能。  
CoOp 无法直接迁移,ProAPO 无法保持样本驱动的增益,而 TPB 保持了这些样本驱动的增益,同时在源模型上展现出优越的可扩展性。  

视觉-语言模型(VLM)[radford2021learning, jia2021align, cherti2023openclip, li2023clipa, tschannen2025siglip2, chuang2025metaclip2, fang2023dfn, sun2023evaclip] 如 CLIP [radford2021learning] 支持使用描述每个类别的自然语言文本提示进行零样本图像分类。在实践中,分类精度对提示的质量很敏感。为了避免劳动密集的人工提示工程,先前的研究 [menon2022dclip, pratt2023cupl, roth2023waffling, wu2023gpt4vis, ren2023chatgpt] 探索了基于 LLM 的自动提示生成。一种常见做法是使用通用指令(例如,“*What does a {class} look like?*”)查询大语言模型 [pratt2023cupl],从而生成仅基于 LLM 先验知识的提示。然而,这些提示通常缺乏对目标视觉分布的良好基础,并且由于类名歧义或幻觉而存在不准确性。最近的研究 [liu2024llmbo, qu2025proapo] 通过利用少量标注图像来促进发现任务优化的提示,从而解决了这种视觉基础不足的问题。为了利用这些少样本示例,这些方法通常优化一个单一的聚合指标(例如总体验证精度)作为提示生成的主要目标。然而,根本局限在于这样的指标可能被一组易识别样本所主导。一旦候选提示正确分类了这些简单实例,验证精度就会过早饱和,无法捕捉目标领域的更广泛视觉多样性。结果,这些方法往往对少样本集过拟合,即使有更多标注样本可用,也只能带来微小的提升。为了解决这些局限并有效利用少样本监督,我们提出了文本提示提升(TPB),其灵感来自经典的 AdaBoost 算法。TPB 不是优化一个在简单样本上快速饱和的单一提示,而是通过显式地将焦点转向“困难样本”,迭代构建一个自然语言提示集成(如图 1(a) 所示)。在每个提升轮次中,TPB 重新加权错误分类的训练样本,从而强制从 LLM 生成的池中选择能够解决这些特定错误的新提示。通过系统地解决失败模式,TPB 最大化了少样本示例的效用,覆盖更广泛的视觉变化,成功捕获了与模型无关的任务知识。在多种图像分类基准上的广泛评估表明,TPB 持续优于最先进的基线方法。图 1(b) 预览了跨五个 ViT-L 规模 VLM 的这种迁移鲁棒的样本可扩展性。通过有效利用少样本监督,TPB 在源模型上展现出优越的样本可扩展性。此外,尽管自然语言提示通过简单的重新嵌入本质上可以在异构 VLM 之间迁移,但先前的方法往往在迁移后无法保留由样本驱动的增益。相比之下,TPB 在迁移到更大、更强大的 VLM 时,保留了在源模型上观察到的样本驱动改进,即使在更高的样本数量下也能保持清晰的性能增益。我们的主要贡献总结如下:  

- • 我们提出了一个将 AdaBoost 与自然语言文本提示相结合的少样本提示框架,生成了一个提升集成,相比于以往的基于文本的方法,其样本可扩展性显著提升。  
- • 我们表明,提示集成通过简单的重新嵌入可以无缝地在异构 VLM 之间迁移,相较于现有的迁移基线实现了优越的跨模型性能。  
- • 我们在标准少样本基准和多个 VLM 骨干网络上进行了大量实验,并附有详细的组件分析。  

## 2 相关工作  

### 2.1 VLM 的提示自适应  

视觉-语言模型的提示策略大致分为软(连续)提示和硬(离散)提示两种范式。软提示通常称为提示学习,将可学习的连续上下文向量附加到类别名称上,实现参数高效的自适应 [zhou2022coop, zhou2022cocoop, khattak2023maple, khattak2023promptsrc, park2024prompt],但学到的提示位于特定模型的表示空间中,不可读且难以跨模型直接迁移。相比之下,硬提示优化搜索离散的自然语言标记,确保生成的提示保持人类可读,并可在不同 CLIP 风格编码器之间复用。为了高效地探索巨大的语言空间,近期方法利用 LLM 生成和精炼提示。例如,DCLIP [menon2022dclip] 和 CuPL [pratt2023cupl] 构建任务特定的描述,而进一步的方法则通过 LLMbo [liu2024llmbo] 中的对话反馈和 ProAPO [qu2025proapo] 中的进化搜索实现少样本自适应。另外,PEZ [wen2023hard] 采用基于梯度的硬提示优化技术。然而,尽管硬提示具有优势,大多数现有方法缺乏有效利用每个类别多于一个标注样本的机制。因此,它们的性能往往饱和,即使提供更多标注样本也只有微小提升。我们的工作遵循硬提示范式,但引入基于 AdaBoost 的框架,在保持可解释性和跨模型迁移能力的同时有效利用额外监督。  

### 2.2 AdaBoost 的多样化应用  

自适应提升(AdaBoost)[freund1997adaboost, zhu2005multi, friedman2000additive] 通过迭代地重新加权训练样本,强调那些被较早分类器错误分类的样本,从而顺序组合多个弱分类器。这一通用框架已被应用于各个领域。在计算机视觉领域,AdaBoost 广泛用于快速检测管线,如级联检测器 [viola2001rapid] 和积分通道特征检测器 [dollar2009integral]。在文本分类和信息检索中,提升将弱词汇谓词聚合成置信度评级的文档分类器 [schapire2000boostexter],并优化用于排序的成对排序 [freund2003efficient]。与这些应用不同,我们处理的是 VLM 的跨模态图像识别,将类别级文本提示视为将图像映射到类别相似度得分的弱分类器。  

## 3 方法  

参见图注  

图 2:我们提出的 TPB 框架概述。  
初始时,样本权重在少样本集 D\mathcal{D} 上均匀分布。在每个轮次 mmm 中,根据上一轮弱分类器的表现更新权重。然后,我们应用增强并通过 GPC 获得最优提示库集合 B⋆\mathcal{B}^\star;B⋆\mathcal{B}^\star 定义了当前的弱分类器。在最后一轮之后,所有弱分类器被聚合成一个单一的强分类器。  

我们提出文本提示提升(TPB),这是一个面向预训练 VLM 少样本自适应的提示集成框架,具有样本可扩展性和迁移鲁棒性。TPB 将类别级提示集合视为基于文本的弱分类器,并通过多轮提升风格的集成构建强分类器。我们首先在第 3.1 节中介绍预备知识,然后在第 3.2 节中介绍大型提示池,在第 3.3 节中介绍我们的弱学习器——贪心提示组合(GPC)。最后,在第 3.4 节中描述 GPC 如何集成到 TPB 提升循环中。TPB 的概述如图 2 所示。  

### 3.1 预备知识  

#### 3.1.1 使用文本提示的 VLM 分类  

我们考虑对图像 x\mathbf{x} 进行 KKK 类分类。给定一个预训练的 VLM,其图像编码器 EimgE_{\mathrm{img}} 和文本编码器 EtextE_{\mathrm{text}},我们形成一个 CLIP 风格的线性分类器,其权重是来自类别提示 tkt_k 的文本特征。具体地,类别 kkk 的 logit 由 Eimg(x)E_{\mathrm{img}}(\mathbf{x}) 与 Etext(tk)E_{\mathrm{text}}(t_k) 之间的余弦相似度计算:  

s(x,tk):=cos(Eimg(x),Etext(tk)).s(\mathbf{x}, t_k) := \cos\bigl(E_{\mathrm{img}}(\mathbf{x}), E_{\mathrm{text}}(t_k)\bigr).(1)  

与其依赖单个提示,多个提示可以分组为类别级提示库 Bk={tk,1,...,tk,nk}B_k = \{t_{k,1}, \dots, t_{k,n_k}\},并通过简单平均计算类别得分:  

s(x,Bk):=1|Bk|∑tk∈Bks(x,tk).s(\mathbf{x}, B_k) := \frac{1}{|B_k|} \sum_{t_k \in B_k} s(\mathbf{x}, t_k).(2)  

令 B:={B1,...,BK}\mathcal{B} := \{B_1, \ldots, B_K\} 表示类别级提示库的集合。然后使用该提示集合,通过固定温度 τ>0\tau > 0 对图像 x\mathbf{x} 进行推理:  

p(y=k∣x;B):=exp(s(x,Bk)/τ)∑i=1Kexp(s(x,Bi)/τ).p(y=k\mid\mathbf{x};\mathcal{B}) := \frac{\exp\bigl(s(\mathbf{x}, B_k)/\tau\bigr)}{\sum_{i=1}^K \exp\bigl(s(\mathbf{x}, B_i)/\tau\bigr)}.(3)  

基于这些概率,预测类别标签通过选择概率最高的类别确定:  

y^(x;B):=argmaxk∈{1,...,K}p(y=k∣x;B).\hat{y}(\mathbf{x};\mathcal{B}) := \operatorname*{argmax}_{k \in \{1,\dots,K\}} p(y=k\mid\mathbf{x};\mathcal{B}).(4)  

虽然先前的文本提示研究 [menon2022dclip, pratt2023cupl, roth2023waffling, liu2024llmbo, qu2025proapo] 仅构建一个集合 B\mathcal{B},我们的 TPB 框架顺序构建多个多样化的集合 {B(m)}m=1M\{\mathcal{B}^{(m)}\}_{m=1}^M。每个集合在 AdaBoost 风格的集成中定义了一个弱分类器,使我们能够明确针对困难样本,同时保持离散文本提示的模型迁移性。  

#### 3.1.2 AdaBoost 概述  

AdaBoost [freund1997adaboost] 是一种著名的集成算法,通过在重新加权的数据上迭代训练弱分类器,将弱学习器组合成强学习器。与通常使用决策树作为弱学习器的标准 AdaBoost 不同,我们的框架使用由提示集合 B\mathcal{B} 诱导的 VLM 分类器作为弱学习器。在每个提升轮次 m∈{1,...,M}m \in \{1,\ldots,M\} 中,我们构建一个提示集合 B(m)\mathcal{B}^{(m)}。由于弱分类器完全由 B(m)\mathcal{B}^{(m)} 诱导的 VLM 预测指定,在轮次 mmm 的目标是最小化训练集 D={(xi,yi)}i=1n\mathcal{D} = \{(\mathbf{x}_i, y_i)\}_{i=1}^n 上的加权分类误差:  

L(m):=∑i=1nwi(m)I[yi≠y^(xi;B(m))],\mathcal{L}^{(m)} := \sum_{i=1}^n w_i^{(m)} \mathbb{I}\!\left[y_i \neq \hat{y}(\mathbf{x}_i;\mathcal{B}^{(m)})\right],(5)  

其中 wi(m)w_i^{(m)} 是在轮次 mm 分配给第 i 张图像的权重,指示当前提示集合应关注该图像的程度,y^\hat{y} 表示方程 (4) 中定义的预测类别。在获得 B(m)\mathcal{B}^{(m)} 后,我们更新下一轮的样本权重,增加被错误分类(困难)样本的权重,减少正确分类样本的权重。这种拟合和重新加权过程重复进行,鼓励后续的提示集合优先处理剩余的困难示例。最终的预测通过聚合所有 MMM 轮的输出来获得。例如,可以通过加权多数投票进行聚合:  

y^final=argmaxk∑m=1Mα(m)⋅I[y^(x;B(m))=k],\hat{y}_{\mathrm{final}} = \operatorname*{arg\,max}_{k} \sum_{m=1}^M \alpha^{(m)} \cdot \mathbb{I}\!\left[\hat{y}(\mathbf{x};\mathcal{B}^{(m)}) = k\right],(6)  

其中 α(m)\alpha^{(m)} 是第 mmm 个弱学习器的权重。具体的重新加权和聚合规则取决于 AdaBoost 的变体;我们采用 SAMME.R [zhu2005multi],这是一个多类实值扩展,本文后续简称为 AdaBoost。  

### 3.2 大型提示池  

在开始提升循环之前,我们首先为每个类别 k∈{1,...,K}k \in \{1,\ldots,K\} 构建一个全面的提示池 P={P1,...,PK}\mathcal{P} = \{P_1, \dots, P_K\}。为了确保足够的表达能力,这些提示池既包含简单的基于模板的提示(例如,“*a photo of a beagle.*”),也包含由 LLM 生成的更丰富、更详细的句子(例如,“*beagles have large, floppy ears that hang down to the sides of their fac*

相似文章

TIPSv2:以更强的块-文本对齐推进视觉-语言预训练

Hugging Face Daily Papers

# 论文页面 - TIPSv2:以更强的块-文本对齐推进视觉-语言预训练 来源:[https://huggingface.co/papers/2604.12012](https://huggingface.co/papers/2604.12012) 发布时间:4 月 13 日 · 提交者 [https://huggingface.co/bingyic](https://huggingface.co/bingyic) [![](https://huggingface.co/avatars/05be62f5927b8586ef7cb927d47dcd83.svg)](https://huggingface.co/bingyic) [bingyi](https://huggingface.co/bingyic) 于 4 月 20 日 作者:,,,,,,,,,,,,,,,,,## 摘要

利用自监督指南提升视觉指令调优

Hugging Face Daily Papers

本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。

视频模型的视觉提示工程

Hugging Face Daily Papers

本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。