Lens:将正确的语义视角聚焦于无训练多模态表示学习

arXiv cs.CL 论文

摘要

本文介绍了Lens,这是一个用于多模态表示学习的无训练框架,它解决了语义视角不对齐的问题,在MMEB数据集上取得了显著的性能提升,无需参数更新。

arXiv:2609.20252v1 Announce Type: new 摘要:高质量表示对于广泛的下游任务至关重要。专用嵌入模型明确优化用于表示学习,但其训练数据在规模和多样性上往往不如用于预训练现代大型语言模型和多模态大型语言模型的大规模语料库。大规模预训练和指令跟随使自回归模型能够选择相关证据、整合多模态信息,并在不同任务视角下推断语义,为无训练表示学习创造了独特机会。然而,我们的分析揭示,现有的语义激发方法不能可靠地将提取状态定向到下游任务所需的语义视角。因此,生成的表示往往仍由显著输入内容主导。我们将此问题表征为语义视角不对齐,并提出Lens,这是一个无训练框架,使表示读取任务定向。语义视角锚定将任务所需视角与任务特定的读取短语关联,指定后来用于提取的位置的解释角色。上下文化短语读取将相同短语放置在完整输入之后,并聚合其token状态,结合完整上下文访问与锚定视角。生成的表示反映任务条件下的证据整合和推断,而非显著内容的通用摘要。无需参数更新、架构修改或重排序,Lens在所有36个MMEB数据集上的整体Precision@1为63.9,优于最接近的同基线无训练嵌入基线10.2个百分点。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:14

# Lens:为免训练多模态表示学习引入合适的语义视角  
来源:https://arxiv.org/html/2609.20252  
Xinran Liu, Shouqian Shi†, Yixian Chen, Ruizhi Chen, Xin\-Wei Yao, Sheng Zhong†  
通讯作者:sqlite@nju\.edu\.cn  

###### 摘要  
高质量的表示对于广泛的下游任务至关重要。专门的嵌入模型显式地为表示学习而优化,但其训练数据在规模和多样性上通常远不及用于预训练现代大型语言模型和多模态大型语言模型的庞大语料库。大规模预训练和指令遵循使自回归模型能够选择相关证据、整合多模态信息,并在不同任务视角下推断语义,这为免训练表示学习创造了独特的机会。然而,我们的分析表明,现有的语义激发方法无法可靠地将提取的状态导向下游任务所需的语义视角。因此,所得表示往往仍由显著的输入内容主导。我们将此问题描述为*语义视角错位*,并提出了Lens——一个免训练框架,使表示读出具有任务导向性。*语义视角锚定*将任务所需视角与任务特定的读出短语相关联,指定了后来用于提取的位置的解释角色。*语境化短语读出*将相同的短语置于完整输入之后,并聚合其标记状态,结合了完整的上下文访问与锚定的视角。所得表示反映了任务条件下的证据整合与推理,而非显著内容的通用摘要。无需参数更新、架构修改或重排序,Lens 在所有36个MMEB数据集上实现了63.9的整体 Precision@1,比最接近的同主干免训练嵌入基线高出10.2个点。

## 引言  
自回归模型正越来越多地被重新用作通用表示模型。与专门的嵌入编码器不同,大型语言模型(LLMs)和多模态大型语言模型(MLLMs)被预训练以在多样化的指令和上下文下解释内容。因此,它们的隐藏状态不仅可以反映输入中明确存在的内容,还可以反映为特定任务应如何理解输入。这种能力使冻结的自回归模型成为免训练表示学习的一个有前景的基础。  
最近的研究开始将解码器隐藏状态转换为嵌入。基于训练的方法通过对比目标、嵌入监督或架构修改来适应预训练模型 BehnamGhader 等人 (2024 (https://arxiv.org/html/2609.20252#bib.bib2));Jiang 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib8));Lin 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib11));Zhang 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib19))。免训练方法则直接从冻结的隐藏状态中激发表示 Jiang 等人 (2024a (https://arxiv.org/html/2609.20252#bib.bib6));Lei 等人 (2024 (https://arxiv.org/html/2609.20252#bib.bib9));Springer 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib15));Jiang 等人 (2024b (https://arxiv.org/html/2609.20252#bib.bib7));Zhu 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib21))。在多模态设置中,E5\-V 为隐藏状态提取引入了语义引导 Jiang 等人 (2024b (https://arxiv.org/html/2609.20252#bib.bib7)),而 FreeRet 进一步结合了任务指令、噪声抑制和层选择 Zhu 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib21))。这些方法展示了冻结解码器在无需额外优化的情况下直接进行表示提取的潜力。  
尽管取得了这些进展,但我们对先前语义激发基线产生的代表性故障案例的分析揭示了一个跨任务的共同模式:提取的表示捕获了合理的输入语义,但强调了一个与下游比较所需不同的视角。参见说明  
图1:先前语义激发基线在不同下游任务中产生的代表性故障案例。  
如图1 (https://arxiv.org/html/2609.20252#Sx1.F1) 所示,分类要求将实例外观抽象为类别身份;视觉问答要求将问题与视觉证据整合以推导答案;组合检索要求解决指定修改的语义效果。然而,提取的表示仍然以即时显著内容为中心。  
观察到的这种视角不匹配反映了一个更深层次的局限性:现有的读出未能将解码器的任务条件理解完全转化为所得嵌入。我们将任务所需的语义视角与表示所表达的视角之间的不匹配定义为*语义视角错位*。  
为了解决这种错位,我们提出了Lens,一个免训练框架,将表示读出引导至所需的语义视角。Lens 将一个任务特定的读出短语与该视角相关联,并在完整的任务规范和输入后重用该短语。其语境化的状态将显式的语义角色与完整的先行上下文结合,它们的聚合产生了任务导向的表示,反映了模型更深层次的任务相关理解。组件消融、受控表示分析和定性案例共同支持这一机制,表明 Lens 将读出重定向到预期的语义,并更好地捕获类别抽象、问题条件推理和组合理解。  
Lens 无需参数更新、架构修改或重排序。我们的贡献总结如下:  
- • 通过跨任务错误分析,我们识别并描述了*语义视角错位*,这是一个反复出现的局限性,其中表示所表达的语义视角与下游比较所需的视角不同。  
- • 我们介绍了Lens,一个通用的免训练框架,它将冻结自回归模型的任务条件理解转换为导向任务且可直接比较的表示,建立了一个利用其语义和推理能力而无需额外优化的新视角。  
- • 我们在涵盖分类、视觉问答、检索和定位的所有36个 MMEB 数据集上提供了全面的实证证据。Lens 实现了63.9的整体 Precision@1,并比最接近的同主干免训练嵌入基线高出10.2个点。组件消融、受控表示分析和定性诊断进一步支持了所提出的机制并证明了其有效性。

## 相关工作  
### 多模态表示学习  
多模态表示学习将异构输入映射到一个嵌入空间,以支持高效的跨模态比较。双编码器模型如 CLIP Radford 等人 (2021 (https://arxiv.org/html/2609.20252#bib.bib14))、ALIGN Jia 等人 (2021 (https://arxiv.org/html/2609.20252#bib.bib5)) 和 SigLIP Zhai 等人 (2023 (https://arxiv.org/html/2609.20252#bib.bib17)) 从大规模配对数据中学习可迁移的视觉-语言表示。更新近的方法将多模态大型语言模型(MLLMs)重新用作通用嵌入模型。VLM2Vec 引入了大规模多模态嵌入基准,并通过对比学习在多样化的嵌入任务中适配 MLLMs Jiang 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib8))。MM\-Embed 通过模态感知的困难负样本挖掘改进了通用多模态检索 Lin 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib11)),而 GME 探索了大规模训练用于通用多模态嵌入 Zhang 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib19))。这些方法通过额外优化获得强表示。Lens 则直接从冻结的多模态解码器中提取任务导向的表示。

### 来自自回归模型的免训练表示  
自回归模型也已被用于无需参数更新的表示学习。在文本领域,PromptEOL 使用自然语言提示来激发句子表示 Jiang 等人 (2024a (https://arxiv.org/html/2609.20252#bib.bib6)),而 MetaEOL 结合多个激发的视图来捕获互补语义 Lei 等人 (2024 (https://arxiv.org/html/2609.20252#bib.bib9))。Echo embeddings 重复输入,使得后续标记状态在因果注意力下获得更完整的上下文 Springer 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib15))。这些方法表明提示设计和读出位置显著影响冻结解码器的表示质量。免训练多模态表示学习将这一思想扩展到 MLLMs。E5\-V 从语义激发的隐藏状态中推导嵌入 Jiang 等人 (2024b (https://arxiv.org/html/2609.20252#bib.bib7))。FreeRet 进一步改进了任务对齐、语义基础、噪声抑制和隐藏状态选择,并使用冻结模型进行检索和重排序 Zhu 等人 (2025 (https://arxiv.org/html/2609.20252#bib.bib21))。这些方法主要改进了如何激发和选择有意义的语义状态。Lens 解决了一个互补的局限性:所选状态是否表达了下游比较所需的语义视角。  
参见说明  
图2:Lens 概览。它将任务所需视角锚定到一个读出短语,并聚合该短语的完整上下文状态作为表示。

## 方法  
### 概览  
给定下游任务\tau,Lens 使用冻结的多模态自回归模型独立编码查询 q 和候选 c,产生表示,其相似度反映任务定义的兼容性。  
用户侧提示 \{任务指令\} \{角色映射\}  
回答格式:\{读出短语\} <\{任务相关语义\}>  
\{语义引导\} \{输入内容\}  
助手侧前缀 \{读出短语\}  
括号内的表达式针对每个任务以及查询和候选分别实例化。斜体标题区分用户和助手侧,不包含在模型输入中。完整的任务特定查询和候选提示在补充材料中提供。  
如图2 (https://arxiv.org/html/2609.20252#Sx2.F2) 所示,Lens 由两个耦合组件组成。*语义视角锚定*确立查询和候选应基于其进行比较的语义。*语境化短语读出*从模型的内部状态中提取这些语义的输入特定实现。前者决定表示应表达什么,后者决定该表示从哪里读取。  
任务所需语义视角是判断查询-候选兼容性所依据的任务特定语义内容。双方可能以不同方式推导或表达此内容,但它们的表示必须以可直接比较的形式组织它。任务指令定义兼容性关系,而角色映射指定每方如何贡献所需语义。回答格式将这些语义与共享的读出短语相关联,而语义引导指定当前输入应在由此产生的视角下如何解释。  
对于新闻分类,查询侧提示推导一篇文章传达的主题,而候选侧提示代表一个主题类别的含义。双方共享回答格式“新闻主题是:”和读出短语“新闻主题是:”,但它们的角色映射和语义引导分别实例化。读出短语的两次出现扮演互补角色。它在回答格式中的出现建立了它与任务所需语义视角的关联。它在助手侧的出现位于完整的任务和输入上下文之后,并提供用于构建表示的隐藏状态。因此,Lens 通过同一个语言短语将语义规范和语境化读出耦合在一起。

### 语义视角锚定  
表示相似性只有在其反映任务兼容性所依赖的语义时才有意义。一个表示可能捕获输入中显著且合理的属性,但如果这些属性不是查询和候选应基于其匹配的语义,那么该表示可能仍不适合进行比较。语义视角锚定通过确立表示相似性应反映的任务所需视角来解决这种不匹配。  
对于给定任务,此视角必须适用于双方输入,同时尊重它们不同的信息角色。查询可能需要从多模态上下文进行推理,而候选可能直接表达相关语义。角色映射在指定此区别的同时,围绕相同视角组织双方。  
Lens 通过回答格式将任务所需视角与共享的读出短语相关联:\{读出短语\} <\{任务相关语义\}>。完整的声明出现在输入之前,并将短语和任务相关语义置于显式的语言关系中。短语的第一次出现不用于表示。相反,完整的回答格式成为后续助手侧可用的先前上下文的一部分。  
锚定的视角必须对应于支配任务兼容性的语义,而不是对任一输入的无限制描述。它必须在查询和候选之间保持一致,即使它们的角色不同,并且回答格式和助手侧前缀中必须使用相同的读出短语。这些条件将双方表示置于共同的任务定义解释之下。  
语义引导指定了任务所需视角应如何从每方输入推导。它引导模型组织相关证据,执行所需的抽象或推理,并保留任务兼容性所需的语义区分。与定义共享视角的回答格式不同,语义引导可能根据查询和候选的信息角色而有所不同。  
通过在读出短语和任务所需视角之间建立显式关联,语义视角锚定在源头针对语义视角错位问题。它还产生了一个可测试的预测:修改或移除此关联应系统性地重定向所得表示,如表3 (https://arxiv.org/html/2609.20252#Sx4.T3) 所探讨的。

### 语境化短语读出  
语义视角锚定确立了与读出短语相关的解释。语境化短语读出将相同的短语置于完整提示之后,并提取其标记状态。因为这些标记出现在任务指令、角色映射、回答格式、语义引导和输入之后,它们的隐藏状态是基于锚定视角和当前输入上下文联合条件化的。所得状态在读出短语处编码当前输入,该短语已被锚定为任务所需视角的载体。聚合这些状态产生了模型理解的表示,该理解已根据任务进行条件化,而非仅反映原始输入内容。

相似文章

Lens:重新思考基础文本到图像模型的训练效率

Hugging Face Daily Papers

Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。

@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。

X AI KOLs Following

LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。