AFMRL:电商中属性增强的细粒度多模态表征学习
摘要
阿里巴巴研究人员提出 AFMRL,一种两阶段框架,利用 MLLM 提取商品属性,增强细粒度多模态表征学习,用于电商检索任务。
arXiv:2604.20135v1 公告类型:新
摘要:多模态表征对电商任务(如同款商品检索)至关重要。大型表征模型(如 VLM2Vec)展现出强大的多模态理解能力,却在细粒度语义理解上表现不足,而这对区分高度相似的商品至关重要。为此,我们提出属性增强的细粒度多模态表征学习(AFMRL),将商品的细粒度理解定义为属性生成任务。该方法利用多模态大语言模型(MLLM)的生成能力,从商品图像和文本中提取关键属性,并通过两阶段训练框架增强表征学习:1)属性引导的对比学习(AGCL),将 MLLM 生成的关键属性用于图文对比学习训练,识别困难样本并过滤噪声假负例;2)检索感知的属性强化(RAR),将属性融合后表征模型检索性能的提升作为奖励信号,在多模态微调中增强 MLLM 的属性生成能力。在大规模电商数据集上的大量实验表明,我们的方法在多项下游检索任务中达到最先进性能,验证了利用生成模型推进细粒度表征学习的有效性。
查看缓存全文
缓存时间: 2026/04/23 10:03
# AFMRL:面向电商的属性增强细粒度多模态表征学习
来源:https://arxiv.org/html/2604.20135
张标,陈立鑫<sup>†</sup>,张斌<sup>†</sup>,王宗伟,刘彤,郑波
阿里巴巴淘宝天猫集团
###### 摘要
多模态表征对电商同款检索等任务至关重要。大型表征模型(如 VLM2Vec)虽具备强大多模态理解能力,却在细粒度语义理解上表现不足,而这是区分高度相似商品的关键。为此,我们提出“属性增强细粒度多模态表征学习”(AFMRL),将商品的细粒度理解定义为属性生成任务,利用多模态大语言模型(MLLM)从图文信息中提取关键属性,并通过两阶段训练框架增强表征学习:1)属性引导对比学习(AGCL),用 MLLM 生成的关键属性参与图文对比训练,精准挖掘难负例并过滤噪声假负例;2)检索感知属性强化(RAR),将属性融入后检索性能提升作为奖励信号,在多模态微调阶段反哺 MLLM 的属性生成。大规模电商数据集实验表明,本文方法在多项下游检索任务上达到 SOTA,验证了利用生成模型推进细粒度表征学习的有效性。
AFMRL:面向电商的属性增强细粒度多模态表征学习
张标<sup>†</sup>,陈立鑫<sup>†</sup>,张斌<sup>†</sup>,王宗伟,刘彤<sup>∗</sup>,郑波
阿里巴巴淘宝天猫集团
## 1 引言
图 1:通用领域与电商领域多模态信息对比。通用领域文本通常对整图进行全局描述,多个实例可交叉对应;电商领域商品标题往往仅描述图中主体实例。此外,同一商品存在多种图像(不同角度、背景)和标题(不同描述、营销话术)。
多模态表征学习正经历范式转变:从判别式匹配框架走向具备复杂理解与推理能力的生成模型(Jiang et al., 2025;Zhang et al., 2025, 2024a;Zhou et al., 2025)。在电商等场景,区分视觉相似商品依赖对细粒度属性的深度理解。准确检索不仅要把“红裙”匹配到图片,更要理解“深红色丝质 V 领 A 字短袖裙”这样的细节,这需要模型解析组合结构并捕捉微妙视觉线索。本文探索如何借助多模态大语言模型(MLLM)实现这一能力跃迁。
传统表征模型如 CLIP 基于判别式双塔结构,学习对齐度量空间,虽适用于宽泛语义检索,却常沦为“词袋”系统(Yuksekgonul et al., 2022),难以进行组合推理——例如易混淆“白色 T 恤配蓝色 Logo”与“蓝色 T 恤配白色 Logo”。相反,基于自回归的 MLLM 必须理解结构关系才能顺序生成连贯描述,其内在设计不仅嵌入了组合理解,还带来指令驱动灵活性与常识推理能力(Li et al., 2025)。
然而,将 MLLM 用于细粒度表征学习仍面临根本挑战:受因果注意力限制,现有大型表征模型通常采用全局平均池化(如 LLM2Vec)或末 token 隐状态(如 VLM2Vec)得到嵌入,无法兼容 ROI 等细粒度对齐技术。这引出了核心研究问题:如何利用 MLLM 的高级理解与指令遵循能力,突破其结构限制,服务电商细粒度任务?
我们的解决思路是把细粒度商品理解定义为关键属性生成任务。以“红裙”为例,若 MLLM 能从图文推断出“深红、丝质、V 领、A 字、短袖”等关键属性,即认为其具备强细粒度理解。接下来,如何将这些属性融入多模态表征学习?我们提出两阶段训练框架:
1. 属性引导对比学习(AGCL):先用 MLLM 为每件商品生成关键属性(如“麂皮材质、系带闭合、橡胶底”),再以这些属性为显式监督信号,在对比学习中精准挖掘难负例并过滤噪声假负例,提升模型判别力;
2. 检索感知属性强化(RAR):为解决生成文本属性与视觉表征的潜在失配,引入强化学习阶段,以表征模型自身为奖励函数,反哺属性生成模型,形成自提升闭环,确保生成属性与最终判别表征最大化对齐并带来收益。
综上,本文贡献如下:
- 首次系统研究并验证 MLLM 在电商细粒度表征学习中的应用;
- 提出融合 AGCL 与 RAR 的新框架,显著提升细粒度判别能力,并保证属性生成与表征学习对齐;
- 在挑战性电商数据集上的大量实验表明,本文方法在多项下游检索任务中达到 SOTA,验证了利用生成模型推进细粒度表征学习的有效性与优越性。
## 2 相关工作
### 2.1 细粒度多模态理解
现代多模态表征学习奠基模型 CLIP 通过大规模图文对比学习开启先河。后续研究致力于提升细粒度视觉-语言理解:FG-CLIP 利用难负例与区域级标注改进跨模态对齐;ECLIP 提出面向电商的实例中心预训练;E² 采用区域对比学习用于时尚检索。这些方法通过引入更细粒度信号增强模型判别性。近年来,LLaVA、CogVLM、DeepSeek-VL、Qwen2.5-VL 等 MLLM 借助大语言模型的世界知识与推理能力,从图文提取细节信息,在细粒度多模态任务上表现更强。
### 2.2 面向表征学习的生成模型
LLM 的巨大成功促使研究激增,旨在将纯解码器架构用于稠密表征学习。早期 LLM-Embedder 采用提示模板提取表征;LLM2Vec 通过启用双向注意力与掩码下一 token 预测,将预训练解码器转化为强文本编码器;NV-Embed 在对比训练中引入潜在注意力并移除因果掩码,提升嵌入效率。该趋势自然延伸至多模态领域,MagicLens、E5-V、VLM2Vec 等利用 MLLM 的卓越架构与推理能力,在指令引导检索与长程多模态编码任务上刷新基准。
图 2:框架总览。模型分两阶段训练:(a) 阶段一:属性引导对比学习,用增强对比损失训练表征模型,含假负例掩蔽与难负例重加权;(b) 阶段二:检索感知属性强化,用强化学习(GRPO)微调属性生成器,冻结的表征模型提供直接检索奖励;(c) 推理:优化后的生成器提取属性丰富查询,再由表征模型编码检索。
## 3 方法
本节介绍 AFMRL(属性增强细粒度多模态表征学习)。AFMRL 遵循“职责解耦”原则:采用两个专用模型——高效表征模型负责生成判别嵌入,强大属性生成器负责高层推理与局部特征提取。分离设计使各组件专精本职。核心前提是显式引入属性可解决细粒度检索中的关键歧义,尤其是视觉相似但语义不同的难负例。
图 3:属性引导学习过程及属性对检索影响的示意。
### 3.1 属性引导对比学习
图 4:检索感知属性强化训练流程总览。G 为属性生成器,R 为表征模型(冻结编码器,用于奖励计算)。
如图 3,AGCL 以 VLM2Vec 为基座嵌入模型,沿用 CLIP 的 InfoNCE 对比损失,但面临两大问题:1) 未能利用稠密嵌入之外的互补匹配信号;2) 对批内假负例(语义相似商品)施加惩罚。为此,AGCL 引入基于 MLLM 的属性生成器(从 Qwen2.5-VL-72B-Instruct 蒸馏,细节见附录 D),为每个训练样本生成关键属性,并增强标准 InfoNCE 损失。
具体而言,利用生成关键属性指导难负例选择:计算查询 q_i 与候选 p_j 属性间的 BM25 得分 B_ij,量化词汇相关性。高 BM25 得分表明词汇高度相似,即为难负例,应在训练中重点关注。将得分转为归一化重要性权重:
w_ij = e^{1 + tanh(B_ij)}. (1)
此外,对每例查询 q_i,计算其与批内所有候选 p_j 的余弦相似度 s_ij = cos(q_i, p_j),定义二值掩码:
M_ij = I[j ≠ i ∧ s_ij > s_ii + δ], (2)
若负样本与查询相似度超过预设 margin,则将其从批内剔除,得到有效负例集 N_i = {j : M_ij = 0},避免模型因正确识别语义相似样本而受罚。
最终损失函数综合上述策略,对每例查询 q_i,相似度经温度 τ 缩放后,AGCL 损失为:
L_AGCL = −log (w_ii e^{s_ii/τ} / (w_ii e^{s_ii/τ} + Σ_{j∈N_i} w_ij e^{s_ij/τ})).相似文章
FashionLens:面向多样化时尚图像检索的任务自适应学习
FashionLens提出了一种统一的多模态大语言模型时尚图像检索框架,采用自适应校准与采样策略,在多种检索场景下实现了最先进的性能。
精细粒度MLLM感知的区域级策略优化
Vision-RL²是一种方法,通过区域级强化学习压缩视觉令牌,在不进行全模型微调的情况下,提升多模态大型语言模型在多个基准测试中的精细粒度感知性能。
多模态长对话中的细粒度片段检索
本文提出了细粒度片段检索(FFR)这一新任务,旨在长对话中定位语义连贯的多模态片段(文本与图像)。作者提出了基于生成的检索模型 F2RVLM(通过强化学习训练)和两阶段检索系统 FFRS,并构建了新的评测数据集 MLDR。
LFRAG:面向布局的多模态文档理解细粒度检索增强生成
LFRAG提出了一种面向布局的细粒度检索增强生成框架,该框架在多模态文档中从页面级检索转向块级检索,在新提出的LFDocQA基准上实现了最先进的性能,并将令牌数量减少了73%。
BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架
本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。