SIMMER: 基于MLLM的跨模态食物图像-食谱检索

arXiv cs.CL 论文

摘要

SIMMER提出了一种新颖的基于MLLM的嵌入方法,用于跨模态食物图像-食谱检索,用统一编码器替代传统的双编码器架构,在Recipe1M数据集上取得了最先进的结果,相比先前方法有显著改进。

arXiv:2604.15628v1 公告类型: 交叉 摘要: 食物图像和食谱文本之间的跨模态检索是一项重要任务,在营养管理、饮食记录和烹饪辅助等应用中具有重要意义。现有方法主要依靠具有单独图像和文本编码器的双编码器架构,需要复杂的对齐策略和特定任务的网络设计来弥合模态之间的语义差距。在本项工作中,我们提出SIMMER(食谱的单一集成多模态模型),它应用多模态大语言模型(MLLM)嵌入模型(特别是VLM2Vec)来处理该任务,用单个统一编码器替代传统的双编码器范式,该编码器可以处理食物图像和食谱文本。我们设计了针对食谱结构特性的提示模板,食谱由标题、食材和烹饪步骤组成,使MLLM能够有效生成嵌入。我们进一步引入了一个组件感知数据增强策略,在完整和部分食谱上训练模型,改进了对不完整输入的鲁棒性。在Recipe1M数据集上的实验表明,SIMMER在1k和10k评估设置中都达到了最先进的性能,显著超过了所有先前的方法。特别是,我们的最佳模型将1k图像到食谱R@1从81.8%提高到87.5%,将10k图像到食谱R@1从56.5%提高到65.5%,相比先前最佳方法有明显改进。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:30

# 基于多模态大语言模型的跨模态食物图像-食谱检索

来源:https://arxiv.org/html/2604.15628

Keisuke Gomi、Keiji Yanai
[email protected][email protected]
电气通信大学
日本东京都调布市调布丘1-5-1 182-8585

###### 摘要

食物图像与食谱文本间的跨模态检索是一项重要任务,在营养管理、饮食记录和烹饪辅助等领域有广泛应用。现有方法主要采用双编码器架构,使用独立的图像和文本编码器,需要复杂的对齐策略和任务特定的网络设计来弥合模态间的语义差距。本文提出SIMMER(Single Integrated Multimodal Model for Embedding Recipes),将多模态大语言模型(MLLM)的嵌入模型(特别是VLM2Vec)应用于该任务,用单一统一编码器代替传统双编码器范式,同时处理食物图像和食谱文本。我们设计了针对食谱结构特性(包括标题、食材和烹饪步骤)的提示模板,使MLLM能有效生成嵌入。我们进一步引入组件感知的数据增强策略,在完整和不完整食谱上进行训练,提高了对不完整输入的鲁棒性。在Recipe1M数据集上的实验表明,SIMMER在1k和10k评估设置中都达到了最先进的性能,显著超越了所有现有方法。特别地,我们的最佳模型将1k图像到食谱的R@1从81.8%提升到87.5%,将10k图像到食谱的R@1从56.5%提升到65.5%,相比之前的最佳方法。

(a) 现有方法
(b) SIMMER(提议方法)

图1:现有方法与SIMMER的概览

## 1 引言

食物是日常生活的重要组成部分,全球对健康饮食习惯的关注持续增长。近年来,食谱分享平台和社交媒体使大量食物图像和食谱文本公开可得,推动了有效利用此类多模态数据的技术需求不断增加。在这一背景下,食物图像与食谱文本间的跨模态检索成为了一个重要的研究问题。该任务旨在实现双向检索:给定食物图像,系统检索相应的烹饪食谱;反之,给定食谱文本,系统检索匹配的食物图像。这些能力具有广泛的实际应用,包括营养管理、饮食记录和烹饪辅助。

同时,在计算机视觉和自然语言处理领域,诸如LLaVA和Qwen2-VL等多模态大语言模型(MLLMs)发展迅速,在图像和文本的整合理解中展现了卓越的能力。最近,一系列研究探索了将MLLMs重新用作嵌入模型。VLM2Vec和MM-Embed等方法表明,大规模预训练期间获取的丰富多模态知识可以有效转移以生成高质量的多模态嵌入。

然而,现有的跨模态食物图像-食谱检索方法主要依赖于双编码器架构,其中独立设计和训练独立的图像和文本编码器,如图1(a)所示。据我们了解,MLLMs尚未被应用于此任务。此外,双编码器方法通常需要精心设计的对齐策略和任务特定的网络设计来弥合视觉和文本模态间的语义差距。例如,ACME和R2GAN采用对抗训练来对齐跨模态的特征分布。H-T和T-Food引入了分层Transformer架构,特别针对由标题、食材和说明组成的结构化食谱文本。

本文提出SIMMER(Single Integrated Multimodal Model for Embedding Recipes),将MLLM嵌入模型(特别是VLM2Vec-V1和VLM2Vec-V2)应用于跨模态食物图像-食谱检索,如图1(b)所示。由于MLLMs在大规模多模态语料库上预训练,它们本质上具有在统一框架内处理图像和文本的能力。通过利用这种预训练知识,SIMMER消除了以往工作中必不可少的复杂对齐机制和专用架构的需要,同时仍能获得有效的跨模态嵌入。

我们通过在Recipe1M这个大规模的食物图像-食谱检索基准数据集上进行广泛实验来验证SIMMER的有效性。本文的主要贡献总结如下:

- 我们是第一个将MLLM嵌入模型应用于跨模态食物图像-食谱检索的工作,证明单一统一编码器可以取代传统的双编码器范式。
- 我们提出了一种编码结构化食谱数据(包括标题、食材和烹饪步骤)的方法,使其适合MLLM嵌入生成,以及一种组件感知数据增强策略,以提高对不完整食谱的鲁棒性。
- SIMMER在Recipe1M数据集上达到了最先进的性能,在图像到食谱和食谱到图像检索任务中都显著超越了所有现有方法。

## 2 相关工作

### 2.1 跨模态图像-文本嵌入

图像和文本的跨模态嵌入长期以来一直是活跃的研究领域。视觉-语义嵌入的早期工作开创了将图像和文本投影到共享向量空间的理念。DeViSE训练了从CNN图像特征到skip-gram语言模型学习的词嵌入空间的线性映射,使未见过的目标类别能够零样本识别。Kiros等人扩展了这个想法,通过对比排序目标联合学习图像和句子编码器,建立了在后续研究中广泛采用的视觉语义嵌入(VSE)框架。VSE++通过在排序损失中引入困难负样本挖掘来改进训练效率。SCAN通过在目标检测器检测的图像区域和单个词之间采用堆叠交叉注意力来进一步推进细粒度匹配,在图像-文本检索基准上取得了强大性能。

超越双编码器设计,一系列工作探索了用于视觉-语言理解的早融合Transformer架构。ViLBERT引入了带有共同注意力层的两流Transformer,在图像-文本对上预训练,而UNITER采用单流Transformer通过掩码语言/区域建模和图像-文本匹配来学习通用图像-文本表示。这些预训练的多模态Transformer显著改进了下游视觉-语言任务,但在推理时需要代价高昂的交叉注意力,限制了其在大规模检索中的使用。

基于这些基础,新一代模型将对比双编码器预训练扩展到网络规模数据。代表性方法包括CLIP、ALIGN、BLIP和SigLIP,它们通过独立编码器对图像和文本进行编码,并通过对比学习在共享表示空间中对齐它们。虽然这些模型在广泛的视觉-语言任务中取得了显著成功,但其双编码器设计固有地限制了跨模态交互的程度,使难以捕捉视觉和语言内容间的细粒度对应。

随着多模态大语言模型(MLLMs)的快速进展,出现了将MLLMs重新用作嵌入模型的新范式。VLM2Vec在大规模多模态嵌入数据集上微调预训练的MLLMs(如Phi-3.5、LLaVA和Qwen2-VL),在多模态嵌入基准上显著超越了传统的基于CLIP的模型。在此基础上,VLM2Vec-V2进一步扩展了训练数据,不仅包括图像和文本,还包括视频和视觉文档,扩大了MLLM嵌入的适用性。这些方法证明了在MLLM预训练期间获取的丰富世界知识和深层跨模态理解可以有效蒸馏为密集向量表示。受这些进展的启发,SIMMER将MLLM嵌入模型应用于食物图像和食谱文本的跨模态检索——一个迄今为止仅探索过双编码器方法的领域。

### 2.2 跨模态食物图像-食谱检索

自Recipe1M数据集发布以来,食物图像和食谱文本间的跨模态检索成为了一个积极研究的任务。与通用图像-文本检索相比,该问题的一个关键特性是食谱文本本质上是结构化的,通常由标题、食材列表和烹饪步骤序列组成。相应地,该领域的进展与(i)每个模态如何编码以及(ii)跨模态对齐目标如何利用这种结构化文本紧密相关。

早期方法主要遵循CNN-RNN食谱编码管道:图像编码器通常是在ImageNet上预训练的CNN,如VGG或ResNet,而食谱编码器使用Word2Vec嵌入后跟LSTM。在这个范式内,Salvador等人引入了用余弦相似度排序目标和语义正则化训练的联合嵌入模型。AdaMine提出了带有双三元组学习方案和自适应三元组挖掘的联合检索和分类框架。随后的几项工作通过添加对抗和生成辅助目标来改进对齐或鲁棒性,更明确地建模烹饪程序,引入噪声鲁棒和句子级别的食谱建模,或采用随机潜在变量来捕捉跨模态交互,同时保持推理效率。虽然这些方法有效,但这些早期食谱编码器通常依赖有限的语言预训练(如Word2Vec),难以捕捉长的、结构化食谱的更丰富的组合语义。

第二波工作强调了更丰富的食谱建模和更细粒度的图像-食谱对应。这包括结构感知的食谱编码器,如捕捉食谱组件间层次关系的树结构LSTM,以及具有基于翻译正则化的Transformer多语言食谱编码器(如X-MRS)。同时,许多方法专注于设计更强的跨模态交互和对齐机制(例如混合融合和模态内/间注意力、多子空间隐式对齐、模态对齐正则化和改进的度量学习目标、语义一致性注意力用于判别性食谱表示,以及基于解耦的生成作为辅助信号)。

随着Transformer架构的兴起,更强的骨干网络在两个模态上变得越来越常见。在食谱端,分层Transformer(H-T)通过编码食谱组件(标题、食材、说明)并在食谱组件上引入自监督目标而产生了影响,使得配对的图像-食谱数据和仅食谱样本都能使用。在这样的现代食谱编码器之上,一些方法在训练时显式建模跨模态交互,同时在推理时保持高效的单模态编码,例如在T-Food中用作多模态正则化的Transformer解码器。大约在同一时间,其他互补的方向也被探索了:在预计算嵌入之上的非参数检索,具有跨模态kNN型对齐(DaC),用于事件密集的文本-图像检索的事件导向模态对齐,在食物领域验证(EOMA),用于联合嵌入学习的TF-IDF增强食谱表示(MSJE),以及结构化"烹饪程序"表示来丰富程序语义。更多最近的基于Transformer的管道进一步细化了食谱编码器和训练制度(例如大批量训练和改进的组件级学习)。

近年来,大规模视觉-语言预训练,最显著的是CLIP,在适应结构化食谱时已成为食物检索的强大骨干。代表性例子包括组件感知提示学习以利用视觉-语言预训练模型而无需完全

相似文章

基于查询的跨模态投影器增强 Mamba 多模态大语言模型

arXiv cs.CL

本文提出了一种基于查询的跨模态投影器,通过交叉注意力机制对视觉标记进行压缩,以提升基于 Mamba 的多模态大语言模型的性能。该方法在视觉语言基准测试中同时提高了模型性能和吞吐量,并消除了手动设计二维扫描顺序的需求。

MiniCPM-V 4.5:通过架构、数据与训练配方打造高效多模态大语言模型

Papers with Code Trending

MiniCPM-V 4.5 是一款 8B 参数规模的多模态大语言模型,凭借统一的 3D-Resampler 架构、创新的数据策略以及混合强化学习方法,实现了高效率与卓越性能。据悉,该模型在显著降低 GPU 显存占用与推理耗时的同时,综合表现已超越更大规模的闭源及开源标杆模型。