SnapBench:为移动交互的即拍即问多模态检索建立基准测试
摘要
SnapBench引入了一个配对干扰基准测试,用于移动端稳健的即拍即问多模态检索,揭示图像噪声是关键降级因素,并提出一种自适应融合方法以增强模态可靠性。
查看缓存全文
缓存时间: 2026/09/03 07:50
论文页面 - SnapBench:移动设备即拍即问多模态检索基准测试
来源:https://huggingface.co/papers/2608.29607
发布于 8 月 30 日
·
由 https://huggingface.co/zrchen03 提交
zrchen (https://huggingface.co/zrchen03) 于 9 月 3 日
摘要
SnapBench 引入了用于移动设备即拍即问检索的配对扰动基准测试,揭示了图像噪声会严重降低多模态检索性能,并提出了一种自适应融合方法来校准模态可靠性。
移动AI作为视觉信息助手,使用户能够拍摄物体照片并提问查询信息。即拍即问检索(https://huggingface.co/papers?q=Snap-and-ask%20retrieval)现已成为移动AI最常见的入口之一,然而照片常因模糊影响效果,文本问题也可能简短或存在拼写错误。现有基准测试仅在干净输入下评估,或未能隔离即拍即问检索(https://huggingface.co/papers?q=snap-and-ask%20retrieval)中的配对鲁棒性。因此我们推出SnapBench——首个针对鲁棒性即拍即问多模态检索(https://huggingface.co/papers?q=multimodal%20retrieval)的配对基准测试,涵盖1,145个查询、9,085个图库条目,包含53种受控扰动条件及人工标注。我们评估了16个多模态检索器,覆盖双塔编码器(https://huggingface.co/papers?q=dual-tower%20encoders)与基于嵌入的视觉语言模型(https://huggingface.co/papers?q=embedding-based%20VLMs)。结果表明图像扰动会显著降低检索性能,而文本扰动主要影响纯文本检索,对联合检索影响有限。干净的纯图像检索常优于联合检索,说明存在粗糙文本拖累问题,且在噪声输入下缺乏跨模态回退机制(https://huggingface.co/papers?q=cross-modal%20fallback)。SnapBench为评估即拍即问场景中的鲁棒检索提供了受控测试平台。我们进一步提出MOOR(https://huggingface.co/papers?q=MOOR)(模态锚定、离群值感知、最优重加权),这是一种简单的自适应融合方法,强调了即拍即问检索(https://huggingface.co/papers?q=snap-and-ask%20retrieval)中可靠性感知模态校准(https://huggingface.co/papers?q=reliability-aware%20modality%20calibration)的必要性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.29607) 查看 PDF (https://arxiv.org/pdf/2608.29607) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.29607)
通过代理获取论文:
hf papers read 2608\.29607
未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接到本文
在模型 README.md 中引用 arxiv.org/abs/2608.29607 以从此页面链接。
引用本文的数据集 1
yefd/SnapBench Viewer • 2 天前更新 • 10.2k • 40 • 1 (https://huggingface.co/datasets/yefd/SnapBench)
引用本文的空间 0
无空间链接到本文
在空间 README.md 中引用 arxiv.org/abs/2608.29607 以从此页面链接。
包含本文的收藏集 0
无收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
MuteBench:不完整多模态融合中的模态不可用容忍度评估
MuteBench是一个基准测试,用于评估多模态融合模型在临床数据集上的模态缺失和模态内部缺失条件下的性能。它提供了关于架构鲁棒性的见解,并表明基于扩散的插补方法可以有所帮助。
SMMBench:面向源分布的多模态智能体记忆基准测试
提出SMMBench,一个用于评估多模态智能体从独立来源(如对话、表格和文档)中检索、对齐和组合分散证据能力的基准。实验表明,当前系统在此类源分布记忆组合任务上仍存在困难。
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。
Blind-Spots-Bench:评估多模态模型中的盲点
介绍Blind-Spots-Bench,这是一个旨在揭示现代多模态AI模型在人类认为简单的任务上持续失败的基准。评估了一系列模型,揭示了性能差距,并且没有单一模型在所有任务类型中占据主导地位。
MMShopBench:面向多模态、多轮购物代理的真实日志基准
MMShopBench 引入了一个面向多模态、多轮购物代理的真实日志基准,要求从用户图像和对话中进行联合推断,并配备离线沙盒和训练集以提升开源模型性能。