SnapBench:为移动交互的即拍即问多模态检索建立基准测试

Hugging Face Daily Papers 论文

摘要

SnapBench引入了一个配对干扰基准测试,用于移动端稳健的即拍即问多模态检索,揭示图像噪声是关键降级因素,并提出一种自适应融合方法以增强模态可靠性。

移动AI作为视觉预言机,赋能用户拍摄物体照片并提问获取信息。即拍即问检索现已成为移动AI最常见的入口之一,但照片往往模糊,文本问题可能简短或输入错误。现有基准测试仅在干净输入上进行,或未能隔离即拍即问检索中的配对稳健性。因此,我们推出了SnapBench,首个用于稳健即拍即问多模态检索的配对基准测试,涵盖1,145个查询、9,085个图库项目,在53种受控干扰条件下,并附有人工标注。我们评估了16个多模态检索器,包括双塔编码器和基于嵌入的视觉语言模型。结果显示,图像干扰显著降低检索性能,而文本干扰主要影响纯文本检索,对联合检索影响有限。干净图像的纯图像检索往往优于联合检索,表明存在粗粒文本的拖累以及在噪声输入下缺乏跨模态回退机制。SnapBench为一个受控测试平台,用于评估即拍即问场景下的稳健检索。我们进一步提出MOOR(模态锚定、异常感知、最优重加权),一种简单的自适应融合方法,强调在即拍即问检索中进行可靠性感知的模态校准的必要性。
查看原文
查看缓存全文

缓存时间: 2026/09/03 07:50

论文页面 - SnapBench:移动设备即拍即问多模态检索基准测试

来源:https://huggingface.co/papers/2608.29607
发布于 8 月 30 日

·

由 https://huggingface.co/zrchen03 提交


zrchen (https://huggingface.co/zrchen03) 于 9 月 3 日

摘要

SnapBench 引入了用于移动设备即拍即问检索的配对扰动基准测试,揭示了图像噪声会严重降低多模态检索性能,并提出了一种自适应融合方法来校准模态可靠性。

移动AI作为视觉信息助手,使用户能够拍摄物体照片并提问查询信息。即拍即问检索(https://huggingface.co/papers?q=Snap-and-ask%20retrieval)现已成为移动AI最常见的入口之一,然而照片常因模糊影响效果,文本问题也可能简短或存在拼写错误。现有基准测试仅在干净输入下评估,或未能隔离即拍即问检索(https://huggingface.co/papers?q=snap-and-ask%20retrieval)中的配对鲁棒性。因此我们推出SnapBench——首个针对鲁棒性即拍即问多模态检索(https://huggingface.co/papers?q=multimodal%20retrieval)的配对基准测试,涵盖1,145个查询、9,085个图库条目,包含53种受控扰动条件及人工标注。我们评估了16个多模态检索器,覆盖双塔编码器(https://huggingface.co/papers?q=dual-tower%20encoders)与基于嵌入的视觉语言模型(https://huggingface.co/papers?q=embedding-based%20VLMs)。结果表明图像扰动会显著降低检索性能,而文本扰动主要影响纯文本检索,对联合检索影响有限。干净的纯图像检索常优于联合检索,说明存在粗糙文本拖累问题,且在噪声输入下缺乏跨模态回退机制(https://huggingface.co/papers?q=cross-modal%20fallback)。SnapBench为评估即拍即问场景中的鲁棒检索提供了受控测试平台。我们进一步提出MOOR(https://huggingface.co/papers?q=MOOR)(模态锚定、离群值感知、最优重加权),这是一种简单的自适应融合方法,强调了即拍即问检索(https://huggingface.co/papers?q=snap-and-ask%20retrieval)中可靠性感知模态校准(https://huggingface.co/papers?q=reliability-aware%20modality%20calibration)的必要性。

查看 arXiv 页面 (https://arxiv.org/abs/2608.29607) 查看 PDF (https://arxiv.org/pdf/2608.29607) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.29607)

通过代理获取论文:

hf papers read 2608\.29607

未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接到本文

在模型 README.md 中引用 arxiv.org/abs/2608.29607 以从此页面链接。

引用本文的数据集 1

yefd/SnapBench Viewer • 2 天前更新 • 10.2k • 40 • 1 (https://huggingface.co/datasets/yefd/SnapBench)

引用本文的空间 0

无空间链接到本文

在空间 README.md 中引用 arxiv.org/abs/2608.29607 以从此页面链接。

包含本文的收藏集 0

无收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

Blind-Spots-Bench:评估多模态模型中的盲点

arXiv cs.AI

介绍Blind-Spots-Bench,这是一个旨在揭示现代多模态AI模型在人类认为简单的任务上持续失败的基准。评估了一系列模型,揭示了性能差距,并且没有单一模型在所有任务类型中占据主导地位。