SLAPBench:面向四指SLAP指纹验证的多模态大语言模型基准测试

arXiv cs.AI 论文

摘要

介绍SLAPBench,这是首个用于评估多模态大语言模型在四指SLAP指纹验证上的基准测试,研究发现提示策略和模型能力对性能有显著影响。

arXiv:2607.15517v1 公告类型:cross 摘要:四指SLAP指纹是一只手食指、中指、无名指和小指的平面活体扫描图像,用于边境管控和执法中的身份验证。此前尚无基准测试评估多模态大语言模型(MLLM)能否从SLAP图像验证身份。我们提出SLAPBench,这是首个基于MLLM的四指SLAP指纹验证基准测试,基于NIST SD302b构建,包含7,832对(176对同源,7,656对非同源)。我们评估了四个开源MLLM(InternVL3-8B、Qwen2.5-VL-7B、Qwen3-VL-8B、Gemma-3-12B)以及专有的Claude Opus 4.8,在零样本、任务描述和相似度评分提示下进行测试。 提示控制验证行为。任务描述提示使四个开源模型全部崩溃,错误接受率(FAR)接近100%;Gemma-3-12B在零样本下同样崩溃;只有Claude Opus 4.8在两种二元提示下均能抵抗崩溃,取得最佳二元结果(FAR=20.2%)。相似度评分消除了开源模型的崩溃,并暴露了巨大的能力差距:Claude的AUC达到0.953,Gemma-3-12B为0.837,而InternVL3-8B发生倒置(AUC=0.590),Qwen2.5-VL-7B接近随机(0.567)。Qwen3-VL-8B实现了完美分离(AUC=1.000),我们将其视为诊断而非能力:SD302b每个手指位置只有一个SLAP捕获,因此同源对是跨分辨率的。一个匹配分辨率的对照实验保留了完美得分,排除了分辨率捷径;在SD302b内无法排除的是近乎重复检测,因为同源对是一次捕获的两次渲染。对性别、种族和年龄的公平性探测表明,随着区分能力减弱,差异增大。SLAPBench建立了首个SLAP特定的MLLM基线,并表明提示控制崩溃,而模型能力控制区分。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:26

# 四指SLAP指纹验证的多模态大语言模型基准测试  
来源:https://arxiv.org/html/2607.15517  

11计算机科学系,威斯康星大学绿湾分校,美国威斯康星州绿湾  

###### 摘要  

四指SLAP指纹是同一只手的食指、中指、无名指和小指的平面活体扫描图像。它们广泛用于高风险场景中的身份验证,包括边境管控、入境筛查、执法、犯罪背景调查和国家身份管理。尽管具有重要的操作意义,但目前尚无基准测试评估过多模态大语言模型(MLLM)是否能从SLAP指纹图像中验证身份。我们提出了**SLAPBench**,这是首个基于MLLM的四指SLAP指纹验证基准测试,它基于NIST Special Database 302b(SD302b)构建。SD302b是一个操作级指甲到指甲指纹数据集,包含201名参与者的数据,在多个设备上以500和1000 PPI分辨率采集。我们采用以冒名顶替者为主的全部配对协议构建了7,832个验证对,包括176个真匹配对和7,656个非匹配对。我们在三种提示策略下评估了四个开源MLLM(InternVL3-8B-Instruct、Qwen2.5-VL-7B-Instruct、Qwen3-VL-8B-Instruct和Gemma-3-12B-IT)以及专有模型Claude Opus 4.8:零样本提示、任务描述提示和连续相似度评分。提示设计对验证行为有显著影响。任务描述提示导致所有开源模型崩溃至近100%的误接受率(FAR),而Gemma-3-12B-IT在零样本提示下也发生崩溃。只有Claude Opus 4.8在两种二元提示下均避免崩溃,并取得了最佳二元结果,FAR=20.2%。连续相似度评分消除了开源模型的崩溃,并揭示了判别能力的明显差异。Claude Opus 4.8的AUC=0.953,EER=11.8%;紧随其后的是Gemma-3-12B-IT,AUC=0.837,EER=15.1%。InternVL3-8B-Instruct出现校准倒置(AUC=0.590),Qwen2.5-VL-7B-Instruct接近随机(AUC=0.567)。Qwen3-VL-8B-Instruct实现了完美分离(AUC=1.000,EER=0.0%);然而,我们将其视为诊断性结果,而非生物识别能力的证据。由于SD302b每个手指位置仅提供一次SLAP采集,真匹配对必须跨分辨率形成,这引发了一个担忧:模型可能利用分辨率而非身份进行判别。我们运行了一个匹配分辨率控制实验,使两个类别都变为跨分辨率,完美分离仍然存在(AUC=1.000),从而排除了分辨率捷径的可能性。仍存在且无法在SD302b内测试的是:一个真匹配对是同一采集的两次渲染,因此模型可能是在检测近乎重复的图像。我们因此将此视为关于MLLM生物识别基准测试如何构建的一个警示性发现。最后,按性别、种族和年龄的分层分析表明,当模型判别能力较弱时,人口统计差异增加,尽管子组大小限制使其仅为初步的公平性探测。总体而言,SLAPBench建立了首个SLAP特定的MLLM验证基线,并表明提示决定了崩溃,而模型能力决定了能否恢复有意义的指纹判别能力。

## 1 引言  

四指SLAP指纹是通过同时采集一只手的食指、中指、无名指和小指获得的平面活体扫描图像。这些图像广泛用于高风险操作场景中的身份验证,包括边境管控、入境筛查、执法、犯罪背景调查和国家身份管理。在美国边境操作中,SLAP图像支持针对大规模生物识别存储库(如DHS自动化生物识别识别系统(IDENT))的旅行者身份验证。  

尽管具有重要的操作意义,SLAP指纹在近期多模态大语言模型(MLLM)的评估中基本上未被探索。现有的指纹导向MLLM基准测试主要评估单个滚动或平面指纹图像。例如,FPBench评估了20个MLLM在八项指纹任务上的表现,但其评估基于从指纹验证竞赛(FVC)数据集和NIST SD302d/SD301a中提取的单指滚动或平面图像。这些设置与SLAP验证有显著差异。四指SLAP图像包含单帧内的多个手指,并在脊线清晰度、接触压力、手指放置、指间间距和局部变形方面存在变化。因此,SLAP验证不仅需要细粒度的脊线比较,还需要对多个手指的相对结构和对应关系进行空间推理。  

NIST Special Database 302b(SD302b)为研究此问题提供了特别相关的基础。与主要为受控算法评估设计的精选基准测试不同,SD302b反映了操作的活体扫描采集,并包含跨多个设备和分辨率采集的图像。这使得它成为评估通用MLLM是否能从四指SLAP指纹图像中执行身份验证的具有挑战性和部署相关性的测试平台。  

第二个悬而未决的问题涉及提示的作用。先前针对人脸和指纹识别的生物识别MLLM基准测试报告了**正向偏差崩溃**,即模型无论输入对如何,重复预测“同一个人”。在平衡的验证集上,这种行为可能产生50%的准确率,同时隐藏了关键故障模式。然而,在高风险生物识别应用中,这种行为是不可接受的,因为它相当于接受每一次比较为真。二元强制选择提示在生物识别MLLM评估中常用,但目前尚不清楚这种格式是否会在SLAP指纹图像上引发类似的崩溃,或者替代提示设计能否缓解此问题。  

为弥补这些空白,我们提出了SLAPBench,一个针对基于MLLM的四指SLAP指纹验证的评估基准。SLAPBench旨在作为当前MLLM行为的评估探测工具,而非用于操作生物识别验证的部署系统。我们的目标是描述这些模型在SLAP格式指纹图像上的成功与失败模式,并考察提示策略如何影响验证行为、崩溃和判别性能。  

本文做出以下贡献:  

1. **SLAPBench**:首个针对四指SLAP指纹验证的MLLM评估基准,基于NIST SD302b构建,这是先前指纹MLLM工作从未使用过的操作级数据集。  
2. **可复现的评估协议**:包含7,832个固定对(176个真匹配对,因SD302b每个手指位置仅提供一次SLAP采集,故跨分辨率形成;7,656个非匹配对,覆盖每个FRGP所有\( \binom{88}{2} \)个受试者组合),以一个固定对清单形式发布,附带人口统计元数据,支持按性别、种族和年龄的分层分析。  
3. **SLAP数据上正向偏差崩溃的系统性证据**:十个二元提示配置中有五个崩溃至几乎接受每一对为真。所有四个开源模型在任务描述提示下均崩溃,Gemma-3-12B在零样本提示下也崩溃,而专有模型Claude Opus 4.8在两种提示下均抵抗崩溃。因此,崩溃很大程度上是提示格式的属性,但能力足够强的模型可以克服它。  
4. **暴露模型能力的相似度评分提示**:评分消除了所有四个开源模型的崩溃,然而判别能力范围从功能良好(Claude Opus 4.8、Gemma-3-12B)到接近随机或倒置(Qwen2.5-VL-7B、InternVL3-8B)。因此评分的必要但非充分条件,模型架构设定了上限(表1)。  
5. **完美基准分数的警示性分析**:Qwen3-VL-8B在评分下达到AUC=1.000。一个匹配分辨率控制实验移除了分辨率作为类别线索,完美分离仍然存在,从而排除了分辨率捷径;但SD302b的单次采集设计留下了近乎重复检测的可能性,且数据集任何配置都无法将其与身份匹配区分。我们以此证明,接近完美的MLLM生物识别结果在被解读为能力之前,需要进行协议审计。  
6. **公开发布**:评估代码、固定对清单、原始结果CSV文件以及每对分数文件,以便此处报告的每个数字都可被重新计算。代码和数据:https://github.com/bibeshpyakurel/SLAPBench。

## 2 相关工作  

**指纹识别**。经典的采集、增强、特征提取和匹配流程在每个阶段都通过深度学习得到推进:FingerNet统一了脊线方向和细节点提取,DeepPrint学习用于可扩展验证的固定长度嵌入,商业匹配器如VeriFinger提供了操作的FAR/FRR基线。SLAP分割已被单独研究;据我们所知,尚无先前工作评估SLAP图像上的端到端MLLM性能。  

**MLLM生物识别基准测试**。FaceXBench评估了28个模型在5,000个人脸任务问题上的表现,发现思维链提示一致地**降低**性能,这提示不要假设更多上下文有帮助。FaceRecBench对27个MLLM进行人脸验证基准测试,报告了两个我们在指纹上重新审视的发现:许多模型通过总是接受或拒绝而崩溃至50%的准确率,且最佳模型携带最强的人口统计偏差;后续工作将其扩展到具有类似能力差距的异构人脸识别。FPBench与我们最接近,它评估了20个MLLM在多项选择提示下的八项单指指纹任务。我们在三个方面有所不同:需要空间推理的四指SLAP图像;二元分类之外的连续相似度评分;以及操作级的SD302b数据集。在这些基准测试中,响应崩溃反复出现,并已被归因于训练数据先验偏好“相同”以及语言中生物识别比较的模糊性;我们首次在SLAP图像上给出定量描述,并表明连续评分可以消除它。

## 3 数据集与数据准备  

### 3.1 NIST Special Database 302b  

NIST SD302b是智能高级研究计划活动(IARPA)收集的指甲到指甲(N2N)指纹挑战数据集的一个子集。该数据库包含来自201名参与者的指纹图像,使用多种设备以两种分辨率采集:500 PPI(标准操作分辨率)和1000 PPI(研究用高分辨率)。参与者覆盖多样的人口统计特征,包括年龄(范围:18-70)、性别、种族和职业背景(工作类型),支持分层公平性分析。我们仅关注由**设备R**采集的**FRGP 13**(右手四指SLAP)和**FRGP 14**(左手四指SLAP)图像。SD302b中的设备R图像原生以1000 PPI采集,对应的500 PPI版本是为与500 PPI指纹算法兼容而提供的。因此500 PPI图像是同一采集的下采样版本,而非第二个独立的按压。我们直接对照分发文件结构确认了这一点:每个(受试者, FRGP)组合恰好由一次采集表示,以两种分辨率可用,且SD302b对任何受试者和手指位置不提供重复的SLAP按压。这个数据库属性(而非我们的选择)决定了真匹配对的形式:**同一次采集的跨分辨率**比较,即原生1000 PPI图像与其500 PPI版本之间的比较,而不是两个独立的按压(第4.1节和第6节)。  

**数据准备**。遵循SD302b文档,我们排除了勘误标记的受试者(标签错误)、滚动图像(设备U、V)、FRGP 15拇指SLAP以及预裁剪的分割图像,仅保留同时具有R-500和R-1000采集的受试者。在201名参与者中,92人拥有设备R在两FRGP 13/14以及两种分辨率下的四指SLAP;移除勘误/不完整受试者后剩余88名干净受试者。因此验证实验使用了352张设备R图像(88个受试者 × 2 FRGP × 2分辨率)。对于每张图像,我们记录图像级元数据、每指分割真值(边界框和从SD302b分割CSV文件中获取的旋转角θ)以及参与者人口统计信息。  

**真实分割**。SD302b附带了每张图像的分割CSV文件,提供每个手指的边界框坐标和旋转角(专用的SLAP分割系统解决相同步骤);代表性的叠加图像出现在图S1中。对于验证,我们使用完整的SLAP图像而不进行裁剪,如同操作流程所做。由于单帧包含四个形态相似的重叠手指,任意两张SLAP图像无论是真匹配还是非匹配,全局看起来都相似,这构成了第6节分析的正向偏差崩溃的基础。

## 4 评估协议与方法  

### 4.1 配对构建  

我们按照FaceRecBench和FPBench中使用的全部配对协议构建真匹配和非匹配验证对。  

**真匹配(真实)对**。对于每个FRGP∈{13,14},我们将每个受试者的原生1000 PPI图像与**同一次采集**的下采样500 PPI版本配对。对于88个干净受试者,每个FRGP产生88个真匹配对,总共176个真匹配对,由数据库的结构决定而非我们的采样决策。  

**非匹配(冒名顶替者)对**。对于每个FRGP,我们形成所有不同的受试者配对。对于88个受试者,每个FRGP产生\( \binom{88}{2} = 3,828 \)个唯一的非匹配对,总共3,828×2=7,656个非匹配对。  

由此产生的7,832个对(176个真匹配 + 7,656个非匹配)以一个固定清单形式发布,构成了一个故意以冒名顶替者为主的协议;按照生物识别标准,我们强调FAR、FRR、AUC、EER以及低FAR下的TAR,而非总体准确率(后者由非匹配对占主导)。  

**分辨率结构及其后果**。真匹配对是跨分辨率的(1000 PPI vs. 500 PPI),而非匹配对是从500 PPI池中抽取的,因此是相同分辨率(500 PPI vs. 500 PPI)。因此这两个类别在一个与身份完全无关的属性上存在差异,模型原则上可以通过读取分辨率或外观统计量而不是比较脊线结构来分离它们。我们一开始就明确说明这一点,因为它决定了第5节中最强结果如何被解读。为解决此问题,我们还构建了一个匹配分辨率变体,其中非匹配对也以1000 PPI vs. 500 PPI形式组成,因此两个类别共享相同的分辨率结构;第6.3节报告在此控制下最强结果不变,

相似文章

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。

FriendBench:在人类和多模态大语言模型中基准测试二元熟悉度推断

arXiv cs.CL

FriendBench 是一个新的基准测试,用于评估人类和多模态大语言模型是否能够从一段20秒的破冰对话视频片段中推断出两个人是熟人还是陌生人。结果表明,最佳模型在准确率上与人类相当,但在偏差上有所不同,并且只有人类能从更丰富的视觉行为中受益。

大型语言模型个性化能力的基准测试

arXiv cs.AI

本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。