EXPL-FR:通过视觉语言对齐解释人脸识别模型

Hugging Face Daily Papers 论文

摘要

EXPL-FR 是一种方法,通过将视觉语言嵌入与识别空间对齐来解释人脸识别模型,从而实现语义属性的无标签审计和模型比较,而无需访问模型架构。

深度人脸识别(FR)模型达到了接近饱和的准确度,但仍然是不透明的:从业者无法询问相似性分数依赖于哪些语义属性。EXPL-FR 在 FR 模型自身的嵌入空间中回答这个问题。一个轻量级适配器将视觉语言模型(VLM)的图像编码器与冻结的 FR 空间对齐,仅在人脸图像上训练,从未在文本上训练。由于 VLM 的编码器共享一个空间,相同的适配器也适用于文本编码器,将 22 个类别中的 978 个属性提示(也可扩展)转化为 FR 空间锚点,无需额外成本。我们不假设这种迁移是有效的:一个面部验证协议对其进行测量,而仅更改适配器的消融研究隔离了其贡献。并非每个概念都能存活,因为 FR 模型通过丢弃其必须跨身份验证的因素来获得不变性。一种无标签的可检测性度量比较每个概念在 FR 空间与 VLM 空间中的可分离性,最可检测的 100 个构成模型的可读语义签名,其身份分离效果优于完整词汇表。我们覆盖了四个 FR 主干网络和两个 VLM 编码器,EXPL-FR 无需架构访问,并支持身份级别、每图像和差异解释。我们在三种监督设置下对属性级审计进行基准测试:人工标签(当前做法)、VLM 伪标签和我们的完全提示驱动审计,并与真实验证行为进行比较。在无标签情况下,提示驱动审计根据测量的每种族 RFW 错误对四个 FR 模型进行排名,并根据真实验证成本对受控属性变化进行排名。
查看原文
查看缓存全文

缓存时间: 2026/08/25 12:35

论文页面 - EXPL-FR:通过视觉-语言对齐解释人脸识别模型

来源:https://huggingface.co/papers/2608.21486

摘要

EXPL-FR 通过将视觉-语言嵌入与识别空间对齐来解释人脸识别相似度得分,从而实现无标签的语义属性审计和模型比较。

深度人脸识别(https://huggingface.co/papers?q=Deep%20face%20recognition)(FR) 模型已达到近乎饱和的准确率,但仍然是不透明的:实践者无法询问相似度得分依赖于哪些语义属性。EXPL-FR 在 FR 模型自身的嵌入空间(https://huggingface.co/papers?q=embedding%20space)中回答了这个问题。一个轻量级的适配器(https://huggingface.co/papers?q=adapter)将视觉-语言模型(https://huggingface.co/papers?q=vision-language%20model)的 (VLM) 图像编码器与冻结的 FR 空间对齐,仅在人脸图像上训练,从未使用文本进行训练。由于 VLM 的编码器共享同一空间,相同的适配器(https://huggingface.co/papers?q=adapter)适用于文本编码器,从而将 22 个类别中的 978 个属性提示(https://huggingface.co/papers?q=attribute%20prompts)(也可扩展)转化为 FR 空间的锚点,且无需额外成本。我们并不假设这种迁移有效:一个面部验证协议对其进行了测量,并且一项仅改变适配器(https://huggingface.co/papers?q=adapter)的消融实验隔离了其贡献。并非每个概念都能存活下来,因为 FR 模型通过丢弃其必须跨身份验证的因素来获得其不变性。一种无标签的可检测性度量(https://huggingface.co/papers?q=detectability%20measure)比较了每个概念在 FR 空间与 VLM 空间中的可分性,其中可检测性最高的 100 个概念构成了模型可读的语义特征(https://huggingface.co/papers?q=semantic%20signature),其身份区分能力优于完整词汇表。我们涵盖了四个 FR 骨干和两个 VLM 编码器,EXPL-FR 无需架构访问权限,并支持身份级、单张图像级和差异化的解释。我们在三种监督设置下对属性级审计进行了基准测试:人类标签(当前实践)、VLM 伪标签以及我们完全由提示驱动的审计(https://huggingface.co/papers?q=prompt-driven%20audit),并与真实的验证行为进行了比较。在没有标签的情况下,提示驱动的审计(https://huggingface.co/papers?q=prompt-driven%20audit)根据测量的每个族群 RFW 误差对四个 FR 模型进行了排序,并根据真实的验证成本对受控属性变化进行了排序。

查看 arXiv 页面 (https://arxiv.org/abs/2608.21486)查看 PDF (https://arxiv.org/pdf/2608.21486)GitHub0 (https://github.com/gurayozgur/EXPL-FR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.21486)

在您的代理中获取此论文:

hf papers read 2608\.21486

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.21486 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.21486 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.21486 以从此页面链接。

包含此论文的收藏集1

相似文章

KODA:面向视觉-语言基础模型的对比表示比较与对齐

arXiv cs.LG

本文介绍了KODA(Kernel Optimization for Discrepancy Analysis,差异分析核优化),一种基于核的框架,用于比较和对齐视觉-语言模型表示,通过识别在CLIP、SigLIP和BLIP等模型中聚类方式不同的样本子集。该方法使用对比嵌入聚类和随机低维近似,能够扩展到大型数据集,同时提供表示之间可解释的结构差异。

超越英语:揭示视觉-语言-动作模型中的多语言差距

arXiv cs.CL

本文首次系统研究了视觉-语言-动作(VLA)模型中的多语言指令跟随问题,揭示了当模型基于英语训练时,在其他语言上的性能显著下降。作者提出了多语言主成分对齐(MPCA)方法来缩小多语言性能差距。