EXPL-FR:通过视觉语言对齐解释人脸识别模型
摘要
EXPL-FR 是一种方法,通过将视觉语言嵌入与识别空间对齐来解释人脸识别模型,从而实现语义属性的无标签审计和模型比较,而无需访问模型架构。
查看缓存全文
缓存时间: 2026/08/25 12:35
论文页面 - EXPL-FR:通过视觉-语言对齐解释人脸识别模型
来源:https://huggingface.co/papers/2608.21486
摘要
EXPL-FR 通过将视觉-语言嵌入与识别空间对齐来解释人脸识别相似度得分,从而实现无标签的语义属性审计和模型比较。
深度人脸识别(https://huggingface.co/papers?q=Deep%20face%20recognition)(FR) 模型已达到近乎饱和的准确率,但仍然是不透明的:实践者无法询问相似度得分依赖于哪些语义属性。EXPL-FR 在 FR 模型自身的嵌入空间(https://huggingface.co/papers?q=embedding%20space)中回答了这个问题。一个轻量级的适配器(https://huggingface.co/papers?q=adapter)将视觉-语言模型(https://huggingface.co/papers?q=vision-language%20model)的 (VLM) 图像编码器与冻结的 FR 空间对齐,仅在人脸图像上训练,从未使用文本进行训练。由于 VLM 的编码器共享同一空间,相同的适配器(https://huggingface.co/papers?q=adapter)适用于文本编码器,从而将 22 个类别中的 978 个属性提示(https://huggingface.co/papers?q=attribute%20prompts)(也可扩展)转化为 FR 空间的锚点,且无需额外成本。我们并不假设这种迁移有效:一个面部验证协议对其进行了测量,并且一项仅改变适配器(https://huggingface.co/papers?q=adapter)的消融实验隔离了其贡献。并非每个概念都能存活下来,因为 FR 模型通过丢弃其必须跨身份验证的因素来获得其不变性。一种无标签的可检测性度量(https://huggingface.co/papers?q=detectability%20measure)比较了每个概念在 FR 空间与 VLM 空间中的可分性,其中可检测性最高的 100 个概念构成了模型可读的语义特征(https://huggingface.co/papers?q=semantic%20signature),其身份区分能力优于完整词汇表。我们涵盖了四个 FR 骨干和两个 VLM 编码器,EXPL-FR 无需架构访问权限,并支持身份级、单张图像级和差异化的解释。我们在三种监督设置下对属性级审计进行了基准测试:人类标签(当前实践)、VLM 伪标签以及我们完全由提示驱动的审计(https://huggingface.co/papers?q=prompt-driven%20audit),并与真实的验证行为进行了比较。在没有标签的情况下,提示驱动的审计(https://huggingface.co/papers?q=prompt-driven%20audit)根据测量的每个族群 RFW 误差对四个 FR 模型进行了排序,并根据真实的验证成本对受控属性变化进行了排序。
查看 arXiv 页面 (https://arxiv.org/abs/2608.21486)查看 PDF (https://arxiv.org/pdf/2608.21486)GitHub0 (https://github.com/gurayozgur/EXPL-FR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.21486)
在您的代理中获取此论文:
hf papers read 2608\.21486
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.21486 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.21486 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.21486 以从此页面链接。
包含此论文的收藏集1
相似文章
KODA:面向视觉-语言基础模型的对比表示比较与对齐
本文介绍了KODA(Kernel Optimization for Discrepancy Analysis,差异分析核优化),一种基于核的框架,用于比较和对齐视觉-语言模型表示,通过识别在CLIP、SigLIP和BLIP等模型中聚类方式不同的样本子集。该方法使用对比嵌入聚类和随机低维近似,能够扩展到大型数据集,同时提供表示之间可解释的结构差异。
VFA: 通过无视觉适应增强多模态大语言模型的多语言能力
本文提出无视觉适应(VFA),一种通过融合多语言和视觉对齐的任务向量来增强多模态大语言模型多语言能力的框架,无需视觉数据,并展示了性能提升和数据效率。
超越英语:揭示视觉-语言-动作模型中的多语言差距
本文首次系统研究了视觉-语言-动作(VLA)模型中的多语言指令跟随问题,揭示了当模型基于英语训练时,在其他语言上的性能显著下降。作者提出了多语言主成分对齐(MPCA)方法来缩小多语言性能差距。
为什么远处看起来在上方:探究视觉-语言模型中的空间表征
探究视觉-语言模型中的空间表征,揭示了一个普遍存在的偏差:模型将图像中的垂直位置与距离混为一谈,并引入了 SpatialTunnel 合成基准来暴露这一捷径;研究发现,更好的解耦空间表征能提升模型的鲁棒性。
视觉为何无法成为通用桥梁:在多语言MLLMs中纠正模态异步性
本文在多语言MLLMs中识别出Ghost Anchor现象,即视觉信号在早期对齐阶段未被充分利用,并提出ANCHOR训练框架以提升视觉语义涌现和跨语言性能。