生理信号作为说话人脸深度伪造检测的法医模态
摘要
提出利用远程光电容积描记(rPPG)波形检测说话人脸深度伪造,在Celeb-DF++ TF子集上达到0.806的AUC,与最佳通用检测器相当。
arXiv:2607.21776v1 公告类型:新
摘要:说话人脸(TF)深度伪造生成技术从静态源图像和音频信号合成照片级逼真的面部视频,生成的伪造内容使得当前基于图像的检测器始终无法识别。与换脸操作不同,TF合成没有底层的真实视频来继承生理特征,这使得远程光电容积描记(rPPG)成为针对此类伪造的独特检测模态。我们提出了一种检测框架,通过RhythmFormer提取每段视频的rPPG波形,并训练一组轻量级分类器来区分真实与合成的生理信号。在严格的主题独立协议下(测试身份与训练身份完全分离)对Celeb-DF++的TF子集进行评估,我们的1D ResNet达到了0.806的AUC和27.8%的EER,仅比已发布的最佳通用检测器(Effort, ICML 2025)低2.4个百分点,且完全在生理通道上运行。我们记录了DeepFakesON-Phys(代表性先前rPPG检测器)的受控复现研究,展示了其从在传统换脸数据上的AUC 0.999下降到在Celeb-DF++ TF子集上的0.622。我们进一步表明,检测难度强烈依赖于方法:在七个TF生成器中,AUC范围从0.985(Real3DPortrait)到0.690(IP-LAP),且排名在所有评估协议中完全稳定。这种差异反映了每个生成器可解释的生理特性,而非评估噪声,构成了本文的主要理论贡献。
查看缓存全文
缓存时间: 2026/07/27 07:41
# 生理信号作为说话人脸深度伪造检测的法医模态
来源: https://arxiv.org/html/2607.21776
Tamer Aldwairi Temple University aldwairi@temple\.edu
###### 摘要
说话人脸 (TF) 深度伪造生成技术从静态源图像和音频信号合成逼真的面部视频,产生当前基于图像的检测器始终无法识别的伪造内容。与换脸篡改不同,TF 合成没有可用于继承生理特征的真实视频底层,这使得远程光电容积描记法 (rPPG) 成为这类伪造检测的独特有效模态。我们提出一个检测框架,通过 RhythmFormer 提取每视频 rPPG 波形,并训练一套轻量级分类器来区分真实和合成的生理信号。在 Celeb-DF++ 的 TF 子集上,采用严格的主题独立协议(测试身份与训练身份完全分离),我们的 1D ResNet 达到了 0.806 的 AUC 和 27.8% 的 EER,仅使用生理通道,其性能与最佳已发表通用检测器 (Effort, ICML 2025) 的差距在 2.4 个百分点以内。我们记录了对 DeepFakesON-Phys(具有代表性的先前 rPPG 检测器)的受控复现研究,展示了其在传统换脸数据上从 AUC 0.999 降至 Celeb-DF++ TF 子集上的 0.622。我们进一步表明,检测难度高度依赖于方法:在七个 TF 生成器中,AUC 范围从 0.985 (Real3DPortrait) 到 0.690 (IP-LAP),且排名在所有评估协议下完全稳定。这种差异反映了每个生成器可解释的生理特性,而非评估噪声,构成了本工作的主要理论贡献。
## 1 引言
深度伪造视频生成已发展到伪造内容经常欺骗人类观众和自动法医系统的程度。Celeb-DF++ 基准测试[9 (https://arxiv.org/html/2607.21776#bib.bib1)] 收录了 22 种当代合成方法,分为三类:换脸 (FS)、面部重演 (FR) 和说话人脸 (TF)。其中,TF 提出了独特的法医挑战。TF 方法,包括 SadTalker[24 (https://arxiv.org/html/2607.21776#bib.bib2)]、IP-LAP[25 (https://arxiv.org/html/2607.21776#bib.bib3)]、AniTalker[11 (https://arxiv.org/html/2607.21776#bib.bib4)]、EDTalk[16 (https://arxiv.org/html/2607.21776#bib.bib5)]、Real3D-Portrait[21 (https://arxiv.org/html/2607.21776#bib.bib6)]、EchoMimic[2 (https://arxiv.org/html/2607.21776#bib.bib7)] 和 FLOAT[8 (https://arxiv.org/html/2607.21776#bib.bib8)],从单个静态源帧根据音频条件合成整个面部外观,没有留下可继承生理特征的真实视频底层。
这种生成特性对法医策略有直接影响。在 FS 伪造中,源视频的时空结构,包括由脉动血流引起的细微皮肤表面反射变化,在交换区域下部分保留。因此,远程光电容积描记法 (rPPG) 方法(从这些微观颜色变化中恢复心脏脉搏波形[17 (https://arxiv.org/html/2607.21776#bib.bib9),18 (https://arxiv.org/html/2607.21776#bib.bib10)])在 FS 设置中是在对抗残留的真实生理信号。在 TF 合成中,不存在这样的底层。TF 生成视频中任何明显的生理信号都必须由生成器从头产生,而当前的生成器并不尝试复现连贯的 rPPG 模式。
先前的基于 rPPG 的深度伪造检测器,如 FakeCatcher[3 (https://arxiv.org/html/2607.21776#bib.bib11)]、DeepFakesON-Phys[7 (https://arxiv.org/html/2607.21776#bib.bib12)]、DeepRhythm[15 (https://arxiv.org/html/2607.21776#bib.bib13)] 以及后续工作[1 (https://arxiv.org/html/2607.21776#bib.bib14),10 (https://arxiv.org/html/2607.21776#bib.bib15),19 (https://arxiv.org/html/2607.21776#bib.bib16)],都是在 FS 数据上开发和评估的,而 rPPG 在理论上最不占优势。与此同时,TF 检测文献主要由利用唇音时间不一致性的音视频方法主导[12 (https://arxiv.org/html/2607.21776#bib.bib18),6 (https://arxiv.org/html/2607.21776#bib.bib17)]。据我们所知,没有先前工作专门针对 TF 伪造应用基于 rPPG 的检测,而在此处生理学论证最为有力。
我们通过以下贡献解决这一空白:
- • 首个专门针对 TF 深度伪造的基于 rPPG 的检测框架,利用 RhythmFormer[26 (https://arxiv.org/html/2607.21776#bib.bib23)] 进行波形提取和轻量级 1D 分类器进行判别,仅使用生理通道即达到 AUC (ROC 曲线下面积) 0.806,与最佳已发表通用检测器的差距在 2.4 个百分点以内。
- • 在 Celeb-DF++ TF 数据上对 DeepFakesON-Phys 进行受控复现,记录了 AUC 从 0.999 (原始 FS 评估) 降至 0.622,量化了 2020 时代 FS 训练数据与当代 TF 伪造之间的分布偏移。
- • 对所有七个 TF 生成器进行按方法分层分析,揭示了 0.690–0.985 的稳定 AUC 范围,直接可追溯至每种方法的像素合成策略,构成了 TF 生成格局的可解释法医特征描述。
- • 采用主题独立评估协议,使用不相交的名人身份分区,产生了方法论上严谨的基线,避免了跨身份生理泄漏。
我们的代码和结果可在 https://github.com/AI-Advanced-Vision-Forensics-Lab/rPPG-TalkingFace-Detector 公开获取。
## 2 相关工作
### 2.1 说话人脸合成
TF 合成方法通过音频动画化静态源图像,产生目标说话者视频。SadTalker[24 (https://arxiv.org/html/2607.21776#bib.bib2)] 从音频估计 3D 可变形模型系数,并通过学习的运动场渲染头部运动。IP-LAP[25 (https://arxiv.org/html/2607.21776#bib.bib3)] 使用地标引导的注意力在同步嘴唇运动的同时保持身份。AniTalker[11 (https://arxiv.org/html/2607.21776#bib.bib4)] 通过通用运动表示将运动与外观分离。EDTalk[16 (https://arxiv.org/html/2607.21776#bib.bib5)] 采用显式面部组件分解进行细粒度嘴唇和表情控制。Real3D-Portrait[21 (https://arxiv.org/html/2607.21776#bib.bib6)] 将 2D 合成问题提升到 3D 渲染框架中。EchoMimic[2 (https://arxiv.org/html/2607.21776#bib.bib7)] 和 FLOAT[8 (https://arxiv.org/html/2607.21776#bib.bib8)] 代表了近期基于扩散的音频驱动肖像动画方法。所有这些方法共享一个基本操作属性:输出视频没有时间上连贯的真实视频底层,排除了任何源视频生理特征的继承。
### 2.2 远程光电容积描记法
rPPG 从由脉动血流引起的面部皮肤细微周期性颜色变化中恢复心脏脉搏信号[17 (https://arxiv.org/html/2607.21776#bib.bib9)]。经典方法使用手工信号分解[5 (https://arxiv.org/html/2607.21776#bib.bib20),18 (https://arxiv.org/html/2607.21776#bib.bib10)]。深度学习方法显著提高了鲁棒性:PhysNet[22 (https://arxiv.org/html/2607.21776#bib.bib21)] 及其变体对时空面部体积应用 3D 卷积;PhysFormer[23 (https://arxiv.org/html/2607.21776#bib.bib22)] 引入 transformer 架构以捕获长程时间依赖关系。RhythmFormer[26 (https://arxiv.org/html/2607.21776#bib.bib23)] 提出了一种周期性稀疏注意力机制,学习关注生理相关的时间位置,在 UBFC-rPPG、PURE 和 MAHNOB 基准测试上达到最先进性能。
### 2.3 基于 rPPG 的深度伪造检测
FakeCatcher[3 (https://arxiv.org/html/2607.21776#bib.bib11)] 率先将 rPPG 用于深度伪造法医,通过从空间池化 rPPG 信号中得出的统计特征对视频进行分类。DeepFakesON-Phys[7 (https://arxiv.org/html/2607.21776#bib.bib12)] 扩展了这一方向,使用操作于面部区域的卷积注意力网络,报告在 Celeb-DF-v2 上 AUC 为 0.999。DeepRhythm[15 (https://arxiv.org/html/2607.21776#bib.bib13)] 通过双时空注意力图提出了注意力心跳节律分析。Liang 和 Deng[10 (https://arxiv.org/html/2607.21776#bib.bib15)] 证明 rPPG 节律模式不仅对检测具有判别性,而且对伪造分类也具有判别性。Wu 等人[19 (https://arxiv.org/html/2607.21776#bib.bib16)] 提出了具有局部注意力和长距离交互模块的多尺度时空 rPPG 图。
所有上述方法都是在 FS 数据上开发和评估的。没有一种方法针对 TF 合成,而在 TF 合成中,真实生理底层的缺失为基于 rPPG 的判别创造了根本上更强的理由。
### 2.4 说话人脸深度伪造检测
专用的 TF 检测方法主要从音视频角度提出。Haliassos 等人[6 (https://arxiv.org/html/2607.21776#bib.bib17)] 证明用于语音识别的嘴唇运动特征可迁移至伪造检测。Liu 等人[12 (https://arxiv.org/html/2607.21776#bib.bib18)] 显式建模了唇语深度伪造中音频与视觉嘴唇运动之间的时间不一致性,在多个基准测试上取得了强结果。Datta 等人[4 (https://arxiv.org/html/2607.21776#bib.bib19)] 通过视觉时序 transformer 利用嘴部区域的时空模式。这些方法统一需要同步音频。相比之下,我们的方法仅基于 RGB 视觉信号运行,使其与音视频方法互补,并适用于音频缺失或音频受损的场景。
### 2.5 Celeb-DF++ 基准测试
Celeb-DF++[9 (https://arxiv.org/html/2607.21776#bib.bib1)] 涵盖了三种常见伪造场景:换脸 (FS)、面部重演 (FR) 和说话人脸 (TF)。每种场景包含大量高质量伪造视频,使用总共 22 种不同的近期 DeepFake 方法生成。该基准测试建立了三种评估协议:GF-eval (跨方法泛化)、GFQ-eval (跨质量) 和 GFD-eval (跨数据集)。值得注意的是,稳健结果仅限于 FS 伪造 (AUC > 85%),而 FR 和 TF 伪造的检测率降低 (AUC 50–70%),确认 TF 是现有检测器最困难的类别。在 Celeb-DF++ 上已发表的最佳单模型结果是 83.0% AUC (Effort[20 (https://arxiv.org/html/2607.21776#bib.bib25)], ICML 2025)。
## 3 方法论
### 3.1 问题表述
我们将 TF 深度伪造检测定义为每视频 rPPG 波形上的二分类问题。形式上,令 \( V = \{v_1, \ldots, v_N\} \) 表示一个面部视频语料库,每个视频分配一个二进制标签 \( y_i \in \{0,1\} \) 表示真实 (\( y=0 \)) 或 TF 合成 (\( y=1 \))。我们的目标是学习一个分类器 \( f: \mathbb{R}^{160} \to [0,1] \),将每视频 rPPG 波形 \( \mathbf{x} \in \mathbb{R}^{160} \) 映射到伪造概率。
参见说明文字
图 1: 提出的基于 rPPG 的说话人脸检测流水线概览。输入视频帧由 MediaPipe BlazeFace 处理进行人脸检测,并以 1.5 倍边界框扩展裁剪。时间窗口化产生 160 帧的片段,步长 \( s=60 \)。RhythmFormer 提取脉搏波形 \( \mathbf{x} \in \mathbb{R}^{160} \),该波形在每窗口进行 z-score 归一化,然后由 1D ResNet (165K 参数) 分类。
### 3.2 波形提取
人脸检测。我们将 RhythmFormer 参考流水线中的 RetinaFace 检测器替换为 MediaPipe BlazeFace 短距离模型 (Tasks API),消除了 TensorFlow 依赖,同时提高了 Celeb-DF++ 中常见头部姿态变化的吞吐量和鲁棒性。人脸边界框以 1.5 倍因子扩展并保持中心位置,以提供上下文边距。完整流水线如图 1 (https://arxiv.org/html/2607.21776#S3.F1) 所示。
时间窗口化。对于每个视频,帧被重新采样以产生恰好 160 帧的片段。对于原生长度 \( T < 160 \) 帧 (\( T \geq 60 \)) 的视频,通过帧索引的线性插值选择帧,保持近似的时序相位关系。对于长度为 \( T \geq 160 \) 帧的视频 \( V \),我们使用滑动步长 \( s \) 提取一组固定长度 \( L = 160 \) 的窗口 \( \{W_k\} \)。第 \( k \) 个窗口的起始帧索引由以下公式给出:
\[
\text{start}(k) = k \cdot s, \quad k = 0,1,\ldots,\left\lfloor \frac{T - L}{s} \right\rfloor,
\quad (1)
\]
使得窗口 \( W_k \) 由帧 \( V[\text{start}(k):\text{start}(k)+L] \) 组成。第 4.3 节 (https://arxiv.org/html/2607.21776#S4.SS3) 描述了训练集真实视频增强所用的特定步长。
RhythmFormer 推理。每个 160 帧片段被调整为 \( 128 \times 128 \),在空间-时间维度上进行全局 z-score 归一化,然后通过加载了 UBFC_cross 检查点的 RhythmFormer[26 (https://arxiv.org/html/2607.21776#bib.bib23)]。RhythmFormer 输出一个脉搏波形 \( \mathbf{x} \in \mathbb{R}^{160} \)。
每窗口归一化。为了去除特定于身份的基线幅度(编码主体身份而非活体信息的直流分量),每个波形独立进行 z-score 归一化:
\[
\tilde{\mathbf{x}} = \frac{\mathbf{x} - \mu_{\mathbf{x}}}{\sigma_{\mathbf{x}} + \epsilon}, \quad \epsilon = 10^{-6}.
\quad (2)
\]
此操作保留了 rPPG 信号的振荡形状和频率内容,同时消除了绝对幅度和均值,使表示更加身份无关。
### 3.3 分类器架构
我们评估了三种核心架构,参数规模受限(56K、165K、69K 参数),旨在表征提取波形中可用的判别信息。另外两种基于 Toeplitz 的表示也经过测试,但在第 3.6 节 (https://arxiv.org/html/2607.21776#S3.SS6) 中作为负面结果讨论。
1D 残差网络 (1D ResNet)。使用三阶段基本残差块,配置为 \( (2,2,2) \),通道宽度为 32、64、128。每个基本块由两个 Conv1d 层、批归一化和跳跃连接组成。前面有一个茎卷积和全局平均池化,最后是线性分类器。此架构总共有 165K 参数,在我们的实验中作为主要分类器。
1D 卷积网络 (1D CNN)。三个顺序的 Conv1d 块,通道维度为 \( 1 \to 32 \to 64 \to 128 \),核大小分别为 9、7、5,依次应用。每个块执行卷积、批归一化、ReLU 激活和 dropout。之后是全局平均池化操作,接着是线性投影到标量 logit。此架构总共有 56K 参数。
1D Transformer。补丁大小为 8,产生每序列 20 个令牌,模型维度为 64,4 个注意力头,2 个编码器层。该架构使用学习的位置嵌入、可学习的 [CLS] 令牌和前层归一化。此架构总共有 69K 参数。相似文章
朝向校准、公平且准确的深度伪造检测
介绍Face-Fairness (FF),一种用于深度伪造检测中偏见缓解的即插即用框架,其中Face-Feature Tuning (FFT)作为首个无需人口统计标签的公平性方法,能够提升群体准确率并缩小不同人口统计群体间的性能差距。
EMO-BOOST:情绪增强的视听特征提升深度伪造检测的泛化能力
本文提出Emo-Boost,一种多模态深度伪造检测框架,利用情绪线索(视听情绪识别)作为高层语义信号,提升对未见操纵类型的泛化能力,在FakeAVCeleb数据集上实现了平均AUC提升2.1%。
面向可泛化深度伪造视频检测的多智能体取证推理
本文介绍了 FaceVid-Forensics-100K,一个带有细粒度标注的大规模深度伪造视频数据集,并提出了一个多智能体取证推理框架(ARGUS),该框架使用四个专门的专家智能体和一个裁判智能体,在深度伪造检测上优于闭源模型。
看看你是否能识别AI深度伪造的测试
BBC报道了一项测试和研究,旨在通过关注对称性、比例和表现力等感知特质,使用StyleGAN3来训练人们识别AI生成的深度伪造面孔。
Hugging Face 面临深度伪造裸照问题
AI Forensics 的一份新报告显示,Hugging Face 的 Spaces 被广泛用于生成未经同意的深度伪造裸照,其中 73% 的提示涉及色情内容,6.7% 针对明显是儿童的对象,突显了内容审核危机。