在警告太迟之前:基于语音的增量电话诈骗检测

arXiv cs.CL 论文

摘要

本文介绍了StreamFraudNet,一种弱监督增量模型,用于从原始语音中检测电话诈骗,达到ROC-AUC 0.9953,并能实时运行,在通话过程中提供早期警告。

arXiv:2609.20223v1 公告类型:新 摘要:我们研究从原始电话音频中弱监督增量电信欺诈检测,其中训练仅提供对话级别标签,且预测必须在通话结束前更新。我们介绍了StreamFraudNet,该模型通过重叠的有限上下文窗口处理传入音频,使用冻结的自监督语音编码器、循环时间建模和学习潜在窗口分数的聚合。在受控英语基准测试中,StreamFraudNet达到ROC--AUC \(0.9953\),显著优于声学和平均池化基线,同时与强大的全局时间模型保持竞争力。该模型在10秒音频后产生首次预测,每2秒更新一次,并在评估的服务器硬件上运行速度快于实时。消融实验表明,循环时间上下文是性能的主要贡献者。这些结果表明,无需转录或时间标注,即可从原始语音中增量评分欺诈风险,同时突出了需要延迟感知训练以改善早期预测。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:12

# 警示为时已晚之前:基于语音的增量电话诈骗检测
来源:https://arxiv.org/html/2609.20223
Khang Nhat Hoang Vo<sup>1,2</sup>, Anh Trac Duc Dinh<sup>3,4</sup>, Tai Tien Ta<sup>4</sup>, Tho Quan<sup>4</sup>

<sup>1</sup>Mohamed bin Zayed大学人工智能研究所,阿联酋阿布扎比 <sup>2</sup>新加坡国立大学,新加坡 <sup>3</sup>人工智能研究中心(CAIR),VinUniversity,越南河内 <sup>4</sup>计算机科学与工程学院,胡志明市理工大学(HCMUT),越南国立大学-胡志明市分校,越南胡志明市  
通讯作者:[Khang\.Vo@mbzuai\.ac\.ae](mailto:[email protected]), [qttho@hcmut\.edu\.vn](mailto:[email protected])

###### 摘要

我们研究了基于原始电话音频的弱监督增量电信欺诈检测,其中训练仅提供对话级别的标签,且预测必须在通话结束前进行更新。我们提出了StreamFraudNet,该模型通过重叠的有界上下文窗口处理传入音频,利用冻结的自监督语音编码器、循环时序建模以及对潜在窗口分数的学习聚合。在一个受控的英文基准测试中,StreamFraudNet的ROC-AUC达到了0.9953,显著优于声学基线和平均池化基线,同时与强大的全局时序模型相比仍具有竞争力。该模型在10秒音频后产生首次预测,每2秒更新一次,并在评估的服务器硬件上运行速度超过实时。消融研究确定循环时序上下文是性能的主要贡献因素。这些结果表明,无需转录或时间标注,即可直接从原始语音中增量评分欺诈风险,同时也凸显了为改善早期预测而需要延迟感知训练的必要性。

警告为时已晚之前:基于语音的增量电话诈骗检测

Khang Nhat Hoang Vo<sup>1,2</sup><sup>††</sup><sup>thanks:</sup>本工作在新加坡国立大学访问期间完成。Anh Trac Duc Dinh<sup>3,4</sup> Tai Tien Ta<sup>4</sup> Tho Quan<sup>4</sup>
<sup>1</sup>Mohamed bin Zayed大学人工智能研究所,阿联酋阿布扎比
<sup>2</sup>新加坡国立大学,新加坡
<sup>3</sup>人工智能研究中心(CAIR),VinUniversity,越南河内
<sup>4</sup>计算机科学与工程学院,胡志明市理工大学(HCMUT),越南国立大学-胡志明市分校,越南胡志明市
通讯作者:[Khang\.Vo@mbzuai\.ac\.ae](mailto:[email protected]), [qttho@hcmut\.edu\.vn](mailto:[email protected])

## 1引言

电话诈骗检测本质上对时间敏感。近期基于LLM的系统会分析进行中的通话,并在有害行动完成前发出警告(Shen等人,2025a (https://arxiv.org/html/2609.20223#bib.bib29), b (https://arxiv.org/html/2609.20223#bib.bib30);Alhulifi等人,2025 (https://arxiv.org/html/2609.20223#bib.bib47);Nicholas和Ng,2024 (https://arxiv.org/html/2609.20223#bib.bib48))。这推动了超越通话后分类的场景:从部分观察到的对话中估计欺诈风险,并随着新证据的出现而更新该估计。这种需求是巨大的。2023年全球电信欺诈损失达389.5亿美元(通信欺诈控制协会,2023 (https://arxiv.org/html/2609.20223#bib.bib26)),而近期工作展示了如何将语言模型、语音识别和语音合成组合成可扩展的诈骗流水线(Gressel等人,2024 (https://arxiv.org/html/2609.20223#bib.bib28);联合国毒品和犯罪问题办公室,2025 (https://arxiv.org/html/2609.20223#bib.bib27))。

现有的对话欺诈检测器通常依赖ASR转录、大型音频-语言模型或更丰富的推理导向监督(Wang等人,2026 (https://arxiv.org/html/2609.20223#bib.bib32);Erlacher,2025 (https://arxiv.org/html/2609.20223#bib.bib45);Chen等人,2026 (https://arxiv.org/html/2609.20223#bib.bib46);Shen等人,2025a (https://arxiv.org/html/2609.20223#bib.bib29), b (https://arxiv.org/html/2609.20223#bib.bib30);Ma等人,2025 (https://arxiv.org/html/2609.20223#bib.bib31))。这些方法可以有效建模语义内容,但可能需要中间转录阶段、高容量模型或细粒度标注。我们转而研究是否可以直接从原始电话音频使用二元对话级别标签来更新欺诈风险。

这种设置是弱监督的,因为模型被告知一个通话是否是欺诈性的,但未被告知欺诈证据出现的时间点。它与多实例学习(Ilse等人,2018 (https://arxiv.org/html/2609.20223#bib.bib35))相关,其中一组实例获得一个全局标签。然而,标准的多实例聚合通常是置换不变的,而对话证据是有序的,并且可能在多个话语中累积。因此,合适的模型必须在从粗粒度对话级别监督中学习时,保持局部时序结构。

图1 (https://arxiv.org/html/2609.20223#S1.F1)说明了这一挑战。一个欺诈性通话可能包含可疑和明显良性的交流,而具有信息量的证据仅在特定时刻出现。单一的通话后预测无法描述随着对话展开估计风险如何变化。因此,我们引入StreamFraudNet,一个有界上下文模型,该模型从第一个观察到的窗口产生初始欺诈分数,并在接收到更多音频时更新对话级别的预测。

参照标题图1:一个SSN诈骗示例,其中高潜在欺诈分数仅针对选定的话语出现。这些分数说明了估计风险如何在对话中变化,但不应被解释为监督的欺诈片段标注。StreamFraudNet将传入音频划分为重叠的有界上下文窗口。一个冻结的Wav2Vec2编码器(Baevski等人,2020 (https://arxiv.org/html/2609.20223#bib.bib33))提取帧级语音表示,注意力池化形成块级向量,一个循环模块捕获每个观察窗口内的时序依赖性。然后,一个学习到的聚合器将目前所有可用的窗口分数组合成当前对话级别的预测。由于没有提供时间标签,中间输出被视为潜在风险分数,而非经过验证的欺诈内容定位。

我们的贡献如下:
- 我们将电信欺诈检测形式化为仅使用对话级别标签从原始音频进行的弱监督增量评分。
- 我们提出了StreamFraudNet,一个具有冻结语音编码器、循环时序建模和增量聚合的有界上下文架构。其0.953M参数的任务头在10秒后产生第一个分数,并每2秒更新一次。
- 通过受控的多种子实验,我们表明循环时序上下文是主要的架构贡献者。StreamFraudNet与强大的时序基线相比仍具有竞争力,并且运行速度超过实时,而有界窗口主要实现增量操作,而非更高的最终通话准确率。

## 2相关工作

### 2.1基于元数据和图的欺诈检测

许多电信欺诈研究依赖通话详细记录和交互元数据,包括通话时长、频率、时间和通信结构(Prasad等人,2020 (https://arxiv.org/html/2609.20223#bib.bib36);Hu等人,2024 (https://arxiv.org/html/2609.20223#bib.bib37);Cao等人,2024 (https://arxiv.org/html/2609.20223#bib.bib38))。基于图的方法将用户、通话或交易表示为关系结构,并学习与欺诈行为相关的模式。Hu等人(2024 (https://arxiv.org/html/2609.20223#bib.bib37))引入了用于电信欺诈检测的代价敏感图学习,而Cao等人(2024 (https://arxiv.org/html/2609.20223#bib.bib38))结合了图对比学习与自适应增强。

相关的交易欺诈方法建模了类别不平衡、邻域结构和时序依赖性(Tian等人,2024 (https://arxiv.org/html/2609.20223#bib.bib39);Tian和Liu,2024 (https://arxiv.org/html/2609.20223#bib.bib40);Xie等人,2024 (https://arxiv.org/html/2609.20223#bib.bib41))。虽然这些研究证明了关系和时序信息的价值,但它们作用于元数据或交易图,而非口头对话。因此,它们广泛地推动了时序建模,但不是原始音频欺诈检测的直接基线。

### 2.2声学和对话欺诈检测

早期的基于音频的工作侧重于录音通话的声学和频谱时域特性。Prasad等人(2020 (https://arxiv.org/html/2609.20223#bib.bib36))结合音频和元数据来表征机器人呼叫,而Elizalde和Emmanouilidou(2021 (https://arxiv.org/html/2609.20223#bib.bib42))评估了手工制作的声学描述符和基于频谱图的分类器,用于机器人呼叫和语音邮件垃圾检测。这些研究确定通话音频包含判别信息,但主要针对录制消息分类,而非在交互式对话中发展的欺诈证据。

一个互补的方向是对对话语义建模。Shen等人(2025a (https://arxiv.org/html/2609.20223#bib.bib29))研究了基于LLM的电话诈骗检测的能力和局限性,而Shen等人(2025b (https://arxiv.org/html/2609.20223#bib.bib30))研究了基于部分观察到的通话转录的实时警告。此类系统可以在通话展开时对语言内容进行推理,但依赖于自动语音识别,并且主要在文本领域操作。

更近期的工作使用端到端音频-语言模型。Ma等人(2025 (https://arxiv.org/html/2609.20223#bib.bib31))引入了TeleAntiFraud-28K,并调整Qwen2-Audio用于电信欺诈分类和推理。Wang等人(2026 (https://arxiv.org/html/2609.20223#bib.bib32))随后提出了使用强化学习和动态风险评估的音频-文本欺诈检测。这些方法使用高容量音频-语言模型和推理导向的监督。我们的设置是互补的:我们研究使用紧凑的可训练头直接从原始音频进行有界上下文欺诈评分,并且仅使用二元对话级别标签。

### 2.3弱监督时序建模

我们的监督设置与多实例学习相关,其中一组实例获得一个包级标签。Ilse等人(2018 (https://arxiv.org/html/2609.20223#bib.bib35))引入了基于注意力的聚合,该聚合从全局监督中学习实例重要性。标准的多实例模型通常是置换不变的(Lee等人,2019 (https://arxiv.org/html/2609.20223#bib.bib49);Rymarczyk等人,2021 (https://arxiv.org/html/2609.20223#bib.bib50)),然而,它们不能明确表示对话证据出现的顺序。

弱监督的声音事件检测类似地从片段级标签学习帧级或段级分数。Miyazaki等人(2020 (https://arxiv.org/html/2609.20223#bib.bib43))在该设置中应用了自注意力,而Deshmukh等人(2021 (https://arxiv.org/html/2609.20223#bib.bib44))引入了辅助自监督目标,用于从粗粒度标注中学习。声音事件通常是时域定位的声学现象(Kotus等人,2014 (https://arxiv.org/html/2609.20223#bib.bib51);Politis等人,2021 (https://arxiv.org/html/2609.20223#bib.bib52)),而电信欺诈可能依赖于分布在多个话语中的证据。因此,StreamFraudNet将对话级别监督与有序的、有界上下文的时序建模相结合。由于时间戳欺诈标注不可用,其窗口输出被视为潜在风险分数,而非经过验证的事件定位。

## 3提出的方法论

### 3.1问题表述

令$\mathbf{x}=(x_1,\ldots,x_C)$表示一个电话对话,被划分为$C$个固定时长的音频块,其中每个$x_c\in\mathbb{R}^T$包含$T$个波形样本。每个对话有一个二元标签$y\in\{0,1\}$,表示合法或欺诈通话。在训练期间,仅提供此对话级别标签;未提供块级、话语级或时间戳级别的标注。

我们将该任务形式化为弱监督增量欺诈评分。在时间$t$,令$C_t$表示目前观察到的块数。观察到的音频被划分为具有步幅$s$的$k$个块的重叠窗口。第$i$个完整窗口是
$\mathbf{w}_i=\left(x_{is+1},x_{is+2},\ldots,x_{is+k}\right).$(1)
有效索引为$i\in\{0,\ldots,N_t-1\}$,其中时间$t$可用的完整窗口数为
$N_t=\left\lfloor\frac{C_t-k}{s}\right\rfloor+1,$(2)
其中$C_t\geq k$。对话结束时,$C_t=C$,总窗口数为$N=\lfloor(C-k)/s\rfloor+1$。

一个窗口检测器$f_{\theta}$将每个观察到的窗口映射到一个潜在欺诈分数:
$\hat{y}_i=f_{\theta}(\mathbf{w}_i)\in[0,1].$(3)
时间$t$可用的分数形成有序序列$\hat{\mathbf{y}}^{(t)}=(\hat{y}_0,\ldots,\hat{y}_{N_t-1})$,它们被组合成当前预测$\hat{y}_{\mathrm{global}}^{(t)}=g_{\psi}(\hat{\mathbf{y}}^{(t)})$。随着新块到达,更多窗口变得可用,并且$\hat{y}_{\mathrm{global}}^{(t)}$被更新。由于时间标注不可用,各个$\hat{y}_i$值被视为潜在风险分数,而非欺诈内容的监督定位。

### 3.2模型架构

StreamFraudNet包含一个有界上下文窗口检测器和一个增量聚合器。该检测器结合了一个冻结的语音编码器、注意力池化、一个BiLSTM和一个窗口分类器,而聚合器结合了目前观察到的所有窗口分数。图2 (https://arxiv.org/html/2609.20223#S3.F2)总结了该模型。

参照标题图2:StreamFraudNet概览。StreamFraudNet使用冻结的Wav2Vec2编码器、注意力池化和一个BiLSTM处理重叠的$k$块窗口。所得的潜在窗口分数被增量聚合为当前通话级分数。

#### 3.2.1有界上下文窗口检测器

对于第$i$个窗口,令$x_{i,j}=x_{is+j}$表示其第$j$个块,其中$j\in\{1,\ldots,k\}$。一个冻结的Wav2Vec2编码器$\mathcal{E}_{\phi}$提取帧级表示:
$\mathbf{F}_{i,j}=\mathcal{E}_{\phi}(x_{i,j})\in\mathbb{R}^{L\times D},$(4)
其中$L$是编码器帧数,$D$是表示维度。Wav2Vec2提供自监督语音表示,推理时无需转录(Baevski等人,2020 (https://arxiv.org/html/2609.20223#bib.bib33))。我们冻结编码器以减少可训练参数和训练时内存。

帧级注意力池化将可变长度的编码器输出转换为固定维度的块表示。对于帧$\ell$的归一化注意力权重是
$a_{i,j,\ell}=\frac{\exp\left(\mathbf{u}^{\top}\mathbf{F}_{i,j,\ell}\right)}{\sum_{m=1}^{L}\exp\left(\mathbf{u}^{\top}\mathbf{F}_{i,j,m}\right)}$(5)
其中$\mathbf{u}\in\mathbb{R}^D$是一个可训练的注意力向量。池化后的块表示是
$\mathbf{c}_{i,j}=\sum_{\ell=1}^{L}a_{i,j,\ell}\mathbf{F}_{i,j,\ell}.$

相似文章

海报:探索基于音频检测土耳其电话诈骗的极限

arXiv cs.CL

本文介绍了首个公开的多模态数据集,包含100个土耳其诈骗和良性电话通话,评估了七种大语言模型在原始音频、ASR转录和人工纠正转录下的表现。结果表明,基于转录的输入优于直接音频,凸显了在低资源语言中进行包容性AI安全研究的必要性。

基于音系激活映射的音素分割与识别

Hugging Face Daily Papers

本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。