从对话到检测:面向保险欺诈检测的多模态混合NLP流水线
摘要
本文提出了一种用于首次损失通知(FNOL)阶段保险欺诈检测的合成多模态框架。该框架生成对话记录和双说话人音频,将ASR、NER、LLM-RAG和说话人嵌入整合到一个基于规则的风险评分系统中。
arXiv:2606.28002v1 公告类型:新
摘要:保险欺诈给保险公司带来巨大的财务损失和运营效率低下,提高了保费并影响了合法投保人的信任。在首次损失通知(FNOL)阶段进行早期检测仍然是一个持续的挑战。现有方法主要依赖私有的纯文本数据集,限制了整合语言、行为和说话人指标的多模态方法的进展。我们提出了一种模拟FNOL条件的合成多模态框架。该框架生成代理-客户对话记录和双说话人音频,执行ASR和说话人日志。下游模块将NER、基于正则表达式的特征提取、LLM-RAG检索和说话人嵌入整合到一个基于规则的风险评分中,用于标记叙述复用、结构不一致和跨案例声音重复,同时平衡敏感性与误报率。数据集验证和组件级评估显示了稳定性和迁移潜力,为超越纯文本欺诈检测提供了可复现的基线。
查看缓存全文
缓存时间: 2026/06/29 05:25
# 从对话到检测:面向保险欺诈检测的多模态混合NLP流水线 来源:https://arxiv.org/html/2606.28002 Akram Htait Sadka Meisingseth Jaitly ###### 摘要 保险欺诈造成巨额经济损失和运营效率低下,推高保费并影响合法保单持有人的信任。在首次损失通知(FNOL)阶段进行早期检测仍是一个持续挑战。现有方法主要依赖私有的纯文本数据集,限制了融合语言、行为及说话人指标的多模态方法的进展。我们提出一个合成多模态框架,模拟FNOL条件。该框架生成客服与客户的对话文本及双说话人音频,并执行自动语音识别(ASR)和说话人日志(diarisation)。下游模块结合命名实体识别(NER)、基于正则表达式的特征提取、大语言模型与检索增强生成(LLM–RAG)检索以及说话人嵌入,通过基于规则的欺诈风险评分来标记叙事复用、结构不一致性和跨案例语音重复,同时平衡敏感性与误报率。数据集验证和组件级评估显示了稳定性和迁移潜力,为超越纯文本欺诈检测提供了可复现的基准。 索引术语:保险欺诈,多模态数据,合成数据,语音聚类,基于规则评分 ###### 关键词: 保险欺诈,多模态数据,合成数据,语音聚类,基于规则评分 ## 1 引言 保险欺诈是全球范围内持续存在且代价高昂的问题,据估计美国每年损失超过3000亿美元,英国超过11亿英镑[1, 2, 3, 4, 5]。此类损失不仅影响保险公司,还通过提高保费和减少福利影响合法保单持有人。理赔流程,尤其是在FNOL阶段,主要由叙事数据主导:通过呼叫中心的口头报告和通过门户网站的书面提交。在此早期阶段检测欺诈既具有战略优势,也存在操作挑战。 传统欺诈检测依赖人工审查/静态规则系统,容易出错且不适用于大规模场景[6]。随着人工智能和自然语言处理(NLP)的发展,基于客户通话文本的自动欺诈检测已成为可行的替代方案。基于Transformer的模型(如BERT、GPT和XLNet)[7, 8, 9]彻底改变了NLP,在经过保险特定数据微调后,能够高精度地对理赔叙事进行分类和解读。然而,进展仍受限于缺乏公开可用的*多模态*数据集,该数据集应包含来自保险理赔的配对语音和文本数据。行业内存在专有数据集,但因隐私法规(GDPR)和合同约束而无法访问[10, 6]。与LibriSpeech或Switchboard等公共语音语料库不同,目前没有公开许可的数据集提供带有欺诈标签的保险理赔客服-客户对话及录音。现有的呼叫中心数据集通常是表格形式或纯文本,且主要来自非保险领域[11, 12]。然而,语音携带副语言欺骗线索,如语气、犹豫和说话人特征[13, 14],而文本则能够实现可扩展的实体提取和语义检索。整合两种模态可以对语音身份和叙事相似性进行交叉验证,从而发现有组织的欺诈团伙。因此,研究一致将数据稀缺视为核心瓶颈[5, 4, 15]。 鉴于缺乏可共享的真实世界数据集以及对多模态证据的需求,我们引入了一个端到端的*合成数据生成与分析流水线*,用于模拟FNOL条件,同时保持现实的实体分布、对话模式和音频特征。该工作流程使用GPT-2生成包含嵌入实体的合法与欺诈对话;使用xTTS合成双说话人音频;使用WhisperX进行语音转文本(STT,包括ASR)和说话人日志;使用NER+正则表达式进行实体提取;使用Resemblyzer嵌入和余弦相似度进行跨案例语音复用检测;使用BERT和RAG进行历史叙事匹配。每个阶段的输出随后输入到一个基于规则的评分系统中,用于估计欺诈风险。该设计旨在无需访问敏感通话的情况下解锁研究,同时保持对操作约束(双声道音频、FNOL文本摘要、说话人日志错误、不完整历史)的忠实,并建立一个可复现评估的系统架构,为未来扩展提供基础。 本工作的主要贡献如下: - • 我们设计了一个可复现的*合成多模态FNOL数据集*,平衡欺诈与合法理赔,同时保持实体、对话结构和音频属性的现实分布。 - • 我们引入了首个面向保险欺诈分析的端到端*多模态流水线*,涵盖合成对话生成、多说话人音频合成、ASR+说话人日志,并结合文本的语义检索与实体提取以及说话人嵌入相似度,以揭示跨理赔的重复叙事和语音复用。 - • 我们提出了一个*透明的风险评分框架*,将结构化、语音和文本信号融合成一个可解释的低到高欺诈等级,使该流水线成为研究社区的可复现基准和扩展基础。 本文涵盖欺诈检测的背景,包括NLP/ML和多模态解决方案,以及系统综述和跨领域见解,详见第2节。在第3节中,我们介绍使用合成数据进行欺诈检测的端到端流水线。在第4节中,我们描述实验设置。第5节讨论所提方案的结果和产出,随后在第6节给出结论。 ## 2 背景与相关工作 多模态数据、AI和NLP能够实现*跨模态验证*,将语音身份与叙事相似性联系起来用于欺诈检测,但其公开可用性仍然稀缺,尤其是在保险领域[10, 6]。这种稀缺性是文献中反复出现的局限,也推动了合成多模态数据集的开发,这些数据集在尊重隐私约束的同时捕捉欺诈相关现象。 请参阅标题图1:提出的基于AI的稳健保险欺诈理赔检测端到端解决方案。 ### 2.1 基于NLP/ML的保险欺诈检测 预训练的Transformer(如BERT[6]和DistilBERT[16])因其捕捉上下文、双向语言理解、迁移学习能力、易用性、开源可用性等优点而提供了显著优势。这些模型能够比传统基于关键词的方法更有效地识别客户对话中的欺诈指标、不一致性和模式。 早期的文本理赔分析工作将词袋和统计分类器应用于结构化理赔数据,但Transformer此后变得普遍。Piehl[10]证明基于BERT的模型在对瑞典保险通话文本进行理赔类型分类时优于传统基线,并指出ASR噪声对分类的不利影响。Bäcklund和Öhman[6]评估了BERT、Word2Vec和TF-IDF在文本和转录通话数据上的欺诈检测性能,报告了中等水平的宏F1分数,并强调了小规模、不平衡数据集的挑战。 近期的研究已扩展到分类之外,涉及欺诈意识和可解释性。Chang等人[17]提出了一种使用NLP意图检测来检测和分类金融欺诈的聊天机器人,而Dimri等人[18]探索了领域特定语言模型以实时支持理赔处理员。Gangani[19]和Tarra[20]强调了AI在检测和风险评分中的作用,包括实体识别和异常检测。Perumal[21]综述了保险中创新的AI应用,Banulescu‐Radu和Yankol‐Schalck[22]提供了在家庭保险中实施基于ML的欺诈检测的操作指南。 ### 2.2 通话数据中的欺诈检测 基于语音的欺诈检测同时涵盖保险特定和更广泛的金融服务场景。Leal等人[13]研究了保险电话通话中的欺骗线索,发现结构化的"模型陈述"可以引发可测量的语言差异。Kumar等人[23]和Gupta[24]使用NLP分类器处理ASR文本以应对诈骗/垃圾电话检测,该领域的技术工具(ASR、NER、分类)可迁移至保险欺诈用例。 ### 2.3 多模态欺诈解决方案 在金融和呼叫中心背景下,声学和语言学分析已被应用于检测欺骗,尽管细节通常是专有的[14]。更多近期研究将LLM与可解释机器学习结合,从文本数据中提取语义和情感特征,同时指出可解释性、欺诈类型粒度以及比较验证方面的局限性[25]。医疗欺诈研究同样表明,将结构化理赔数据与叙事文本结合,并辅以预处理、特征工程和混合学习流水线,可改进异常检测[26]。在保险和汽车保险领域,融合图像、文本和表格特征的多模态系统相比单模态基线取得了增益,但仍属于案例特定,依赖封闭数据集和所有特征的可用性,且未包含对话式通话音频或对齐文本[27, 28]。 商业解决方案也越来越多地采用AI驱动的融合。Swiss Re的ClaimsGenAI通过维护人工监督自动化处理非结构化文档的理赔流程;Xenoss使用语义搜索和自适应学习整合结构化与非结构化流(如交易、行为信号和文本);Moody's Maxsight通过可解释的名称匹配统一合规、筛选和调查工作流程[29, 30, 31]。然而,这些系统主要运行在文档或交易层面,并未在FNOL阶段集成语音-文本处理。总体而言,它们确认了多模态融合的价值,但突显了缺乏可复现、可解释、可共享的配对FNOL音频与文本基准。 ### 2.4 系统综述与跨领域见解 金融[5]、保险[4]、电子商务[32]和医疗[26]欺诈领域的系统文献综述揭示了以下共性:(i) 缺乏标准化、可共享的数据集;(ii) 类别不平衡的挑战;(iii) 结合统计、ML和规则组件的混合模型的潜力。这些综述强化了实体提取[33]、历史感知评分以及多模态证据集成的重要性。 ### 2.5 ML流水线与开放实现 几个开源项目展示了保险欺诈检测的应用ML工作流程,包括监督分类器、异常检测和特征工程[34, 35, 36, 37]。尽管并非领域完备,这些仓库体现了可复现的方法和基线架构。公共数据集如Mendeley保险理赔欺诈数据集[11]仍为纯文本,缺乏对话式语音,为多模态合成数据集留下了空白。 ## 3 提出的端到端流水线 如上所述,现有保险欺诈检测研究因缺乏公开可共享的多模态数据集而受阻,受到隐私和监管要求的限制。即使欺诈理赔造成巨额经济损失并推高保费,这一进展仍然受限。为填补这一空白,我们提出(图1)一个合成多模态流水线,模拟真实FNOL条件,并在不暴露敏感客户数据的情况下支持可复现研究。 与先前研究相比,我们的方法将多个很少在单一工作流程中结合的组件统一起来:(i) 生成包含结构化实体的*合成*客服-客户对话,(ii) 使用xTTS合成*双说话人音频*,(iii) 通过WhisperX应用*ASR+说话人日志*以创建真实的转录条件,(iv) 集成*NER*和*正则表达式*进行特征提取以获取客户历史,(v) 集成*BERT*、*基于RAG的检索*和*基于规则的评分*进行分类,(vi) 提取*说话人嵌入*用于跨案例语音复用检测,以及(vii) 将所有信号融合到*基于规则的评分*中进行风险评分。该设计明确解决了最小化误报的需求,在关键理赔阶段平衡欺诈灵敏度与精确度,以保护客户体验。据我们所知,此前没有工作将这些元素整合到一个面向保险欺诈检测的单一端到端流水线中。 ### 3.1 合成数据集生成 图2展示了合成数据生成过程。流水线从用户指定的输入开始,包括(i)*欺诈与合法对话模板*,以及(ii)*结构化变量*,如客户姓名、年龄、邮政编码、保单号和产品类型。这些输入被传递给GPT-2 Transformer模型,该模型生成多样且连贯的合成文本。真实的FNOL通话通常包括小的言语不流畅,如"嗯"
相似文章
海报:探索基于音频检测土耳其电话诈骗的极限
本文介绍了首个公开的多模态数据集,包含100个土耳其诈骗和良性电话通话,评估了七种大语言模型在原始音频、ASR转录和人工纠正转录下的表现。结果表明,基于转录的输入优于直接音频,凸显了在低资源语言中进行包容性AI安全研究的必要性。
SAGE:一种由LLM驱动的自我反思智能体框架用于欺诈检测
介绍了SAGE,首个端到端的LLM驱动的多智能体框架用于欺诈检测,它使用数据诊断树和具有自然语言梯度的马尔可夫决策过程,在类别不平衡下优化模型。实验表明,在五个数据集上,与基线相比F1有显著提升。
口语对话中的上下文感知多模态声明验证
本文介绍了MAD2,一个用于口语对话中多模态声明验证的新基准,并提出了音频和文本模型的校准融合,利用对话上下文来提高验证准确性。
使用多模态语言模型检测社交媒体上的AI生成内容
来自Meta和卡内基梅隆大学的这篇论文提出了一种多模态视觉-语言模型管道,用于检测社交媒体上的AI生成内容,实现了最先进的性能,并对用户参与度产生了积极的下游影响。
欺骗语义:法律领域欺骗检测与通用领域最先进方法的基准测试
本文综述并评测了法律语境下基于NLP的自动欺骗检测,比较了微调Transformer和七个大语言模型(LLM)在七个数据集上采用多种提示策略的表现。结果表明存在明显的领域敏感性:微调模型在数据丰富的通用领域表现出色,而少样本LLM在低资源法律场景中具有竞争力。