面向金融应用的多模态事件序列基础模型

arXiv cs.LG 论文

摘要

本文提出了一种基于预训练Transformer的基础模型,该模型对金融应用中的多模态事件序列进行训练,统一了异构数据源,并通过下一事件预测学习通用表示。该方法优于传统的任务专用模型,并已在东欧一家大型银行部署,带来了可衡量的业务改进。

arXiv:2607.09955v1 Announce Type: new 摘要:预测建模是现代金融服务的核心组成部分,传统上,各种任务通过单独训练的模型来处理,这些模型依赖于手动构建的表格特征。这种任务专用方法限制了复用性,并且难以充分利用异构数据源,例如交易历史和数字交互信号。在本文中,我们提出了一种基于预训练Transformer基础模型的方法,该模型对用户事件的多模态序列进行训练。来自多个数据源的事件被统一到单个时间序列中,从而实现异构模态的早期融合,并通过下一事件预测目标学习通用表示。这些表示与现有的工程化用户特征相结合,在此基础上训练轻量级神经网络模型以执行多个下游任务。所提出的系统在减少开发开销的同时,优于传统的任务专用模型。该方法已在东欧最大银行之一的生产环境中部署,带来了可衡量的业务指标改进。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:14

# 面向金融应用的多模态事件序列基础模型
来源:https://arxiv.org/html/2607.09955
\(2026\)

###### 摘要.

预测建模是现代金融服务的核心组成部分,传统上,多种任务通过针对人工设计的表格特征单独训练的模型来处理。这种针对特定任务的方法限制了复用性,也使得充分挖掘交易历史、数字交互信号等异构数据源的潜力变得困难。本文提出了一种方法:在用户事件的多模态序列上预训练一个基础Transformer模型。来自多个数据源的事件被统一为单一的时序序列,实现异构模态的早期融合,并通过下一事件预测目标学习通用表征。这些表征与现有的人工设计用户特征相结合,在此基础上为多个下游任务训练轻量级神经网络模型。所提出的系统性能优于传统的任务特定模型,同时减少了开发开销。该方法已在东欧最大银行之一的生产环境中部署,带来了可衡量的业务指标提升。

基础模型;多模态事件序列;自监督学习;交易数据;金融应用

††期刊年份:2026††版权:cc††会议:第32届ACM SIGKDD知识发现与数据挖掘会议V.2††会议举办地:2026年8月9日至13日,韩国济州岛††会议论文集:第32届ACM SIGKDD知识发现与数据挖掘会议V.2(KDD '26),2026年8月9日至13日,韩国济州岛††DOI:10.1145/3770855.3818311††ISBN:979-8-4007-2259-2/2026/08††CCS:信息系统 数据挖掘††CCS:计算方法 神经网络††CCS:计算方法 学习潜在表示

## 1. 引言

机器学习是现代金融服务的核心组成部分,支持广泛的预测任务,如风险评估、欺诈检测、产品推荐和客户分析(Braithwaite等,2025 (https://arxiv.org/html/2607.09955#bib.bib18); Yeh等,2025 (https://arxiv.org/html/2607.09955#bib.bib17); Skalski等,2023 (https://arxiv.org/html/2607.09955#bib.bib16); Babaev等,2022 (https://arxiv.org/html/2607.09955#bib.bib15); Jha等,2012 (https://arxiv.org/html/2607.09955#bib.bib25))。在大型金融机构中,这些任务通常通过为每个用例构建单独的模型来处理,这些模型基于从用户交易历史和数字交互数据中人工设计的特征进行训练。虽然这种针对特定任务的方法在个别应用中表现出色,但会导致大量重复工作、学习表征的复用性有限,并且随着预测任务数量的增加,系统复杂性不断上升。

该范式的一个关键局限性在于无法充分利用现有数据的规模和丰富性(Braithwaite等,2025 (https://arxiv.org/html/2607.09955#bib.bib18); Yeh等,2025 (https://arxiv.org/html/2607.09955#bib.bib17))。在实践中,用户行为通过多个异构来源记录,包括金融交易、在线交互、通信和其他行为信号,每种来源具有不同的结构和时间动态(Mollaev等,2025 (https://arxiv.org/html/2607.09955#bib.bib21))。大型金融机构在长时间跨度内收集大量此类事件级数据。将这些多模态事件流转化为任务特定的表格特征需要大量人工工作,并且常常导致信息损失。因此,只有一小部分可用数据被有效利用,而为某一任务学到的见解也难以迁移或复用于其他任务。

为了解决这些挑战,我们探索了一种基于Transformer基础模型在用户事件序列上预训练的方法(Braithwaite等,2025 (https://arxiv.org/html/2607.09955#bib.bib18); Yeh等,2025 (https://arxiv.org/html/2607.09955#bib.bib17); Karpukhin和Savchenko,2025 (https://arxiv.org/html/2607.09955#bib.bib22); Ostroukhov等,2026 (https://arxiv.org/html/2607.09955#bib.bib23); Dou等,2025 (https://arxiv.org/html/2607.09955#bib.bib24))。模型以自监督方式进行训练,从大规模异构数据中学习可复用于多个下游任务的通用表征。来自不同数据源的事件被统一为单一的时序序列,实现多模态信号的早期融合,并使用下一事件预测目标进行预训练。预训练模型充当共享表征骨干:其嵌入被冻结,并与现有的人工设计用户特征结合,在此基础上为各个应用训练轻量级的任务特定表格神经网络模型。

我们在俄罗斯联邦储蓄银行(Sber)——东欧最大银行之一,服务超过1亿客户——对提出的方法在多个真实金融预测任务上进行了评估。实验表明,自监督预训练以及使用多个数据模态,相较于传统的任务特定模型,持续提升了预测性能。我们进一步分析了不同融合策略的影响,并研究了在工业推理约束下模型规模和序列长度方面的扩展行为。所提出的系统已投入生产,带来了可衡量的业务指标提升,同时减少了模型开发时间和整体系统复杂性。

## 2. 相关工作

### 2.1. 用户行为建模和推荐系统的基础模型

近期有多项工业研究探索了基于预训练Transformer模型的用户行为建模方法。这些方法侧重于从用户行为序列中学习可复用的用户表征,并应用于多个下游任务。Pinnerformer(Pancha等,2022 (https://arxiv.org/html/2607.09955#bib.bib6))引入了一个基于用户行为训练的Transformer模型,用于生成高质量的用户嵌入,这些嵌入可用于Pinterest的多个推荐任务。TransAct(Xia等,2023 (https://arxiv.org/html/2607.09955#bib.bib7))提出了一种混合排序框架,将基于Transformer的实时序列模型捕捉的短期用户兴趣,与通过离线PinnerFormer计算的长期用户表征相结合。最后,PinFM(Chen等,2025 (https://arxiv.org/html/2607.09955#bib.bib8))明确采用了基础模型范式以及预训练-微调方法,用于Pinterest的用户活动建模。作者在跨多个应用收集的大规模用户活动序列数据上预训练了一个序列模型。下游排序模型复用了预训练的Transformer和嵌入表,并进一步使用应用特定数据和特征进行微调。ARGUS(Khrylchenko等,2025 (https://arxiv.org/html/2607.09955#bib.bib9))研究了自回归预训练Transformer模型在推荐中的可扩展性。该模型在用户历史序列上使用下一项目和反馈预测目标进行预训练,然后针对各种排序任务进行微调。研究表明,该方法在广泛的Transformer规模下都能有效扩展。DV365(Lyu等,2025 (https://arxiv.org/html/2607.09955#bib.bib10))专注于将极长的用户历史编码为紧凑的用户嵌入。提出的离线基础模型从长行为序列中预先计算用户表征,然后共享给大量下游模型,从而提升对应任务的性能。

通用行为建模也是RecSys Challenge 2025的核心主题(Dabrowski等,2025 (https://arxiv.org/html/2607.09955#bib.bib11))。目标是学习任务无关的用户表征,这些表征基于丰富的多事件用户日志(如购买、加购、页面访问和搜索查询),可适用于不同的下游任务,包括流失预测、产品倾向预测和类别倾向预测。相关工作(Sawada等,2025 (https://arxiv.org/html/2607.09955#bib.bib12))提出了一种对比学习方法,使用一个Transformer模型进行预训练,最大化同一用户行为中过去和未来片段的表征之间的一致性,同时拉远不同用户的表征。另一种解决方案(Makeev等,2025 (https://arxiv.org/html/2607.09955#bib.bib13))基于使用下一事件预测目标预训练大型Transformer模型,其中同时预测下一事件的多个属性。论文(Klenitskiy等,2025 (https://arxiv.org/html/2607.09955#bib.bib14))提出使用序列自编码器学习通用表征,该自编码器从用户嵌入中重构整个用户历史。除了RecSys Challenge,还有其他几项工作也探索了用户行为建模的预训练方法(Wang等,2023 (https://arxiv.org/html/2607.09955#bib.bib29); Gong等,2025 (https://arxiv.org/html/2607.09955#bib.bib30); Liu等,2022 (https://arxiv.org/html/2607.09955#bib.bib31))。

### 2.2. 面向金融应用的交易序列表征学习

自回归预训练和对比学习是交易数据表征学习中最常用的方法之一(Bazarova等,2025 (https://arxiv.org/html/2607.09955#bib.bib32); Sakhno等,2025 (https://arxiv.org/html/2607.09955#bib.bib33); Moskvoretskii等,2024 (https://arxiv.org/html/2607.09955#bib.bib35))。从用户交易历史中学习通用嵌入的早期工作主要依赖循环神经网络。CoLES(Babaev等,2022 (https://arxiv.org/html/2607.09955#bib.bib15))代表了对比学习范式在事件序列建模中的一个例子。该方法通过学习用户事件历史子序列的嵌入,促使同一用户子序列的表征相似,同时拉远不同用户子序列的表征。从交易数据集中学到的嵌入被证明对下游金融任务有效。NPPR(Skalski等,2023 (https://arxiv.org/html/2607.09955#bib.bib16))采用自回归预训练方法,在大型交易序列语料库上训练基于RNN的模型,结合了下一次交易预测和过去重构目标。作者证明了下一事件预测任务在金融应用中的成功。

近期的工作将基于Transformer的自回归预训练应用于大规模交易数据集(Yeh等,2025 (https://arxiv.org/html/2607.09955#bib.bib17); Braithwaite等,2025 (https://arxiv.org/html/2607.09955#bib.bib18); Dou等,2025 (https://arxiv.org/html/2607.09955#bib.bib24))。例如,TREASURE(Yeh等,2025 (https://arxiv.org/html/2607.09955#bib.bib17))引入了一个专门为交易数据设计的Transformer基础模型。该模型使用下一次交易预测以及一个捕捉当前交易网络信号的辅助目标进行预训练。在nuFormer(Braithwaite等,2025 (https://arxiv.org/html/2607.09955#bib.bib18))中,作者研究了带有文本和结构化属性的交易数据的Transformer表征学习。作者提出了一种分词方案,每个交易由多个令牌表示,并使用标准的下一个令牌预测目标预训练因果Transformer。引入了一种端到端的微调方法,将学到的用户嵌入与现有表格特征结合,用于下游金融任务。另一条研究路线探索了将大语言模型用于交易数据(Polleti等,2025 (https://arxiv.org/html/2607.09955#bib.bib26); Guo等,2025 (https://arxiv.org/html/2607.09955#bib.bib27); Raman等,2024 (https://arxiv.org/html/2607.09955#bib.bib28); Shestov等,2025 (https://arxiv.org/html/2607.09955#bib.bib34))。

总之,先前的工作已经证明了预训练序列模型在用户行为建模和基于交易的金融应用中的有效性。现有方法要么专注于非金融的用户交互数据,要么孤立地对交易序列进行建模。相比之下,我们的工作针对大规模金融系统的实际场景,其中数据本质上是多模态的,因为用户行为通过多个异构数据源被观测到。

## 3. 问题形式化

我们考虑从金融系统中大规模、异构的行为数据中学习通用用户表征的问题。用户行为通过多个数据源记录,每个数据源捕捉用户活动的互补方面。对于给定的用户\(u\),每个模态\(m\)(来自可用模态集合\(M\))产生一个时序事件序列:

\[
S_u^{(m)} = [e_{u1}^{(m)}, e_{u2}^{(m)}, \dots].
\]

不同模态的事件在结构和属性上是异构的,但共享一个共同的时间线。一个关键挑战是将这些异构序列整合为统一的表征。现有方法通常依赖于两种策略:一是晚期融合,即每种模态独立建模;二是早期融合,即将所有模态的事件合并为单一的时序序列。晚期融合限制了跨模态的时间交互,而早期融合需要能够处理异构输入的统一事件表征。

除了原始事件序列,生产系统还依赖一组丰富的人工设计用户特征\(\mathbf{f}_u \in \mathbb{R}^K\)。这些特征编码了领域知识,在现有表格模型中具有强大的预测价值,并且已深度集成到下游流水线中。因此,一个实用的解决方案应当补充这些特征,而非取代它们。

学到的表征应适用于多种下游业务任务,无需针对特定任务进行调整。在实际场景中,任务集合并非事先固定,通常规模庞大且随时间演变,因为业务目标变化可能会产生新任务。因此,为每个任务训练和维护一个单独的序列模型在计算上代价高昂,在操作上也不切实际。总结而言,我们的目标是学习一个通用的用户嵌入函数:

\[
\Phi_{\text{core}}: \{S_u^{(1)}, \dots, S_u^{(M)}\} \rightarrow \mathbf{z}_u \in \mathbb{R}^D,
\]

使得:
- \(\mathbf{z}_u\) 捕捉跨所有模态的行为模式和时间动态;
- 嵌入与任务无关,可复用于多样的下游目标;
- \(\Phi_{\text{core}}\) 在预训练后可被冻结,从而能够在\((\mathbf{z}_u, \mathbf{f}_u)\)之上高效训练轻量级下游模型,无需对核心模型进行微调。

## 4. 方法

我们采用早期融合策略,以更好地捕捉用户行为中的跨模态交互。来自所有可用数据源的事件被合并为单一的时序序列,我们在此序列上使用下一事件预测目标预训练一个基于Transformer的序列编码器。这个预训练的编码器充当共享表征骨干:其参数被冻结并复用,无需...

相似文章

面向金融欺诈检测的多流时序融合

arXiv cs.LG

提出用于金融欺诈检测的多流欺诈Transformer(MSFT),该模型使用Transformer独立编码交易、登录和风险事件流,并通过时间感知位置编码和门控融合进行融合,在大型数据集上实现了0.9961的AUROC。

Chronicle:用于联合语言和时间序列理解的多模态基础模型

arXiv cs.LG

Chronicle 是一个 324M 参数的纯解码器 Transformer,从零开始在自然语言和时间序列上预训练,在 NLU 和时间序列分类任务上取得了有竞争力的性能,并在 UCR/UEA 数据集上的冻结嵌入时间序列分类中创造了新的最先进水平。