从“用户是谁?”到“这次购买意味着什么?”:一个应用于银行规模的语义用户分析部署管道

arXiv cs.AI 论文

摘要

本文介绍了一个部署的语义用户分析管道,该管道使用基于每个交易模式的LLM推理,在一家大型日本银行将成本降低了三个数量级。

arXiv:2609.19928v1 Announce Type: new 摘要:基于用户的交易历史进行LLM推理会将推理预算与用户数量线性绑定,这在应用规模下变得不可行。我们将属性推断从基于用户重新定义为基于交易模式。管道运行分为三个阶段:Resolve(通过可选的网络验证解析抽象项目名称)、Profile(为每个频繁模式推断属性)和Tag(将自由文本属性聚类到可查询数据库中)。在Profile阶段,每个模式的一个LLM调用输出预定义的分类标签、自由文本属性和每个属性的流行度估计。由于推理是在模式上运行而非用户,预算随着模式数量而非用户数量增长。在公开的Open e-commerce corpus上,数据库在评估属性上的AUC与直接读取每个用户原始历史的LLM在统计上无法区分,并且流行度估计在正负用户之间具有区分信号。该管道已部署在一家大型日本银行,分析约数千万用户,与基于用户的管道相比,LLM推理目标减少了近三个数量级。代码在 https://github.com/CyberAgentAILab/profiling-agent-open-ecommerce 上公开可用。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:27

# 从"用户是谁?"到"这笔购买意味着什么?":银行规模语义用户画像的部署流水线
来源:https://arxiv.org/html/2609.19928

## 从"用户是谁?"到"这笔购买意味着什么?":银行规模语义用户画像的部署流水线
致谢:†这些作者对本工作贡献均等。

Ryota Mitsuhashi†, Tetsuro Morimura†, Hirotake Ito

###### 摘要

针对交易历史的按用户LLM推理将推理预算与用户数量线性绑定,在实际规模下成本过高。我们将属性推断从按用户重构为按交易模式。该流水线分三个阶段运行:*解析*阶段通过可选的网络锚定抽象商品名称,*画像*阶段为每个频繁模式推断属性,*标签*阶段将自由文本属性聚类到可查询数据库中。在画像阶段,每个模式只需一次LLM调用,即可输出预定义的分类标签、自由文本属性以及每个属性的普及率估计。由于推理是基于模式而非用户进行,预算增长与模式数量而非用户数量相关。在公开的Open电商语料库上,该数据库在评估的属性AUC指标上与直接阅读每个用户原始历史的LLM在统计上无显著差异,且普及率估计在正负用户间具有区分信号。该流水线已部署于日本一家主要银行,对约数千万用户进行画像,与按用户流水线相比,LLM推理目标减少了近三个数量级。代码已公开于https://github.com/CyberAgentAILab/profiling-agent-open-ecommerce。

###### 索引术语:
用户画像,交易数据,大语言模型,部署系统

参见图例图1:按用户与按交易模式画像。传统流水线(上图)为每个用户调用一次LLM。所提流水线(下图)分为三个阶段(第四章):*解析*通过可选的网络锚定抽象商品名称;*画像*在一个联合LLM调用中跨三类属性(人口统计、心理行为、生活事件)输出封闭集标签、自由文本属性和每个属性的先验概率;*标签*将每个属性类别内的自由文本属性聚类并为每个簇命名一个标签。生成的属性数据库可通过标签查询。为清晰起见,图中仅追踪了单商品模式下的自由文本路径;封闭集标签出现在相同的画像输出中,画像中挖掘的多商品模式也采用相同公式。## I引言

营销活动[1]、金融产品个性化以及内容推荐通常基于用户的自然语言描述进行操作,例如"注重教育的学龄儿童家长"或"最近有了孩子"。有用的描述涵盖人口统计情境、行为和生活事件,形成长尾分布,任何封闭的分类列表都无法事先穷尽:IAB技术实验室受众分类法[2]固定了约一千个节点,仍然遗漏了运营者希望操作的大部分关系性、情境性描述。此类描述在运营上有用是当前实践所证实的:在第七章部署的银行中,工作人员手动阅读单个用户的交易记录,并撰写恰好属于这种形式的简短自然语言描述——自由文本,而非标签索引或数值向量[3,4]。我们在第三章将这些描述形式化为用户画像的开放集自由文本方面。

早期从购买或交易历史推断用户属性的工作并未生成此类描述,而是返回固定模式的分配或学习的向量嵌入(第二章)。大语言模型改变了可直接生成的内容:给定用户的物品,模型可以通过提示阅读这些物品并输出简短的自然语言描述。自然的实现方式,也是几乎所有近期采用此路径的工作[4,5,6]所采纳的,是按用户提示LLM。这种实现继承了在实际规模下成本线性的结构问题。

按用户LLM推理面临三重结构性壁垒。首先,初始构建成本随用户数量线性增长;在拥有数千万客户的主要银行规模下,按照当前公共API价格,一次按用户LLM调用成本达到运营者未纳入常规预算的数量级[注1]。其次,当LLM孤立地阅读每个用户时,即使用户行为有重叠,措辞也会因用户而异,因此在没有单独标准化步骤的情况下,跨用户比较、聚合和搜索变得不可靠。第三,用户交易日志持续增长,因此要保持数据库最新,需要对日志已更改的每个用户重新推断;限制构建规模的同一线性因素也限制了每次刷新。

我们的核心策略是不问"用户是谁?"而是问"这种购买模式意味着什么?",让LLM在有限的、跨用户共享的频繁交易模式集合上运行,而非在用户上运行。推理预算因此随唯一模式数量而非用户数量增长,这在公开数据上一旦用户数量超过支持阈值的倒数(图2)就趋于平稳,在银行规模下将推理目标减少了近三个数量级(第七章)。匹配到相同模式的两个用户获得相同属性,因此无需标准化步骤即可明确定义跨用户比较和聚合;刷新仅针对之前不存在的模式运行,匹配先前已见模式的用户重用缓存属性。

如图1所示,该流水线对每个交易模式执行一次联合LLM调用,输出跨三类属性(人口统计、心理行为、生活事件)的封闭集标签、每个类别的开放集自由文本属性,以及一个在[0,1]范围内的每个属性先验概率,估计该模式购买者中的普及率。按交易模式的输出被聚合为按用户画像,开放集部分在每个类别内聚类和打标签,形成以标签而非自由文本字符串为查询单元的可查询属性数据库。该流水线已部署于日本一家主要银行用于广告和受众分析(第七章),并在公开的Open电商语料库[7]上通过自我报告调查(第五、六章)复现。

我们做出三项贡献。C1(公式与方法,原创性和技术质量):我们将交易历史的用户属性推断重构为按交易模式而非按用户的问题(第三章),并实现为一个流水线,该流水线在每次模式的单次联合LLM调用中输出封闭集标签、开放集自由文本属性和跨三类属性的每个属性先验概率(第四章);公式及其实现均属方法论贡献。C2(评估,技术质量和清晰度):我们在公开的Open电商语料库上通过两种互补设置评估信息保留(第五、六章),报告每个属性先验概率的区分信号有效性(第六章),并表征生成的标签清单和覆盖范围(第六章)。C3(部署,相关性和重要性):我们报告在日本一家银行的部署情况,聚合系统指标以比率而非绝对值表达,以及流水线所扮演的运营角色(第七章)。

## II相关工作

LLM之前关于从购买或交易历史推断属性的工作分为两条线。封闭人口统计模式上的结构化预测:[8]针对零售购物篮,[9]添加任务特定注意力,[10]在浏览日志上,[11]融合异构交易字段。交易序列的学习向量嵌入:[12](对比序列嵌入),[13](一个在来自180家银行的50亿笔卡交易上预训练的GPT风格基础模型),[14]。这两条线都按用户运行推理,输出要么是小固定模式,要么是嵌入向量,两者都不是第一章所激励的可读、可查询的自然语言描述;基于LLM的按用户画像确实生成此类描述,将在下文单独讨论。

基于LLM的按用户画像是其自然继承者:[4]生成简短自然语言角色,并通过基于图的亲和步骤在用户间传播;[5]通过迭代LLM提示挖掘标签分类法,并将其蒸馏为轻量级分类器以实现规模化;[6],在交易数据上最直接的LLM竞争者,通过序列化事件序列的下一个词预测微调LLM,并从隐藏状态提取用户嵌入。三者在输出形式(角色标签、蒸馏分类器、嵌入向量)上不同,但共享两个使成本与用户基数线性相关的假设:单一输出表示,以及按用户推理。用于推荐的自然语言画像[3,15,16]以及更广泛的LLM用于推荐方向[17,18]遵循相同的按用户模式。我们在两个维度上同时偏离,在交易模式层面执行的单次LLM调用中生成混合输出(封闭集标签、开放集自由文本属性和每个属性先验概率);其成本和一致性后果在第一章和第三章详细阐述。

另一项独立工作将银行交易的生活事件检测视为独立任务:[19]使用工程化的RFM和伪社交网络特征上的梯度提升,从6000万笔借记交易预测四个离散事件(搬家、生育、新关系、分手);[20]是量化业务影响的后续研究;[21]将信用卡序列聚类为少量生活方式原型。这条线一次处理一个事件,使用固定事件词汇和与特定机构相关的特征工程。我们的流水线将生活事件视为统一画像中三类属性类别之一,通过相同的LLM调用生成,并以自由文本表示,覆盖更广泛的事件词汇。不同的银行、事件定义和队列(第八章)使得与该线的直接数值比较不可比,我们并未进行此类比较。

对于第五、六章的基于标签的属性评估,相同的LLLM作为评判者,在原始历史和属性数据库输入上使用相同的提示模板,这是[22,23]LLM即评判者方法论的一个实例;这种对称设计的偏差特性在第五、八章讨论。先前在第四章引入的每个属性先验概率π(d)基于[24]的可言说置信度公式和[25]的置信度引出分析;第六章测试其在正负用户间的区分信号而非概率校准。该模式的三类别划分(人口统计、心理行为、生活事件)源于[26]的细分框架,根植于[27,28,29]和[2]的行业标准层级;将自由文本转化为标签词汇的聚类工具链遵循标准实践(句子-BERT[30]、UMAP[31]、HDBSCAN[32]),并在第四章描述。

## III任务公式

给定每个用户的购买或交易历史作为物品名称序列X_u = (p_1, ..., p_T),其中每个p_i是一个购买物品或交易的未处理文本,时间戳不被流水线消费。我们的任务是为每个用户生成一个混合画像Y_u = (Y_u^closed, Y_u^open),结合封闭集分配和开放集自由文本描述。封闭集部分Y_u^closed记录用户到源于[26]细分框架并组织为三类属性模式的分配:七个人口统计属性A_dem,四个心理行为属性A_pb,以及八个生活

相似文章