大型语言模型能否识别转化归因中的有意义触点?

arXiv cs.CL 论文

摘要

本文评估了大型语言模型在识别转化归因中有意义触点方面的能力,揭示了语义鸿沟,并分析了提示策略以提高性能。

arXiv:2608.28649v1 公告类型:新 摘要:转化归因中的触点选择,即识别对转化有贡献的有意义触点,对于电子商务推荐和在线广告至关重要。当前的选择方法严重依赖于基于协同过滤的启发式方法,这些方法未能与用户感知的语义意图对齐。通过人工标注,我们揭示了一个显著的语义鸿沟:许多隐含相关的、语义相关的触点未被现有规则检测到。因此,我们系统地评估了大型语言模型 (LLMs) 在识别这些隐藏关联方面的能力。我们的评估表明,虽然LLMs有效地揭示了大部分隐含相关的触点,但在其选择性能上仍有显著的改进空间。此外,我们分析了不同提示策略和基础模型选择对识别性能的影响,为它们的推理模式和有效性提供了有价值的见解。这些见解为转化归因从机械规则匹配转向人类对齐的语义推理提供了一条新路线图。此外,我们利用LLM归因的转化标签来增强工业CVR模型训练,并取得了显著的离线性能提升,显示了LLMs在转化归因中的潜力。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:00

# 大型语言模型能否识别转化归因中的关键触点?
来源:https://arxiv.org/html/2608.28649
## 大型语言模型能否识别转化归因中的关键触点?会议:第35届ACM国际信息与知识管理大会论文集;2026年11月7日–11日;意大利罗马第35届ACM国际信息与知识管理大会(CIKM '26)论文集,2026年11月7日–11日,意大利罗马DOI:10.1145/3799682.3839867 (https://doi.org/10.1145/3799682.3839867)ISBN:979-8-4007-2539-5/2026/11CCS:应用计算 电子商务CCS:信息系统 计算广告CCS:计算方法学 排序

金琦 邮箱:[[email protected]](mailto:[email protected]) 注:同等贡献。附属机构:南京大学新型软件技术国家重点实验室,南京,中国附属机构:南京大学智能科学与技术学院,苏州,中国思朔 陈 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,詹明 陈 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,永白 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,超毅 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,韩竹 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,书典余 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,雷张 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,胜陈 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,承欢侯 邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国,建徐 注:通讯作者。邮箱:[[email protected]](mailto:[email protected])附属机构:阿里巴巴集团淘宝与天猫事业部,北京,中国以及超有富 邮箱:[[email protected]](mailto:[email protected])附属机构:南京大学新型软件技术国家重点实验室,南京,中国附属机构:南京大学智能科学与技术学院,苏州,中国

2026; © cc

###### 摘要\.

转化归因中的触点选择,即识别对转化有贡献的关键触点,对电子商务推荐和在线广告至关重要。当前的触点选择方法严重依赖基于协同过滤的启发式规则,这些规则未能与用户感知的语义意图保持一致。通过人工标注,我们揭示了一个显著的**语义鸿沟**:许多隐式相关、但语义上相关的触点,仍被现有规则所遗漏。因此,我们系统地评估了大型语言模型在识别这些隐藏关联方面的能力。我们的评估表明,虽然LLM能有效发掘大量隐式相关的触点,但其选择性能仍有很大提升空间。此外,我们分析了不同提示策略和基础模型选择对识别性能的影响,为它们的推理模式和有效性提供了有价值的见解。这些见解为转化归因从机械的规则匹配转向符合人类认知的语义推理,提供了一条新的路线图。此外,我们利用LLM标注的转化标签来增强工业CVR模型的训练,并取得了显著的离线性能提升,展示了LLM在转化归因中的潜力。

###### 关键词:

大型语言模型,转化归因,电子商务推荐,在线广告

††cc 许可证:by

## 1. 引言

转化归因,即将转化功劳分配给过去用户触点的机制,是电子商务平台的基石,它影响着向广告主展示的广告效果(19 (https://arxiv.org/html/2608.28649#bib.bib7);10 (https://arxiv.org/html/2608.28649#bib.bib3);22 (https://arxiv.org/html/2608.28649#bib.bib9);15 (https://arxiv.org/html/2608.28649#bib.bib12))、转化率(CVR)预测模型的标签生成(4 (https://arxiv.org/html/2608.28649#bib.bib2);23 (https://arxiv.org/html/2608.28649#bib.bib10);21 (https://arxiv.org/html/2608.28649#bib.bib13)),并最终影响平台收入。过去关于转化归因的研究主要集中在:(1) 给定一系列用户触点的**权重分配**,这通常局限于与消费产品**同一商品或店铺**下的触点(22 (https://arxiv.org/html/2608.28649#bib.bib9);4 (https://arxiv.org/html/2608.28649#bib.bib2))。最近,来自Meta的研究(23 (https://arxiv.org/html/2608.28649#bib.bib10))发现,(2) **触点选择**是转化归因的另一个重要方面,旨在从完整的用户行为序列中识别有意义的触点。图1 (https://arxiv.org/html/2608.28649#acmlabel1)展示了转化归因的两个关键组成部分。

转化归因概述,包括触点选择和后续的权重分配。
图1. 转化归因中的触点选择与权重分配。
尽管Meta的研究(23 (https://arxiv.org/html/2608.28649#bib.bib10))揭示了全路径归因在挖掘转化信号和增强CVR预测模型训练方面的价值,但其触点选择依赖于基于商品分类法和协同过滤(CF)信号的**启发式规则**,这可能无法捕捉那些与目标商品语义相关,但缺乏显式分类或历史交互重叠的**隐式相关触点**。为验证此点,我们构建了SILVA——首个用于**全路径转化归因触点选择**(Selection In fuLl-path conVersion Attribution)的基准数据集,该数据集采集自一个大规模的电子商务平台。在SILVA上进行的人工标注结果揭示了一个惊人的事实:除了由分类法和基于CF的启发式规则所覆盖的**显式相关触点**之外,*存在大量当前被忽视的隐式相关触点*。这些发现凸显了当前转化归因方法的一个关键缺陷,即它们对大量隐式相关、语义相关的触点视而不见。

为弥合这一差距并探索如何识别这些隐式相关触点,我们转向具有卓越语义推理能力的大型语言模型(20 (https://arxiv.org/html/2608.28649#bib.bib8))。具体而言,我们在SILVA上对代表性LLM进行了系统评估,评估其在不同模型规模和提示策略下,识别显式和隐式相关触点的有效性。我们总结的主要发现如下:

1. (1) **LLM的触点选择能力**:前沿LLM擅长识别显式相关触点,并能有效发现大量隐式相关触点,但在隐式相关触点选择方面仍有很大改进空间。
2. (2) **提示策略的影响**:成对推理优于列表推理,但随着模型能力的提升,差距会缩小。
3. (3) **不同LLM家族的表现**:闭源LLM,如Gemini 3.1 Pro(8 (https://arxiv.org/html/2608.28649#bib.bib15))和GPT 5.5(17 (https://arxiv.org/html/2608.28649#bib.bib14)),仅略微优于开源模型,如GLM 5.1(7 (https://arxiv.org/html/2608.28649#bib.bib17))和DeepSeek V4-Pro(5 (https://arxiv.org/html/2608.28649#bib.bib18));较小的LLM(<100B)则远落后于旗舰模型。

此外,受这些见解启发,我们遵循先前工作(4 (https://arxiv.org/html/2608.28649#bib.bib2) 和 23 (https://arxiv.org/html/2608.28649#bib.bib10)),利用LLM标注的转化标签作为辅助信号来训练CVR预测模型。结果表明,我们的方法**面向LLM的触点理解与选择(LOTUS)**,在一个拥有数亿活跃用户的大规模电子商务平台上,预测主要转化目标时,其绝对GAUC指标比生产环境基线(Base)(4 (https://arxiv.org/html/2608.28649#bib.bib2))提升了0.35个百分点(pp),并比启发式竞争方案CABB(23 (https://arxiv.org/html/2608.28649#bib.bib10))进一步提升了0.15 pp。我们相信,我们的系统分析和发现为利用LLM进行转化归因中的触点选择开辟了新途径,有助于电子商务平台提升用户满意度和平台收入。

## 2. 相关工作

转化归因机制,即在用户触点间分配转化功劳的规则,在电子商务平台中扮演着至关重要的角色(19 (https://arxiv.org/html/2608.28649#bib.bib7))。先前关于转化归因的研究聚焦于通过因果建模进行触点间的权重分配(19 (https://arxiv.org/html/2608.28649#bib.bib7);12 (https://arxiv.org/html/2608.28649#bib.bib5);6 (https://arxiv.org/html/2608.28649#bib.bib11);10 (https://arxiv.org/html/2608.28649#bib.bib3);22 (https://arxiv.org/html/2608.28649#bib.bib9);2 (https://arxiv.org/html/2608.28649#bib.bib1);11 (https://arxiv.org/html/2608.28649#bib.bib4);15 (https://arxiv.org/html/2608.28649#bib.bib12)),并利用归因结果训练CVR预测模型(4 (https://arxiv.org/html/2608.28649#bib.bib2);23 (https://arxiv.org/html/2608.28649#bib.bib10);21 (https://arxiv.org/html/2608.28649#bib.bib13))。然而,几乎所有的研究都忽略了**触点选择**,默认只考虑与消费产品同一商品或店铺下的触点。Meta的工作(23 (https://arxiv.org/html/2608.28649#bib.bib10))提出了一种基于协同过滤信号的启发式方法来挖掘跨商品相关触点,并展示了触点选择对于增强Meta平台CVR预测模型训练的价值。尽管如此,他们简单的启发式选择策略可能会忽略隐式相关触点。据我们所知,我们的研究首次*探索了隐式相关触点的特征*,并探索了如何*利用LLM进行转化归因中的触点选择*。

## 3. SILVA 基准数据集

### 3.1. 问题形式化

**触点选择**旨在识别历史交互是否对转化有所贡献。形式上,给定一个转化C及其前置触点集$\{t_1, t_2, \dots, t_n\}$,我们为每个$t_i$分配一个标签$l_i \in \{\text{不相关, 显式相关, 隐式相关}\}$。在电子商务的语境下,有意义的触点被归类为:

- • **显式相关**:与C共享元数据驱动或统计关联的交互,包括:(1) **分类法匹配**,例如相同的商品、店铺、品牌或叶子品类;(2) **基于CF的相似性**,涉及由协同过滤信号确定的相似叶子品类(23 (https://arxiv.org/html/2608.28649#bib.bib10))。
- • **隐式相关**:具有语义驱动关联、但规避了显式规则的触点,包括:(1) **功能互补性**(例如,相机和存储卡);(2) **场景/受众匹配**(例如,共享动漫IP)。

### 3.2. 基准构建与分析

我们建立了SILVA——首个用于**全路径转化归因触点选择**(Selection In fuLl-path conVersion Attribution)的基准数据集。SILVA从一个拥有数亿日活用户的电子商务平台采集,包含1,000个独特的转化事件及其在3天回溯窗口内的前置触点,共计69,680个触点。每个触点都附有点击商品的多模态信息,包括其图片、标题、店铺和品类元数据。

图2展示了一个标注用户档案、候选触点、最终转化,以及“不相关”、“显式相关”和“隐式相关”标签选择的示意图。
图2. 用于构建SILVA基准的示意图标注界面。
**标注可靠性**。对于人工标注,我们招募了六名训练有素的标注员,使用图2所示的界面进行标签分配。所有标注员均按照当地现行工资标准获得公平报酬。在正式标注前,标注员接受了包含详细指南和显式相关与隐式相关代表性示例的培训。重要的是,标注员仅根据语义标注指南分配标签,不会看到基于分类法或CF启发式基准的输出。每个触点由从六名标注员池中随机抽取的三名标注员独立标注。我们使用Fleiss' κ在三方标签空间(即不相关、显式相关和隐式相关)上衡量标注者间一致性。标注结果的Fleiss' κ > 0.70,表明除偶然一致性外,具有实质性一致性;最终标签通过三次标注的多数投票决定。

分析结果显示,显式相关触点占数据集的19.09%。关键的是,**隐式相关触点占到了显著的14.91%**,这些触点规避了传统的分类法和基于CF的规则。这些统计数据强调,**隐式信号不可忽视**,并且代表了当前转化归因研究(22 (https://arxiv.org/html/2608.28649#bib.bib9);4 (https://arxiv.org/html/2608.28649#bib.bib2);23 (https://arxiv.org/html/2608.28649#bib.bib10))所忽视的用户转化旅程的重要组成部分。为填补这一空白,我们在第4节(https://arxiv.org/html/2608.28649#S4)研究了LLM发现这些潜在关联的能力,并在第5节(https://arxiv.org/html/2608.28649#S5)展示了这些隐式相关触点对于增强CVR预测的下游价值。

## 4. 利用LLM进行触点选择

表1. LLM在SILVA上进行触点选择的主要结果。Exp.和Imp.分别代表显式和隐式触点。阴影列标记了F1指标,加粗和下划线分别表示每列F1值的最佳和次佳。

### 4.1. 实验设置

**基础模型**。我们评估了八个代表性的LLM:GPT-5.5(17 (https://arxiv.org/html/2608.28649#bib.bib14))、Gemini-3.1-Pro(8 (https://arxiv.org/html/2608.28649#bib.bib15))、Claude-Opus-4.7(1 (https://arxiv.org/html/2608.28649#bib.bib16))、GLM-5.1(7 (https://arxiv.org/html/2608.28649#bib.bib17))、DeepSeek-V4-Pro和DeepSeek-V4-Flash(5 (https://arxiv.org/html/2608.28649#bib.bib18)),以及Qwen3.5-27B和Qwen3.5-30B-A3B(18 (https://arxiv.org/html/2608.28649#bib.bib19))。对于支持切换思考模式的模型,我们使用思考模式;否则,使用默认设置。

**提示协议**。我们比较了成对和列表提示。在**成对**协议中,模型接收用户档案、一个候选触点和最终转化,判断该触点是否与转化相关。在**列表**协议中,模型接收用户档案、所有候选触点的列表以及最终转化,同时对列表中所有触点的相关性进行判断。

相似文章

大规模语言模型的概率归因

arXiv cs.CL

本文提出了一种与模型无关的基于概率的令牌归因度量,利用贝叶斯规则反转下一个令牌的对数概率,捕捉模型对令牌序列的内部表示,并通过熵分析提高可解释性。

大型语言模型中的类人回指消解

arXiv cs.CL

本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。

理解大型语言模型

arXiv cs.CL

本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。