从显式元素到隐式意图:用于可审计行为推理的预定义库
摘要
介绍SemantiClean,一个模块化框架,用于从电子商务会话数据中提取结构化语义信号,驱动可插拔推理目标(购买意图、客户细分、产品亲和力),同时优先考虑可审计性和结构透明度而非纯粹的准确性。
arXiv:2606.11207v1 公告类型:新
摘要:我们提出SemantiClean,一个模块化框架,用于从电子商务会话数据中提取结构化语义信号,并通过共享元素库驱动可插拔推理目标,包括购买意图、客户细分和产品亲和力。与仅优化准确率的传统端到端预测器不同,SemantiClean优先考虑可审计性、结构治理和sigma=0可重复性,明确牺牲边际预测增益以换取元素级透明度和可辩护的决策轨迹。该框架基于在线购物者购买意图(OSPI)数据集,将24个行为元素组织成四层架构(功能层、交互层、系统层、上下文层),并通过三种抗膨胀机制确保信号质量:RedundancyGroup贡献上限、TieredPenaltyCalculator偏差惩罚和AdaptiveConstraintMode冷启动保护。本报告介绍了LLM集成语义推理引擎,这是一个完全实现的两阶段LLM驱动推理架构,在推理时利用完整的元素元数据。本文报告的所有定量结果均由该引擎产生。确定性引擎输出保持完全可重复(sigma=0);依赖于LLM的结果(E8、E10)在固定的提供商/模型/温度设置下受到可控输出变异性的约束。性别推理目标在当前实现中不起作用,因此被排除在所有定量结果之外。
查看缓存全文
缓存时间: 2026/06/11 13:46
# 从显式元素到隐式意图:一个用于可审计行为推理的预定义库
来源:https://arxiv.org/html/2606.11207
###### 摘要
我们提出 **SemantiClean**,一个模块化框架,用于从电子商务会话数据中提取结构化语义信号,并通过共享的元素库驱动可插拔的推理目标——包括购买意图、客户细分和产品关联。与仅优化准确率的传统端到端预测器不同,SemantiClean 优先考虑可审计性、结构治理和可复现性(σ=0),明确以边际预测增益换取元素级别的透明度和可辩护的决策轨迹。该框架基于在线购物者购买意向(OSPI)数据集(UCI存储库ID 468;12,330个会话,18个特征),将二十四个行为元素组织成四层架构(功能层、交互层、系统层、上下文层),并通过三种防膨胀机制确保信号质量:冗余组贡献上限、分层罚分计算器偏差惩罚、以及自适应约束模式冷启动保护。
本报告介绍了 **LLM集成语义推理引擎**,这是一个完全实现的两阶段LLM驱动推理架构,在推理时利用完整的元素元数据。本报告中报告的所有定量结果均由该引擎产生。确定性引擎输出完全可复现(σ=0);LLM相关结果(E8, E10)在固定提供商/模型/温度设置下,其输出变异性受到控制。性别推断目标在当前实现中无效,已从所有定量结果中排除。
## 1. 引言
从Web会话日志预测用户行为是电子商务分析领域长期存在的挑战。跳出率和页面浏览量等聚合指标捕捉了表面活动,但混杂了异质性的行为信号,这些信号对于不同的推理任务具有不同的语义权重。一个浏览了十二个产品页面且跳出率几乎为零的用户,可能是一位分析型研究者、一位比价的品牌忠诚者,或一位回头的意向买家——每种情况都需要不同的下游处理方式。
SemantiClean 通过将会话数据分解为一个语义上独特的行为元素库来解决此问题,每个元素捕捉一个范围狭窄的信号。这些元素由确定性引擎根据OSPI会话字段计算,然后由可插拔的推理目标聚合,这些目标定义自己的标签集和信号权重。同一个元素库同时服务于一个设计时的提议者/审查者流水线,该流水线使用大型语言模型生成和质量把关新元素,确保在库构建阶段而非推理阶段实现语义非冗余性。
Cirqueira 等人[2]提出了一种三方分类法,区分了三种电子商务购买行为预测任务:客户意图、购买会话和购买决策。这三个任务直接对应于 SemantiClean 的 `purchase_intent`、`customer_segment` 和 `product_affinity` 推理目标,将框架的目标设计建立在既有的研究分类法[2]之上。
SemantiClean 背离了电子商务分析领域主流的以准确性为中心的范式。该框架没有优化端到端的黑盒分类器,而是将行为预测视为一个可审计的推理过程。通过将信号提取(确定性元素库)与任务特定聚合(可插拔目标)解耦,系统优先考虑结构透明度、对低置信度猜测的保守放弃,以及对信号膨胀的显式治理。这种设计使 SemantiClean 成为合规敏感应用的基础设施,在这些应用中,决策可追溯性比原始预测性能的边际增益更重要。
该框架跨越三个主要的架构版本演进:
1. **版本1:原型架构(v1.x)**:十一个元素,四个推理目标,带有外部提示文件的提议者/审查者代理。
2. **版本2:确定性核心引擎**:JSON驱动架构——所有元素定义移至单一可信源库文件;无硬编码元素逻辑。
3. **版本3:LLM集成语义推理引擎**:两阶段LLM推理引擎,支持按需加载元素,本报告已完全实现并进行了实证评估。
#### 相关工作。
以往OSPI研究主要依赖直接在原始会话特征上训练的端到端机器学习分类器——包括Sakar等人[11]的实时LSTM基准、Gupta, Alamuri 和 Bondalapu [4]的SMOTE增强SVC(ROC-AUC = 0.886, F1 = 0.633)、Tokuç 和 Dag [12]的混合点击流表示、Wang等人[13]的XGBoost多特征融合(准确率=0.9761, F1=0.9763),以及Zhou 和 Hudin [14]的GNN增强深度学习方法。相比之下,SemantiClean 强调可解释的模块化语义元素——一个通过可插拔推理目标组合的窄域行为信号库,而非输入黑盒模型。
在LLM方面,Chodak等人[1]展示了ChatGPT-4o在电子商务日志分析中的效率,同时提醒注意幻觉风险;诸如SPARK_AI[8]和HCoT[6]等结构化LLM架构表明,提示编排的多阶段工作流能提高推理可靠性。SemantiClean 通过其双引擎架构连接了这些线索。
## 2. 数据集
SemantiClean 运行于在线购物者购买意向(OSPI)数据集[UCI机器学习存储库,ID 468;10],包含12,330个Web会话,18个特征,无缺失值。该数据集包含三个特征组。
#### 页面行为数值。
Administrative, Administrative Duration, Informational, Informational Duration, Product Related, Product Related Duration——每种内容类型的页面计数和停留时间,直接用于功能层和交互层元素。
#### Google Analytics 指标。
Bounce Rates (b), Exit Rates (e), Page Values (Pv), Special Day (Sday)——参与质量和促销邻近度信号。
#### 上下文分类变量。
Month, Operating Systems, Browser, Region, Traffic Type, Visitor Type, Weekend——用于上下文层元素的环境和流量条件。
二元目标标签 `Revenue`(购买完成,约15%正例率)仅用于推理验证,不参与元素计算。OSPI中缺失的三个字段——查询文本、类别详情和性别——分别代表了LLM补充机制(E8)和未校准的性别推断目标所解决的主要数据缺口。
#### 可复现性说明。
所有确定性结果的σ=0。E8和E10的LLM结果存在输出变异性;应在受控的提供商/模型/温度设置下收集多轮均值和标准差。
## 3. 元素库架构
### 3.1 四层组织结构
元素库将二十四个行为元素组织成四个语义层,按以下固定顺序执行(由库元数据决定):
功能层 → 交互层 → 系统层 → 上下文层 (1)
**功能层**(E1–E4, E12–E16, E20)计算可直接测量的页面行为指标。**交互层**(E5–E8, E17–E19, E21–E24)捕获决策模式和意图信号。**系统层**(E9, E19)根据上游输出产生跨元素复合体。**上下文层**(E10–E11, E12, E14, E18)应用环境修饰器。层成员身份由每个元素定义的主要类别标签决定;每个元素的完整标签数组跨越 ≥ 2 个不同的层(审查者代理检查3)。
### 3.2 JSON驱动架构
所有元素定义、执行顺序、信号得分映射和冗余组参数都位于单个元素库文件(`behavior_elements.json`)中,作为两个引擎和设计时代理的单一可信源。确定性引擎从库元数据中读取执行顺序,通过函数调度表按名称调度元素特定的蒸馏函数,并根据每个元素的映射规范推导信号得分映射。当映射规范缺失时,应用硬编码的回退字典。添加新元素只需在库文件中添加一个条目;无需更改算法。
### 3.3 元素参考
表1总结了 `behavior_elements.json` 中的完整元素清单。元素E01–E11为核心库;元素E12–E24是在库扩展期间添加的,以提高OSPI信号覆盖率。
表1:核心行为元素汇总(E01–E11)。完整的24元素清单(包括扩展元素)见附录C。
## 4. 方法论
### 4.1 派生字段计算
在元素蒸馏之前,派生字段计算模块从原始OSPI字段计算一组派生字段。关键量包括总会话时长 D_total = D_admin + D_info + D_prod (公式1)、总页面数 N_total (公式2),以及当 D_total > 0 时的时间分配比率 r_prod = D_prod / D_total 和 r_info = D_info / D_total (公式3-4)。这些比率分别被E1和E5直接使用。
D_total < 10 秒且 N_total = 0 的会话会触发回退规则1。这个10秒阈值是一个无消融支持的设计常量。Gorman [3] 为该设计选择提供了实证支持:在一项关于OSPI的多元逻辑回归研究中,极短会话与非购买行为强相关,其中 BounceRates, ExitRates, PageValues 和 VisitorType 均被确定为显著预测因子(AUC = 0.8969)。回退规则1的阈值将该实证发现操作化为一个确定性排除标准[3]。
### 4.2 功能层元素 (E1–E4, E12–E16, E20)
功能层元素直接从OSPI数字字段计算可直接观察的页面行为信号。所有计算都是确定性的(σ=0)。
#### E1 – 产品参与深度
将产品浏览行为的三个互补维度综合成一个深度分数:
s_depth = 0.40 · r_prod + 0.30 · min(1, t̄_prod/120) + 0.30 · min(1, Pv/50) (2)
其中 r_prod 捕捉时间分配,t̄_prod/120 捕捉每页停留深度(120秒归一化上限),Pv/50 捕捉Google Analytics页面价值(50单位上限)。权重系数 [0.40, 0.30, 0.30] 是设计常量。将停留时间、页面计数和GA页面价值结合成一个单一深度信号的理由得到了 Necula [9] 的支持,他证明了产品页面停留时间与跳出率、退出率和客户类型相结合,是购买决策的显著预测因子[9]。
#### E2 – 跳出退出承诺度
将会话承诺度计算为跳出-退出复合指标的补数:
s_commit = max(0, [1 − (0.5b + 0.5e)] · (0.7 + 0.3 · min(1, N_total/10)) − δ_traffic) (3)
其中对于付费搜索(TrafficType = 2)和引荐流量(TrafficType = 4),δ_traffic = 0.10。
#### E3 – 页面价值转化信号
对 Pv = 0 但有大量产品浏览的会话应用插补:
s_pv = { 0.15 如果 (Pv=0 ∧ N_prod > 3); min(1, Pv/50) 其他情况 } (4)
插补值0.15反映了设计假设:高浏览但GA为零的会话可能隐含转化意图,这得到了 Gupta, Alamuri 和 Bondalapu [4] 的特征分析支持,该分析将产品页面参与度确定为一个关键的行为预测因子。
#### E4 – 促销环境敏感性
是两个标记为偏差(†)的元素之一:
s_promo = 0.50 · S_day + 0.30 · 1[高峰月份] + 0.20 · 1[周末] (5)
高峰月份:11月、12月、2月、5月。高 s_promo 值表明观察到的购买行为可能由促销压力驱动,而非真实偏好。
### 4.3 交互层元素 (E5–E8, E17–E19, E21–E24)
交互层捕获决策模式、流量意图、访客忠诚度和LLM补充的语义信号。E5–E7完全确定性(σ=0);E8和E10在推理时引入了LLM调用。
#### E5 – 研究决策风格
计算研究强度分数:
s_research = 0.35 · r_info + 0.30 · (1 − b) + 0.35 · min(1, N_prod/8) (6)
会话被分类为决策风格:分析型(s_research > 0.55)、适度型(0.25–0.55)、冲动型(≤0.25)。
#### E6 – 流量来源意图分数
通过查找表将流量类型代码映射到预定义的基础意图分数,这基于 Hendriksen 等人[5]的论证,即渠道类型对于匿名会话预测具有信息价值。
表2:流量来源意图分数查找表。流量类型代码7–20回退到默认分数0.40。回访者获得+0.15的忠诚度奖励(上限1.0),这是一个设计常量。
#### E7 – 访客忠诚度承诺度
从查找结构返回一个离散的忠诚度分数。
表3:访客忠诚度承诺度查找结构。边界条件:新访客的两个条件均满足时,s_loyalty = 0.55。
#### E8 – 搜索意图语义推理
在推理引擎中引入了LLM零样本调用,仅对搜索流量会话(Traffic Type ∈ {2, 3})激活。使用零样本LLM推理进行语义搜索意图与 Chodak 等人[1]一致,他们实证评估了ChatGPT-4o在电子商务服务器日志上的表现,同时提醒需要精确的提示表述并管理幻觉风险。SemantiClean 的LLMExecutionGuard和E8的结构化输出要求直接回应了这些警示[1]。相似文章
超越回忆:行为规范作为AI个性化的解释层
本文介绍了表征准确性和一种行为规范作为AI个性化的解释层,表明与原始数据检索相比,它在大约25倍更少的上下文成本下提高了表征准确性,尤其是在需要解释的问题上。
符号学视角下的思考:PEEL 作为认识论负责任的 AI 辅助研究的支架框架
本文介绍了 PEEL(AI 认识参与素养协议)框架,该框架将 Voyant Tools 的确定性文本分析与 Claude 的大语言模型解释相结合,以皮尔斯符号学为理论基础,旨在揭示 AI 生成的研究摘要中的系统性失真,并促进认识论层面的问责。
LLaMA 3.1-8B-Instruct中的框架条件道德计算:伦理推理的机械可解释性审计
本文使用机械可解释性对LLaMA 3.1-8B-Instruct中的伦理推理进行审计,发现了“情境锚定效应”,即特定领域的表征在道德计算中占主导地位,并提出了“机械对齐”作为研究计划。
个性化作为逆规划:通过结构去噪学习智能幻灯片生成的潜在设计意图
本文提出Spire框架,将幻灯片个性化建模为逆规划问题,利用结构去噪和强化学习来推断潜在的设计意图,无需依赖显式模板或冗长的指令。
semantica-agi/semantica
Semantica 是一个开源的、图原生(graph-native)基础设施平台,用于构建具备上下文感知和可问责性的 AI 系统。它能够摄取企业数据、构建知识/上下文图谱,并提供图分析、因果推理和端到端的决策溯源。