面向有限语义表格数据的大型语言模型:来自工业车辆改装预测的证据
摘要
本文评估了基于大型语言模型(LLM)的策略(嵌入、提示、混合)与经典表格模型在一个包含哈希化类别特征的工业车辆改装预测数据集上的表现。研究发现,树集成整体上优于LLM,但嵌入和混合方法仍有价值,而在缺乏语义线索时直接提示失败。
arXiv:2606.15314v1 Announce Type: new
Abstract: 工业改装规划依赖于结构化操作数据而非自由文本:规划人员需要估计新注册的原型是否需要改装、需要哪种改装套件以及工作需要多长时间。我们研究了一个工业数据集,该数据集将一个原型注册系统(284,271辆车)与一个改装管理系统(48,716次清理后的访问记录)相关联。我们将强大的表格机器学习基线方法与三种基于LLM的策略(行序列化输入)进行比较:嵌入特征(Amazon Titan)、直接提示分类(Claude Sonnet 4)以及ML+LLM堆叠方法。在二分类发生预测、15类别改装类型分类、每次访问持续时间的回归以及聚合月度基准测试中,经典的树集成仍然是最强的独立模型。然而,LLM的结果揭示了一致的模式:嵌入在表格上仍然有用(二分类AUC=0.982);一旦通过哈希化去除语义信号,直接提示就会失效(二分类AUC=0.500;多分类加权F1=0.018);而混合堆叠方法得出了最佳手动构建的多分类模型(加权F1=0.626)。在月度基准测试中,基于滞后的机器学习优于时间序列基础模型,尽管Chronos-small在零样本预测中仍具有竞争力。结果表明,在隐私受限的工业表格上,LLM作为补充组件比替换强大的表格基线更有效。
查看缓存全文
缓存时间: 2026/06/16 11:41
# 语义有限的表格数据上的大语言模型:来自工业汽车改装预测的证据
来源:https://arxiv.org/html/2606.15314
Aina Vila Pons¹,²,Ioannis Tzachristas¹,Constantinos Antoniou¹
¹慕尼黑工业大学交通系统工程系,德国
²宝马集团,慕尼黑,德国
###### 摘要
工业改装规划依赖结构化的运营数据而非自由文本:规划人员需要估计新注册的样车是否需要进行改装、需要哪种改装包以及工作量将耗时多久。我们研究了一个工业数据集,该数据集链接了样车注册系统(284,271 辆车)与改装管理系统(清洗后 48,716 次到店记录),并比较了强基线表格机器学习方法与三种基于大语言模型(LLM)的策略,这些策略在序列化输入行上运行:嵌入特征(Amazon Titan)、直接提示分类(Claude Sonnet 4)以及 ML+LLM 堆叠方法。在二元发生预测、15 类改装类型分类、单次到店时长回归以及聚合月基准测试中,经典的树集成方法仍然是最强的独立模型。然而,LLM 的结果揭示了一致模式:嵌入在表格上仍然有用(二元 AUC=0.982=0.982),一旦语义信号被哈希剥离,直接提示就会崩溃(二元 AUC=0.500=0.500;多类加权 F1=0.018=0.018),而混合堆叠产生了最佳的手工构建多类模型(加权 F1=0.626=0.626)。在月基准测试中,基于滞后特征的机器学习优于时间序列基础模型,不过 Chronos-small 在零样本预测中仍具竞争力。结果表明,在隐私受限的工业表格上,LLM 作为互补组件比替代强表格基线更有效。
## 1 引言
汽车开发中的改装部门通过实施硬件和软件改动来修改样车,以便后续测试能够进行。容量规划很困难,因为早期车辆元数据维度高、大多为类别型且噪声大,而改装需求信号稀疏。在实践中,规划人员需要回答三个问题:新注册的样车是否会到访改装部门,需要哪种改装包,以及改装大概需要多长时间?
我们通过结构化数据上的大语言模型(LLM)来研究这一流程。输入是类别值已被哈希化的表格,因此行序列化暴露了结构,但几乎没有词汇语义。这使得该场景有助于区分基于LLM的方法哪些能从分布模式中学习,哪些需要语义内容来解决。我们将强基线表格模型与三种基于序列化行的LLM策略进行比较,同时还在聚合的月度规划信号上对时间序列基础模型进行基准测试。¹¹¹https://github.com/aina-vila-pons/retrofit-forecast-pipeline.
#### 贡献。
- • 我们制定了一个端到端的工业规划问题,基于结构化数据:二元发生预测、15 类改装类型预测、单次到店时长回归以及月度时间序列基准测试。
- • 我们将三种基于 LLM 的表格预测策略——嵌入特征、提示分类和 ML+LLM 堆叠——与强基线经典模型和 AutoML 参考进行比较。
- • 我们报告了一个清晰的失败模式:直接提示表现不佳,而基于嵌入的特征和混合堆叠仍保留有用信号。
- • 我们提炼了关于成本、延迟和隐私受限模型设计的部署经验,适用于在企业表格上运行的 LLM 系统。
样车注册(所有车辆) → 改装到店(部门案例) → 左连接 → 标签 y∈{0,1} → 内连接(仅改装行) → 第一阶段:二元分类器 ^p(改装) → 第二阶段:多类分类器 ^y_type → 第三阶段:时长回归器 ^d → 规划输出:type × duration 工作量估算
图 1:三阶段规划流程的简洁视图。LLM 方法通过将每个结构化行序列化为文本,在分类阶段进行评估。
## 2 相关工作
#### 结构化数据上的大语言模型。
近期研究探究语言模型接口是否能改善表格上的预测。一个方向是将行序列化为文本并从其嵌入表示中学习(Dinhet al. 2022 (https://arxiv.org/html/2606.15314#bib.bib18);Hegselmannet al. 2023 (https://arxiv.org/html/2606.15314#bib.bib19))。第二个方向是在序列化行上执行直接提示预测,可选地带有少量样本示例(Hegselmannet al. 2023 (https://arxiv.org/html/2606.15314#bib.bib19))。第三个方向是将 LLM 输出与经典表格模型结合在混合系统中。与此同时,诸如 TabPFN 之类的表格基础模型探究预训练变压器是否能匹配提升树在结构化数据上的表现(Hollmannet al. 2023 (https://arxiv.org/html/2606.15314#bib.bib16))。
#### 工业表格机器学习与时间序列预测。
对于高基数工业表格,目标编码(Micci-Barreca 2001 (https://arxiv.org/html/2606.15314#bib.bib1))和梯度提升树(如 XGBoost、LightGBM 和 CatBoost)仍然是强基线(Chen and Guestrin 2016 (https://arxiv.org/html/2606.15314#bib.bib4);Keet al. 2017 (https://arxiv.org/html/2606.15314#bib.bib5);Prokhorenkovaet al. 2018 (https://arxiv.org/html/2606.15314#bib.bib6))。罕见事件预测进一步需要不平衡感知训练和仔细的指标选择(Saito and Rehmsmeier 2015 (https://arxiv.org/html/2606.15314#bib.bib7);Chawlaet al. 2002 (https://arxiv.org/html/2606.15314#bib.bib2))。在时间序列方面,我们将经典统计预测(Box and Jenkins 1990 (https://arxiv.org/html/2606.15314#bib.bib8);Hyndman and Athanasopoulos 2021 (https://arxiv.org/html/2606.15314#bib.bib9);Taylor and Letham 2018 (https://arxiv.org/html/2606.15314#bib.bib10))与近期的时间序列基础模型(包括 Chronos 和 TIME-LLM)进行比较(Ansariet al. 2024 (https://arxiv.org/html/2606.15314#bib.bib11);Jinet al. 2024 (https://arxiv.org/html/2606.15314#bib.bib12))。
## 3 数据与问题定义
### 3.1 数据来源
我们使用一家大型汽车制造商的内部系统:(1) 样车注册系统,记录所有新建造的样车及其早期元数据,如衍生型号、集成步骤、建造阶段、发动机类型、建造地点和截止日期;(2) 改装管理系统,记录改装到店情况,包含改装包标签和流程时间戳。所有类别值已哈希化;本研究使用的连续特征是从时间戳、车队数量和频率统计中工程化得到的。对于基于 LLM 的方法,每行还会被序列化为键值描述,以便嵌入或传递给提示分类器。
### 3.2 连接与标签
我们得到两个监督数据集。左连接产生二元发生数据集 (n=284,271),目标指示车辆是否曾经到访改装部门(正样本率约 4.4%;12,378 正样本 vs. 271,893 负样本)。内连接产生仅改装数据集 (n=54,174 次到店,在时长筛选之前),用于改装类型预测和时长回归。在将 17 种罕见的多类型组合合并到其最不常见的组件后,改装类型任务包含 15 个类别。对于时长,我们移除 P1–P99 异常值(503 行),剩下 52,507 次到店。简要数据集概览见附录 A (https://arxiv.org/html/2606.15314#A1)。
#### 目标。
第一阶段:发生。给定注册行 x,预测车辆是否会来改装。
第二阶段:改装类型。对于改装到店,预测改装类型标签。
第三阶段:时长。预测改装开始日期与结束日期之间的天数。原始时长分布右偏(均值=9.2 天,中位数=4.0 天),因此我们对建模采用 log(1+x) 变换。
#### 聚合月度基准测试。
除了单次到店时长任务,我们构建了一个 76 个点的月均改装时长时间序列。该基准测试提供了粗略的规划信号和一个故意低数据量的设置,用于时间序列基础模型。它还允许我们比较车辆级别的监督与一个更小的聚合预测问题。
## 4 方法
图 2 (https://arxiv.org/html/2606.15314#S4.F2) 总结了完整的建模流程。从两个运营数据库开始,流程经过数据清洗、特征工程和三个监督学习阶段。每个分类阶段都使用经典机器学习模型和基于 LLM 的替代方案进行评估,而 AutoML 和时间序列基础模型提供了额外的参考点。
(参见图注)
图 2:完整建模流程:从数据摄取,经过经典机器学习、基于 LLM 的方法和时间序列基础模型基准测试,到最终比较和预测链接。
### 4.1 特征工程与经典基线
我们将类别元数据与工程化的数值信号区分开来。数值特征包括车辆月龄、按衍生型号、基础类型、发动机类型和建造地点聚合的车队数量计数,以及交互项如 age × fleet 和 priority × fleet。为减轻数据泄露,我们排除了直接标识符和会轻易揭示目标的时间字段。在目标编码、频率编码和基于重要性的预筛选之后,二元任务保留 44 个特征,多类/时间任务各保留 50 个特征。
在三个阶段中,我们评估了逻辑回归、随机森林(Breiman 2001 (https://arxiv.org/html/2606.15314#bib.bib3))、额外树、梯度提升、XGBoost、LightGBM 和 CatBoost(Chen and Guestrin 2016 (https://arxiv.org/html/2606.15314#bib.bib4);Keet al. 2017 (https://arxiv.org/html/2606.15314#bib.bib5);Prokhorenkovaet al. 2018 (https://arxiv.org/html/2606.15314#bib.bib6))。对于第一阶段,我们还训练了来自表现最佳模型的堆叠和加权软投票集成。超参数使用 Optuna 调优(Akibaet al. 2019 (https://arxiv.org/html/2606.15314#bib.bib20));对于多类任务,SMOTE 比率与模型超参数联合调优(Chawlaet al. 2002 (https://arxiv.org/html/2606.15314#bib.bib2))。
### 4.2 基于 LLM 的方法
我们在分类阶段评估了三种基于 LLM 的策略。
#### LLM-嵌入。
每个结构化行被序列化为键值文本字符串,并使用 Amazon Titan Embed v2(1024 维)进行嵌入。在所得向量上训练逻辑回归分类器。由于 API 成本,嵌入阶段被下采样到 5000 个训练行。
#### LLM-提示。
Claude Sonnet 4 接收每个序列化行以及任务特定的少样本示例,并直接预测标签。我们使用直接提示分类而非微调。由于成本和延迟,提示推理在较小的保留子集上评估(根据任务不同为 200–500 行)。
#### LLM-堆叠。
一个元学习器结合最佳经典概率与 LLM 衍生输出。此设计测试 LLM 作为特征提供者或互补组件是否比作为端到端预测器更有用。
### 4.3 AutoML 与时间序列基线
AutoGluon 作为表格任务的 AutoML 参考(Ericksonet al. 2020 (https://arxiv.org/html/2606.15314#bib.bib17))。对于月度基准测试,我们比较统计基线、基于滞后特征的机器学习、基于滞后特征的 AutoGluon 以及时间序列基础模型,包括 Chronos 和 TIME-LLM(Ansariet al. 2024 (https://arxiv.org/html/2606.15314#bib.bib11);Jinet al. 2024 (https://arxiv.org/html/2606.15314#bib.bib12))。该基准测试故意设计得小且稀疏,使其成为零样本预测的有用压力测试。
## 5 实验设置
我们对分类和回归使用 80/20 分层训练-测试分割,对月度时间序列使用 16 个月保留集。我们还计算了自助置信区间和配对 McNemar 检验;正文报告核心性能表,而二元任务的详细置信区间保留在附录 B (https://arxiv.org/html/2606.15314#A2) 中。
评估指标为:第一阶段:ROC-AUC、PR-AUC 和阈值化 F1;第二阶段:准确率、加权 F1、宏平均 F1 和一对多 AUC;第三阶段:MAE、RMSE 和 R²。由于第一阶段严重不平衡,ROC-AUC 与 PR-AUC 一起解读(Saito and Rehmsmeier 2015 (https://arxiv.org/html/2606.15314#bib.bib7))。对于月度基准测试,我们报告 16 个月测试窗口上的 MAE 和 R²。
## 6 结果
### 6.1 第一阶段:发生预测
表 1 (https://arxiv.org/html/2606.15314#S6.T1) 显示了主要二元结果。超参数调优的 CatBoost 实现了最强的独立性能(AUC=0.997,F1=0.884),而投票集成取得了最佳 PR-AUC。在基于 LLM 的方法中,嵌入在行上仍然有用(AUC=0.982),但直接提示崩溃到随机性能(AUC=0.500)。混合堆叠在其 200 行评估子集上达到 F1=0.900,表明有互补信号,但总体情况仍然清晰:强表格模型作为独立预测器占主导地位。
表 1:第一阶段二元发生预测。† 表示较小的 200 行 LLM 评估子集。完整表见附录 B (https://arxiv.org/html/2606.15314#A2)。
| 模型 | ROC-AUC | PR-AUC | F1 |
|------|---------|--------|----|
| CatBoost (超参数调优) | 0.997 | 0.932 | 0.884 |
| 投票集成 | 0.997 | 0.937 | 0.883 |
| LLM-堆叠† | 0.996 | 0.897 | 0.900 |
| LLM-嵌入 | 0.982 | 0.667 | 0.684 |
| LLM-提示† | 0.500 | 0.045 | 0.086 |
| AutoGluon | 0.997 | — | 0.881 |
### 6.2 第二阶段:改装类型预测
多类任务为混合 LLM 使用提供了最明确的正向结果。如表 2 (https://arxiv.org/html/2606.15314#S6.T2) 所示,LLM-堆叠在手工配置的流程中达到了最佳加权 F1(0.626),略高于带 SMOTE 的随机森林(0.621)和 XGBoost(0.614)。AutoGluon 在整体上仍保持最佳,加权 F1 为 0.654。再次,直接提示分类在输入上表现不佳,而基于嵌入的特征仍然可用但明显低于顶级表格基线。
表 2:第二阶段改装类型预测。完整表见附录 B (https://arxiv.org/html/2606.15314#A2)。
| 模型 | Acc | F1w | F1m |
|------|-----|-----|-----|
| AutoGluon | 0.702 | 0.654 | 0.348 |
| LLM-堆叠 | 0.680 | 0.626 | 0.281 |
| 随机森林 (SMOTE) | 0.611 | 0.621 | 0.390 |
| XGBoost (SMOTE) | 0.601 | 0.614 | 0.380 |
| LLM-嵌入 | 0.480 | 0.521 | 0.327 |
| LLM-提示 | 0.100 | 0.018 | 0.012 |
### 6.3 第三阶段:时长预测与月度基准测试
对于单次到店时长,经典集成仍然占主导地位:AutoGluon 达到 MAE=4.9 天,额外树达到 MAE=5.1 天。在月度序列上,基于滞后特征的机器学习仍然最佳(LightGBM 和 AutoGluon 均达到相似文章
LLM作为检测器:一种用于表格异常检测的上下文学习方法
本文提出了LLM-Detector,这是一个利用大语言模型进行上下文学习的框架,用于执行表格异常检测,无需微调,在多个数据集上展示了相对于现有方法的持续改进。
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
不确定性引导的LLM语义增强用于异质性治疗效果估计
本文提出CURL,一种即插即用适配器,利用估计器不确定性分配预训练LLM的语义能力,以改进异质性治疗效果(CATE)估计。它引入两种角色调节的提示,构建面向分配和异质性的表示,在四个基准上提升了十个宿主学习器的性能。
LLM-as-a-Discriminator:当合成表格看起来仍然真实
本文提出了一种基于LLM鉴别的方法,用于审计合成表格数据的隐私,通过让LLM将样本分类为真实或合成,表明LLM鉴别可以作为一种实用的隐私审计信号。
大语言模型可通过正确提示更好地捕捉人类判断
本文提出了一些简单的提示策略,帮助大语言模型更好地捕捉人类判断的完整分布,从而在道德场景和信念方面提升与人类的对齐效果。作者表明,让模型报告标准差和响应比例,同时确保场景清晰度,能够获得与人类反应更一致的结果。