在离散选择模型中嵌入具有结构性保证的基础模型预测
摘要
本文提出了一种两阶段适配器,将基础模型预测嵌入到多项逻辑模型中,保留成本单调性和可解释的支付意愿等经济特性,同时将准确率提升高达12.8个百分点。
arXiv:2606.26432v1 Announce Type: new
摘要:表格基础模型在选择预测任务上取得了很高的准确率,但它们的预测常常违背这些任务所需的经济逻辑:提高价格反而可能增加预测需求,隐含的支付意愿估计值经常为负或不可信,不可用的备选方案被赋予非零概率。我们提出了一种两阶段适配器,将基础模型预测的选择概率作为预先计算的特征,嵌入到多项Logit的效用函数中。在第一阶段,我们通过带符号约束的最大似然估计拟合多项Logit的结构系数;在第二阶段,我们冻结这些系数,并拟合一个作用于基础模型预测的小型神经网络校正。我们证明这种组合恰好保留了多项Logit的边际替代率,因此可解析计算的时间价值成为一种数学保证而非经验巧合。在三个数据集和两个基础模型上,适配器相比多项Logit平均提高了6.4个百分点的测试准确率,最高达12.8个百分点,保持了100%的成本单调性,并在交通数据集上产生的时间价值处于已发表的交通经济学范围内。在基础模型上下文受限时,性能优雅地下降,即使仅使用原始基础模型上下文的10%,仍能保持至少6个百分点的准确率提升。
查看缓存全文
缓存时间: 2026/06/26 05:19
# 将基础模型预测嵌入具有结构保证的离散选择模型
来源:https://arxiv.org/html/2606.26432
王颖硕¹ 孙曦² 李彦航³ 范志超⁴ 庄泽欣⁵
¹加州大学伯克利分校,美国加利福尼亚州伯克利市。
²杜克大学,美国北卡罗来纳州达勒姆市。
³东北大学,美国马萨诸塞州波士顿市。
⁴伊利诺伊大学厄巴纳-香槟分校,美国伊利诺伊州。
⁵南卫理公会大学,美国得克萨斯州达拉斯市。
通讯作者:王颖硕。
###### 摘要
表格基础模型在选择预测任务上取得了很高的准确率,但它们的预测常常违反这些任务所需的经济逻辑:提高价格可能增加预测的需求,隐含的支付意愿估计值经常为负或不合理,以及不可用的备选方案被赋予了非零概率。我们提出一个两阶段适配器,将基础模型预测的选择概率作为预先计算的特征,并将其嵌入到多项Logit的效用函数中。在第一阶段,我们通过带符号约束的最大似然估计拟合多项Logit的结构系数;在第二阶段,我们冻结这些系数,并拟合一个作用于基础模型预测的小型神经网络校正。我们证明这种组合精确地保留了多项Logit的边际替代率,因此可解析计算的时间价值成为数学保证而非偶然经验。在三个数据集和两个基础模型上,适配器相对于多项Logit平均获得6.4个百分点的测试准确率提升,最高达12.8个百分点,保持100%的成本单调性,并在交通数据集上产生符合已发表交通经济学文献范围的时间价值。在基础模型上下文受限的情况下,性能呈优雅退化,即使在原始基础模型上下文的10%下仍能保持至少6个百分点的准确率提升。
## 1 引言
离散选择模型指导着具有重大经济影响的政策决策:通勤方式选择预测中的每分钟时间价值(Ben-Akiva and Lerman, 1985 (https://arxiv.org/html/2606.26432#bib.bib2); Train, 2009 (https://arxiv.org/html/2606.26432#bib.bib3))是数十亿美元铁路和公路投资成本效益评估的基石;而消费者离散选择实验得出的支付意愿估计值则用于定价并预测标签制度如何改变行为。一个选择模型必须完成两件事:预测哪个备选方案被选中,以及预测选择如何对干预做出响应。多项Logit效用模型(Ben-Akiva and Lerman, 1985 (https://arxiv.org/html/2606.26432#bib.bib2); Train, 2009 (https://arxiv.org/html/2606.26432#bib.bib3))通过构造满足了第二个要求:带符号约束的成本系数给出了单调的需求,β时间/β成本比值提供了可解释的支付意愿,且不可用的备选方案获得零概率。但它们对第一个要求的满足仅属一般。现代机器学习模型则反转了这种权衡,以逐一破坏每个结构属性为代价来提高准确率(Hillel et al., 2021 (https://arxiv.org/html/2606.26432#bib.bib6); van Cranenburgh et al., 2022 (https://arxiv.org/html/2606.26432#bib.bib7); Zhao et al., 2020 (https://arxiv.org/html/2606.26432#bib.bib8))。诸如TabPFN(Hollmann et al., 2023 (https://arxiv.org/html/2606.26432#bib.bib11), 2025 (https://arxiv.org/html/2606.26432#bib.bib12))和Mitra(Maddix Robinson et al., 2025 (https://arxiv.org/html/2606.26432#bib.bib13))等表格基础模型通过提高准确率天花板并继承相同的结构缺陷,加剧了这种紧张关系。现有的补救措施各有代价:具有架构约束的单调神经网络(Sill, 1997 (https://arxiv.org/html/2606.26432#bib.bib22); Wehenkel and Louppe, 2019 (https://arxiv.org/html/2606.26432#bib.bib23); Sartor et al., 2025 (https://arxiv.org/html/2606.26432#bib.bib19))消除了单调性违反,但失去了闭形式权衡比率;知识蒸馏(Hinton et al., 2015 (https://arxiv.org/html/2606.26432#bib.bib17))到一个多项Logit学生模型保留了结构保证,但无法匹配教师模型的准确率;带惩罚的微调需要通过基础模型权重的梯度,这与TabPFN和Mitra在推理时使用的上下文学习不兼容。
我们提出一个两阶段适配器,将基础模型预测的概率向量作为预先计算的特征嵌入到受约束的多项Logit中。在第一阶段,我们在校正保持为零的情况下,通过最大似然拟合结构系数,并施加通常的MNL约束;在第二阶段,我们冻结这些系数,拟合一个小型神经网络校正。我们证明这种两阶段过程精确地保留了结构边际替代率,而结构系数和校正的联合训练则不能:校正的表达力产生了一族似然等价的解,破坏了可识别性。我们的贡献如下:
* **适配器**。一个两阶段行为适配器,通过构造保留了结构多项Logit的经济保证,同时恢复了基础模型的大部分准确率优势。
* **理论**。命题1 (https://arxiv.org/html/2606.26432#Thmproposition1) 和 2 (https://arxiv.org/html/2606.26432#Thmproposition2) 将两阶段训练确定为保留结构可识别性的设计选择,并刻画了联合训练的失败模式。
* **评估**。三个离散选择数据集、两个基础模型、六项消融实验、一个特征增强多项Logit基线、结合三种事后方法的校准分析,以及一个反事实总体份额评估。在每个(数据集,基础模型)单元的全部10个自举重复中,准确率提升均为正,精确二项符号检验的p ≈ 0.002,并且在较大数据集上麦克尼马尔配对观测p值低于10^{-20}。
* **审计管道**。一个适用于任何离散选择数据集和任何预测函数的行为审计方案,将时间价值审计推广到任意非成本属性的支付意愿,以及针对面板数据的聚类感知聚合。
## 2 相关工作
#### 机器学习与选择建模中的经济一致性。
离散选择建模自Ben-Akiva和Lerman (1985 (https://arxiv.org/html/2606.26432#bib.bib2))以来一直是交通经济学和消费者行为中的标准工具。近期工作将机器学习推向该领域,同时暴露了与经济结构的紧张关系:Hillel等人 (2021 (https://arxiv.org/html/2606.26432#bib.bib6)) 记录了神经网络和集成方法相对于多项Logit的一致准确率提升,但缺乏行为诊断;Zhao等人 (2020 (https://arxiv.org/html/2606.26432#bib.bib8)) 报告了机器学习选择模型中频繁的单调性违反和不可信的支付意愿估计;van Cranenburgh等人 (2022 (https://arxiv.org/html/2606.26432#bib.bib7)) 将经济一致性视为一个独立于预测准确率的未决挑战。Han等人 (2022 (https://arxiv.org/html/2606.26432#bib.bib9))(TasteNet)提出了一种神经嵌入离散选择模型,将口味参数作为个体特征的神经网络函数来学习,目标是口味参数的可解释性,通过学习的异质性而非我们在这里采用的结构加校正分解。本工作基于我们的研讨会论文 (Wang et al., 2026 (https://arxiv.org/html/2606.26432#bib.bib1));本文将其扩展到包含一个额外的数据集、正式保留结果以及反事实总体份额评估。此外,我们推导了正式的保留结果,跨基础模型进行了评估,并刻画了联合训练的失败模式。
#### 架构约束的单调神经网络。
架构方法通过符号约束权重和单调激活函数来强制执行单调性(Sill, 1997 (https://arxiv.org/html/2606.26432#bib.bib22); Wehenkel and Louppe, 2019 (https://arxiv.org/html/2606.26432#bib.bib23); Sartor et al., 2025 (https://arxiv.org/html/2606.26432#bib.bib19)),消除了成本单调性违反,但失去了闭形式权衡比率:没有全局系数,时间价值的类似物必须从每个观测的梯度计算,而不是直接读取为β时间/β成本。我们的适配器采取了不同的思路:单调性和权衡比率来自结构分量,其受约束的参数化在整个训练过程中保持不变,而基础模型贡献了一个不可微的旁路通道。
#### 表格基础模型与知识蒸馏。
诸如TabPFN(Hollmann et al., 2023 (https://arxiv.org/html/2606.26432#bib.bib11), 2025 (https://arxiv.org/html/2606.26432#bib.bib12))和Mitra(Maddix Robinson et al., 2025 (https://arxiv.org/html/2606.26432#bib.bib13))等表格基础模型通过上下文学习实现了强大的分类准确率。它们公开的基准测试侧重于预测准确率;特定于选择建模的结构有效性诊断(成本单调响应、有限正权衡比率、不可用备选方案零概率)在测试行覆盖率方面并非这些基准测试的一部分。我们的审计填补了这一空白。知识蒸馏(Hinton et al., 2015 (https://arxiv.org/html/2606.26432#bib.bib17))到一个多项Logit学生模型保留了结构保证,但受限于学生模型的表达力:一个普通的MNL学生模型参数化了严格的特征线性效用,而基础模型捕获的残差方差位于该上限之上。我们以不同的方式定位基础模型:它的预测成为一个解释性特征,嵌入到结构约束的效用内部,而基础模型的参数从未被修改。
## 3 方法
### 3.1 设置与符号
我们考虑一个离散选择设置,包含N个观测值,索引为i∈{1,...,N}。每个观测值有一个特征向量xi∈X,一个可用备选方案集合Ki⊆{1,...,K},以及一个观测到的选择yi∈Ki。对于面板数据,我们额外观测到一个主体标识符si,因为来自同一主体的多个观测值不可交换;我们在整个过程中对si进行聚类。一个选择模型产生概率Pk(xi)∈[0,1],在Ki上总和为1,即(K−1)单纯形Δ^{K-1}上的一个向量。标准多项Logit(MNL)通过线性效用Vk(xi)=β^T φk(xi)和softmax Pk=exp Vk / ∑_{j∈Ki} exp Vj 对这些概率进行参数化(Ben-Akiva and Lerman, 1985 (https://arxiv.org/html/2606.26432#bib.bib2))。备选方案特定的特征变换φk从xi中选择进入备选方案k效用的列,通常包括成本、时间、备选方案常数以及社会人口学交互项。我们将φk视为由数据集的规范固定,并通过最大似然估计恢复β。
### 3.2 行为审计
每个模型都通过三个模型无关的函数进行求值,这些函数只接受一个预测函数 x ↦ P(x)∈Δ^{K-1} 作为输入。我们说模型无关,是指审计只读取模型输出,无需梯度访问或了解内部结构。
干预协议。对于适配器和特征增强MNL,我们在整个过程中使用**固定-q**协议:当在第i行扰动成本或属性时,基础模型概率向量qi被固定为在未扰动的xi上计算的值,扰动仅进入V_k^{struct}。另一种**重新计算-q**协议会在扰动输入上重新运行基础模型;我们仅在原始基础模型反事实评估(第5.3节 (https://arxiv.org/html/2606.26432#S5.SS3))中使用它,并在那种情况下放弃结构保证。
这三个函数是:(1) **单调性**。对于每个测试行i和备选方案k,将k的成本向上扰动其观测范围的1%,并检查Pk是否下降;我们报告观测值级别的比率(面板数据上聚类感知)。(2) **权衡比率**。非成本属性a与成本b之间的边际替代率,以标准交通经济学符号惯例报告,使得时间价值和改善效用属性的支付意愿为正:当两个偏导均为负时(例如时间和成本都降低效用),ρ^{VOT}_{a,b} = (∂Pk/∂a)/(∂Pk/∂b);当∂Pk/∂a为正且∂Pk/∂b为负时(期望的非成本属性与成本),ρ^{WTP}_{a,b} = -(∂Pk/∂a)/(∂Pk/∂b)。通过有限差分估计,缩放至每列观测范围的1%。(3) **可用性合规**。对于可用集合Ki随观测值变化的数据集(例如Swissmetro,其中提议的Swissmetro选项并未提供给所有受访者),Leak(M) = E_i [∑_{k∉Ki} Pk(xi)] 测量了分配给形式上不可用备选方案的预测概率。多项Logit仅在Ki上应用softmax,因此其泄漏机械地为零;忽略可用性掩码的黑箱预测器可能将非零概率泄漏到不可用备选方案上。
### 3.3 两阶段行为适配器
架构。对于每个观测值i、备选方案k,以及通过一次前向传播在原始输入上从基础模型获得的预先计算的基础模型概率向量q(xi)∈Δ^{K-1},适配器的效用为:
Vk(xi) = Vk^{struct}(经济结构) + 基础模型校正 = β^T φk(xi) + gk(q(xi)) (1)
其中g: Δ^{K-1} → R^K 是一个小型MLP(两个隐藏层,宽度32)。为了在整个训练过程中强制成本/时间单调性,我们将每个此类系数重新参数化为β = -exp(θ)。
两阶段训练。我们分两个顺序阶段拟合模型。
*阶段1*:在校正保持为g≡0的情况下,在符号约束下通过最大似然拟合β,恢复独立MNL估计β*。
*阶段2*:固定β=β*,仅通过最大似然拟合g。该架构干净地实现了阶段1,因为g的输出层为零。相似文章
用于离散选择估计的表格基础模型
本文提出一种重新表述方法,将表格基础模型(TFMs)应用于离散选择估计,解决了行独立假设的结构性差距。最佳重新表述在留出对数似然上优于层次贝叶斯估计8%,在命中率上优于3.6%,同时运行速度快16倍。
基于Neural-Bayesian结构学习的离散选择建模
本文提出了Neural-Bayesian结构学习框架,该框架将可微结构学习与离散选择建模相结合,用于预测选择行为和评估干预措施,在恢复连贯的依赖结构的同时,实现了与现有基准可比的性能。
基于时间序列基础模型嵌入的剩余使用寿命估计
本文介绍了一种轻量级方法,利用Chronos-2时间序列基础模型的冻结嵌入,结合一个简单的回归头,进行剩余使用寿命估计,在工业传感器数据上相比基线方法取得了更优的性能。
面向基础模型综合评估的细粒度基准生成
一种新的自动化基准生成框架能够实现基础模型的细粒度、全面评估,具有更低的错误率和更丰富的元数据,在机器学习、公司金融和个人金融基准上得到了验证。
基于面板数据的Markov Chain选择模型的估计、预测与分类优化
本文提出了一个针对带面板数据的Markov Chain选择模型的框架,包括利用偏序偏好信息的新型EM算法进行估计、个性化选择预测以及分类优化。在合成数据和sushi数据集上的实验结果表明,相比传统方法有显著改进。