从结构方程模型到双机器学习:基于调查研究的稳健性分析

arXiv cs.LG 论文

摘要

本文开发了一个分阶段的稳健性分析框架,该框架将结构方程模型(SEM)、普通最小二乘法(OLS)和双机器学习(DML)连接起来,用于基于调查的潜变量研究,并通过金融科技数字客户亲密度调查模型进行了演示。该框架为研究人员提供了一个可重复使用的模板,用于评估不同估计方法下研究结果的稳定性。

arXiv:2607.00512v1 公告类型:新 摘要:结构方程模型(SEM)广泛应用于基于调查的商业和信息系统研究中,以评估潜变量和理论驱动的结构关系。然而,SEM路径显著性是在特定模型规范下获得的,可能无法显示研究结果在替代估计框架下是否保持稳定。本研究开发并演示了一个分阶段的稳健性分析框架,该框架连接了SEM、普通最小二乘法(OLS)回归和双机器学习(DML)。首先使用SEM来细化测量结构并估计稳健性基线SEM模型,在该模型中保留完整的理论指定结构路径系统,用于下游的稳健性分析,然后再进行最终的结构路径评估。然后,将OLS回归应用于SEM导出的构念得分,作为透明的回归基准。最后,使用DML风格的残差化来检查每个测试的焦点关系在基于机器学习的灵活调整观察控制后是否保持稳定。学习器敏感性检查比较了随机森林、梯度提升和支持向量机学习器,并选择反向方向诊断来检查方向敏感性。该框架通过金融科技数字客户亲密度调查模型进行了演示。研究结果识别了哪些关系在SEM、OLS和DML风格检查中保持稳定,哪些需要更谨慎的解释。一个可重现的Google Colab工作簿和生成的结果文件公开可用,为研究人员和学生提供了一个可重复使用的模板,可应用于其他基于调查的潜变量研究。本文为寻求通过传统和基于机器学习的稳健性检查来补充SEM的基于调查的研究人员提供了实用的稳健性工作流程和解释指南。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:38

# 从结构方程建模到双机器学习:基于调查研究的稳健性分析
来源:https://arxiv.org/html/2607.00512
###### 摘要

结构方程建模 \(SEM\) 广泛应用于基于调查的商业与信息系统研究中,用于评估潜在构念及理论驱动的结构关系。然而,SEM 路径显著性是在特定模型设定下获得的,可能无法显示研究发现在替代估计框架下是否保持稳定。本研究开发并展示了一个分阶段的稳健性分析框架,该框架将 SEM、普通最小二乘法 \(OLS\) 回归和双机器学习 \(DML\) 连接起来。首先使用 SEM 来完善测量结构并估计作为稳健性基准的 SEM 模型,在该模型中,完整的理论指定结构路径系统被保留用于下游稳健性分析,然后再进行最终的结构路径评估。然后,将 OLS 回归应用于 SEM 导出的构念得分,作为透明的回归基准。最后,使用 DML 风格的残差化方法来检验每个被测试的核心关系在基于灵活机器学习的观察控制变量调整后是否保持稳定。学习者敏感性检验比较了随机森林、梯度提升和支持向量机等学习者,并选用了反向方向诊断来检验方向敏感性。该框架通过一个金融科技数字客户亲密度的调查模型进行了演示。研究结果识别出哪些关系在 SEM、OLS 和 DML 风格检验中保持稳定,哪些需要更谨慎的解释。一个可复现的 Google Colab 工作簿和生成的结果文件已公开提供,为研究人员和学生提供了一个可复用的模板,适用于其他基于调查的潜在构念研究。本文为基于调查的研究人员提供了一个实用的稳健性工作流程和解释指南,旨在补充 SEM 与传统及基于机器学习的稳健性检验。

###### 关键词:

结构方程建模,双机器学习,OLS,稳健性分析,调查研究,信息系统,金融科技

††期刊:待确认期刊\\affiliation

\[UniSQ\]组织=商学院、法律、人文与路径学院,地址=南昆士兰大学,城市=斯普林菲尔德,邮编=4300,州=昆士兰,国家=澳大利亚

## 1 引言

基于调查的研究通常依赖于潜在构念,如信任、满意度、态度、意图、感知质量和客户亲密度。这些构念通常通过多个调查题项而非直接观察来测量。因此,结构方程建模 \(SEM\) 非常适合这类研究,因为它使研究人员能够在一个框架内评估测量模型并估计理论驱动的结构关系。然而,一个显著的 SEM 路径系数只是在特定模型设定下的结果。因此,研究人员可能受益于补充性的稳健性分析,即在做出最终模型决策之前,检验关键关系在替代得分表示和估计假设下是否保持稳定。

本研究为基于调查的潜在构念研究开发了一个分阶段的 SEM–OLS–DML 稳健性框架。该框架围绕两个分析层次组织。第一层生成经验证据:完善测量模型,重新估计完整的理论指定结构模型作为稳健性基准 SEM 模型,构建构念得分,并在最终结构路径评估之前对所有 SEM 路径运行 OLS 和 DML 风格的稳健性检验;同时构建 SEM 因子得分和均值复合得分,并对所有被测试的 SEM 路径运行 OLS 和 DML 风格的稳健性检验。第二层比较和解释跨方法、得分表示、干扰学习者和(在理论上有用时)选定的反向方向诊断检验生成的输出。这种两层设计将稳健性证据的产生与收敛、分歧和敏感性的解释分离开来。

本文的动机源于一个新兴的方法论空白。近期研究已将双机器学习 \(DML\) 引入信息系统研究\(Shi et al., 2025 (https://arxiv.org/html/2607.00512#bib.bib22)\),将 PLS-SEM 与机器学习算法结合用于预测和探索目的\(Richter and Tudoran, 2024 (https://arxiv.org/html/2607.00512#bib.bib21)\),并直接在金融科技相关的实证环境中应用 DML\(Wu et al., 2024 (https://arxiv.org/html/2607.00512#bib.bib25)\)。这些研究表明机器学习和 DML 在实证研究中越来越相关。然而,较少关注的是将 DML 用作 SEM 后、逐路径的稳健性工具,用于基于调查的潜在构念模型。本文通过将 SEM 定位为主要测量和理论检验框架,OLS 作为透明回归基准,DML 作为 SEM 隐含关系的灵活控制稳健性检验,来填补这一空白。

本研究围绕以下研究问题展开:

- • RQ1: 如何将 SEM、OLS 和 DML 风格分析整合为一个分阶段的稳健性框架,用于基于调查的潜在构念研究?
- • RQ2: 如何在最终结构路径评估之前,将稳健性基准 SEM 模型转化为路径级别的 OLS 和 DML 风格规范?
- • RQ3: OLS 和 DML 风格估计在评估最初测试的结构路径的稳健性时,如何补充 SEM?
- • RQ4: 研究人员如何在提出的稳健性框架内解释收敛、分歧、得分敏感性、学习者敏感性和选定的反向方向诊断?
- • RQ5: 在金融科技 DCI 演示案例中,哪些最初测试的结构路径在 SEM、OLS 和 DML 风格检验中保持稳健,哪些路径需要进一步的理论、测量或方向诊断讨论?

本文做出三项贡献。首先,它提供了一个实用工作流程,用于将 SEM 隐含的结构路径转化为 OLS 和 DML 风格的稳健性检验,而不将机器学习视为 SEM 的替代品。其次,它阐明了如何解释基于调查的潜在构念研究中的得分表示敏感性和学习者敏感性。第三,它使用一个金融科技数字客户亲密度模型演示了该工作流程,其中在评估最终结构路径并做出决策之前生成稳健性证据,并将通过 Zenodo 存档提供一个 Google Colab 工作簿和生成的 CSV 输出,使研究人员和学生能够将工作流程适应其他基于调查的 SEM 应用。

## 2 文献背景与方法论定位

### 2.1 SEM 与潜在构念调查研究

基于调查的研究通常使用多题项工具来测量无法直接观察的构念。在此背景下,SEM 不仅仅是一个带有命名变量的回归模型。其独特价值在于从多个观察指标中建模潜在构念、评估测量质量以及估计理论指定的结构路径系统\(Bollen, 1989 (https://arxiv.org/html/2607.00512#bib.bib5); Anderson and Gerbing, 1988 (https://arxiv.org/html/2607.00512#bib.bib1); MacKenzie et al., 2011 (https://arxiv.org/html/2607.00512#bib.bib17)\)。这种测量角色在行为、商业和信息系统研究中尤为重要,因为构念效度是可信理论检验的核心。首先评估测量模型,然后估计结构模型的两步逻辑,为将 SEM 用作主要建模阶段(而非初步得分生成工具)提供了基础\(Anderson and Gerbing, 1988 (https://arxiv.org/html/2607.00512#bib.bib1)\)。

在 SEM 之后,基于回归的稳健性检验仍可发挥有用的补充作用。在应用信息系统研究中,SEM 和回归长期以来被视为互补而非互斥的方法\(Gefen et al., 2000 (https://arxiv.org/html/2607.00512#bib.bib13)\)。在当前框架中,OLS 被用作一个透明基准,它询问当潜在构念表示为受访者级别的构念得分时,SEM 隐含的关系是否仍然可见。该基准并不取代 SEM;相反,它提供了一种更简单的、基于得分的比较,用于检验结构模式在常规线性回归假设下是否可见。

### 2.2 DML、SEM–ML 集成及相邻应用研究

DML 之所以具有影响力,是因为它允许在灵活机器学习方法近似观察控制变量和共预测变量的干扰函数的同时,估计低维核心关系\(Chernozhukov et al., 2018 (https://arxiv.org/html/2607.00512#bib.bib8)\)。DML 软件框架进一步支持在 Python 中可重复地实现这一逻辑\(Bach et al., 2022 (https://arxiv.org/html/2607.00512#bib.bib2)\)。最近的信息系统工作已将 DML 引入作为实证模型规范和因果推断导向研究设计的灵活半参数方法\(Shi et al., 2025 (https://arxiv.org/html/2607.00512#bib.bib22)\)。在应用金融科技和可持续性研究中,DML 常被直接用作主要实证策略。例如,Wu et al. (2024 (https://arxiv.org/html/2607.00512#bib.bib25)) 使用城市级面板数据,在灵活控制调整下研究了金融科技发展与包容性绿色增长之间的关系。

一个相关但不同的研究流将 SEM 或 PLS-SEM 与机器学习结合起来。例如,Richter and Tudoran (2024 (https://arxiv.org/html/2607.00512#bib.bib21)) 讨论了如何将 PLS-SEM 与选定的机器学习算法结合,以改善预测、识别非线性和交互作用,并支持商业研究中的理论洞察。这类工作显示了 SEM–ML 集成的日益增长的价值,但其重点通常在于预测、探索或因果预测方法。本研究则更狭窄、更具诊断性。它询问理论指定的 SEM 路径在使用 OLS 和 DML 风格稳健性检验重新检验时,是否在方向和统计上保持稳定。

### 2.3 为何在 SEM 之后逐路径应用 DML

这一区别很重要,因为直接将 DML 应用于原始调查题项或简单复合得分可能未能充分利用 SEM 的核心优势之一:在测试结构关系之前建模测量结构的能力。因此,本研究首先使用 SEM 验证潜变量测量结构并识别保留的理论路径系统。然后,OLS 和 DML 以逐路径的方式应用作为补充的稳健性分析。每个选定的 SEM 路径作为核心关系被重新检验,其他相关的理论构念和观察控制变量被视为调整变量。

这种 DML 的使用在目的和实现上与典型的应用 DML 研究不同。在许多应用中,主要目标是估计一个核心处理-结果关系,同时灵活调整控制变量。相反,本研究将 DML 用作潜变量路径系统的稳健性诊断。SEM 提供测量和理论地图,OLS 提供透明回归基准,DML 为单个 SEM 隐含路径提供灵活控制的稳健性检验。

### 2.4 因果谨慎、内生性及方向性解释

尽管 DML 常在因果推断文献中被讨论,但本研究将其用作稳健性分析,而非确定的因果识别。调查数据是观察性的,因此在 SEM、OLS 和 DML 中估计的结构路径被解释为基于理论的相关性,除非更强的识别假设得到证明。这种谨慎的解释与 Pearl 关于因果模型和推断的论述\(Pearl, 2009 (https://arxiv.org/html/2607.00512#bib.bib18)\)以及 Pearl 的层级区分(关联性、干预性和反事实性主张)\(Bareinboim et al., 2022 (https://arxiv.org/html/2607.00512#bib.bib3)\)一致。因此,提出的 SEM–OLS–DML 工作流程增强了稳健性评估,但其本身并不能建立干预层面或反事实的因果主张。

同样的谨慎适用于外生性、内生性和方向性。在 SEM 中,外生和内生构念由其在指定结构模型中的位置定义。这种模型区分不应与计量经济学中的内生性混淆,后者指的是由遗漏变量、联立性、反向因果、测量误差或相关来源引起的潜在偏差。DML 可以通过灵活调整观察到的协变量来改善稳健性,但它不能消除未观察到的混杂因素,也不能在横截面调查数据中证明因果方向。在本研究中,方向性语言指的是构念之间在理论上指定并在统计上估计的关联方向,而非确定的因果方向。正向系数表示预测变量与结果变量之间的直接关系,负向系数表示反向关系。对于理论上敏感的路径,反向方向 OLS/DML 检验因此可用作方向稳健性或可能互为关联的诊断证据,而非双向因果性的证明。

## 3 预备知识与符号说明

本节介绍用于连接 SEM、OLS 和 DML 风格稳健性阶段的符号。目的不是推导新的估计量,而是明确说明调查指标、潜变量构念得分、结构路径和稳健性估计在三个阶段中如何一致地表示。

### 3.1 观察调查数据

令 \(N\) 和 \(P\) 分别表示受访者数量和观察到的调查变量数量。对于受访者 \(i\),完整的观察响应向量记为 \(\mathbf{Z}_{i}\):

\[
\mathbf{Z}_{i} = \begin{bmatrix} Z_{i1} & Z_{i2} & \cdots & Z_{iP} \end{bmatrix}^{\prime}, \quad i=1,\ldots,N.
\] (1)

将所有受访者级别的向量堆叠起来,得到观察数据矩阵:

\[
\mathbf{Z} = \begin{bmatrix} \mathbf{Z}_{1}^{\prime} \\ \mathbf{Z}_{2}^{\prime} \\ \vdots \\ \mathbf{Z}_{N}^{\prime} \end{bmatrix} \in \mathbb{R}^{N \times P}.
\] (2)

令 \(\mathcal{C}\) 表示潜变量构念集合,令 \(\mathcal{I}_{c}\) 表示分配给构念 \(c \in \mathcal{C}\) 的观察指标集合。如果 \(\mathcal{I}_{c} = \{j_{1}, j_{2}, \ldots, j_{J_{c}}\}\),那么对于构念 \(c\) 和受访者 \(i\) 的观察指标向量为:

\[
\mathbf{z}_{c,i} = \begin{bmatrix} Z_{ij_{1}} & Z_{ij_{2}} & \cdots & Z_{ij_{J_{c}}} \end{bmatrix}^{\prime}, \quad j_{1},\ldots,j_{J_{c}} \in \mathcal{I}_{c}.
\] (3)

### 3.2 一阶和二阶潜变量构念

SEM 测量模型包括一阶和二阶潜变量构念。对于一阶构念 \(c\),令 \(\mathbf{z}_{c,i}\) 表示受访者 \(i\) 的观察指标向量,令 \(\omega_{c,i}\) 表示相应的潜变量构念。

相似文章

大型语言模型能否革新调查研究?以灾害防备响应的实验为例

arXiv cs.AI

本文提出一个五阶段框架,将大型语言模型整合到调查研究中,以应对回复率下降、样本偏差和欺诈性完成等问题。基于2024年米尔顿飓风调查数据,作者提出了一种理论知情的LLM(A-TLM),在缺失数据场景中优于经典插补方法,并通过基于事实的拒答机制展示了可控的幻觉风险。

当合成用户失效时:LLM模拟人类调查响应的跨领域基准测试

arXiv cs.CL

本文在两个大规模数据集上对LLM模拟的人类调查响应进行了基准测试,发现没有模型在个体层面上能超越简单的基线,并且模型系统性地过度决定人口统计特征,扭曲了群体差异。这些失败在不同模型规模和系列中持续存在,引发了对使用合成用户进行决策支持的担忧。