@Zen_with_AI: 《因果推断入门课程》(免费490页教科书)作者彭丁,教授……
摘要
一本由彭丁撰写的免费490页因果推断教科书,涵盖从相关性到纵向数据的各种主题,并附有R代码和数据集。
查看缓存全文
缓存时间: 2026/09/11 00:27
《因果推断入门》(免费490页教材)作者:彭丁,加州大学伯克利分校统计系教授。本书汇集了他七年因果推断课程的讲义,对应本科生课程Stat 156与研究生课程Stat 256,内容仅需概率论、统计推断、线性回归及逻辑回归基础——本科生亦可挑战。全书从尤尔-辛普森悖论开篇,首先厘清相关性与因果性的区别,随后逐步展开识别、估计及纵向数据等主题。配套R代码与数据集已上传至哈佛数据平台,遵循CC BY 4.0协议免费下载。若需补充参考书,柯克·博恩亦推荐裘德亚·珀尔的《统计因果推断入门》:两者共读,一本教你如何操作,一本阐释思维逻辑。
链接:—
因果推断入门
来源:https://arxiv.org/html/2305.18793 致对因果推断感兴趣的学生与读者
目录
-
引言 (https://arxiv.org/html/2305.18793#Pt1)
1.1 相关性、关联性与尤尔–辛普森悖论 (https://arxiv.org/html/2305.18793#chapter1)
1.1.1 统计学的传统观点 (https://arxiv.org/html/2305.18793#S1)
1.1.2 常用关联性度量 (https://arxiv.org/html/2305.18793#S2)
1.1.2.1 相关与回归 (https://arxiv.org/html/2305.18793#S2.SS1)
1.1.2.2 列联表 (https://arxiv.org/html/2305.18793#S2.SS2)
1.1.3 尤尔–辛普森悖论实例 (https://arxiv.org/html/2305.18793#S3)
1.1.3.1 数据 (https://arxiv.org/html/2305.18793#S3.SS1)
1.1.3.2 解释 (https://arxiv.org/html/2305.18793#S3.SS2)
1.1.3.3 尤尔–辛普森悖论的几何解释 (https://arxiv.org/html/2305.18793#S3.SS3)
1.1.4 伯克利研究生院录取数据 (https://arxiv.org/html/2305.18793#S4)
1.1.5 习题 (https://arxiv.org/html/2305.18793#S5) -
潜在结果 (https://arxiv.org/html/2305.18793#chapter2)
1.1.6 实验学家的因果推断观 (https://arxiv.org/html/2305.18793#S6)
1.1.7 潜在结果的形式化表示 (https://arxiv.org/html/2305.18793#S7)
1.1.7.1 因果效应、亚组与尤尔–辛普森悖论的不存在性 (https://arxiv.org/html/2305.18793#S7.SS1)
1.1.7.2 实验单元定义的微妙之处 (https://arxiv.org/html/2305.18793#S7.SS2)
1.1.8 处理分配机制 (https://arxiv.org/html/2305.18793#S8)
1.1.9 习题 (https://arxiv.org/html/2305.18793#S9) -
随机实验 (https://arxiv.org/html/2305.18793#Pt2)
1.2 完全随机化实验与费舍尔随机化检验 (https://arxiv.org/html/2305.18793#chapter3)
1.2.1 CRE (https://arxiv.org/html/2305.18793#S10)
1.2.2 FRT (https://arxiv.org/html/2305.18793#S11)
1.2.3 检验统计量的典型选择 (https://arxiv.org/html/2305.18793#S12)
1.2.4 LaLonde实验数据案例研究 (https://arxiv.org/html/2305.18793#S13)
1.2.5 随机化实验与FRT的历史 (https://arxiv.org/html/2305.18793#S14)
1.2.5.1 詹姆斯·林德的实验 (https://arxiv.org/html/2305.18793#S14.SS1)
1.2.5.2 品茶女士实验 (https://arxiv.org/html/2305.18793#S14.SS2)
1.2.5.3 实验的两个费舍尔原则 (https://arxiv.org/html/2305.18793#S14.SS3)
1.2.6 讨论 (https://arxiv.org/html/2305.18793#S15)
1.2.6.1 其他精确零假设与置信区间 (https://arxiv.org/html/2305.18793#S15.SS1)
1.2.6.2 其他检验统计量 (https://arxiv.org/html/2305.18793#S15.SS2)
1.2.6.3 结语 (https://arxiv.org/html/2305.18793#S15.SS3)
1.2.7 习题 (https://arxiv.org/html/2305.18793#S16) -
完全随机化实验的奈曼重复抽样推断 (https://arxiv.org/html/2305.18793#chapter4)
1.2.8 有限总体参数 (https://arxiv.org/html/2305.18793#S17)
1.2.9 奈曼(1923)定理 (https://arxiv.org/html/2305.18793#S18)
1.2.10 证明 (https://arxiv.org/html/2305.18793#S19)
1.2.11 CRE的回归分析 (https://arxiv.org/html/2305.18793#S20)
1.2.12 示例 (https://arxiv.org/html/2305.18793#S21)
1.2.12.1 模拟 (https://arxiv.org/html/2305.18793#S21.SS1)
1.2.12.2 厚尾结果与正态近似的失效 (https://arxiv.org/html/2305.18793#S21.SS2)
1.2.12.3 应用 (https://arxiv.org/html/2305.18793#S21.SS3)
1.2.13 习题 (https://arxiv.org/html/2305.18793#S22) -
随机化实验中的分层与事后分层 (https://arxiv.org/html/2305.18793#chapter5)
1.2.14 分层 (https://arxiv.org/html/2305.18793#S23)
1.2.15 FRT (https://arxiv.org/html/2305.18793#S24)
1.2.15.1 理论 (https://arxiv.org/html/2305.18793#S24.SS1)
1.2.15.2 一个应用 (https://arxiv.org/html/2305.18793#S24.SS2)
1.2.16 奈曼推断 (https://arxiv.org/html/2305.18793#S25)
1.2.16.1 点估计与区间估计 (https://arxiv.org/html/2305.18793#S25.SS1)
1.2.16.2 数值示例 (https://arxiv.org/html/2305.18793#S25.SS2)
1.2.16.3 比较SRE与CRE (https://arxiv.org/html/2305.18793#S25.SS3)
1.2.17 CRE中的事后分层 (https://arxiv.org/html/2305.18793#S26)
1.2.17.1 Meinert等人(1970)的示例 (https://arxiv.org/html/2305.18793#S26.SS1)
1.2.17.2 Chong等人(2016)的示例 (https://arxiv.org/html/2305.18793#S26.SS2)
1.2.18 实践问题 (https://arxiv.org/html/2305.18793#S27)
1.2.19 习题 (https://arxiv.org/html/2305.18793#S28) -
再随机化与回归调整 (https://arxiv.org/html/2305.18793#chapter6)
1.2.20 再随机化 (https://arxiv.org/html/2305.18793#S29)
1.2.20.1 实验设计 (https://arxiv.org/html/2305.18793#S29.SS1)
1.2.20.2 统计推断 (https://arxiv.org/html/2305.18793#S29.SS2)
1.2.21 回归调整 (https://arxiv.org/html/2305.18793#S30)
1.2.21.1 协变量调整的FRT (https://arxiv.org/html/2305.18793#S30.SS1)
1.2.21.2 协方差分析与扩展 (https://arxiv.org/html/2305.18793#S30.SS2)
1.2.21.2.1 Lin (2013)结果的一些启发式理解 (https://arxiv.org/html/2305.18793#S30.SS2.SSS1)
1.2.21.2.2 通过预测潜在结果理解Lin (2013)估计量 (https://arxiv.org/html/2305.18793#S30.SS2.SSS2)
1.2.21.2.3 通过调整协变量不平衡理解Lin (2013)估计量 (https://arxiv.org/html/2305.18793#S30.SS2.SSS3)
1.2.21.3 关于回归调整的更多注记 (https://arxiv.org/html/2305.18793#S30.SS3)
1.2.21.3.1 ReM与回归调整之间的对偶性 (https://arxiv.org/html/2305.18793#S30.SS3.SSS1)
1.2.21.3.2 回归调整与事后分层的等价性 (https://arxiv.org/html/2305.18793#S30.SS3.SSS2)
1.2.21.3.3 差异中的差异作为协变量调整的特例 τ^(\beta_1,\beta_0)\hat{\tau}(\beta_{1},\beta_{0}) (https://arxiv.org/html/2305.18793#S30.SS3.SSS3)
1.2.21.4 扩展到SRE (https://arxiv.org/html/2305.18793#S30.SS4)
1.2.22 统一、组合与比较 (https://arxiv.org/html/2305.18793#S31)
1.2.23 模拟 (https://arxiv.org/html/2305.18793#S32)
1.2.24 结语 (https://arxiv.org/html/2305.18793#S33)
1.2.25 习题 (https://arxiv.org/html/2305.18793#S34) -
配对实验 (https://arxiv.org/html/2305.18793#chapter7)
1.2.26 实验设计与潜在结果 (https://arxiv.org/html/2305.18793#S35)
1.2.27 FRT (https://arxiv.org/html/2305.18793#S36)
1.2.28 奈曼推断 (https://arxiv.org/html/2305.18793#S37)
1.2.29 协变量调整 (https://arxiv.org/html/2305.18793#S38)
1.2.29.1 FRT (https://arxiv.org/html/2305.18793#S38.SS1)
1.2.29.2 回归调整 (https://arxiv.org/html/2305.18793#S38.SS2)
1.2.30 示例 (https://arxiv.org/html/2305.18793#S39)
1.2.30.1 达尔文比较玉米异花授粉与自花授粉高度的数据 (https://arxiv.org/html/2305.18793#S39.SS1)
1.2.30.2 儿童电视工作坊实验数据 (https://arxiv.org/html/2305.18793#S39.SS2)
1.2.31 比较MPE与CRE (https://arxiv.org/html/2305.18793#S40)
1.2.32 扩展到一般匹配实验 (https://arxiv.org/html/2305.18793#S41)
1.2.32.1 FRT (https://arxiv.org/html/2305.18793#S41.SS1)
1.2.32.2 估计层内效应的平均值 (https://arxiv.org/html/2305.18793#S41.SS2)
1.2.32.3 一个更一般的因果估计量 (https://arxiv.org/html/2305.18793#S41.SS3)
1.2.33 习题 (https://arxiv.org/html/2305.18793#S42) -
随机化实验中费舍尔与奈曼推断的统一 (https://arxiv.org/html/2305.18793#chapter8)
1.2.34 在CRE中检验强与弱零假设 (https://arxiv.org/html/2305.18793#S43)
1.2.35 CRE中的协变量调整FRT (https://arxiv.org/html/2305.18793#S44)
1.2.36 模拟研究 (https://arxiv.org/html/2305.18793#S45)
1.2.37 一般建议 (https://arxiv.org/html/2305.18793#S46)
1.2.38 案例研究 (https://arxiv.org/html/2305.18793#S47)
1.2.39 习题 (https://arxiv.org/html/2305.18793#S48) -
桥接有限总体与超总体因果推断 (https://arxiv.org/html/2305.18793#chapter9)
1.2.40 CRE (https://arxiv.org/html/2305.18793#S49)
1.2.41 CRE下的模拟:超总体视角 (https://arxiv.org/html/2305.18793#S50)
1.2.42 扩展到SRE (https://arxiv.org/html/2305.18793#S51)
1.2.43 习题 (https://arxiv.org/html/2305.18793#S52) -
观察性研究 (https://arxiv.org/html/2305.18793#Pt3)
1.3 观察性研究、选择性偏差与因果效应的非参数识别 (https://arxiv.org/html/2305.18793#chapter10)
1.3.1 引导性示例 (https://arxiv.org/html/2305.18793#S53)
1.3.2 潜在结果框架下的因果效应与选择性偏差 (https://arxiv.org/html/2305.18793#S54)
1.3.3 因果效应非参数识别的充分条件 (https://arxiv.org/html/2305.18793#S55)
1.3.3.1 识别 (https://arxiv.org/html/2305.18793#S55.SS1)
1.3.3.2 可忽略性假设的合理性 (https://arxiv.org/html/2305.18793#S55.SS2)
1.3.4 两种简单的估计策略及其局限性 (https://arxiv.org/html/2305.18793#S56)
1.3.4.1 基于离散协变量的分层或标准化 (https://arxiv.org/html/2305.18793#S56.SS1)
1.3.4.2 结果回归 (https://arxiv.org/html/2305.18793#S56.SS2)
1.3.5 习题 (https://arxiv.org/html/2305.18793#S57) -
倾向得分在观察性研究因果效应中的核心作用 (https://arxiv.org/html/2305.18793#chapter11)
1.3.6 倾向得分作为降维工具 (https://arxiv.org/html/2305.18793#S58)
1.3.6.1 理论 (https://arxiv.org/html/2305.18793#S58.SS1)
1.3.6.2 倾向得分分层 (https://arxiv.org/html/2305.18793#S58.SS2)
1.3.6.3 应用 (https://arxiv.org/html/2305.18793#S58.SS3)
1.3.7 倾向得分加权 (https://arxiv.org/html/2305.18793#S59)
1.3.7.1 理论 (https://arxiv.org/html/2305.18793#S59.SS1)
1.3.7.2 逆概率加权估计量 (https://arxiv.org/html/2305.18793#S59.SS2)
1.3.7.3 IPW的一个问题与因果推断的一个根本问题 (https://arxiv.org/html/2305.18793#S59.SS3)
1.3.7.4 应用 (https://arxiv.org/html/2305.18793#S59.SS4)
1.3.8 倾向得分的平衡性质 (https://arxiv.org/html/2305.18793#S60)
1.3.8.1 理论 (https://arxiv.org/html/2305.18793#S60.SS1)
1.3.8.2 协变量平衡检查 (https://arxiv.org/html/2305.18793#S60.SS2)
1.3.9 习题 (https://arxiv.org/html/2305.18793#S61) -
平均因果效应的双重稳健或增强逆概率加权估计量 (https://arxiv.org/html/2305.18793#chapter12)
1.3.10 双重稳健估计量 (https://arxiv.org/html/2305.18793#S62)
1.3.10.1 总体版本 (https://arxiv.org/html/2305.18793#S62.SS1)
1.3.10.2 样本版本 (https://arxiv.org/html/2305.18793#S62.SS2)
1.3.11 双重稳健估计量的更多直觉与理论 (https://arxiv.org/html/2305.18793#S63)
1.3.11.1 降低IPW估计量的方差 (https://arxiv.org/html/2305.18793#S63.SS1)
1.3.11.2 降低结果回归估计量的偏差 (https://arxiv.org/html/2305.18793#S63.SS2)
1.3.12 示例 (https://arxiv.org/html/2305.18793#S64)
1.3.12.1 τ的一些典型估计量总结 (https://arxiv.org/html/2305.18793#S64.SS1)
1.3.12.2 模拟 (https://arxiv.org/html/2305.18793#S64.SS2)
1.3.12.3 应用 (https://arxiv.org/html/2305.18793#S64.SS3)
1.3.13 一些进一步的讨论 (https://arxiv.org/html/2305.18793#S65)
1.3.14 习题 (https://arxiv.org/html/2305.18793#S66) -
处理组单元的平均因果效应及其他估计量 (https://arxiv.org/html/2305.18793#chapter13)
1.3.15 τ_{\textsc{t}} 的非参数识别 (https://arxiv.org/html/2305.18793#S67)
1.3.16 τ_{\textsc{t}} 的逆概率加权与双重稳健估计 (https://arxiv.org/html/2305.18793#S68)
1.3.17 一个示例 (https://arxiv.org/html/2305.18793#S69)
1.3.18 其他估计量 (https://arxiv.org/html/2305.18793#S70)
1.3.19 习题 (https://arxiv.org/html/2305.18793#S71) -
在因果效应回归中使用倾向得分 (https://arxiv.org/html/2305.18793#chapter14)
1.3.20 将倾向得分作为协变量的回归 (https://arxiv.org/html/2305.18793#S72)
1.3.21 由倾向得分逆加权的回归 (https://arxiv.org/html/2305.18793#S73)
1.3.21.1 平均因果效应 (https://arxiv.org/html/2305.18793#S73.SS1)
1.3.21.2 处理组单元的平均因果效应 (https://arxiv.org/html/2305.18793#S73.SS2)
1.3.22 习题 (https://arxiv.org/html/2305.18793#S74) -
观察性研究中的匹配 (https://arxiv.org/html/2305.18793#chapter15)
1.3.23 一个简单的起点:控制单元多得多的情况 (https://arxiv.org/html/2305.18793#S75)
1.3.24 一个更复杂但现实的场景 (https://arxiv.org/html/2305.18793#S76)
1.3.25 平均因果效应的匹配估计量 (https://arxiv.org/html/2305.18793#S77)
1.3.25.1 点估计与偏差校正 (https://arxiv.org/html/2305.18793#S77.SS1)
1.3.25.2 与双重稳健估计量的联系 (https://arxiv.org/html/2305.18793#S77.SS2)
1.3.26 处理组平均因果效应的匹配估计量 (https://arxiv.org/html/2305.18793#S78)
1.3.27 案例研究 (https://arxiv.org/html/2305.18793#S79)
1.3.27.1 实验数据 (https://arxiv.org/html/2305.18793#S79.SS1)
1.3.27.2 观察数据 (https://arxiv.org/html/2305.18793#S79.SS2)
1.3.27.3 协变量平衡检查 (https://arxiv.org/html/2305.18793#S79.SS3)
1.3.28 讨论 (https://arxiv.org/html/2305.18793#S80)
1.3.29 习题 (https://arxiv.org/html/2305.18793#S81) -
观察性研究的困难与挑战 (https://arxiv.org/html/2305.18793#Pt4)
1.4 观察性研究因果效应中可忽略性的困难 (https://arxiv.org/html/2305.18793#chapter16)
1.4.1 因果图的一些基础知识 (https://arxiv.org/html/2305.18793#S82)
1.4.2 评估可忽略性假设 (https://arxiv.org/html/2305.18793#S83)
1.4.2.1 使用负面结果 (https://arxiv.org/html/2305.18793#S83.SS1)
1.4.2.2 使用负面暴露 (https://arxiv.org/html/2305.18793#S83.SS2)
1.4.2.3 总结 (https://arxiv.org/html/2305.18793#S83.SS3)
1.4.3 过度调整的问题 (https://arxiv.org/html/2305.18793#S84)
1.4.3.1 M-偏差 (https://arxiv.org/html/2305.18793#S84.SS1)
1.4.3.2 Z-偏差 (https://arxiv.org/html/2305.18793#S84.SS2)
1.4.3.3 在观察性研究中我们应该调整哪些协变量? (https://arxiv.org/html/2305.18793#S84.SS3)
1.4.4 习题 (https://arxiv.org/html/2305.18793#S85) -
E值:存在未测量混杂的观察性研究中因果关系的证据 (https://arxiv.org/html/2305.18793#S86)
1.4.5 E值的定义与性质 (https://arxiv.org/html/2305.18793#S87)
1.4.6 计算E值 (https://arxiv.org/html/2305.18793#S88)
1.4.7 示例 (https://arxiv.org/html/2305.18793#S89)
1.4.8 讨论 (https://arxiv.org/html/2305.18793#S90)
1.4.9 习题 (https://arxiv.org/html/2305.18793#S91)
相似文章
@clcoding:免费PDF提醒!博弈论(开放获取教材)585页 165道习题解答 完全免费 无论你是对…
一本免费的开放获取博弈论教材,共585页,包含165道习题解答,被推荐为经济学、人工智能、计算机科学等领域的资源。
@DanKornas: 人工智能与机器学习的算法
来自斯坦福大学的一本69页关于人工智能与机器学习算法的书籍现可免费获取。
@aiwithjainam: 来自麻省理工、斯坦福和伯克利的10本免费教科书,你可以合法下载。→ 线性代数导论…
一条推特线程分享了一份精选列表,包含来自麻省理工、斯坦福、伯克利和哈佛的10本免费且可合法下载的教科书,涵盖线性代数、机器学习、概率和数据科学等主题。
@clcoding: Deep Learning on Graphs — 免费PDF 探索图神经网络和图结构数据深度学习的迷人世界
文章宣布了由Yao Ma和Jiliang Tang撰写的教科书《Deep Learning on Graphs》免费提供,涵盖图神经网络和图结构数据的深度学习。
@techNmak: 这个GitHub仓库是个宝库,如果你想深入理解AI/ML,而不仅仅是使用它。数学、计算机科学和AI概要。免费…
一个免费的、直觉优先的开放教材和GitHub仓库,涵盖从基础知识到前沿课题的数学、计算机科学和AI,并附带一个用于AI助手的MCP服务器。