第一步:为什么要发明这个东西?(发现问题)
想象你要调查一个村子里所有人的总收入。
情况 A(简单模式):
你搞了一个大抽奖箱,把村里每个人的名字写在一样大的纸条上。你闭着眼睛随便摸出 10 个人。
这时候,每个人被抽到的概率是一样的(比如都是 10%)。
那你只需要把这 10 个人的钱加起来,再乘以 10,大概就是全村的钱了。这叫简单随机抽样。
想象你要调查一个村子里所有人的总收入。
情况 A(简单模式):
你搞了一个大抽奖箱,把村里每个人的名字写在一样大的纸条上。你闭着眼睛随便摸出 10 个人。
这时候,每个人被抽到的概率是一样的(比如都是 10%)。
那你只需要把这 10 个人的钱加起来,再乘以 10,大概就是全村的钱了。这叫简单随机抽样。
根据《Causal Inference: What If》(Hernán & Robins, 2020)的内容框架,IPW(逆概率加权)仅是书中介绍的多种因果推断方法之一,并非全书核心依赖的方法。该书系统性地整合了因果推断的理论体系,覆盖了从基础概念到高级模型的完整路径。以下从方法论结构和内容重点展开分析:
以下是对因果推断领域所有23个核心概念的系统性介绍,严格遵循您提供的框架:
定义
因果效应指干预(如药物治疗)对结局(如生存率)的净影响,需通过比较同一对象在干预与未干预下的潜在结局(Potential Outcomes)来定义。例如:个体服药后生存时间 (Y^{a=1}) 与未服药生存时间 (Y^{a=0}) 的差值 (Y^{a=1} - Y^{a=0})。
随机实验 (Randomized Experiments)
通过随机分配干预(如抛硬币分组),确保干预组与对照组除干预外特征可比。黄金标准方法,可消除混淆偏差(如年龄对疗效的影响)。
观察性研究 (Observational Studies)
基于自然状态下的观测数据(如电子病历),需用统计方法(如倾向评分)模拟随机化,但受未测量混杂因素威胁(如未记录的吸烟史)。
混杂因子(Confounder)是因果推断的核心概念,其判定高度依赖专家知识,但也需结合数据验证。以下是系统解析:
指同时影响暴露(干预)和结局的变量,若不调整会导致虚假因果关联。
示例:
下面给出本章节“因果推断 what if —— 因果效应的定义”的全部要点、中英文双语总结,所有结论都使用标准 LaTeX 数学公式格式书写。请仔细阅读以下内容:
本章目的在于用数学符号形式精确定义因果效应,以补充我们日常直观认识(“what if”思维)的描述。作者引入了潜在结果(或反事实结果)的概念,为后续严格推断因果效应奠定了符号系统基础。
核心目标:形式化因果直觉的数学符号,区分关联 (Association) 与 因果 (Causation)。
技术重点:
以下是《因果推断》第12章的核心内容总结及注意事项,分步梳理关键概念与方法:
研究背景与目标
IP加权(逆概率加权)原理
边际结构模型(MSM)
处理缺失数据(删失)
效应修饰(Effect Modification)
以下是第13章的核心内容总结,使用标准Markdown和LaTeX数学公式格式:
标准化方法
E[Ya=1,c=0]−E[Ya=0,c=0]
E[Ya,c=0]=l∑E[Y∣A=a,C=0,L=l]⋅Pr[L=l]
参数化g公式
标准化是一种非参数方法,用于估计反事实期望 $$E[Y^{a,c=0}]$$(在干预设定所有人接受处理 (a) 且未删失时的潜在结果均值)。其核心思想是通过对混杂变量 (L) 的分布进行调整,消除混杂偏倚:
[
以下是《因果推断》第14章的核心内容总结,包含关键概念、公式、结论及思维导图框架:
ACE of smoking cessation A on weight gain Y in each strata defined by the covariates L