Chapter_7
9/17/25About 6 min
### 第7章 混杂(CONFOUNDING)
7.1 混杂的结构
技术重点(Technical Points):
- 混杂的定义:当处理(A)和结局(Y)存在共同原因(L或U)时,关联不等于因果效应,称为混杂。混杂源于开放的后门路径(如 (A \leftarrow L \rightarrow Y))。
- 后门路径:非因果路径,其箭头指向处理变量(A)。例如,图7.1中路径 (A \leftarrow L \rightarrow Y) 是后门路径。
- 混杂的数学表达:若存在混杂,关联风险比 (\frac{\Pr[Y=1|A=1]}{\Pr[Y=1|A=0]}) 不等于因果风险比 (\frac{\Pr[Y{a=1}=1]}{\Pr[Y=1]})。
- 混杂的常见场景:
- 职业因素(如消防员健康工人偏倚)。
- 临床决策(如适应症混杂)。
- 生活方式(如吸烟与运动的混杂)。
- 遗传因素(如连锁不平衡)。
- 社会/环境因素(如收入与污染物)。
细节要点(Fine Points):
- 混杂的实质:由共同原因引起的关联是真实的,但不可解释为因果效应(Yule, 1903)。
- 结构基础:所有混杂案例均源于开放的后门路径(如 (A \leftarrow L \rightarrow Y) 或 (A \leftarrow U \rightarrow Y))。
7.2 混杂与可交换性
技术重点(Technical Points):
- 可交换性:
- 边际可交换性((Y^a \perp!!!\perp A)):无混杂时成立(如随机实验),因果效应可直接计算为 (E[Y|A=1] - E[Y|A=0])。
- 条件可交换性((Y^a \perp!!!\perp A | L)):需调整混杂因子L,通过标准化或IP加权计算因果效应:
[
E[Y^{a=1}] - E[Y^{a=0}] = \sum_l \left( E[Y|L=l,A=1] - E[Y|L=l,A=0] \right) \Pr[L=l]
]
- 后门准则:若L满足以下条件,则条件可交换性成立:
- 阻断所有A到Y的后门路径。
- L不包含A的后代变量。
- 无混杂的场景:
- 无共同原因(如边际随机实验)。
- 有共同原因但L可阻断所有后门路径(无未测量混杂)。
细节要点(Fine Points):
- 可交换性的应用:后门准则在FFRCISTG模型下等价于条件可交换性(Technical Point 7.1)。
- 混杂方向与强度:后门准则不量化混杂大小或方向(需敏感性分析,见Fine Point 7.1)。
7.3 混杂与后门准则
技术重点(Technical Points):
- 后门准则应用:
- 图7.1:调整L可阻断后门路径(无未测量混杂)。
- 图7.2-7.3:调整L可阻断由未测量U引起的后门路径。
- 图7.4:无混杂(L为碰撞子,无需调整;调整会引入选择偏倚)。
- 混杂因子定义:若数据(A,Y)不足以识别因果效应,则L是混杂因子(需调整);否则是非混杂因子。
- 选择偏倚:调整碰撞子(如L在图7.4)会打开后门路径,导致偏倚。
细节要点(Fine Points):
- 混杂方向预测:使用符号因果图(如箭头符号相同为正混杂,反之为负混杂)。
- 混杂强度:取决于混杂因子-处理/结局关联强度及混杂因子(Cornfield et al., 1959)。
- M-偏倚:图7.4中调整L引入的偏倚(Greenland, 2003)。
7.4 混杂与混杂因子
技术重点(Technical Points):
- 传统混杂因子定义问题:基于关联标准(如与A/Y关联且不在因果路径)可能导致错误调整(如图7.4调整L引入偏倚)。
- 结构方法:需基于因果DAG确定混杂因子,调整需满足后门准则。
- 混杂因子的相对性:L是否为混杂因子取决于已测变量(如U未测时L是混杂因子;若U已测则否)。
细节要点(Fine Points):
- 代理混杂因子:未测U的代理变量(如收入代理社会经济地位)可部分减少混杂(图7.8)。
- 传统定义修正:需结合交换性条件(Technical Point 7.2)。
7.5 单世界干预图(SWIGs)
技术重点(Technical Points):
- SWIG原理:将反事实变量(如(Y^a))纳入DAG,表示干预设定A=a的世界。
- 可交换性验证:在SWIG中,(Y^a \perp!!!\perp A | L) 当且仅当L阻断所有后门路径(图7.9-7.10)。
- 优势:统一反事实与图形方法,直接验证d-分离。
细节要点(Fine Points):
- 处理后代变量:调整A的后代变量(如图7.11的L)不满足条件可交换性(图7.12)。
7.6 混杂调整
技术重点(Technical Points):
- 调整方法:
- G-方法:标准化、IP加权、g-估计(模拟删除 (L \rightarrow A) 的路径)。
- 常规方法:分层、匹配(基于子集估计)。
- 替代方法:工具变量、前门准则(Technical Point 7.4)、差分法(Technical Point 7.3)。
- 前门准则:当存在完全中介M且无未测量混杂时(图7.14):
[
\Pr[Y^a=1] = \sum_m \Pr[M=m|A=a] \sum_{a'} \Pr[Y=1|M=m,A=a'] \Pr[A=a']
]
细节要点(Fine Points):
- 差分法:利用阴性结局控制(如干预前结局)估计混杂大小(图7.13)。
- 观察性研究的挑战:需依赖领域知识测量足够混杂因子,但无法完全消除混杂风险。
- 科学批评的回应:需具体指出混杂源(如吸烟),而非泛化批评。
关键公式总结
- 条件可交换性下的因果效应:
[
E[Y^{a}] = \sum_l E[Y|L=l,A=a] \Pr[L=l]
] - 前门准则:
[
\Pr[Y^a=1] = \sum_m \Pr[M=m|A=a] \sum_{a'} \Pr[Y=1|M=m,A=a'] \Pr[A=a']
] - 差分法(阴性结局控制):
[
E[Y^{1} - Y^{0}|A=1] = (E[Y|A=1] - \E[Y|A=0]) - (\E[C|A=1] - \E[C|A=0])
]
图示说明(基于描述)
- 图7.1-7.3:共同原因L或U导致混杂(后门路径)。
- 图7.4:L为碰撞子,调整引入偏倚。
- 图7.14(前门准则):M中介A对Y的效应,阻断后门路径需调整M。