Chapter_14
9/17/25About 8 min
### 第14章总结:结构嵌套模型的G估计
章节逻辑结构
14.1 因果问题回顾
- 目标:估计戒烟(处理 (A))对体重增加(结果 (Y)) 的条件平均因果效应 (E[Y^{a=1,c=0}|L] - E[Y^{a=0,c=0}|L]),其中 (L) 为混杂变量(性别、年龄、种族等)。
- 子群体分析:可通过边际结构模型(含乘积项)或标准化方法估计特定子群(如年龄=45)的效应。
- 数据:NHEFS 观测数据((n=1566)),调整混杂和删失((C=0) 表示未失访)。
14.2 可交换性再探
- 核心定义:条件可交换性 (Y^a \perp!!!\perp A \mid L) 等价于:
[
\Pr[A=1 \mid Y^{a=0}, L] = \Pr[A=1 \mid L]
] - Logistic 模型:
[
\text{logit} \Pr[A=1 \mid Y^{a=0}, L] = \alpha_0 + \alpha_1 Y^{a=0} + \alpha_2 L
]
若可交换性成立,则 (\alpha_1 = 0)(反事实 (Y^{a=0}) 不预测处理分配 (A))。
- 核心定义:条件可交换性 (Y^a \perp!!!\perp A \mid L) 等价于:
14.3 结构嵌套均值模型(SNMM)
- 模型形式:
[
E[Y^a - Y^{a=0} \mid A=a, L] = \beta_1 a + \beta_2 a L
]- (\beta_1, \beta_2) 量化 (A) 对 (Y) 在 ((A,L)) 层内的平均因果效应。
- 半参数特性:不指定截距 (\beta_0) 和 (L) 的主效应 (\beta_3 L),较参数化 g-公式更稳健。
- 删失调整:
- G 估计仅处理混杂,需先用 IP 权重 (W^C = 1/\Pr[C=0 \mid L,A]) 调整删失偏倚(创建伪总体)。
- 精细点 14.1:
- 半参数边际结构模型 (E[Y^a - Y^{a=0} \mid V] = \beta_1 a + \beta_2 a V) 与 SNMM 等价(当 (V \subset L) 时)。
- 技术点 14.1:
- 乘性 SNMM(用于正值结局):
[
\log \left( \frac{E[Y^a \mid A=a, L]}{E[Y^{a=0} \mid A=a, L]} \right) = \beta_1 a + \beta_2 a L
]
- 乘性 SNMM(用于正值结局):
- 模型形式:
14.4 秩保持
- 秩保持模型:
[
Y_i^a - Y_i^{a=0} = \psi_1 a + \psi_2 a L_i \quad (\forall i)
]- 假设个体因果效应在 (L) 层内恒定(如戒烟使所有人增重 (\psi_1 + \psi_2 L_i) kg)。
- 非现实性:个体效应存在异质性(如图 14.3),但引入以简化 G 估计理解。
- 关键点:SNMM 本身不要求秩保持,仅估计层内平均因果效应。
- 秩保持模型:
14.5 G估计
- 步骤:
- 构建候选反事实 (H(\psi^\dagger) = Y - \psi^\dagger A)(基于秩保持模型 (Y^{a=0} = Y - \psi_1 A))。
- 搜索 (\psi^\dagger) 使得 (H(\psi^\dagger)) 与 (A) 独立(给定 (L)):
[
\text{logit} \Pr[A=1 \mid H(\psi^\dagger), L] = \alpha_0 + \alpha_1 H(\psi^\dagger) + \alpha_2 L
]
解 (\alpha_1 = 0) 的 (\psi^\dagger) 即为估计 (\hat{\psi}_1)。 - 删失调整:仅对未删失个体((C=0))分析,权重为 (W^C)。
- 置信区间:
- 反转检验:95% CI 为满足 (\alpha_1 = 0) 的检验 (p>0.05) 的 (\psi^\dagger) 集合。
- 保守性:因使用 IP 权重,大样本下置信水平 (\geq 95%)。
- 精细点 14.2:
- 未测量混杂敏感性分析:若可交换性不成立((\alpha_1 \neq 0)),可假设 (\alpha_1) 取值并重复 G 估计。
- 步骤:
14.6 多参数 SNMM
- 模型扩展:
[
E[Y^a - Y^{a=0} \mid A=a, L] = \beta_1 a + \beta_2 a V \quad (V \subset L)
] - G 估计:
- 搜索 ((\beta_1^\dagger, \beta_2^\dagger)) 使 (H(\beta^\dagger) = Y - \beta_1^\dagger A - \beta_2^\dagger A V) 满足:
[
\alpha_1 = \alpha_2 = 0 \quad \text{in} \quad \text{logit} \Pr[A=1 \mid H(\beta^\dagger), V, L]
] - 闭式解:线性 SNMM 可通过估计方程直接求解(技术点 14.2)。
- 搜索 ((\beta_1^\dagger, \beta_2^\dagger)) 使 (H(\beta^\dagger) = Y - \beta_1^\dagger A - \beta_2^\dagger A V) 满足:
- 模型误指定风险:若忽略效应修饰(如未包含 (\beta_2 a V)),估计有偏。
- 模型扩展:
技术点 14.2:G 估计的估计方程
- 估计方程:
[
\sum_{i=1}^n I[C_i=0] W_i^C H_i(\beta^\dagger) (A_i - E[A \mid L_i]) q(L_i) = 0
]- (H_i(\beta^\dagger) = Y_i - A_i \gamma(L_i; \beta^\dagger)),(\gamma(L; \beta^\dagger)) 为 SNMM 指定函数。
- (q(L_i)) 为用户指定函数(影响效率但不影响一致性)。
- 双稳健性:若指定 (E[H(\beta^\dagger) \mid L]) 或同时正确指定 (E[A \mid L]) 和 (\Pr[C=0 \mid A,L]),则估计一致。
结论
- G 估计原理:利用反事实结果 (Y^{a=0}) 与处理 (A) 的条件独立性(给定 (L))估计 SNMM 参数,核心为求解 (\alpha_1 = 0)。
- 优势:
- 半参数特性:不建模 (E[Y^{a=0} \mid L]),较参数方法更稳健。
- 可处理连续处理和多参数模型。
- 支持未测量混杂的敏感性分析。
- 局限:
- 需 IP 权重调整删失偏倚。
- 忽略效应修饰时模型易误指定。
- 与其他方法关系:
- 与 IP 加权、标准化并称 g-methods。
- SNMM 估计 (L)-条件效应,而边际结构模型估计总体或 (V)-条件效应。
所有技术术语(如 g-methods, SNMM, rank preservation)保留英文以确保准确性,数学公式按标准 LaTeX 格式呈现。