Chapter_15
9/17/25About 10 min
### 第15章:结果回归与倾向评分(OUTCOME REGRESSION AND PROPENSITY SCORES) **核心观点**:结果回归和倾向评分是常用的参数化因果推断方法,但仅适用于简单场景(如固定治疗),无法处理时变治疗的复杂性(需使用g-methods)。本章聚焦其有限适用性。
15.1 结果回归(Outcome Regression)
目标与模型
- 估计吸烟 cessation(治疗 (A))对体重 gain(结局 (Y))的因果效应。
- 结构模型(faux marginal structural model):
[
E[Y^{a,c=0}|L] = \beta_0 + \beta_1 a + \beta_2 a L + \beta_3 L
]- (\beta_1, \beta_2):治疗 (A) 在 (L) 各层内的因果效应((\beta_1) 为基准效应,(\beta_2) 为效应修饰)。
- (\beta_0, \beta_3):讨厌参数(nuisance parameters),描述 (Y^{a=0,c=0}) 与 (L) 的非因果关联((\beta_3) 非 (L) 的因果效应)。
估计方法
- 通过最小二乘拟合结果回归模型:
[
E[Y|A, C=0, L] = \alpha_0 + \alpha_1 A + \alpha_2 A L + \alpha_3 L
] - 假设:若 (L) 足以调整混杂/选择偏倚且模型正确,则 (\alpha = \beta)。
- 实例:
- 含交互项(吸烟强度):(\hat{\beta}_1 = 2.6, \hat{\beta}_2 = 0.05) → 吸烟 5支/天者效应 2.8 kg (95% CI: 1.5, 4.1),40支/天者 4.4 kg (95% CI: 2.8, 6.1)。
- 无交互项(假设无效应修饰):效应 3.5 kg (95% CI: 2.6, 4.3)。
- 通过最小二乘拟合结果回归模型:
关键局限
- 依赖 (L-Y) 关联的正确设定(错误指定导致偏倚)。
- 与结构嵌套模型对比:后者不建模 (L-Y) 关系,但依赖治疗模型正确性(见 Fine Point 15.1)。
15.2 倾向评分(Propensity Scores)
定义与性质
- 倾向评分 (\pi(L) = \Pr[A=1|L]),衡量给定 (L) 的治疗倾向。
- 平衡性:若 (L) 满足可交换性,则 (\pi(L)) 也满足:
[
A \perp!!!\perp L \mid \pi(L) \quad \text{且} \quad Y^a \perp!!!\perp A \mid \pi(L)
] - 估计:通过逻辑回归(如 (\text{logit} \Pr[A=1|L] = \alpha_0 + \alpha_1 L))。
核心定理(Rosenbaum & Rubin, 1983)
- 若基于 (L) 的可交换性/正性成立,则基于 (\pi(L)) 也成立(见 Technical Point 15.1)。
- 倾向评分是平衡评分(balancing score)的最简形式。
15.3 倾向分层与标准化(Propensity Stratification and Standardization)
分层法
- 步骤:
- 估计 (\hat{\pi}(L)),按十分位数分层。
- 每层内计算效应 (E[Y|A=1, C=0, \pi(L)=s] - E[Y|A=0, C=0, \pi(L)=s])。
- 问题:连续 (\pi(L)) 在层内分布可能不同 → 可交换性不严格成立。
- 实例:效应范围 0.0–6.6 kg(置信区间宽)。
- 步骤:
回归调整
- 将 (\hat{\pi}(L)) 作为连续变量纳入结果回归:
[
E[Y|A, C=0, \pi(L)] = \alpha_0 + \alpha_1 A + \alpha_2 \pi(L)
]- 实例:效应 3.6 kg (95% CI: 2.7, 4.5)。
- 优势:避免分层离散化问题;可用样条(splines)增强灵活性。
- 将 (\hat{\pi}(L)) 作为连续变量纳入结果回归:
标准化法
- 标准化条件均值至总体:
[
E[Y^{a,c=0}] = \sum_s E[Y|A=a, C=0, \pi(L)=s] \cdot \Pr[\pi(L)=s]
]- 实例:效应 3.6 kg (95% CI: 2.7, 4.6)。
- 标准化条件均值至总体:
15.4 倾向匹配(Propensity Matching)
方法
- 为每个处理个体匹配未处理个体((\hat{\pi}(L)) 相近,如 (\pm 0.05)),形成匹配人群。
- 目标:在匹配人群中实现 (A \perp!!!\perp \pi(L))。
挑战
- 偏差-方差权衡:
- 宽松匹配 → (\pi(L)) 分布差异 → 可交换性不成立。
- 严格匹配 → 样本减少 → 置信区间变宽。
- 正性问题:
- 若 (\hat{\pi}(L)) 无重叠(如高倾向个体无对照),匹配会排除个体(不区分随机/结构非正性)。
- 目标人群模糊:匹配后效应仅适用于成功匹配的子群(难解释或外推)。
- 偏差-方差权衡:
对比其他方法
- 倾向回归/标准化保留全样本,假设随机非正性;匹配强制限制样本。
15.5 倾向模型、结构模型与预测模型
模型类型对比
模型类型 目标 参数性质 依赖正确性 倾向模型 估计 (\Pr[A=1|L]) 讨厌参数(无因果解释) 治疗模型 结构模型(因果) 直接建模 (Y^a) 与 (A) 关系 因果参数(如 (\beta_1)) 结构模型形式 预测模型 预测 (Y)(非因果) 关联参数 预测准确性 变量选择误区
- 因果 vs. 预测:
- 预测模型:选择提升预测力的变量(如机器学习、逐步回归)。
- 因果模型:只需包含保证可交换性的 (L),无关变量可能:
- 增加方差(如医院变量导致非重叠)。
- 引入偏倚(如调整碰撞器或工具变量)。
- 关键警告:倾向模型不需完美预测 (A)(例:若 (\pi(L)=0.99/0.01),估计方差无限大)。
- 因果 vs. 预测:
结构模型类型
- 边际结构模型(MSM):参数化 (E[Y^a]),可选效应修饰 (V)。
- 结构嵌套模型(SNM):参数化 (E[Y^a - Y^{a=0} \mid L])。
结论
方法适用性:
- 结果回归和倾向评分适用于简单固定治疗场景,但需严格满足可交换性、正性、一致性。
- 时变治疗需用 g-methods(IP 加权、标准化、g-估计)。
核心局限:
- 结果回归:依赖 (L-Y) 模型正确性。
- 倾向评分:匹配法导致目标人群不明确;分层法存在离散化偏倚。
- 变量选择:因果推断中避免预测导向的变量筛选(可能引入偏倚/方差)。
实践建议:
- 优先使用双稳健方法(doubly robust methods)。
- 确保倾向评分模型包含足够混杂因子,但避免无关变量。
- 用样条等灵活模型减少函数形式误设。
注:所有结论严格基于文本,未添加主观内容。数学公式、技术术语(如 nuisance parameters, balancing score)保留英文以确保准确性。