Chapter_10
9/17/25About 5 min
### 第10章 随机变异性 (RANDOM VARIABILITY) #### **核心概念** 1. **系统偏倚 vs. 随机变异性** - 因果推断错误的两大原因: - **系统偏倚**(混杂、选择偏倚、测量偏倚) - **随机变异性**(小样本导致的偶然变异) - 随机变异性在小样本中会稀释效应估计(如盲人行人例子:处理组50%个体对处理无反应)。
- 识别 (Identification) vs. 估计 (Estimation)
- 识别:在无限大研究人群中计算因果效应(忽略随机变异),需满足:
- 可交换性 (Exchangeability)
- 正值性 (Positivity)
- 一致性 (Consistency)
- 估计:在有限样本中推断超总体 (super-population) 参数,需处理随机变异。
- 识别:在无限大研究人群中计算因果效应(忽略随机变异),需满足:
10.1 识别与估计
技术要点 (Technical Points)
估计目标与估计量
- 估计目标 (Estimand):超总体参数(如 )。
- 估计量 (Estimator):从样本数据计算估计目标的规则(如样本比例 )。
- 估计值 (Estimate):特定样本的数值结果(如 )。
一致性 (Consistency)
- 当样本量 时,估计量收敛于估计目标:
- 当样本量 时,估计量收敛于估计目标:
置信区间 (Confidence Intervals)
- Wald 95% 置信区间:
其中 是标准误估计值(如二项分布标准误 = )。
- 性质:
- 校准 (Calibrated):覆盖真实参数的概率为95%。
- 保守 (Conservative):覆盖概率 >95%。
- 有效 (Valid):覆盖概率至少95%(校准或保守)。
- 频率学派解释:置信区间不表示参数位于区间内的概率,而是重复抽样中覆盖参数的频率。
- Wald 95% 置信区间:
诚实区间 (Honest Intervals)
- 要求存在样本量 ,使得无论参数真实值如何,覆盖概率至少95%(Robins & Ritov, 1997)。
10.2 因果效应估计
技术要点
随机试验中的估计
- 超总体中满足可交换性时:
- 因果风险差 。
- 样本风险差 是无偏估计量。
- 超总体中满足可交换性时:
置信区间计算
- 风险差:
- 风险比:
- 标准化、IP加权等方法适用于观察性研究。
随机化推断 (Randomization-Based Inference)
- 若仅研究样本随机化(无超总体),需考虑样本内偶然混杂。
10.3 超总体迷思 (The Myth of the Super-Population)
细节要点 (Fine Points)
二项置信区间的两种场景
- 场景1:研究样本来自无限超总体(隐含假设)。
- 场景2:个体有相同反事实概率 (现实中不成立,因个体风险异质性)。
- 结论:报告二项置信区间者默认场景1。
超总体的作用
- 优点:简化统计方法,便于推广 (generalization)。
- 局限:超总体是虚构概念;置信区间解释为反事实陈述 ("what-if")。
10.4 条件性原则 (The Conditionality Principle)
技术要点
协变量调整的必要性
- 例子:随机试验中偶然出现吸烟 () 与处理 () 相关(表10.2)。
- 未调整风险差:
- 分层调整后风险差:(各层无效应)。
- 条件性原则:应以辅助统计量(如 关联)为条件进行推断。
- 例子:随机试验中偶然出现吸烟 () 与处理 () 相关(表10.2)。
辅助统计量 (Ancillary Statistic)
- 精确辅助统计量:分布已知且不影响目标参数(如随机试验中 和 的联合分布)。
- 调整估计量优势:
- 条件无偏 (Conditionally unbiased)。
- 无条件更高效 (Unconditionally efficient)。
技术点 10.4 (Technical Point 10.4)
- 当 是 的风险因子时,调整估计量 (如 MLE) 优于未调整估计量:
其中 量化 关联。
10.5 维数灾难 (The Curse of Dimensionality)
技术要点
高维数据问题
- 当协变量 的层数(如 )远大于样本量():
- 调整后置信区间过宽(如 ),失去信息性。
- 未调整估计量仍保持较窄区间(如 )。
- 当协变量 的层数(如 )远大于样本量():
条件性原则的局限
- 协变量较少时:调整估计量更优。
- 高维时:严格遵循条件性导致估计不精确。
技术点 10.6 (Technical Point 10.6)
- 解决方案:利用先验信息构建高效无偏估计量(见第18章)。
结论 (Conclusions)
- 随机变异性是因果推断的核心挑战,需通过置信区间量化不确定性。
- 超总体概念是简化统计推断的实用工具,但本质是虚构。
- 条件性原则在低维数据中优先选择调整估计量;高维数据需权衡偏差与精度。
- 维数灾难要求发展新方法(如正则化、机器学习),在后续章节讨论。
注:所有数学公式严格按原义以 格式呈现,技术术语保留英文并附中文释义(如 估计目标 (Estimand))。