Chapter_11
9/17/25About 11 min
### 第11章总结:为什么需要模型?
11.1 数据不能为自己说话
- 技术重点:
- 当处理变量 (A) 为离散型(如二分类或四分类)时,可通过样本均值无偏估计总体条件均值 (E[Y|A=a])。
- 但当 (A) 为连续变量(如剂量 0-100 mg/day)且某些水平无样本(如 (A=90))时,样本均值未定义。
- 非参数估计器(如样本均值)在数据稀疏时失效,需模型补充信息。
- 细节要点:
- 研究人群:16名HIV感染者,随机抽样自目标总体(target population)。
- 二分类 (A)(治疗/未治疗):样本均值估计 (E[Y|A=1]=146.25),(E[Y|A=0]=67.50)。
- 四分类 (A):样本量固定时,类别增加导致置信区间变宽(例如 (A=1,2,3,4) 的估计分别为 70.0, 80.0, 117.5, 195.0)。
- 连续 (A):多数剂量无样本,无法直接估计 (E[Y|A=90])。
- 结论:数据不足时需模型补充信息。
11.2 条件均值的参数估计
- 技术重点:
- 参数条件均值模型:通过有限参数描述 (E[Y|A]),如线性模型:
[
E[Y|A] = \theta_0 + \theta_1 A
] - 普通最小二乘法 (OLS):最小化残差平方和估计参数 (\hat{\theta}_0, \hat{\theta}_1)。
- 估计未观测点:(\hat{E}[Y|A=90] = \hat{\theta}_0 + 90 \hat{\theta}_1)。
- 参数条件均值模型:通过有限参数描述 (E[Y|A]),如线性模型:
- 细节要点:
- 示例:OLS 估计 (\hat{\theta}_0 = 24.55),(\hat{\theta}_1 = 2.14) → (\hat{E}[Y|A=90] = 216.9)。
- 同方差下 95% CI:(\theta_0 \in (-21.2, 70.3)),(\theta_1 \in (1.28, 2.99)),(E[Y|A=90] \in (172.1, 261.6))。
- 模型定义:对数据分布的先验限制(如强制 (E[Y|A]) 为线性)。
- 结论:参数模型通过借用信息估计未观测值,但依赖模型正确设定。
11.3 条件均值的非参数估计
- 技术重点:
- 非参数估计器:无先验限制,直接基于数据估计(如样本均值)。
- 饱和模型 (saturated model):参数数 = 未知条件均值的数量(如二分类 (A) 时 (E[Y|A] = \theta_0 + \theta_1 A) 无限制)。
- 非参数估计在数据缺失时不可行(如 (A) 有 100 水平且 (A=90) 无样本)。
- 细节要点:
- 二分类 (A) 下:饱和模型估计 (\hat{E}[Y|A=0] = 67.5),(\hat{E}[Y|A=1] = 146.25),等同样本均值。
- Fisher 一致性(Fine Point 11.1):非参数估计器在总体中计算得真实值,但常不可行。
- 本书 Part I 方法(标准化、IP 加权等)基于非参数估计;Part II 依赖参数模型。
- 结论:非参数估计无模型限制,但需充足数据。
11.4 平滑
- 技术重点:
- 平滑 (smoothing):模型将噪声数据转换为曲线,平滑度由参数数量控制:
- 参数少 → 高平滑(如直线)。
- 参数多 → 低平滑(如高次多项式插值数据点)。
- 多项式扩展:增加灵活性(如二次模型):
[
E[Y|A] = \theta_0 + \theta_1 A + \theta_2 A^2
]
- 平滑 (smoothing):模型将噪声数据转换为曲线,平滑度由参数数量控制:
- 细节要点:
- 示例:二次模型估计 (\hat{\theta}_0 = -7.41),(\hat{\theta}_1 = 4.11),(\hat{\theta}_2 = -0.02) → (\hat{E}[Y|A=90] = 197.1)(95% CI: (142.8, 251.5))。
- 带宽限制:局部拟合(如仅用 (A \in [80,100]) 的样本)可调节平滑度。
- 多变量模型:参数越少,预测曲面越光滑。
- 结论:平滑通过借用邻近信息降低方差,但需权衡偏差。
11.5 偏差-方差权衡
- 技术重点:
- 偏差-方差权衡:
- 低参数模型(如线性):方差小,但若模型错误设定则偏差大。
- 高参数模型(如二次):偏差小(更灵活),但方差大(CI 更宽)。
- 模型正确性关键:推断依赖 (E[Y|A]) 的设定。
- 偏差-方差权衡:
- 细节要点:
- 示例:线性模型 (\hat{E}[Y|A=90] = 216.9)(CI: (172.1, 261.6)) vs. 二次模型 (197.1)(CI: (142.8, 251.5))。
- 若真实关系非线性,线性模型有偏且 CI 未校准。
- 贝叶斯 vs. 频率学派(Fine Point 11.2):高维模型中贝叶斯可信区间可能覆盖不足。
- 结论:选择模型需权衡偏差与方差,实践中依赖传统/可解释性,但需敏感性分析。
关键结论
- 模型必要性:数据稀疏时(如连续处理、多类别),需参数模型补充信息。
- 模型类型:
- 参数模型:通过先验限制(如线性)借用信息,但需正确设定。
- 非参数模型:无限制但需充足数据。
- 核心权衡:平滑度影响偏差(低平滑减少偏差)与方差(高平滑减少方差)。
- 实践建议:模型选择需结合领域知识,并进行敏感性分析验证稳健性。
此总结严格遵循原文逻辑与技术细节,未引入主观内容,数学公式采用 LaTeX 格式,技术术语保留英文以确保精确性。