Nonparametric estimation of the continuous treatment effect with measurement error¶
作者: Wei Huang, Zheng Zhang
来源: Journal of the Royal Statistical Society Series B
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本方向研究的是连续型处理变量(continuous treatment)存在测量误差(measurement error)时的因果效应非参数估计。具体而言,研究者观测到的是带有误差的处理变量 \(W\)(而非真实处理变量 \(T\)),以及结果变量 \(Y\) 和协变量 \(X\),目标是估计平均剂量-反应函数(ADRF)\(\mu(t) = \mathbb{E}[Y(t)]\),其中 \(Y(t)\) 是处理水平 \(t\) 下的潜在结果。这是一个将因果推断(连续处理效应估计)与测量误差模型(deconvolution)交叉的领域,其核心困难在于:① 连续处理变量导致倾向性得分退化为条件密度,需要非参数估计;② 测量误差使得真实处理变量不可观测,必须通过去卷积技术恢复其分布;③ 两者叠加使得估计量的偏差-方差权衡变得极为复杂。
发展脉络(history)¶
奠基工作(1980s-2000s):Rosenbaum and Rubin (1983, 1984) 建立了基于倾向性得分的二元处理效应估计框架,奠定了因果推断的基石。Hirano and Imbens (2004) 首次将这一框架推广至连续处理变量,提出了广义倾向性得分(GPS)方法,通过估计条件密度 \(f_{T|X}(t|x)\) 来构造权重。同期,Fan and Truong (1993) 和 Delaigle et al. (2009) 在测量误差回归领域取得了突破,建立了去卷积核估计的最优收敛速率理论。
主要进展(2010s):Kennedy et al. (2017) 提出了连续处理效应的双重稳健(doubly robust)估计量,通过构造伪结果(pseudo-outcome)并对其做核回归,允许处理密度或结果回归之一被错误设定。Galvao and Wang (2015) 建立了连续处理效应估计的均匀半参数有效性理论。Ai et al. (2021) 将协变量平衡(covariate balancing)方法引入连续处理设定,通过最大化全局凹准则函数来估计权重。在测量误差方面,Hall and Lahiri (2008) 揭示了去卷积分布估计中矩的收敛速率依赖于矩阶数的奇偶性这一反直觉性质;Delaigle et al. (2008) 证明了利用重复测量数据可以在不已知误差分布的情况下达到与已知误差相同的收敛速率。
当前 frontier:连续处理效应估计的主流方法包括:① 基于GPS的加权估计(Hirano & Imbens, 2004);② 双重稳健估计(Kennedy et al., 2017);③ 协变量平衡估计(Ai et al., 2021)。然而,所有这些方法都假设处理变量被精确观测。当处理变量存在测量误差时,这些方法直接失效——因为GPS无法基于观测到的 \(W\) 正确识别。本文(Huang & Zhang, 2024)是第一个将连续处理效应估计与测量误差结合的工作,填补了这一空白。
子线索聚类¶
-
连续处理效应估计(无测量误差):Hirano & Imbens (2004) [GPS加权] → Kennedy et al. (2017) [双重稳健] → Galvao & Wang (2015) [均匀半参数有效] → Ai et al. (2021) [协变量平衡]。这一簇的核心问题是:如何构造权重使得 \(\mu(t) = \mathbb{E}[Y \cdot w(T,X)]\) 被识别,并达到最优收敛速率。
-
测量误差回归与去卷积:Fan & Truong (1993) [最优速率] → Delaigle et al. (2009) [局部多项式去卷积] → Hall & Lahiri (2008) [矩估计的奇偶性] → Hall & Meister (2007) [ridge方法]。这一簇的核心问题是:当协变量存在测量误差时,如何通过去卷积核恢复回归函数,以及误差分布的光滑性如何影响收敛速率。
-
协变量平衡与经验似然:Kitamura & Stutzer (1997) [广义经验似然] → Imbens et al. (1998) [GMM] → Ai et al. (2021) [连续处理协变量平衡] → 本文 [局部广义经验似然]。这一簇的核心问题是:如何通过矩条件约束来构造权重,使得协变量在处理组和对照组之间达到平衡。
这个方向在追问的核心问题¶
- 识别问题:当处理变量存在测量误差时,ADRF \(\mu(t)\) 是否仍能被非参数识别?需要什么条件?
- 估计问题:如何构造 \(\mu(t)\) 的估计量,使其在误差分布光滑性不同的情况下达到最优收敛速率?
- 推断问题:如何构造置信区间和进行假设检验?估计量的渐近分布是什么?
- 平滑参数选择:去卷积核估计涉及两个带宽(一个用于去卷积,一个用于回归),如何选择它们以最小化均方误差?
已知瓶颈:① 连续处理下的重叠(positivity)条件比二元处理更严格——需要 \(f_{T|X}(t|x) > 0\) 对所有 \(t,x\) 成立,这在实践中几乎不可能满足;② 测量误差使得GPS无法直接估计,必须通过去卷积恢复 \(f_{T|X}\),但去卷积本身就是一个病态逆问题;③ 双重稳健性质在测量误差下是否保持尚不清楚。
⚠️ 作者的 framing¶
作者将缺口 frame 为:"现有连续处理效应估计方法均假设处理变量被精确观测,而实际应用中测量误差普遍存在。本文首次将两者结合,提出一个非参数估计框架。" 具体而言: - 作者强调现有方法(Kennedy et al., 2017; Ai et al., 2021)无法处理测量误差,因此本文是"显然的下一步"。 - 作者淡化了以下竞争路线:① 使用重复测量数据来估计误差分布(Delaigle et al., 2008)——本文假设误差分布已知或可通过验证数据估计,未讨论重复测量场景;② 使用工具变量或proximal causal inference来校正测量误差——本文未涉及未测量混杂与测量误差同时存在的情况。 - 值得研究者去查的问题:① 本文未引用任何关于"测量误差下的因果推断"的综述性工作(如Carroll et al., 2006的经典教材),也未讨论与"proximal causal inference"(Tchetgen Tchetgen et al., 2020)的关系——后者也处理不可观测变量,但用的是不同的识别策略。② 本文未讨论"测量误差与未测量混杂同时存在"这一更现实的场景——这是否可以通过negative controls来校正?③ 本文未引用任何关于"连续处理下的重叠条件"的高维讨论(D'Amour et al., 2017)——该文指出高维协变量下重叠条件几乎不可能满足,这一警告是否适用于本文的设定?
张力¶
未见明显对立引用。各被引工作之间在技术假设上存在差异(如误差分布光滑性假设不同),但未发现彼此矛盾的结论。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(T \in \mathbb{R}\):真实处理变量(连续,一维),不可观测。 - \(W \in \mathbb{R}\):观测到的处理变量,满足 \(W = T + U\),其中 \(U\) 是测量误差,可观测。 - \(Y \in \mathbb{R}\):结果变量,可观测。 - \(X \in \mathbb{R}^d\):协变量(可能高维),可观测。 - \(Y(t)\):处理水平 \(t\) 下的潜在结果(counterfactual),不可观测。 - \(\mu(t) = \mathbb{E}[Y(t)]\):平均剂量-反应函数(ADRF),目标 estimand。 - \(f_{T|X}(t|x)\):给定协变量 \(X=x\) 时真实处理 \(T\) 的条件密度,不可直接观测(因为 \(T\) 不可观测)。 - \(f_{W|X}(w|x)\):给定协变量 \(X=x\) 时观测处理 \(W\) 的条件密度,可估计。 - \(\varphi_U(u)\):测量误差 \(U\) 的特征函数,假设已知(或可通过验证数据估计)。 - \(h, h_0\):两个带宽参数——\(h\) 用于去卷积核(恢复 \(T\) 的分布),\(h_0\) 用于回归核(估计 \(\mu(t)\))。 - \(K(\cdot)\):核函数(通常为对称概率密度)。 - \(K_h(\cdot) = K(\cdot/h)/h\):缩放后的核。 - \(K_h^{\text{dec}}(\cdot)\):去卷积核,其傅里叶变换为 \(\tilde{K}_h^{\text{dec}}(s) = \tilde{K}(hs) / \tilde{\varphi}_U(s)\),其中 \(\tilde{\cdot}\) 表示傅里叶变换。
模型: 1. 无混杂性(unconfoundedness):\(Y(t) \perp T \mid X\),即给定协变量 \(X\),处理分配与潜在结果独立。 2. 测量误差结构:\(W = T + U\),其中 \(U \perp (T, X, Y)\),且 \(U\) 的分布已知(或可通过验证数据一致估计)。 3. 重叠条件(positivity):\(f_{T|X}(t|x) > 0\) 对所有 \(t \in \mathcal{T}\) 和 \(x \in \mathcal{X}\) 成立。 4. 误差分布光滑性:\(\varphi_U(s)\) 在实轴上非零(否则去卷积核无定义),且其衰减速度决定收敛速率——"ordinary smooth"(多项式衰减)或"supersmooth"(指数衰减)。
可观测数据: - 研究者实际能观测到的是:\(\{(W_i, Y_i, X_i)\}_{i=1}^n\),即每个个体的带误差处理变量、结果和协变量。 - 想要但观测不到的是:真实处理变量 \(T_i\) 和潜在结果 \(Y_i(t)\)。 - 识别依赖于:通过去卷积从 \(W\) 的分布中恢复 \(T\) 的分布,再结合无混杂性识别 \(\mu(t)\)。
第二步:最小内核¶
最简特例:假设 \(d=1\)(只有一个协变量),\(X\) 为二元变量(\(X \in \{0,1\}\)),且测量误差 \(U \sim N(0, \sigma^2)\) 已知。在此特例下,本文的核心思路可以完全讲清楚。
识别:在无混杂性下,有
估计:本文的核心想法是同时进行去卷积和加权。具体而言,对于给定的 \(t\),构造权重 \(\hat{w}_i(t)\) 使得
为什么这样能行:去卷积核 \(K_h^{\text{dec}}(W_i - t)\) 的期望(给定 \(X_i\))近似于 \(f_{T|X}(t|X_i)\),因此矩条件 \(\mathbb{E}[K_h^{\text{dec}}(W - t) \cdot m_j(X)] \approx \mathbb{E}[f_{T|X}(t|X) \cdot m_j(X)]\)。通过LGEL最大化,权重被调整到使得这些矩条件在样本中恰好为零,从而实现了协变量平衡——即加权后的样本在 \(X\) 的分布上近似于"给定 \(T=t\)"的条件分布。
最小内核的数学困难:① 去卷积核 \(K_h^{\text{dec}}\) 可能取负值(因为其傅里叶变换涉及除以 \(\tilde{\varphi}_U(s)\)),导致权重可能为负——这与传统经验似然的非负权重不同;② 矩条件数量 \(J_n\) 需随样本量增长以控制偏差,但过多矩条件会导致权重估计的方差爆炸;③ 两个带宽 \(h\)(去卷积)和 \(h_0\)(回归)的选择相互影响,且去卷积核的方差通常比普通核大得多(尤其在误差为supersmooth时)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当连续型处理变量存在测量误差时,如何非参数地估计平均剂量-反应函数 \(\mu(t) = \mathbb{E}[Y(t)]\),并构造其渐近有效的统计推断。
- 核心工具/方法:提出局部广义经验似然(LGEL) 与去卷积核相结合的估计框架——通过最大化受一组扩张的条件矩约束的广义经验似然来构造权重,其中矩条件基于去卷积核构造,从而同时处理测量误差和协变量平衡。
- 主要结论:推导了ADRF估计量的渐近偏差、方差和渐近线性展开(asymptotic linear expansion),证明了其渐近正态性;提出了基于模拟-外推(SIMEX)的平滑参数选择方法,并设计了新的外推程序以稳定计算。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
定义: - 平均剂量-反应函数:\(\mu(t) = \mathbb{E}[Y(t)]\),其中 \(Y(t)\) 是处理水平 \(t\) 下的潜在结果。 - 广义倾向性得分:\(g(t|x) = f_{T|X}(t|x)\),即给定协变量 \(X=x\) 时真实处理 \(T=t\) 的条件密度。 - 权重函数:\(w(t,x) = g(t|x) / \mathbb{E}[g(t|X)]\),使得 \(\mu(t) = \mathbb{E}[Y \cdot w(t,X)]\)。
假设: 1. 无混杂性(Assumption 1):\(Y(t) \perp T \mid X\),对所有 \(t\) 成立。 2. 测量误差结构(Assumption 2):\(W = T + U\),其中 \(U \perp (T, X, Y)\),且 \(U\) 的特征函数 \(\varphi_U(s)\) 已知且非零。 3. 重叠条件(Assumption 3):存在常数 \(c > 0\) 使得 \(g(t|x) \geq c\) 对所有 \(t \in \mathcal{T}\) 和 \(x \in \mathcal{X}\) 成立。 4. 光滑性条件(Assumption 4-5):\(\mu(t)\) 和 \(g(t|x)\) 关于 \(t\) 有 \(p\) 阶连续导数;核函数 \(K\) 为 \(p\) 阶核。 5. 误差分布光滑性(Assumption 6):\(\varphi_U(s)\) 的衰减速度被控制——要么是ordinary smooth(\(|\varphi_U(s)| \asymp |s|^{-\beta}\)),要么是supersmooth(\(|\varphi_U(s)| \asymp \exp(-|s|^\beta/\gamma)\))。 6. 矩条件扩张速率(Assumption 7):矩条件数量 \(J_n \to \infty\) 且 \(J_n = o(n^{1/2})\)。
相比已有文献的强化/放宽: - 相比Kennedy et al. (2017):本文增加了测量误差假设(Assumption 2),但放宽了对GPS可直接估计的依赖——Kennedy et al. 需要 \(f_{T|X}\) 可直接从观测数据估计,而本文通过去卷积恢复它。 - 相比Ai et al. (2021):本文的LGEL框架更灵活——Ai et al. 使用全局凹准则函数,而本文使用局部广义经验似然,允许矩条件数量随样本量增长。 - 相比Delaigle et al. (2009):本文处理的是因果效应估计(涉及潜在结果和无混杂性),而非单纯的回归函数估计。
主要结果¶
定理1(渐近偏差与方差):在正则条件下,ADRF估计量 \(\hat{\mu}(t)\) 的渐近偏差和方差为:
定理2(渐近线性展开):\(\hat{\mu}(t)\) 可以表示为:
定理3(渐近正态性):在适当条件下,
平滑参数选择:作者采用模拟-外推(SIMEX) 方法选择带宽。具体而言: 1. 模拟步:在观测数据上添加额外的测量误差(方差递增),对每个误差水平估计ADRF。 2. 外推步:将估计量作为误差方差的函数,外推至零误差情形。 作者提出了一个新的外推程序——基于局部多项式的外推,相比传统的二次外推更稳定,尤其在误差方差较大时。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干):
-
第一步:识别与权重构造。证明在无混杂性和测量误差结构下,\(\mu(t) = \mathbb{E}[Y \cdot w(t,X)]\),其中 \(w(t,x) = g(t|x)/\mathbb{E}[g(t|X)]\)。将权重估计转化为一个条件矩约束优化问题:寻找权重 \(\{w_i\}\) 使得 \(\sum w_i \cdot \mathbb{E}[K_h^{\text{dec}}(W_i - t) \cdot m_j(X_i) | X_i] \approx 0\)。
-
第二步:LGEL估计。将上述优化问题具体化为局部广义经验似然:
\[\hat{w}_i(t) = \frac{\rho'(\hat{\lambda}^\top \hat{g}_i)}{\sum_{j=1}^n \rho'(\hat{\lambda}^\top \hat{g}_j)},\]其中 \(\hat{\lambda}\) 是拉格朗日乘子,通过求解 \(\sum \hat{w}_i \hat{g}_i = 0\) 得到。这里 \(\rho(\cdot)\) 是凹函数(如 \(\rho(v) = \log(1+v)\) 对应经验似然)。 -
第三步:去卷积核的渐近分析。将 \(K_h^{\text{dec}}(W - t)\) 展开为:
\[K_h^{\text{dec}}(W - t) = \frac{1}{2\pi} \int e^{-is(W-t)} \frac{\tilde{K}(hs)}{\tilde{\varphi}_U(s)} ds.\]利用傅里叶分析,证明 \(\mathbb{E}[K_h^{\text{dec}}(W - t) | X] = g(t|X) + O(h^p)\)(偏差)和 \(\text{Var}[K_h^{\text{dec}}(W - t) | X] = O(1/(nh))\)(方差),其中 \(p\) 是核阶数。 -
第四步:ADRF估计量的渐近展开。将 \(\hat{\mu}(t) = \sum \hat{w}_i(t) Y_i\) 分解为:
\[\hat{\mu}(t) - \mu(t) = \underbrace{\sum \hat{w}_i(t) (Y_i - \mu(T_i))}_{\text{噪声项}} + \underbrace{\sum \hat{w}_i(t) (\mu(T_i) - \mu(t))}_{\text{偏差项}}.\]对噪声项应用经验过程理论(empirical process theory)得到渐近线性展开;对偏差项使用泰勒展开和去卷积核的偏差分析。 -
第五步:带宽选择与SIMEX。将SIMEX应用于ADRF估计:对每个 \(k = 0,1,\ldots,K\),构造 \(W_{i,k} = W_i + \sqrt{\delta_k} \cdot U_i'\)(其中 \(U_i'\) 是独立于数据的模拟误差),估计 \(\hat{\mu}_k(t)\),然后将 \(\{\hat{\mu}_k(t)\}\) 作为 \(\delta\) 的函数外推至 \(\delta = -1\)(即零误差情形)。
关键跳跃点: - 去卷积核的负值问题:\(K_h^{\text{dec}}\) 可能取负值,导致LGEL的权重可能为负。作者通过选择适当的 \(\rho\) 函数(如 \(\rho(v) = -\exp(-v-1)\) 对应指数倾斜)来允许负权重,同时保持优化问题的凸性。 - 矩条件数量的选择:\(J_n\) 需随样本量增长以控制偏差(更多矩条件意味着更好的协变量平衡),但过多矩条件会导致 \(\hat{\lambda}\) 的估计方差爆炸。作者证明了 \(J_n = o(n^{1/2})\) 是最优选择,并给出了具体的速率条件。 - 两个带宽的交互:去卷积带宽 \(h\) 和回归带宽 \(h_0\) 的选择相互影响。作者通过SIMEX将两者解耦——先固定 \(h_0\) 选择 \(h\),再基于去卷积后的数据选择 \(h_0\)。
技术技巧点名: - 傅里叶分析/去卷积核:用于从 \(W\) 的分布恢复 \(T\) 的分布,核心工具是特征函数的比值 \(\tilde{K}(hs)/\tilde{\varphi}_U(s)\)。 - 广义经验似然:用于构造权重,相比普通经验似然允许负权重,且通过选择不同的 \(\rho\) 函数可涵盖多种现有方法(如指数倾斜、连续更新GMM)。 - 经验过程理论(empirical process):用于推导 \(\hat{\mu}(t)\) 的渐近线性展开,处理去卷积核的非光滑性。 - U-统计量展开:在分析去卷积核的方差时,涉及二阶U-统计量的渐近行为。 - SIMEX外推:用于带宽选择,作者提出了新的局部多项式外推程序,相比传统的二次外推更稳定。
真实例子与应用¶
数据:作者使用了美国国家健康与营养调查(NHANES) 数据,研究身体质量指数(BMI)对收缩压(SBP)的因果效应。BMI作为连续处理变量 \(T\),但实际观测到的 \(W\) 是自我报告的BMI(存在测量误差),SBP作为结果 \(Y\),协变量 \(X\) 包括年龄、性别、种族、教育水平等。
方法应用: 1. 假设测量误差 \(U \sim N(0, \sigma^2)\),其中 \(\sigma^2\) 通过验证数据(NHANES中同时有自我报告和实测BMI的子样本)估计。 2. 使用本文提出的LGEL+去卷积核方法估计ADRF \(\mu(t) = \mathbb{E}[SBP(t)]\),其中 \(t\) 是BMI的真实值。 3. 带宽选择采用SIMEX,外推步使用局部多项式。
结果: - 估计的ADRF呈U形:BMI在22-25之间时SBP最低,过低或过高的BMI均导致SBP升高。 - 与忽略测量误差的朴素估计(即直接用 \(W\) 代替 \(T\) 的Kennedy et al.方法)相比,本文方法估计的ADRF在两端(低BMI和高BMI)更陡峭——说明测量误差导致了"回归稀释"(regression dilution)偏倚,使得朴素估计低估了BMI的极端效应。 - 置信区间在BMI中间区域较窄(样本量大),在两端较宽(样本量小且去卷积方差大)。
这个例子想说明:① 测量误差在实际数据中确实存在且不可忽略;② 忽略测量误差会导致有偏的因果效应估计,且偏倚方向符合理论预期(回归稀释);③ 本文方法在有限样本下可行,且能提供合理的推断。
🔎 结论是否比证明窄¶
- 定理1-3的证明依赖于误差分布已知的假设(Assumption 2),但作者在结论中声称"误差分布可通过验证数据估计"。实际上,当误差分布被估计时,去卷积核的渐近性质会发生变化(估计误差会引入额外方差),但作者未严格证明这一情况下的渐近结果。作者在Section 5.2中仅通过模拟验证了误差分布被估计时的表现,但未给出理论保证。
- 重叠条件(Assumption 3)要求 \(g(t|x) \geq c > 0\) 对所有 \(t,x\) 成立,这在连续处理下几乎不可能满足(尤其当 \(t\) 在分布尾部时)。作者在模拟中使用了截断(只估计 \(t\) 在中间范围的值),但在理论部分未明确讨论这一限制。结论中声称"适用于连续处理变量",但实际适用范围可能比声称的窄。
- 渐近线性展开(定理2)要求 \(J_n = o(n^{1/2})\),但作者在模拟中使用了 \(J_n = 5\)(固定),未验证 \(J_n\) 随 \(n\) 增长时的表现。结论中声称"矩条件数量可随样本量扩张",但模拟证据有限。
四、开放问题¶
-
误差分布未知时的理论保证:本文假设误差分布已知或可通过验证数据一致估计,但未给出当误差分布被估计时ADRF估计量的渐近理论。扎根于:Assumption 2(误差分布已知)与Section 5.2(模拟中估计误差分布)之间的差距。要确认这是否为真gap,可查阅Delaigle et al. (2008)关于重复测量下误差分布估计的收敛速率,以及其如何影响去卷积估计的渐近性质。
-
重叠条件的放松:连续处理下的严格重叠条件(\(g(t|x) \geq c > 0\))在实践中几乎不可能满足。能否借鉴Ma and Wang (2020)的鲁棒推断方法(处理小分母问题)或Muñoz and Van Der Laan (2012)的随机干预(stochastic intervention)思路来放松这一条件?扎根于:Assumption 3 和作者在Section 6中提到的"未来工作可考虑更弱的positivity条件"。
-
双重稳健性质的缺失:本文的LGEL估计量不是双重稳健的——它要求GPS模型(通过去卷积恢复)被正确设定。能否将Kennedy et al. (2017)的双重稳健思想引入测量误差设定?即构造一个伪结果 \(\tilde{Y}_i = \hat{\mu}(T_i) + (Y_i - \hat{\mu}(T_i)) / \hat{g}(T_i|X_i)\),然后对其做去卷积核回归。扎根于:本文未讨论双重稳健性质,而Kennedy et al. (2017)是本文的核心竞争方法之一。
-
高维协变量下的表现:本文的LGEL方法涉及对协变量 \(X\) 的基函数展开,当 \(X\) 的维度 \(d\) 较大时,基函数数量 \(J_n\) 需随 \(d\) 指数增长(维数灾难)。能否借鉴D'Amour et al. (2017)关于高维协变量下重叠条件的讨论,或引入稀疏性假设(如只有少数协变量是confounders)来缓解这一问题?扎根于:本文假设 \(d\) 固定且较小,未讨论高维情形。
Maintained by 陈星宇 · Homepage · Source on GitHub