Causal inference with a functional outcome¶
作者: Kreske Ecker, Xavier de Luna, Lina Schelin
来源: Journal of the Royal Statistical Society Series C
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是函数型结果变量的因果推断。根本的科学问题是:当处理变量(如是否在特定地区居住)对结果的影响不是单一数值,而是一条随时间/空间变化的曲线(如收入轨迹)时,如何定义、识别和推断其因果效应?该方向当前处于从“标量结果因果推断”向“函数型结果因果推断”的初步扩展阶段,方法学上主要依赖经典因果推断框架(结果回归、倾向性评分、双重稳健)与函数型数据分析(FDA)工具的直接拼接,尚未形成成熟的半参数效率理论或高维处理框架。
发展脉络¶
奠基工作:因果推断的标量结果框架(Rubin因果模型、未混淆假设、结果回归/倾向性评分/双重稳健估计)是本文的底层基础。本文直接引用了Tan (2007) 对结果回归(OR)与双重稳健(DR)估计的系统比较,作为其选择OR估计量的方法论依据。同时,Belloni et al. (2017) 的工作为高维控制变量下的函数型结果因果推断提供了“近似稀疏”假设下的后选择/后正则化推断框架,但本文明确区分了自己的贡献:“我们提供精确的有限样本推断,而Belloni et al. (2017) 为渐近bootstrap推断提供证明”——这是本文定位自身的一个关键口子。
主要进展:函数型数据分析(FDA)领域为函数型参数的推断提供了多种工具。本文引用了多条线索: - 同时置信带(SCB):Choi & Reimherr (2018) 提出了基于超椭球和超矩形的函数型参数置信区域构建策略,但指出“几乎所有区域在使用经验协方差时覆盖率为零”,并提出“ghosting”新范式。Liebl & Reimherr (2020) 提出了快速、公平的SCB方法,不依赖重抽样且无需完整协方差函数估计。Telschow & Schwartzman (2022) 利用高斯运动学公式(GKF)构建SCB,并证明即使观测非高斯,CLT也足以保证渐近精确覆盖。 - 多重比较校正:Vsevolozhskaya et al. (2014) 和 Abramowicz et al. (2018) 分别提出了函数型方差分析中的p值调整和区间错误率控制方法。 - 函数型结果的因果效应:Lin et al. (2021) 将因果效应定义在Wasserstein空间(分布函数空间)上,并开发了双重稳健估计量——这是与本文最接近的先行工作,但处理的是分布函数而非函数型轨迹。
当前frontier与本文位置:本文位于“将经典因果推断框架(结果回归)与函数型数据推断工具(同时置信带)结合”这一具体节点上。作者将缺口frame为:现有函数型结果因果推断文献缺乏对FATE的全局推断方法(同时置信带),而现有FDA的SCB方法尚未被应用于因果推断设定。本文的贡献是填补这一空白。
子线索聚类¶
-
因果推断方法论(标量结果):Tan (2007) [OR/DR比较]、Belloni et al. (2017) [高维稀疏下的均匀推断]、Genbäck & de Luna (2019) [未混淆假设违背下的敏感性分析]、Moosavi et al. (2021) [均匀有效推断的成本与收益]。这一簇提供了本文的因果识别框架和估计量选择依据。
-
函数型数据推断工具:Choi & Reimherr (2018) [几何方法构建置信区域]、Liebl & Reimherr (2020) [快速公平SCB]、Telschow & Schwartzman (2022) [GKF-based SCB]、Vsevolozhskaya et al. (2014) [多重比较校正]、Abramowicz et al. (2018) [函数型线性模型推断]。这一簇提供了本文的推断工具。
-
函数型结果的因果效应:Lin et al. (2021) [Wasserstein空间上的因果效应]。这是与本文最直接竞争/互补的工作,但处理的是分布函数而非函数型轨迹。
-
实证应用:Schwandt & von Wachter (2019) [劳动力市场进入时机对工资的长期影响]、Lindgren et al. (2016) [瑞典SIMSAM数据库]。这一簇提供了本文的实证背景和数据来源。
这个方向在追问的核心问题¶
- 如何定义函数型结果的因果效应? 是逐点定义(FATE(t))还是全局定义(如分布函数、Wasserstein距离)?
- 如何对函数型因果效应进行全局推断? 同时置信带是自然选择,但如何保证其覆盖率和有限样本性质?
- 如何处理高维/函数型协变量? 当协变量本身是函数型或高维时,如何实现有效推断?
- 如何实现双重稳健或半参数有效估计? 现有工作(如本文)仅使用结果回归,尚未发展出函数型结果的DR估计或效率界。
当前主流方法与已知瓶颈:主流方法是将标量结果因果推断的估计量(OR、IPW、DR)逐点应用于函数型结果,然后使用FDA的推断工具进行全局校正。瓶颈在于:(a) 逐点估计的紧性难以保证(Choi & Reimherr, 2018 已指出);(b) 函数型协变量下的推断问题尚未解决;(c) 缺乏半参数效率理论。
⚠️ 作者的framing¶
作者将缺口frame为:“现有文献缺乏对函数型平均处理效应(FATE)的全局推断方法(同时置信带)”。具体来说: - 作者声称“我们的方法论贡献在于提供精确的有限样本推断,而Belloni et al. (2017) 提供渐近bootstrap推断”——这暗示本文的方法在有限样本下更优。 - 作者淡化/回避了以下竞争路线:(a) 双重稳健估计(DR)——本文仅使用结果回归,但DR在标量结果中已被证明具有更好的稳健性;(b) 半参数效率理论——本文未推导FATE估计量的效率界;(c) 高维协变量处理——本文假设协变量维数固定且远小于样本量。
什么明显该被引/该存在、却没出现在intro里? - 没有引用任何关于函数型数据半参数效率理论的工作(如函数型数据的有效影响函数、效率界)。 - 没有引用函数型双重稳健估计的工作(如将Kennedy (2016) 的DR框架扩展到函数型结果)。 - 没有引用函数型工具变量或函数型中介分析的工作——这些是因果推断中更复杂的设定。 - 没有引用函数型数据的高维推断工作(如函数型数据的lasso或稀疏主成分分析)。
张力¶
未见明显对立引用。所有被引工作基本在各自子领域内自洽,没有出现“在略不同条件下得相反结论”的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(A_i \in \{0, 1\}\):第 \(i\) 个个体的二值处理变量(如是否在早期居住于特定地区)。 - \(Y_i(t) \in \mathbb{R}\):第 \(i\) 个个体的函数型结果在时间点 \(t \in [0, 1]\) 的值(如 \(t\) 岁时的收入)。\(Y_i\) 是一个随机函数(随机过程)。 - \(X_i \in \mathbb{R}^p\):第 \(i\) 个个体的协变量向量(如性别、出生年份、父母收入等),\(p\) 固定且远小于样本量 \(n\)。 - \(Y_i^{(a)}(t)\):第 \(i\) 个个体的潜在结果(potential outcome)在时间点 \(t\) 的值,如果处理 \(A_i = a\)。这是不可观测的——对于每个个体,我们只能观测到 \(Y_i(t) = Y_i^{(A_i)}(t)\)。 - \(\theta(t) = \mathbb{E}[Y_i^{(1)}(t) - Y_i^{(0)}(t)]\):函数型平均处理效应(FATE) 在时间点 \(t\) 的值。这是要估计的目标参数(estimand),是一个函数。 - \(\mu_a(t, x) = \mathbb{E}[Y_i(t) \mid A_i = a, X_i = x]\):结果回归函数(outcome regression function),即给定处理 \(a\) 和协变量 \(x\) 时结果的条件期望。这是需要估计的 nuisance 参数。 - \(\hat{\theta}(t)\):FATE 的估计量。 - \(\hat{B}(t) = \hat{\theta}(t) - \theta(t)\):估计量的偏差过程(bias process)。 - \(\hat{\Sigma}(s, t)\):\(\hat{B}(t)\) 的协方差函数的估计量。 - \(n\):样本量。 - \(p\):协变量维数。
模型: - 数据生成机制:\((X_i, A_i, Y_i(\cdot))\) 独立同分布(i.i.d.)来自某个联合分布。\(Y_i(\cdot)\) 是定义在 \([0, 1]\) 上的随机函数,假设其轨迹是光滑的(属于某个Sobolev空间或Hilbert空间)。 - 识别假设: - 未混淆性(Unconfoundedness):\(A_i \perp\!\!\!\perp Y_i^{(a)}(t) \mid X_i\),对所有 \(t \in [0, 1]\) 和 \(a \in \{0, 1\}\) 成立。即给定协变量 \(X_i\),处理分配与潜在结果独立。 - 重叠性(Overlap):\(0 < \mathbb{P}(A_i = 1 \mid X_i = x) < 1\),对所有 \(x\) 成立。 - 一致性(Consistency):\(Y_i(t) = Y_i^{(A_i)}(t)\)。 - 已知/未知:协变量 \(X_i\) 的分布、处理分配机制 \(e(x) = \mathbb{P}(A_i = 1 \mid X_i = x)\)(倾向性评分)和结果回归函数 \(\mu_a(t, x)\) 都是未知的,需要从数据中估计。本文假设 \(\mu_a(t, x)\) 是参数化的(如线性模型),但方法本身可扩展到非参数估计。
可观测数据: - 可观测:\(\{(X_i, A_i, Y_i(t_{i1}), \ldots, Y_i(t_{i m_i}))\}_{i=1}^n\),即每个个体在离散时间点上的结果观测值。时间点个数 \(m_i\) 可能因个体而异(稀疏/密集采样),但本文假设所有个体在相同密集网格 \(\{t_1, \ldots, t_m\}\) 上被观测,且 \(m\) 固定且远小于 \(n\)。 - 不可观测:每个个体的完整函数型轨迹 \(Y_i(\cdot)\)(只能从离散观测插值/平滑得到),以及潜在结果 \(Y_i^{(1-a)}(t)\)(反事实)。
第二步:讲最小内核¶
最简特例:假设 \(p=1\)(只有一个协变量 \(X_i\)),且结果回归函数是线性的:
在这个特例下,FATE 退化为:
估计步骤(最小内核): 1. 逐点估计:对每个时间点 \(t_j\)(\(j=1,\ldots,m\)),用线性回归估计 \(\hat{\beta}_{0a}(t_j)\) 和 \(\hat{\beta}_{1a}(t_j)\)(基于处理组 \(A_i=a\) 的个体),然后计算:
-
偏差过程:\(\hat{B}(t_j) = \hat{\theta}(t_j) - \theta(t_j)\)。在正则条件下,\(\hat{B}(t_j)\) 是渐近正态的,且 \(\hat{B}(\cdot)\) 是均值为零的高斯过程。
-
协方差估计:估计 \(\hat{B}(t)\) 的协方差函数 \(\hat{\Sigma}(s, t) = \widehat{\text{Cov}}(\hat{B}(s), \hat{B}(t))\)。这可以通过bootstrap或解析公式得到。
-
同时置信带:构建形如 \([\hat{\theta}(t) \pm c_\alpha \hat{\sigma}(t)]\) 的带,其中 \(\hat{\sigma}^2(t) = \hat{\Sigma}(t, t)\),临界值 \(c_\alpha\) 满足:
\[\mathbb{P}\left(\sup_{t \in [0,1]} \frac{|\hat{\theta}(t) - \theta(t)|}{\hat{\sigma}(t)} \leq c_\alpha\right) = 1 - \alpha\]这可以通过模拟高斯过程的分位数得到(如使用Cholesky分解或bootstrap)。
核心思路:本文的整个方法就是把这个最小内核中的“线性回归”替换成更一般的参数/半参数模型,并把“逐点估计”替换成“函数型回归”(如使用B样条基展开),然后用同时置信带进行全局推断。数学上的主要困难在于:当结果回归函数是函数型的(即系数是函数)时,偏差过程 \(\hat{B}(t)\) 的协方差结构更复杂,且需要证明其紧性(tightness)以保证同时置信带的渐近有效性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在未混淆假设下,对二值处理对函数型结果的因果效应(FATE)进行识别、估计和全局推断。
- 核心工具/方法:使用结果回归(OR)估计量,结合函数型数据分析中的同时置信带(SCB)对FATE进行全域推断。
- 主要结论:提出了FATE的OR估计量,证明了其逐点渐近正态性,并构建了同时置信带;模拟实验表明SCB能有效控制多重比较问题;实证分析估计了早期居住地对后续收入轨迹的因果效应。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - 函数型结果:\(Y_i(t)\) 定义在 \([0, 1]\) 上,假设属于 \(L^2[0,1]\) 空间。实际观测是在密集网格 \(\{t_1, \ldots, t_m\}\) 上,\(m\) 固定且远小于 \(n\)。 - 结果回归模型:\(\mu_a(t, x) = \mathbb{E}[Y_i(t) \mid A_i = a, X_i = x]\) 被参数化为:
关键假设(与已有文献的比较): - Assumption 1 (未混淆性):与标量结果因果推断的标准假设一致,未放宽或强化。 - Assumption 2 (重叠性):标准假设。 - Assumption 3 (高斯性):假设 \(Y_i(t) \mid A_i, X_i\) 是高斯过程。作者指出“Assumption 3中的高斯条件并非推导 \(\hat{\theta}(t)\) 的逐点性质(如一致性)所必需”(引用Genbäck & de Luna, 2019),但对同时置信带的构建至关重要——因为SCB的临界值依赖于高斯过程的分布。这是一个强假设,在实证中可能不成立。 - Assumption 4 (模型正确设定):结果回归模型 \(\mu_a(t, x)\) 被正确设定。这是OR估计量的标准要求,也是其相对于DR估计量的弱点。 - 函数型数据假设:假设所有个体在相同密集网格上被观测,且 \(m\) 固定。这比“稀疏/不规则采样”的设定更简单。
相比已有文献的放宽/强化: - 放宽:相比Belloni et al. (2017) 的高维设定,本文假设协变量维数 \(p\) 固定且远小于 \(n\),无需稀疏性假设。 - 强化:相比标量结果因果推断,本文增加了高斯过程假设(Assumption 3)和函数型线性模型假设(Assumption 4)。
主要结果¶
理论结果(本文为应用型论文,理论结果相对简洁):
-
逐点渐近正态性(Theorem 1):在Assumptions 1-4下,对任意固定 \(t \in [0, 1]\),有:
\[\sqrt{n} (\hat{\theta}(t) - \theta(t)) \xrightarrow{d} N(0, \sigma^2(t))\]其中 \(\sigma^2(t)\) 是渐近方差。证明依赖于标准M-估计理论(结果回归估计量的逐点性质)。 -
同时置信带(Theorem 2):在Assumptions 1-4下,构建形如 \([\hat{\theta}(t) \pm c_\alpha \hat{\sigma}(t)]\) 的带,其中 \(\hat{\sigma}^2(t)\) 是 \(\sigma^2(t)\) 的一致估计,\(c_\alpha\) 通过模拟高斯过程的分位数得到。该带满足:
\[\lim_{n \to \infty} \mathbb{P}\left(\theta(t) \in [\hat{\theta}(t) \pm c_\alpha \hat{\sigma}(t)], \forall t \in [0,1]\right) = 1 - \alpha\]证明依赖于:(a) \(\hat{B}(t) = \sqrt{n}(\hat{\theta}(t) - \theta(t))\) 作为随机过程在 \(C[0,1]\) 中的紧性(tightness);(b) 协方差函数 \(\Sigma(s, t)\) 的一致估计;(c) 连续映射定理。
技术难点: - 紧性证明:需要证明 \(\hat{B}(t)\) 作为 \(C[0,1]\) 中的随机过程是紧的。这通常需要验证其等度连续性(equicontinuity),即对任意 \(\epsilon > 0\),存在 \(\delta > 0\) 使得 \(\sup_{|s-t|<\delta} |\hat{B}(s) - \hat{B}(t)|\) 以高概率小于 \(\epsilon\)。本文利用结果回归估计量的光滑性(基函数展开)来保证这一点。 - 协方差估计:\(\hat{\Sigma}(s, t)\) 的估计需要处理函数型数据的相关性结构。本文使用bootstrap(如残差bootstrap或wild bootstrap)来估计协方差,避免了复杂的解析公式。
与baseline的对比(模拟实验): - 本文比较了同时置信带与逐点置信带(pointwise confidence bands,即对每个 \(t\) 分别构建95%置信区间,不做多重比较校正)。 - 核心量化结论:当FATE在部分区域为0时,逐点置信带会过度拒绝(即错误地认为FATE非零),而同时置信带能有效控制族系错误率(FWER)。例如,在模拟中,当FATE在 \([0.2, 0.8]\) 上恒为0时,逐点置信带的实际覆盖率远低于95%,而同时置信带接近95%。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干):
-
估计结果回归函数:对每个处理组 \(a \in \{0, 1\}\),使用基展开和最小二乘法估计 \(\hat{\mu}_a(t, x)\)。这一步是标准的函数型线性模型拟合。
-
构造FATE估计量:\(\hat{\theta}(t) = \frac{1}{n} \sum_{i=1}^n [\hat{\mu}_1(t, X_i) - \hat{\mu}_0(t, X_i)]\)。这一步是“平均化”预测值,类似于标量结果中的OR估计量。
-
推导偏差过程的渐近分布:
- 将 \(\hat{\theta}(t) - \theta(t)\) 分解为“估计误差”+“近似误差”(如果基展开是近似的)。
- 利用M-估计的渐近理论,证明 \(\sqrt{n}(\hat{\theta}(t) - \theta(t))\) 逐点收敛到正态分布。
-
证明该过程作为 \(C[0,1]\) 中的随机过程是紧的(tight),从而其极限是一个高斯过程。
-
估计协方差函数:使用bootstrap(如残差bootstrap)估计 \(\hat{\Sigma}(s, t)\)。具体来说,对每个bootstrap样本,重新估计 \(\hat{\theta}^*(t)\),然后计算bootstrap样本的协方差。
-
构建同时置信带:
- 计算标准化过程 \(\hat{Z}(t) = \frac{\hat{\theta}(t) - \theta(t)}{\hat{\sigma}(t)}\)。
- 模拟高斯过程 \(G(t)\),其均值为0,协方差为 \(\hat{\Sigma}(s, t) / (\hat{\sigma}(s) \hat{\sigma}(t))\)。
- 通过模拟找到临界值 \(c_\alpha\),使得 \(\mathbb{P}(\sup_{t \in [0,1]} |G(t)| \leq c_\alpha) = 1 - \alpha\)。
- 输出带 \([\hat{\theta}(t) \pm c_\alpha \hat{\sigma}(t)]\)。
关键跳跃点: - 从逐点正态到过程紧性:这是从“逐点推断”到“全局推断”的关键跳跃。作者需要证明 \(\hat{B}(t)\) 的样本路径是“足够光滑”的,以保证其紧性。这依赖于结果回归估计量的光滑性(基函数展开天然提供了光滑性)。 - bootstrap的一致性:需要证明bootstrap估计的协方差函数 \(\hat{\Sigma}(s, t)\) 是 \(\Sigma(s, t)\) 的一致估计。这通常需要验证bootstrap的“镜像”性质(即bootstrap样本的分布收敛到原始样本的分布)。
技术技巧点名: - 基函数展开(B-splines):用于将函数型回归问题转化为有限维参数估计问题。这是函数型数据分析的标准技巧。 - M-估计理论:用于证明逐点渐近正态性。这是标量结果因果推断的标准工具。 - bootstrap(残差bootstrap):用于估计协方差函数,避免解析推导。这是计算上的实用技巧。 - 高斯过程模拟:用于计算同时置信带的临界值。这是FDA中构建SCB的标准方法(如Telschow & Schwartzman, 2022 使用的GKF方法,但本文使用更直接的模拟)。
真实例子与应用¶
数据:瑞典出生队列数据(Umeå SIMSAM Lab, Lindgren et al., 2016),聚焦于1954年出生的队列。
场景:估计早期居住地(18岁时的居住地,二值处理:城市 vs. 农村)对后续收入轨迹(19-50岁的年收入,函数型结果)的因果效应。
方法应用: 1. 协变量:性别、父母收入、父母教育水平、出生地等。 2. 结果回归模型:对每个处理组(城市/农村),用B样条基展开拟合收入轨迹,协变量作为线性项进入模型。 3. FATE估计:计算 \(\hat{\theta}(t)\),即城市 vs. 农村的平均收入差异轨迹。 4. 同时置信带:构建95%同时置信带,判断在哪些年龄区间上效应显著。
结果: - FATE估计显示:早期居住在城市的人,在20-30岁期间收入显著高于农村居住者(同时置信带不包含0),但在40岁以后差异消失。 - 逐点置信带(未校正)在30-40岁期间也显示显著差异,但作者指出这可能是多重比较导致的假阳性。
这个例子想说明什么: - 验证理论:展示同时置信带在实际数据中如何控制多重比较问题,避免过度解释。 - 展示相对baseline的优势:与逐点置信带对比,说明同时置信带更保守但更可靠。 - 实际意义:为“早期居住地对长期收入的影响”这一经济学问题提供因果证据。
🔎 结论是否比证明窄¶
- 高斯过程假设(Assumption 3):作者在Theorem 2的证明中明确依赖于高斯性,但在实证中收入数据显然不是高斯的。作者在讨论中承认“高斯条件可能不成立”,但声称“bootstrap方法对偏离高斯性具有稳健性”——这是一个conjecture,没有严格证明。读者应检查bootstrap在非高斯函数型数据下的一致性条件。
- 模型正确设定假设(Assumption 4):作者假设结果回归模型被正确设定,但在实证中线性模型可能不成立。作者没有进行模型误设定下的敏感性分析或稳健性检验。
- 密集网格假设:作者假设所有个体在相同密集网格上被观测,但实际数据可能存在缺失或稀疏采样。作者没有讨论这种情况下的处理方法。
- “精确有限样本推断”的声称:作者在引言中声称“提供精确的有限样本推断”,但Theorem 2是渐近结果(\(n \to \infty\)),并非精确有限样本。这个声称可能过于强烈——实际提供的是渐近精确的同时置信带。
四、开放问题¶
-
非高斯函数型结果下的同时置信带:本文的Theorem 2依赖于高斯过程假设(Assumption 3)。能否在非高斯设定下(如使用bootstrap的极限理论)证明同时置信带的渐近有效性? 扎根于:Assumption 3的讨论(“高斯条件并非推导逐点性质所必需,但对同时置信带至关重要”)。
-
双重稳健估计:本文仅使用结果回归(OR)估计量,但标量结果文献中DR估计量具有更好的稳健性(对OR或PS模型误设定不敏感)。能否将DR估计量扩展到函数型结果,并推导其渐近性质和同时置信带? 扎根于:引言中引用Tan (2007) 讨论OR/PS/DR,但本文仅使用OR。
-
高维协变量下的函数型因果推断:本文假设协变量维数 \(p\) 固定且远小于 \(n\)。当 \(p\) 随 \(n\) 增长(高维设定)时,如何实现函数型结果的因果推断? 是否需要类似Belloni et al. (2017) 的稀疏性假设?扎根于:引言中引用Belloni et al. (2017) 但明确区分了自己的“有限样本推断”vs. 他们的“渐近bootstrap推断”。
-
函数型协变量:当协变量本身是函数型(如基因表达轨迹)时,如何定义和推断函数型结果的因果效应? 这需要处理“函数型变量对函数型变量”的因果效应,目前文献几乎空白。扎根于:本文假设协变量是标量向量,但引言中未讨论函数型协变量的情况。
提醒:要确认第1条(非高斯下的SCB)是否是真gap,建议去读Liebl & Reimherr (2020) 和 Telschow & Schwartzman (2022) 的近期工作——如果它们已经处理了非高斯设定,则本文的gap可能已被填补。
Maintained by 陈星宇 · Homepage · Source on GitHub