Local conformal prediction for individual causal effects¶
作者: Fernando Delbianco, Fernando Tohm\'e
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.09612
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在因果推断中,如何为个体(而非群体平均)的因果效应提供具有有限样本覆盖保证的不确定性量化。当前主流方法(如Causal Forest、Double ML)为条件平均处理效应(CATE)提供渐近置信区间,但这些区间覆盖的是条件期望,而非个体反事实实现。当处理效应异质性很强时,条件均值可能对任何具体个体都缺乏代表性。本文试图用共形预测(conformal prediction)的分布自由框架,结合局部校准策略,来填补这一缺口。该方向的成熟度中等:共形预测用于因果推断已有奠基工作(Lei & Candès, 2021),但如何从边际覆盖推进到(近似)条件覆盖,以及如何在观测研究中处理倾向性评分异质性,仍是活跃的开放问题。
发展脉络(history)¶
-
奠基工作:共形预测用于因果推断。Lei & Candès (2021) 建立了共形化反事实与个体处理效应(ITE)推断的基础框架。他们通过逆倾向性评分加权校准集来处理处理组与对照组之间的协变量偏移,实现了ITE的边际覆盖。其关键局限是:覆盖是协变量分布上的平均,对特定子群体可能远低于名义水平。Kivaranovic et al. (2020) 更早地将未加权的共形推断应用于随机对照试验,但未扩展到具有异质性倾向性评分的观测研究。
-
主要进展:非参数CATE估计。Wager & Athey (2018) 引入Causal Forest,通过自适应划分协变量空间,为CATE提供渐近有效的置信区间。Künzel et al. (2019) 的X-learner通过元学习插补反事实结果来构造CATE估计。Nie & Wager (2021) 的R-learner通过Robinson (1988) 的部分线性分解实现oracle效率。这些方法的一个关键区分(由Lei & Candès, 2021强调)是:它们的目标是CATE的条件期望,而非ITE的个体反事实实现。BART (Hill, 2011) 的后验预测区间可以覆盖ITE,但其有效性依赖于贝叶斯模型的正确设定。
-
当前frontier:从边际到条件覆盖。本文的位置是:在Lei & Candès (2021) 的边际覆盖基础上,通过局部校准来逼近条件覆盖。其核心想法是:将校准集限制在与查询单元共享相同局部因果机制的观测上,从而使校准得分与查询的得分近似可交换。这与Invariant Causal Prediction (Peters et al., 2016) 的精神相通——通过要求残差分布在不同实验环境下不变来识别因果变量。
子线索聚类¶
-
线索一:共形预测 + 因果推断。核心工作:Lei & Candès (2021), Kivaranovic et al. (2020)。这一簇关注如何将共形预测的分布自由覆盖保证扩展到反事实和ITE。主要挑战是处理反事实不可观测导致的得分不可计算问题,以及从随机试验到观测研究的推广。
-
线索二:非参数CATE估计。核心工作:Wager & Athey (2018), Künzel et al. (2019), Nie & Wager (2021), Hill (2011)。这一簇关注如何用灵活的非参数/机器学习方法估计CATE函数,并提供渐近推断。其共同局限是推断目标为条件均值而非个体实现。
-
线索三:双重稳健/半参数估计。核心工作:Robins et al. (1994), Chernozhukov et al. (2018)。这一簇提供具有Neyman正交性的估计量,使一阶误差不传播到因果效应估计。本文将其作为共形得分的构建基础。
这个方向在追问的核心问题¶
- 如何从边际覆盖推进到条件覆盖? 共形预测的有限样本保证本质上是边际的。要实现条件覆盖,通常需要额外的假设或更强的估计精度要求。局部校准是一种尝试,但其理论保证仍停留在“近似条件覆盖”。
- 如何在观测研究中处理倾向性评分异质性? 当处理分配机制复杂时,简单的逆概率加权可能不稳定。本文通过合成数据增强和超相关过滤来应对。
- 如何在小样本局部校准集中稳定分位数估计? 局部校准的核心矛盾是:更窄的邻域因果上更合适,但统计上不稳定。合成增强是一种缓解策略,但其理论性质(如对覆盖的影响)尚未充分刻画。
⚠️ 作者的framing¶
作者将缺口frame成:标准CATE估计量回答的是群体平均问题,而非个体问题。当处理效应异质性“无界”(unbounded heterogeneity)时,条件均值对任何具体个体都缺乏代表性。因此,“显然的下一步”是构造覆盖个体反事实实现的预测区间,而非进一步改进CATE估计的渐近效率。
被淡化/回避的竞争路线: - 作者将BART (Hill, 2011) 定位为“依赖于贝叶斯模型的正确性”,但未深入讨论BART在实践中的表现——BART的后验预测区间在多个基准上表现良好,其模型错误设定敏感性可能被高估。 - 作者未讨论分位数处理效应(QTE) 估计量,后者直接估计处理效应的条件分位数,而非条件均值,可能部分回应“个体不确定性”问题。
什么明显该被引/该存在、却没出现在intro里? - 分位数回归与因果推断的结合(如Chernozhukov et al. 2013的“Quantile Treatment Effects”综述)未被引用。QTE直接估计处理效应的条件分位数,与本文“个体效应分布”的目标有直接关联。 - 共形预测的局部/条件版本(如Barber et al. 2021的“Predictive inference with the jackknife+”)未被引用。这些工作探讨了如何通过数据分割或交叉拟合来改进共形预测的条件性质,与本文的局部校准思路有技术重叠。
张力¶
未见明显对立引用。被引工作之间在目标(CATE vs. ITE)和保证类型(渐近 vs. 有限样本)上有明确分工,而非矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(X \in \mathbb{R}^p\):预处理协变量向量。 - \(T \in \{0, 1\}\):二元处理变量。 - \(Y \in \mathbb{R}\):观测结果变量。 - \(Y(t)\):潜在结果(potential outcome),\(t=0,1\)。\(Y = Y(T)\) 由SUTVA保证。 - \(\tau_q = Y_q(1) - Y_q(0)\):查询单元 \(q\) 的个体因果效应(ICE),是要推断的目标。 - \(e(x) = P(T=1|X=x)\):倾向性评分(propensity score)。 - \(\mu^{(t)}(x) = E[Y|X=x, T=t]\):条件均值函数。 - \(\tau(x) = \mu^{(1)}(x) - \mu^{(0)}(x)\):条件平均处理效应(CATE)。 - \(\hat{\mu}^{(t)}(\cdot)\):\(\mu^{(t)}\) 的估计量(如Causal Forest)。 - \(\hat{e}(\cdot)\):\(e\) 的估计量。 - \(\mathcal{D} = \{(X_i, T_i, Y_i)\}_{i=1}^n\):观测数据集。 - \(\mathcal{R}_q^{(t)}\):查询单元 \(q\) 在处理臂 \(t\) 下的“相关控制集”(relevant controls)。 - \(\mathcal{S}_q^{(t)}\):合成增强集(synthetic augmentation)。 - \(\mathcal{R}_q^{*(t)}\):超相关校准集(super-relevant calibration set),是最终用于共形校准的集合。 - \(V_i^{(t)}\):单元 \(i\) 在处理臂 \(t\) 下的非一致性得分(non-conformity score)。 - \(\hat{q}_{1-\alpha}\):非一致性得分样本的 \(1-\alpha\) 分位数。 - \(\hat{C}_q(Y(t))\):查询单元 \(q\) 在反事实 \(Y(t)\) 上的共形预测区间。 - \(\hat{C}(\tau_q)\):查询单元 \(q\) 的ICE共形预测区间。
模型: 数据生成机制由结构因果模型(SCM)描述:
可观测数据: 研究者实际能观测到的是 \(\mathcal{D} = \{(X_i, T_i, Y_i)\}_{i=1}^n\),其中 \(Y_i = Y_i(T_i)\)(SUTVA)。对于每个单元,只能观测到一个潜在结果(\(T_i=1\) 时观测 \(Y_i(1)\),\(T_i=0\) 时观测 \(Y_i(0)\))。想要但观测不到的是每个单元的反事实结果 \(Y_i(1-t)\),以及查询单元 \(q\) 的完整潜在结果向量 \((Y_q(0), Y_q(1))\)。识别依赖于强可忽略性假设:\((Y(0), Y(1)) \perp T \mid X\)。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设我们只有一个处理组(\(T=1\)),且协变量 \(X\) 是一维的(\(p=1\))。查询单元 \(q\) 的特征为 \(x_q\)。我们想为 \(Y_q(1)\) 构造一个共形预测区间。
标准(全局)方法(Lei & Candès, 2021): 1. 用所有 \(T_i=1\) 的观测拟合 \(\hat{\mu}^{(1)}(x)\)。 2. 对每个 \(i\)(\(T_i=1\)),计算非一致性得分 \(V_i = |Y_i - \hat{\mu}^{(1)}(X_i)|\)。 3. 对查询单元 \(q\),计算 \(\hat{C}_q(Y(1)) = [\hat{\mu}^{(1)}(x_q) - \hat{q}_{1-\alpha}, \hat{\mu}^{(1)}(x_q) + \hat{q}_{1-\alpha}]\),其中 \(\hat{q}_{1-\alpha}\) 是 \(\{V_i\}\) 的 \(1-\alpha\) 分位数。 4. 在交换性假设下,\(P(Y_q(1) \in \hat{C}_q(Y(1))) \geq 1-\alpha\)(边际覆盖)。
问题:如果处理效应异质性很强——例如,\(Y(1) = \sin(10\pi X) + \varepsilon\)——那么全局校准集包含的观测与 \(x_q\) 的局部机制可能完全不同。\(V_i\) 的分布不能代表 \(V_q\) 的分布,导致条件覆盖(给定 \(X_q = x_q\))远低于名义水平。
本文的局部方法(最简版本): 1. 局部校准集:只选择 \(X_i\) 与 \(x_q\) 接近的观测(例如,\(|X_i - x_q| < \delta\))作为校准集 \(\mathcal{R}_q^{(1)}\)。 2. 拟合与得分:在 \(\mathcal{R}_q^{(1)}\) 上拟合 \(\hat{\mu}^{(1)}\),计算 \(V_i = |Y_i - \hat{\mu}^{(1)}(X_i)|\)。 3. 共形区间:同上,但分位数 \(\hat{q}_{1-\alpha}\) 来自局部校准集。 4. 直觉:如果 \(\delta\) 足够小,\(\mathcal{R}_q^{(1)}\) 中的观测与 \(q\) 共享相同的局部结构方程 \(f(x, 1, \varepsilon)\),则 \(V_i\) 与 \(V_q\) 近似可交换,区间近似达到条件覆盖。
核心数学困难:当 \(p\) 很大时,\(\delta\) 必须很小才能保证局部机制近似不变,但小 \(\delta\) 导致 \(\mathcal{R}_q^{(1)}\) 样本量极小,分位数估计不稳定(Meng, 2018的“大数据悖论”)。本文的应对是:①用Causal Forest变量重要性将相似度限制在因果相关子空间(降维);②用合成数据增强(Gaussian扰动)扩增局部样本;③用超相关过滤(Shapley + 倾向性评分接近度)剔除机制不匹配的观测。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在强处理效应异质性下,为个体因果效应 \(\tau_q = Y_q(1) - Y_q(0)\) 构造具有有限样本覆盖保证的共形预测区间。
- 核心工具/方法:局部共形预测框架(ICP),通过Causal Forest变量重要性加权的余弦相似度定义因果相关邻域,用合成数据增强扩增小样本局部校准集,并用满足Neyman正交性的AIPW伪结果作为非一致性得分。
- 主要结论:在SUTVA、强可忽略性和选择可测性条件下,所得区间达到名义水平的边际覆盖(Theorem 1);局部设计通过使校准得分更具代表性,支持近似条件覆盖;合成和IHDP实验表明局部策略在保持名义或以上覆盖率的同时提升点估计精度。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- Assumption 1 (SUTVA):潜在结果 \(Y_i(t)\) 定义良好且不受其他单元处理分配影响;观测结果 \(Y_i = Y_i(T_i)\)。这是因果推断的标准假设。
- Assumption 2 (Strong Ignorability):① \((Y_i(0), Y_i(1)) \perp T_i \mid X_i\)(无未测量混杂);② \(\eta \leq e(X_i) \leq 1-\eta\) a.s.,其中 \(\eta \in (0, 1/2)\)(重叠条件)。相比Lei & Candès (2021) 的随机试验设定,本文允许观测研究中的异质性倾向性评分。
- Assumption 3 (Selection Measurability):用于构造 \(\mathcal{R}_q^{*(t)}\) 的复合超相关得分 \(\phi_i(q)\) 仅依赖于 \((X_i, T_i, X_q)\),不依赖于任何 \(Y_j\)。这是本文最关键的技术假设:它保证了校准集成员资格独立于结果值,从而维持了共形预测所需的交换性。作者通过构造确保该假设成立:\(\phi_i^{Sh}(q)\) 来自Causal Forest的叶权重(仅依赖 \(X\)),\(\phi_i^{PS}(q) = 1 - |\hat{e}(X_i) - \hat{e}(x_q)|\) 仅依赖协变量和倾向性评分模型。
相比已有文献的放宽/强化: - 相比Lei & Candès (2021):本文从全局校准推进到局部校准,目标是近似条件覆盖而非仅边际覆盖。代价是引入了额外的选择可测性假设(Assumption 3)和局部校准集构造的复杂性。 - 相比Kivaranovic et al. (2020):本文扩展到观测研究(处理异质性倾向性评分),而非仅随机试验。 - 相比Wager & Athey (2018):本文的目标是ITE而非CATE,保证类型是有限样本而非渐近。
主要结果¶
Theorem 1 (Finite-Sample Coverage of the ICE):在Assumptions 1-3下,假设 \(T_q = 0\)(\(Y_q(0)\) 观测,\(Y_q(1)\) 反事实),从 \(\mathcal{R}_q^{*(1)}\) 构造的共形区间 \(\hat{C}(\tau_q) = \hat{C}_q(Y(1)) - Y_q\) 满足:
直觉:选择可测性(Assumption 3)保证校准集成员资格独立于结果。因此,校准得分 \(\{V_i\}_{i \in \mathcal{R}_q^{*(1)}}\) 与查询得分 \(V_q\) 在潜在结果分布上边际可交换。标准分裂共形覆盖结果直接适用。
必要条件: - 校准集构造不能使用 \(Y\)(Assumption 3)。 - 处理分配机制必须满足强可忽略性(Assumption 2),否则AIPW得分有偏。 - 覆盖是边际的,不是条件的。作者论证了局部设计使边际覆盖逼近条件水平,但未给出严格定理。
解决的技术难点: - 反事实不可观测导致得分不可计算:通过将校准集限制在已观测到目标处理臂的单元上解决。 - 局部校准集样本量小:通过合成数据增强缓解。 - 高维噪声变量干扰邻域定义:通过Causal Forest变量重要性加权解决。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干):
- 校准集构造:通过三步(相关控制 → 合成增强 → 超相关过滤)构造 \(\mathcal{R}_q^{*(t)}\)。关键:每一步都只使用 \((X, T)\),不使用 \(Y\),从而保证Assumption 3成立。
- 得分计算:对 \(\mathcal{R}_q^{*(t)}\) 中的每个单元,计算AIPW伪结果 \(\hat{\Gamma}_i\) 和Causal Forest的OOB估计 \(\hat{\tau}_{OOB}(X_i)\),非一致性得分 \(V_i = |\hat{\Gamma}_i - \hat{\tau}_{OOB}(X_i)|\)。
- 交换性论证:由Assumption 3,校准集成员资格独立于 \(Y\)。将 \(\hat{\mu}^{(t)}\) 视为固定函数(条件于训练数据),则校准得分 \(\{V_i\}_{i \in \mathcal{R}_q^{*(t)}}\) 与查询得分 \(V_q\) 在潜在结果分布上可交换。
- 标准共形覆盖:由Vovk et al. (2005) 的Proposition 2.1,\(P(Y_q(t) \in \hat{C}_q(Y(t))) \geq 1-\alpha\)。
- ICE区间:当 \(T_q=0\) 时,\(\hat{C}(\tau_q) = \hat{C}_q(Y(1)) - Y_q\),事件 \(\{\tau_q \in \hat{C}(\tau_q)\} = \{Y_q(1) \in \hat{C}_q(Y(1))\}\),覆盖保证直接继承。
关键跳跃点: - 跳跃点1:从“校准集成员资格独立于 \(Y\)”到“得分可交换”。这里隐含了条件:\(\hat{\mu}^{(t)}\) 必须在 \(\mathcal{R}_q^{*(t)}\) 上拟合,且拟合过程不能使用 \(Y\) 信息来影响校准集选择。作者通过OOB构造(Causal Forest的honest splitting)和选择可测性假设来保证。 - 跳跃点2:从“边际覆盖”到“近似条件覆盖”。作者仅给出启发式论证(“因为 \(\mathcal{R}_q^{*(t)}\) 集中在 \(x_q\) 附近的因果相关子空间”),未提供严格定理或收敛速率。这是本文理论最薄弱的一环。
技术技巧点名: - 共形预测(conformal prediction):提供分布自由的有限样本覆盖保证。用于将局部校准转化为个体化不确定性陈述。 - AIPW伪结果(AIPW pseudo-outcome):满足Neyman正交性,使一阶误差不传播。用于构建双重稳健的非一致性得分,缩小区间宽度。 - Causal Forest变量重要性:用于加权余弦相似度,将邻域定义限制在因果相关子空间,避免噪声变量主导。 - 合成数据增强(Gaussian perturbation):用于扩增小样本局部校准集,缓解Meng (2018) 指出的局部正性失败问题。 - Shapley影响权重:用于衡量每个观测对Causal Forest预测查询单元 \(q\) 的贡献,作为超相关过滤的一个组成部分。
真实例子与应用¶
合成数据实验(Section 5): - 数据:\(N=800\),\(p=20\)(仅 \(X_1, X_2, X_3\) 是因果变量,其余17个为纯噪声)。处理效应 \(\tau(X) = 5 + 2X_1 - 3X_2^2 + 2\cos(\pi X_3)\),仅依赖前三个变量。 - 方法应用:比较四种策略——Full(全局)、Relevant(局部相关)、Relevant+Synth(局部+合成增强)、Super-Relevant+Synth(局部+合成+超相关过滤)。使用留一法共形协议,\(\alpha=0.10\)。 - 结果:所有策略达到96%经验覆盖(高于名义90%)。局部策略在点估计精度上优于全局:Relevant+Synth RMSE最低(3.379 vs. 3.416),Super-Relevant+Synth MAE最低(2.112 vs. 2.118)。局部策略区间更窄(12.63 vs. 13.70)。 - 想说明什么:①共形覆盖保证成立;②在因果相关子空间局部化足以改善点估计;③合成增强一致降低RMSE。
IHDP半合成数据(Section 6.1): - 数据:Hill (2011) 的标准基准,结合真实协变量(来自随机试验)与模拟结果(Response B),\(N=747\),\(p=25\)。 - 结果:所有策略达到100%经验覆盖。Relevant+Synth在RMSE(0.399 vs. 0.437)、MAE(0.298 vs. 0.333)和区间宽度(8.007 vs. 8.094)上均优于全局基线。 - 想说明什么:在更现实的设定下,局部策略的优势仍然成立,且超相关过滤在点估计上进一步改进。
LaLonde (1986) 数据(Section 6.2): - 仅用于说明,无真实ITE基准。区间宽度约\(31,678-\)35,858,反映个体层面收入效应的大不确定性。
🔎 结论是否比证明窄¶
是。Theorem 1 严格证明的是边际覆盖,但作者在introduction和讨论中反复声称“近似条件覆盖”。这一声称在论文中仅有启发式论证(Section 3.3末尾:“Under the additional condition that \(f(x, t, \varepsilon)\) is approximately constant within \(\mathcal{R}_q^{*(t)}\), the marginal coverage approaches the conditional level”),没有严格定理、收敛速率或有限样本界。这是本文理论贡献与实证声称之间的主要差距。
此外,Theorem 1 的证明依赖于“将 \(\hat{\mu}^{(t)}\) 视为固定函数”,这在实际中是通过条件于训练数据实现的。但Causal Forest的honest splitting和OOB构造如何精确保证这一点,论文未给出形式化论证。
四、开放问题(点到为止,扎根具体语句)¶
-
条件覆盖的严格理论:Theorem 1 仅保证边际覆盖。作者声称局部设计支持“近似条件覆盖”,但未给出任何收敛速率或有限样本界。扎根点:Section 3.3末尾“Under the additional condition that \(f(x, t, \varepsilon)\) is approximately constant within \(\mathcal{R}_q^{*(t)}\), the marginal coverage approaches the conditional level”——这个“approaches”需要量化:需要多强的局部常数性?收敛速率是多少?能否构造反例说明局部校准可能恶化条件覆盖?
-
合成增强的理论性质:合成数据增强(Gaussian perturbation + 局部线性模型插补)被用于缓解小样本问题,但其对覆盖保证的影响未被理论刻画。扎根点:Section 4.1 Stage 2描述合成增强步骤,但Theorem 1的证明假设校准集仅包含真实观测。合成观测的加入是否破坏交换性?如果破坏,覆盖保证是否仍然成立(可能以保守为代价)?
-
高维下的变量选择一致性:Causal Forest变量重要性用于定义因果相关子空间,但本文未证明该重要性得分在 \(p \gg n\) 时能否一致地识别出真正因果变量。扎根点:Section 4.1 Stage 1使用“variable importance scores \(\omega_j\) from a global Causal Forest”——当噪声变量远多于因果变量时,Causal Forest的变量重要性是否可靠?是否存在理论保证?
-
扩展到IV/纵向设定:作者在Discussion中提及“a natural extension replaces unconfoundedness with an instrumental variable strategy”,但未给出任何具体识别条件或校准集定义。扎根点:Section 7最后一段“Conformal prediction for IV-identified effects remains largely unexplored”——这是一个明确的开放方向,但需要解决:在IV设定下,校准集如何定义?局部LATE的共形区间如何构造?
Maintained by 陈星宇 · Homepage · Source on GitHub