Conformalized Lee Inference: Distribution-Free Individual Treatment Effect Intervals under Monotone Sample Selection¶
作者: Jung Hyub Lee
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.02898
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在随机化实验中,当结果变量仅对部分样本可观测(样本选择问题),且处理本身会影响谁被观测到时,如何为个体处理效应(ITE)构造有效的预测区间。核心困难在于,处理组和对照组的可观测子群来自不同的潜在人群,因此标准预测方法(如共形预测)因可观测样本与目标人群的分布不匹配而失效。当前该方向的成熟度处于“从平均效应推断向个体水平推断过渡”的阶段,已有成熟的平均效应识别方法(Lee bounds),但个体水平的分布自由预测方法尚在发展中。
发展脉络(history)¶
-
奠基工作:Lee [2009]:提出单调样本选择假设(处理不会使原本可观测的个体变得不可观测),并在此假设下为平均处理效应(ATE)构造了sharp bounds。核心思想是:通过修剪处理组可观测结果分布的上尾或下尾,来消除边际进入(marginal-in)单元的污染。留下的口子:只处理了平均效应,无法回答个体水平的预测问题。
-
主要进展(平均效应方向):
- Honoré and Hu [2020, 2024]:在不使用排他性约束的情况下处理样本选择模型,关注参数异质性和部分识别。作者定位:这些工作是Lee bounds在更丰富设定下的扩展。
- Heiler [2024]:在协变量丰富的选择模型下处理异质性处理效应界。作者定位:将Lee-type选择校正扩展到协变量丰富设定。
- Semenova [2025]:提出广义Lee界。作者定位:扩展了Lee界的形式。
- Lee and Liu [2024]:处理连续处理变量下的样本选择。作者定位:扩展了Lee界适用的处理类型。
- Kurisu et al. [2026]:将Lee界扩展到随机对象(random objects)。作者定位:扩展了Lee界适用的结果类型。
-
Dong and Heiler [2026]:处理处理内生性下的样本选择。作者定位:扩展了Lee界适用的识别假设。
-
当前frontier(个体水平预测方向):
- 共形预测基础:Vovk et al. [2005] 提出共形预测框架;Lei et al. [2018] 发展分裂共形预测。作者定位:标准共形预测在可交换性假设下有效,但本文设定下校准样本与目标样本不可交换。
- 分布偏移下的共形预测:Tibshirani et al. [2019] 处理协变量偏移下的加权共形预测;Barber et al. [2023] 处理超越可交换性的共形预测。作者定位:这些方法需要已知或可估计的密度比,而本文中密度比仅被部分识别(有上界)。
- 共形因果推断:Lei and Candès [2021] 开发反事实和ITE的共形方法;Chernozhukov et al. [2021] 将共形思想用于反事实和合成控制推断。作者定位:这些方法假设无样本选择问题。
-
鲁棒共形敏感性分析:Jin et al. [2023] 提出PAC鲁棒共形程序;Yin et al. [2024] 开发ITE的共形敏感性分析。作者定位:这些方法的鲁棒性类由分析者选择的敏感性参数生成,而本文的鲁棒性类由单调选择假设和观测到的选择率识别。
-
本文的位置:本文是第一个将Lee的单调选择逻辑与共形预测结合的工作,将识别问题从平均效应扩展到个体水平预测,并利用部分识别结构导出闭式校准调整。
子线索聚类¶
-
平均效应识别(Lee bounds及其扩展):Lee [2009], Honoré and Hu [2020, 2024], Heiler [2024], Semenova [2025], Lee and Liu [2024], Kurisu et al. [2026], Dong and Heiler [2026]。这一簇关注在单调选择下识别和估计平均或分布因果参数。
-
共形预测与分布偏移:Vovk et al. [2005], Lei et al. [2018], Tibshirani et al. [2019], Barber et al. [2023]。这一簇关注在可交换性假设或已知密度比下构造分布自由预测区间。
-
共形因果推断与敏感性分析:Lei and Candès [2021], Chernozhukov et al. [2021], Jin et al. [2023], Yin et al. [2024], Yadlowsky et al. [2022], Dorn and Guo [2023], Dorn et al. [2025]。这一簇关注在因果推断中使用共形预测,通常需要无混淆或已知敏感性参数。
-
主分层与部分识别:Frangakis and Rubin [2002], Zhang and Rubin [2003], Huber [1981], Horowitz and Manski [1995], Manski [2003]。这一簇提供概念框架(主分层)和数学工具(污染模型、部分识别)。
这个方向在追问的核心问题¶
- 如何从平均效应推断扩展到个体水平推断? 当前主流方法(Lee bounds)只给出ATE的区间,无法为特定个体的反事实结果或ITE提供预测区间。
- 如何在分布偏移下保持共形预测的有效性? 当校准样本与目标样本的分布关系仅被部分识别(而非已知密度比)时,如何调整校准阈值?
- 如何将部分识别结构与共形预测的鲁棒校准结合? 能否利用识别假设导出的分布约束来构造闭式校准调整,而非依赖数值优化或PAC下界?
- 已知瓶颈:现有共形因果推断方法要么假设无样本选择(Lei and Candès [2021]),要么需要分析者指定敏感性参数(Jin et al. [2023]),无法直接利用单调选择假设导出的识别结构。
⚠️ 作者的framing¶
作者把缺口frame成:Lee [2009] 的单调选择逻辑可以用于构造个体水平预测区间,而不仅仅是平均效应界。作者将本文定位为“Lee-type nesting → 分布识别 → 共形校准”的链条,使得本文成为Lee [2009] 在个体预测方向上的“显然的下一步”。
被淡化或回避的竞争路线: - 作者将Tibshirani et al. [2019] 和 Barber et al. [2023] 的分布偏移共形预测定位为“需要已知或可估计的密度比”,从而突出本文“仅需密度比上界”的优势。但作者没有讨论:如果π(x)可以通过协变量条件选择率估计,是否可以用加权共形预测(Tibshirani et al. [2019])得到更紧的区间? - 作者将Jin et al. [2023] 的PAC鲁棒共形程序定位为“需要分析者选择敏感性参数”,从而突出本文“鲁棒性类由识别假设导出”的优势。但作者没有讨论:如果π未知,本文的plug-in和lower-bound实现本质上也是一种敏感性分析(对π的敏感性)。
什么明显该被引/该存在、却没出现在intro里? - 没有引用任何关于高维协变量下选择率估计的工作(如LASSO-based propensity score estimation),尽管作者在future work中提到了“估计局部选择份额π(x)在高维设定下的统计问题”。 - 没有引用任何关于共形预测与半参数效率结合的工作(如debiased ML + conformal),尽管这与研究者(陈星宇)的武器库直接相关。
张力¶
未见明显对立引用。所有被引工作基本在Lee [2009] 的单调选择框架下扩展,彼此之间没有根本性矛盾。一个潜在的张力是:Tibshirani et al. [2019] 的加权共形预测在已知密度比下可以更紧,而本文的方法在仅知密度比上界下更鲁棒——但这两种方法服务于不同的信息结构,并非对立。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \(D_i \in \{0,1\}\):处理分配(随机化)。 - \(X_i \in \mathcal{X} \subseteq \mathbb{R}^d\):预处理协变量。 - \(Y_i(1), Y_i(0)\):潜在结果(处理/对照)。 - \(S_i(1), S_i(0) \in \{0,1\}\):潜在选择指示变量(处理/对照下是否被观测到)。 - \(S_i = D_i S_i(1) + (1-D_i) S_i(0)\):实际选择指示变量。 - \(Y_i = D_i Y_i(1) + (1-D_i) Y_i(0)\):实际观测到的结果(仅当 \(S_i=1\) 时)。 - \(p_d = \Pr(S(d)=1)\),\(d \in \{0,1\}\):处理/对照下的选择概率。 - \(\pi = p_0 / p_1\):处理组可观测单元中始终可观测(always-selected)单元的比例。 - \(Z = (X, Y(1)) \in \mathcal{Z} = \mathcal{X} \times \mathcal{Y}\):协变量与处理潜在结果的联合变量。 - \(P = \mathcal{L}(Z \mid S(1)=1)\):处理组可观测单元的分布(可识别)。 - \(Q_0 = \mathcal{L}(Z \mid \mathcal{A})\):始终可观测单元的分布(目标分布,不可直接观测)。 - \(\mathcal{A} = \{S(0)=S(1)=1\}\):始终可观测层(principal stratum)。 - \(\mathcal{M} = \{S(0)=0, S(1)=1\}\):边际进入层。 - \(\mathcal{N} = \{S(0)=S(1)=0\}\):从未可观测层。
模型: - 随机化(Assumption 1):\((Y(1), Y(0), S(1), S(0), X) \perp\!\!\!\perp D\)。 - 单调选择(Assumption 2):\(S(1) \geq S(0)\) 几乎必然。 - 正性(Assumption 3):存在 \(\eta_0, \eta_1 > 0\) 使得 \(\eta_0 < p_0 < 1-\eta_0\) 且 \(\eta_1 < p_1 < 1-\eta_1\)。
可观测数据:\(\{(D_i, X_i, S_i, S_i Y_i)\}_{i=1}^n\)。即: - 对所有单元:处理分配 \(D_i\)、协变量 \(X_i\)、选择指示 \(S_i\)。 - 仅对 \(S_i=1\) 的单元:观测到结果 \(Y_i\)。 - 对 \(S_i=0\) 的单元:结果缺失。
想要但观测不到的量: - 始终可观测单元的处理潜在结果 \(Y(1)\) 的分布 \(Q_0\)(目标分布)。 - 每个处理组可观测单元属于 \(\mathcal{A}\) 还是 \(\mathcal{M}\) 的身份。 - 边际进入单元的处理潜在结果分布 \(R = \mathcal{L}(Z \mid \mathcal{M})\)。
第二步:讲最小内核¶
最简特例:假设 \(d=1\)(单协变量),且我们只关心无条件(不利用协变量)的预测区间。此时,\(P\) 和 \(Q_0\) 都是 \(\mathbb{R}\) 上的分布(\(Y(1)\) 的分布),没有 \(X\)。
在这个特例下: - 可观测数据:处理组可观测样本 \(\{Y_i : D_i=1, S_i=1\}\) 来自混合分布 \(P = \pi Q_0 + (1-\pi)R\),其中 \(Q_0\) 是目标分布(始终可观测单元),\(R\) 是边际进入单元的分布(完全未知)。 - 目标:为来自 \(Q_0\) 的一个新样本 \(Y_{\text{new}}\) 构造 \(1-\alpha\) 预测区间。 - 核心困难:校准样本来自 \(P\),但目标样本来自 \(Q_0\),两者不同。
核心思路: 1. 识别约束:由单调选择,\(Q_0\) 必须被 \(P\) 控制,且似然比不超过 \(1/\pi\)。即对任何事件 \(A\),\(Q_0(A) \leq P(A)/\pi\)。 2. 校准调整:要保证 \(Q_0(Y_{\text{new}} > t) \leq \alpha\),只需保证 \(P(Y > t) \leq \alpha\pi\)。因此,应使用 \(P\) 的 \(1-\alpha\pi\) 分位数作为阈值,而非通常的 \(1-\alpha\) 分位数。 3. 实现:从处理组可观测样本中计算 \(1-\alpha\pi\) 样本分位数 \(\hat{t}\),预测区间为 \((-\infty, \hat{t}]\)(或双侧类似)。
为什么成立: - 设 \(t^* = F_P^{-1}(1-\alpha\pi)\),其中 \(F_P\) 是 \(P\) 的CDF。 - 对任意 \(Q \in \mathcal{Q}(P, \pi)\)(满足似然比约束的分布),有 \(Q(Y > t^*) \leq P(Y > t^*)/\pi = \alpha\)。 - 因此,\(Q(Y \leq t^*) \geq 1-\alpha\)。 - 样本分位数 \(\hat{t}\) 是 \(t^*\) 的有限样本估计,Theorem 1 给出了精确的有限样本覆盖保证。
这个最小内核揭示了论文的核心数学操作:将部分识别问题(\(Q_0\) 未知但属于一个集合)转化为鲁棒校准问题(选择阈值使得最坏情况下的覆盖达到名义水平)。校准调整量 \(\alpha \to \alpha\pi\) 直接来自似然比上界 \(1/\pi\)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在随机化实验中,当结果变量仅对部分样本可观测且处理影响选择时,为始终可观测单元的个体处理效应(ITE)构造分布自由的预测区间。
- 核心工具/方法:将Lee [2009] 的单调选择逻辑转化为分布识别问题(Lee ambiguity set),然后利用该集合的似然比上界将标准共形预测的校准分位数从 \(1-\alpha\) 调整为 \(1-\alpha\pi\),其中 \(\pi = p_0/p_1\) 是始终可观测单元在处理组可观测样本中的比例。
- 主要结论:该调整后的共形预测区间具有有限样本、分布自由的覆盖保证,且该调整是sharp的——任何更小的阈值都会对某些观测等价的数据生成过程失效。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- Assumption 1(随机化):\((Y(1), Y(0), S(1), S(0), X) \perp\!\!\!\perp D\)。含义:处理分配独立于所有潜在变量。相比已有文献:标准假设,与Lee [2009] 相同。
- Assumption 2(单调选择):\(S(1) \geq S(0)\) 几乎必然。含义:处理不会使原本可观测的个体变得不可观测。相比已有文献:与Lee [2009] 相同,但本文将其用于分布识别而非仅平均效应。
- Assumption 3(正性):存在 \(\eta_0, \eta_1 > 0\) 使得 \(\eta_0 < p_0 < 1-\eta_0\) 且 \(\eta_1 < p_1 < 1-\eta_1\)。含义:选择概率非退化。相比已有文献:标准正性假设。
额外定义: - Lee ambiguity set(Definition 1):\(\mathcal{Q}(P, \pi) = \{Q \ll P : 0 \leq dQ/dP \leq 1/\pi \text{ P-a.s.}\}\)。这是所有与观测数据 \((P, p_0, p_1)\) 一致的始终可观测目标分布的集合。 - 主分层:\(\mathcal{A} = \{S(0)=S(1)=1\}\)(始终可观测),\(\mathcal{M} = \{S(0)=0, S(1)=1\}\)(边际进入),\(\mathcal{N} = \{S(0)=S(1)=0\}\)(从未可观测)。
主要结果¶
Proposition 1(必要性):在Assumptions 1-3下,真实目标分布 \(Q_0\) 属于 \(\mathcal{Q}(P, \pi)\)。即 \(Q_0 \ll P\) 且 \(dQ_0/dP \leq 1/\pi\) P-a.s.。直觉:因为 \(\{S(0)=1\} \subseteq \{S(1)=1\}\),所以对任何事件 \(B\),\(\pi Q_0(B) \leq P(B)\)。解决的技术难点:将Lee的修剪论证从结果分布提升到联合分布 \((X, Y(1))\)。
Proposition 2(sharpness):\(\mathcal{Q}(P, \pi)\) 是相对于缩减可观测信息 \((P, p_0, p_1)\) 的sharp识别区域。即每个 \(Q \in \mathcal{Q}(P, \pi)\) 都可以由某个满足Assumptions 1-3且匹配 \((P, p_0, p_1)\) 的数据生成过程产生。直觉:构造性证明——给定任意候选 \(Q\),定义残差分布 \(R = (P - \pi Q)/(1-\pi)\),然后构造主分层使得 \(\mathcal{A}\) 的分布为 \(Q\),\(\mathcal{M}\) 的分布为 \(R\)。解决的技术难点:需要证明 \(R\) 是有效的概率测度(由 \(dQ/dP \leq 1/\pi\) 保证)。
Theorem 1(有限样本覆盖):设 \(\hat{\pi}\) 是算法使用的估计值,则预测集 \(\hat{C}_1(x)\) 满足
Proposition 3 & 4(minimax最优性):在 \(\mathcal{Q}(P, \pi)\) 上,最坏情况下的尾概率为 \(\sup_{Q \in \mathcal{Q}(P, \pi)} Q(V > t) = \min\{1, P(V > t)/\pi\}\)。因此,最小的一致有效人口阈值为 \(t^* = F_P^{-1}(1-\alpha\pi)\)。直觉:任何更小的阈值都会对某个观测等价的 \(Q\) 失效。解决的技术难点:构造达到上界的 \(Q_t\)(当 \(P(V>t) \leq \pi\) 时在 \(A_t\) 上设置密度 \(1/\pi\),否则设置条件分布 \(P(\cdot \mid A_t)\))。
Corollary 1(ITE预测):对于对照组的可观测单元(已知属于 \(\mathcal{A}\)),ITE预测集为 \(\hat{C}_\tau(x, y_0) = \hat{C}_1(x) - y_0\),且满足相同的覆盖保证。
证明路线与技术技巧¶
整体路线(Theorem 1的证明): 1. 条件化:固定 \(\mathcal{H}\)(训练集、选择样本、随机分割),则校准分数 \(V_i\) i.i.d. 来自 \(P\),目标分数 \(V_{m+1}\) 来自 \(Q\)。 2. 似然比上界:由 \(Q \in \mathcal{Q}(P, \pi)\),有 \(Q(V > t) \leq P(V > t)/\pi\)。 3. 引入辅助变量:构造 \(Z^\circ_{m+1} \sim P\) 独立于校准样本,则 \(P(V > \hat{t}) = \Pr(V^\circ_{m+1} > \hat{t} \mid \mathcal{H})\)。 4. 可交换秩论证:将 \((V_1, \ldots, V_m, V^\circ_{m+1})\) 与独立均匀变量 \(U_i\) 结合,构造字典序分数 \(W_i = (V_i, U_i)\)。由于 \(W_i\) 几乎必然不同且可交换,\(W^\circ_{m+1}\) 的秩在 \(\{1, \ldots, m+1\}\) 上均匀分布。 5. 事件包含:\(\{V^\circ_{m+1} > V_{(k)}\} \subseteq \{R \geq k+1\}\),其中 \(R\) 是 \(W^\circ_{m+1}\) 的秩。 6. 概率界:\(\Pr(V^\circ_{m+1} > V_{(k)} \mid \mathcal{H}) \leq (m+1-k)/(m+1)\)。 7. 合并:\(\Pr_Q(V_{m+1} > \hat{t} \mid \mathcal{H}) \leq (m+1-k)/((m+1)\pi)\)。 8. 误差项:由 \(k = \lceil (m+1)(1-\alpha\hat{\pi}) \rceil\) 得 \((m+1-k)/(m+1) \leq \alpha\hat{\pi}\),因此误差 \(\hat{\Delta} \leq \frac{\alpha}{\pi}(\hat{\pi} - \pi)_+\)。
关键跳跃点: - 从 \(Q(V > t) \leq P(V > t)/\pi\) 到有限样本覆盖:需要将 \(P(V > \hat{t})\) 转化为可交换秩事件。这里的关键技巧是引入辅助变量 \(Z^\circ_{m+1} \sim P\),使得 \(P(V > \hat{t}) = \Pr(V^\circ_{m+1} > \hat{t} \mid \mathcal{H})\),然后利用可交换性。 - 处理分数分布有原子:通过引入独立均匀变量 \(U_i\) 进行字典序排序,实现随机破平(random tie-breaking),使得分数几乎必然不同,秩均匀分布成立。
技术技巧点名: - 可交换秩论证(Kuchibhotla [2020]):用于将尾概率转化为秩事件。用在步骤4-6。 - 随机破平:通过独立均匀变量实现字典序排序。用在步骤4。 - 似然比上界:由单调选择导出的分布约束。用在步骤2。 - 辅助变量法:引入 \(Z^\circ_{m+1} \sim P\) 将目标尾概率转化为可交换事件。用在步骤3。
真实例子与应用¶
本文为纯理论+模拟研究,无真实数据例子。模拟部分(Section 5)包含四个数据生成过程(DGP): - Benign:始终可观测状态独立于 \((X, U_1, Y(1))\),因此 \(P = Q\),无分布偏移。 - Conditional tail:始终可观测单元被分配到条件上尾的 \(|U_1|\),产生近最坏情况的分数偏移。 - Unconditional tail:始终可观测单元被分配到无条件上尾的 \(|U_1|\),同时由于 \(\sigma(X)\) 依赖于 \(X_1\),也产生协变量偏移。 - Smooth:使用logistic模型根据 \(X_1\) 和标准化残差 \(|U_1|/\sigma(X)\) 概率性地分配始终可观测状态。
模拟结果: - Naive conformal(\(\hat{\pi}=1\)):在Benign DGP下覆盖接近名义水平(gap=0.003),但在Conditional tail(gap=-0.273)、Unconditional tail(gap=-0.284)、Smooth(gap=-0.135)下严重欠覆盖。 - Oracle Lee(使用真实 \(\pi\)):在所有DGP下恢复覆盖,gap在0.011到0.066之间。 - Plug-in Lee(使用 \(\hat{\pi} = \min\{1, \hat{p}_0/\hat{p}_1\}\)):表现接近Oracle Lee,gap在0.012到0.067之间。 - CP-Lee和Hoeffding-Lee(使用下置信界):保守,gap为正(0.115到0.244)。
这些例子想说明: 1. 当选择导致分布偏移时,标准共形预测失效。 2. Lee调整(使用真实或估计的 \(\pi\))能有效恢复覆盖。 3. 下界实现(CP-Lee, Hoeffding-Lee)提供保守但保证的覆盖。 4. Lee调整对分数函数的选择(oracle residual, fitted residual, CQR)具有鲁棒性。
🔎 结论是否比证明窄¶
- Theorem 1 的覆盖保证是边际的(marginal over the selected-control population),而非条件于特定个体的协变量和未处理结果。作者在Introduction中明确说明了这一点("The resulting guarantee is marginal over the selected-control population, not conditional on a fixed individual's covariates and untreated outcome.")。这意味着对于特定个体,区间可能欠覆盖或过覆盖。
- Corollary 1 的ITE覆盖保证同样是边际的,且依赖于“随机抽取的对照可观测单元”这一解释。对于非随机抽取的单元,保证不成立。
- Proposition 3 & 4 的minimax最优性是在缩减信息 \((P, p_0, p_1)\) 下证明的。作者在Appendix中给出了完整观测信息下的sharp识别区域 \(\mathcal{Q}_{\text{full}}\),但没有证明基于 \(\mathcal{Q}_{\text{full}}\) 的校准阈值是否更紧或如何构造。作者在Conclusion中将其列为未来工作。
- 模拟中,作者使用了“same-\(\alpha\) convention”处理CP-Lee和Hoeffding-Lee,即使用相同的名义误覆盖 \(\alpha\) 但形式目标为 \(1-\alpha-\delta_\pi\)。这意味着这些方法的实际覆盖目标低于名义水平,作者在Table 3和Table 4的注释中明确说明了这一点。
四、开放问题¶
-
协变量自适应Lee方法:作者在Conclusion中提出,基于条件ambiguity set \(\mathcal{Q}_x \ll P_x, 0 \leq dQ_x/dP_x(y) \leq 1/\pi(x)\) 开发完全协变量自适应的共形化Lee方法,可能比缩减信息程序产生更短的区间。扎根点:Conclusion第一段("A promising next step is to develop fully covariate-adaptive conformalized Lee methods based on the conditional ambiguity set...")和Appendix 7.3(完整观测信息识别)。
-
高维设定下局部选择份额 \(\pi(x)\) 的估计:作者指出,使用灵活机器学习估计量、交叉拟合和单侧置信带可能使完整观测信息版本实用化,主要挑战是在避免过度保守的同时保持有限样本或高概率覆盖。扎根点:Conclusion第二段("Future work should study the statistical problem of estimating local selection shares \(\pi(x)\) in high-dimensional settings.")。
-
超越二元处理和单调选择的扩展:连续或多值处理、动态处理制度、随时间流失、竞争选择机制都会产生相关的主分层预测问题。扎根点:Conclusion第三段("The framework can be extended beyond binary treatment and monotone sample selection.")。
-
单调性违反的敏感性分析:允许受控数量的违抗者(defier)或双向选择,并推导相应的鲁棒共形阈值。扎根点:Conclusion第四段("there is room to connect conformalized Lee inference with sensitivity analysis for violations of monotonicity.")。
提醒:要确认这些是否是真正的gap,建议阅读近5篇相关论文(如Heiler [2024], Semenova [2025], Jin et al. [2023], Yin et al. [2024], Barber et al. [2023])的Introduction,看它们是否都指向相同的方向(共识=真gap)或互相打架(机会)。
Maintained by 陈星宇 · Homepage · Source on GitHub