COMPACT: Spectral Adjustment Scores from a Complete and Irreducible Causal Criterion¶
作者: Eric V. Strobl
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2608.10305
一、领域脉络与小综述¶
-
这个方向是什么:本子方向解决的根本问题是:在观测研究中,当存在大量基线协变量(高维、混合类型、有噪声)且研究者不确定哪些变量是真正的混杂因素时,如何自动地、有原则地从这些变量中提取一个低维的调整得分(adjustment score),使得基于该得分的因果效应估计(如ATE、CATE)是有效的。其核心挑战在于,得分既要保留足够的混杂控制信息(即与处理分配相关),又要避免被仅预测处理但不影响结局的变量所主导(即要与结局相关),同时还要能处理混杂变量未被直接观测、仅通过代理变量(proxy variables)部分观测的情况。
-
发展脉络(history):该领域的发展可大致分为三条交织的线索,本文(Strobl, 2026)试图将它们统一在一个谱系框架下。
-
倾向得分及其扩展:奠基工作是 Rosenbaum & Rubin (1983) 提出的倾向得分(propensity score),它证明在给定倾向得分的条件下,处理分配与协变量条件独立,从而将高维协变量压缩为标量。然而,作者引用 Brookhart et al. (2006) 指出,倾向得分模型会吸收“仅预测处理、与结局无关”的变异,导致方差增大或有限样本不稳定。后续工作如 Covariate Balancing Propensity Score (CB-PS; Imai & Ratkovic, 2014) 通过直接优化协变量平衡来改进,但作者在模拟中发现CB-PS在高维(p=500)时性能急剧恶化。Outcome-Adaptive Lasso (OAL-PS; Shortreed & Ertefaie, 2017) 则试图在倾向得分模型中引入结局信息,通过惩罚项让结局相关变量被更少地惩罚。
-
结局导向的得分与双重得分:Hansen (2008) 提出了预后得分(prognostic score),作为倾向得分的结局侧类比。Leacy & Stuart (2014) 进一步探索了联合使用倾向得分和预后得分(DOUBLE)进行匹配或调整。作者指出,这些得分通常通过独立的处理模型和结局模型分别估计,仅在调整阶段才结合。Double/Debiased Machine Learning (DML; Chernozhukov et al., 2018) 也采用类似的分步估计策略,通过Neyman正交性来估计处理效应。本文的COMPACT与这些方法的关键区别在于,它联合地使用处理和残差结局信息来定义调整表示本身,而非事后组合。
-
代理变量方法与充分降维:当混杂变量未观测到时,Proximal Causal Inference (Miao et al., 2018; Tchetgen Tchetgen et al., 2024) 通过引入特定的代理变量(proxy)和负对照(negative control)来识别因果效应,这通常需要为变量分配特定的因果角色并求解桥函数(bridge function)。本文的设定不同:它假设存在一个高维的基线特征系统X,其中每个变量都是潜在基线状态C的部分、有噪声、有重叠的测量,而不是被明确区分为不同的代理角色。因此,COMPACT自然地与充分降维(Sufficient Dimension Reduction, SDR)联系起来,如Sliced Inverse Regression (SIR; Li, 1991) 和Cook & Ni (2005) 的方法,它们寻找保留结局回归信息的低维投影。但作者强调,SDR的目标主要是结局导向的,并未同时保留处理分配信息。
-
子线索聚类:
- 线索一:基于处理的得分(Propensity Score及其变体):核心是估计P(T|X),然后基于此进行匹配、加权或分层。代表:Rosenbaum & Rubin (1983), Imai & Ratkovic (2014), Shortreed & Ertefaie (2017)。
- 线索二:基于结局的得分与双重得分(Prognostic Score, DML):核心是估计E(Y|X)或同时估计处理与结局的 nuisance 函数。代表:Hansen (2008), Leacy & Stuart (2014), Chernozhukov et al. (2018)。
-
线索三:代理变量与充分降维(Proximal CI, SDR):核心是在未观测混杂或高维协变量下,利用代理变量或降维技术恢复混杂信息。代表:Miao et al. (2018), Tchetgen Tchetgen et al. (2024), Li (1991), Cook & Ni (2005)。
-
这个方向在追问的核心问题:
- 如何定义一个得分,使其在控制混杂方面既“完整”(包含所有必要信息)又“不可约”(不包含冗余信息)?
- 如何在无需预先指定调整集的情况下,从高维代理变量中自动学习这样一个得分?
- 如何量化因代理信息不足和有限样本估计导致的因果误差?
-
如何对包含得分学习步骤的完整流程进行有效的统计推断(如bootstrap)?
-
⚠️ 作者的 framing:作者将缺口 frame 为:现有方法要么只关注处理预测(倾向得分),要么只关注结局预测(预后得分/SDR),或者将两者分开估计再组合(DOUBLE/DML),缺乏一个联合地、谱系地从处理和残差结局信息中学习调整表示的框架。作者声称,其提出的“完整且不可约的因果准则”(Theorem 1)是第一个从图论角度严格定义得分应满足的、对处理效应存在性不变的条件。作者淡化了 Proximal CI 的路线,将其定位为“需要为变量分配特定因果角色”的设定,而 COMPACT 处理的是“未分区的代理系统”。什么明显该被引/该存在、却没出现在 intro 里? 作者没有引用任何关于“统计-计算权衡”(statistical-computational tradeoff)或“低度多项式障碍”(low-degree polynomial barrier)的文献。考虑到 COMPACT 的核心是一个广义特征值问题,其计算复杂度是多项式时间的,但理论部分并未讨论是否存在更优的、但计算上不可行的估计量(例如,基于全似然的估计),也未讨论其方法是否达到了某种信息论下界。对于一位对计算约束统计感兴趣的研究者,这是一个值得追问的空白。
-
张力:未见明显对立引用。各条线索的文献之间更多是互补关系,而非矛盾。例如,倾向得分和预后得分被明确视为可以联合使用的工具。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(i = 1, \dots, n\):观测单元索引。
- \(T_i\):处理变量(标量,可为二值或连续)。
- \(Y_i\):结局变量(标量)。
- \(X_i \in \mathbb{R}^p\):观测到的预处理协变量向量(高维代理变量)。
- \(C_i \in \mathbb{R}^{d_C}\):未观测的潜在基线状态(混杂变量),是调整所需的充分统计量。
- \(U_{T,i} = a^\top C_i\):处理平衡变量(treatment-balancing variable),一个标量,是\(C_i\)的线性组合,且处理分配仅通过它依赖于\(C_i\)。
- \(U_{R,i} = (b + h_q)^\top C_i\):结局导向变量(outcome-guided variable),一个标量,是\(C_i\)的另一个线性组合,与结局相关。
- \(U_i = (U_{T,i}, U_{R,i})^\top\):潜在的二维调整向量。
- \(\beta \in \mathbb{R}^p\):候选得分方向系数向量。
- \(S_{\beta,i} = X_i^\top \beta\):候选标量得分。
- \(S_i = (S_{i,1}, S_{i,2})^\top\):COMPACT 学习到的二维得分向量。
- \(\tau = \mathbb{E}[Y_i(1) - Y_i(0)]\):平均处理效应(ATE)。
-
\(\tau_S(s) = \mathbb{E}[Y_i(1) - Y_i(0) | S_i = s]\):得分索引的条件平均处理效应(CATE)。
-
模型:
- 潜在结果模型:\(Y_i(t) = \alpha + b^\top C_i + t\{\gamma + q^\top C_i\} + \varepsilon_{Y,i}(t)\),其中\(\mathbb{E}[\varepsilon_{Y,i}(t) | C_i, T_i] = 0\)。这意味着CATE是线性的:\(\tau_C(t, t_0; C_i) = (t-t_0)\{\gamma + q^\top C_i\}\)。
- 处理分配模型:\(\mathbb{P}(T_i \in A | C_i) = \mathbb{P}(T_i \in A | U_{T,i})\),即处理分配仅通过\(U_{T,i}\)依赖于\(C_i\)。对于二值处理,\(T_i | C_i \sim \text{Bernoulli}\{g(U_{T,i})\}\)。
-
代理变量模型:\(X_i \perp\!\!\!\perp \{T_i, Y_i(t)\} | C_i\),且\(\mathbb{E}[X_i | C_i] = \Lambda C_i\)。这意味着代理变量是非差异性的(nondifferential),且条件均值是线性的。
-
可观测数据:研究者能观测到的是\(\{Y_i, T_i, X_i\}_{i=1}^n\)。关键点是:真正的混杂变量\(C_i\)是不可观测的。研究者只能通过高维、有噪声的代理变量\(X_i\)来间接获取关于\(C_i\)的信息。COMPACT 的目标是从\(X_i\)中学习一个二维得分\(S_i\),使得调整\(S_i\)足以控制由\(C_i\)引起的混杂。
第二步:讲最小内核¶
最简特例:考虑一个极端简化的情形,其中: - 潜在状态\(C_i\)是一维标量(\(d_C = 1\))。 - 代理变量\(X_i\)也是一维标量(\(p = 1\)),且\(\mathbb{E}[X_i | C_i] = \lambda C_i\)(\(\lambda\)是标量)。 - 处理\(T_i\)是二值的,且\(\mathbb{P}(T_i = 1 | C_i) = \text{logit}^{-1}(a C_i)\),其中\(a\)是标量。因此\(U_{T,i} = a C_i\)。 - 结局模型简化为\(Y_i = b C_i + T_i \gamma + \varepsilon_{Y,i}\)(即\(q=0\),无效应异质性)。因此\(U_{R,i} = b C_i\)。 - 目标是估计ATE \(\tau = \gamma\)。
在这个特例下,COMPACT 的核心思想是什么? 1. 准则:我们要找一个标量得分方向\(\beta\)(这里\(\beta\)也是标量),使得得分\(S_{\beta,i} = \beta X_i\)同时满足两个条件: - \(S_{\beta,i} \not\!\perp\!\!\!\perp T_i\)(与处理相关) - \(S_{\beta,i} \not\!\perp\!\!\!\perp Y_i | T_i\)(在给定处理后与结局相关) 作者证明(Theorem 1),这两个条件是“完整且不可约”的,即它们是对处理效应存在性不变的、最严格的图类约束。
-
谱系实现:作者将上述准则转化为一个广义特征值问题。在标量情况下,这退化为寻找一个\(\beta\)最大化一个“乘积”准则。但为了得到闭式解,作者用算术平均归一化代替了几何平均归一化,最终求解:
\[\hat{H} \beta = \hat{\rho} \hat{G}_\eta \beta\]其中\(\hat{H}\)是一个秩至多为2的矩阵(在标量处理、标量结局下),\(\hat{G}_\eta\)是一个正则化的协方差矩阵。在标量\(X\)的特例下,\(\hat{H}\)和\(\hat{G}_\eta\)都是\(1 \times 1\)的标量,所以解就是\(\beta = 1\)(或任何非零标量),而\(\hat{\rho}\)就是目标函数值。这个解对应的得分\(S_i = X_i\)。 -
核心思路:在这个特例下,COMPACT 的“学习”过程是平凡的——它直接使用了代理变量\(X_i\)本身作为得分。但关键是,它证明了这个得分\(X_i\)恰好是潜在调整变量\(U_i = (a C_i, b C_i)^\top\)的线性预测(因为\(\mathbb{E}[X_i | C_i] = \lambda C_i\),所以\(X_i\)与\(C_i\)成比例,从而与\(U_i\)的每个分量都成比例)。因此,调整\(X_i\)等价于调整\(U_i\),从而控制了混杂。
为什么这个特例抓住了核心? 因为即使在这个最简单的设定下,COMPACT 的整个逻辑链条已经完整呈现: - 问题:混杂\(C_i\)未观测,只有代理\(X_i\)。 - 准则:得分必须同时与处理和残差结局相关。 - 方法:通过谱系方法(这里退化为平凡解)学习得分。 - 结果:学习到的得分空间(这里是一维)恢复了潜在调整空间(这里是二维的,但因为\(C_i\)是一维,所以\(U_{T,i}\)和\(U_{R,i}\)是线性相关的,其张成空间也是一维),从而保证了因果调整的有效性。
论文的一般情形(高维\(X\)、高维\(C\)、非线性处理模型)只是将这个核心思路推广到了更复杂的设定,其中得分空间是二维的,并且需要通过广义特征值分解来求解。
三、这篇论文做了什么¶
- 三句话:
- 研究了什么问题:在高维代理变量场景下,如何自动学习一个低维(二维)的调整得分,用于估计ATE和CATE,而无需预先指定调整集。
- 核心工具/方法:提出COMPACT算法,它通过一个广义特征值问题,联合地最大化得分与处理的相关性以及得分与残差结局的相关性,从而学习到一个同时包含处理平衡信息和结局导向信息的二维得分空间。
-
主要结论:理论上,COMPACT的得分空间在代理信息充分和样本量足够时,能一致地恢复潜在调整空间,且下游的因果估计误差由代理恢复误差和有限样本估计误差共同控制;同时,完整的bootstrap推断是有效的。模拟和实际数据应用显示COMPACT在ATE和CATE估计、潜在变量恢复和计算效率上优于多种现有方法。
-
关键设定与假设:
- 潜在结果模型:假设线性CATE(式5),即\(Y_i(t) = \alpha + b^\top C_i + t\{\gamma + q^\top C_i\} + \varepsilon_{Y,i}(t)\)。这是一个较强的参数假设,但作者在理论部分(Theorem 3)的假设中放宽为“平滑的潜在响应曲面”(Assumption 2c)。
- 处理分配模型:假设处理分配仅通过一个单指标\(U_{T,i} = a^\top C_i\)依赖于\(C_i\)(式3)。对于非线性\(m_T\)(如二值处理),还需额外假设线性条件(式4),即\(\mathbb{E}[C_i | U_{T,i}]\)是\(U_{T,i}\)的线性函数(这当\(C_i\)服从椭圆对称分布时成立)。
- 代理变量模型:假设代理变量是非差异性的(式8),即\(X_i \perp\!\!\!\perp \{T_i, Y_i(t)\} | C_i\),且条件均值是线性的\(\mathbb{E}[X_i | C_i] = \Lambda C_i\)。这是Proximal CI中的标准假设,但这里不要求将代理变量区分为不同的类型。
- 忠实性假设:用于图论准则(Theorem 1),确保观测到的条件独立关系能反映图结构。
-
线性可检测性:用于将图论准则中的条件独立关系转化为线性相关系数和偏相关系数是否为零的检验(式12)。这意味着非线性依赖关系可能被遗漏。
-
主要结果:
- Theorem 1 (图论准则):证明了得分\(S_\beta\)必须同时满足\(S_\beta \not\!\perp\!\!\!\perp T\)和\(S_\beta \not\!\perp\!\!\!\perp Y | T\),这是对处理效应存在性不变的、完整且不可约的原始关系集。这是整个方法的理论基础。
- Theorem 2 (空间恢复):证明了学习到的得分空间\(\hat{\mathcal{S}}_\eta\)与潜在调整空间\(\mathcal{U}\)之间的距离(投影范数)以\(O_p(1/p_{\text{eff}} + d_{\text{eff}}(\eta)/(n\Delta^2))\)的速率收敛到0。其中\(p_{\text{eff}}\)是有效代理强度,\(d_{\text{eff}}(\eta)\)是正则化有效维度,\(\Delta\)是谱间隙。这分离了代理恢复误差和有限样本估计误差。
- Theorem 3 (因果一致性):证明了在适当的正则性条件下,基于COMPACT得分的下游ATE和CATE估计量的误差也以\(O_p((1/p_{\text{eff}} + d_{\text{eff}}(\eta)/(n\Delta^2))^{1/2})\)的速率收敛到0。这建立了空间恢复与因果估计质量之间的直接联系。
-
Theorem 4 (Bootstrap有效性):证明了当下游使用OLS时,完整流程(重新学习得分+重新拟合下游模型)的非参数bootstrap是有效的,即bootstrap分布能一致地逼近估计量的抽样分布。
-
证明路线与技术技巧:
-
整体路线:
- 图论基础:通过d-分离和忠实性假设,证明得分应满足的“完整且不可约”的图论准则(Theorem 1)。
- 谱系转化:将图论准则转化为一个广义特征值问题,通过最大化一个乘积型目标函数(式12)并采用算术平均归一化来获得闭式解(Section 5.1)。
- 潜在空间连接:在给定的参数模型下,证明COMPACT的广义特征空间对应于潜在调整变量\(U_i\)的岭正则化线性预测(Proposition 1)。
- 误差分解:将学习到的得分空间与潜在调整空间的距离分解为两部分:一是从有限样本估计谱系目标(即人口COMPACT得分空间\(\mathcal{S}_\eta\))的误差(Lemma 1),二是人口COMPACT得分空间与潜在调整空间\(\mathcal{U}\)之间的代理恢复误差(Lemma 2)。Theorem 2通过三角不等式将两者结合。
- 因果误差传播:在假设下游学习器一致且潜在响应曲面平滑的条件下,将空间恢复误差转化为下游因果估计的偏差,从而证明因果一致性(Theorem 3)。
- Bootstrap推断:通过证明COMPACT得分空间的投影算子是经验矩的连续可微函数(Lemma 10),并利用Delta方法和bootstrap的线性表示,证明完整流程的bootstrap有效性(Theorem 4)。
-
关键跳跃点:
- 从图论到谱系:将非凸的乘积准则(式12)替换为算术平均归一化的谱系准则(式13),从而得到一个可解的广义特征值问题。作者通过模拟验证了这种替换的有效性,但理论上并未证明两者等价,这是一个近似。
- 从广义特征向量到潜在变量:Proposition 1的证明依赖于一系列线性代数操作和模型假设(特别是线性条件均值假设式4),将广义特征空间与潜在调整变量的线性预测联系起来。这是连接方法输出与因果目标的关键桥梁。
- Bootstrap有效性的证明:证明的核心在于将COMPACT得分空间的估计视为一个“生成回归量”(generated regressor)问题。Lemma 10证明了得分空间投影算子是经验矩的连续可微函数,这使得可以应用Delta方法。Lemma 11和12则分别处理了“Oracle”下游估计量和“生成回归量”部分的联合bootstrap逼近。
-
技术技巧点名:
- 广义特征值分解:用于求解谱系准则。
- Sherman-Morrison公式:用于简化广义特征空间与岭正则化预测之间的关系(在Proposition 1的证明中)。
- Davis-Kahan定理(Lemma 3的引用):用于建立经验谱投影与人口谱投影之间的收敛速率(Lemma 1的证明)。
- Delta方法:用于推导bootstrap的线性表示。
- 生成回归量(Generated Regressors):将得分学习视为一个生成回归量的过程,并分析其对下游推断的影响。
-
真实例子与应用:
- 数据:Adolescent Brain Cognitive Development (ABCD) Study,一个大型纵向观测队列。研究问题是:开始阅读(reading for pleasure)对后续认知能力的影响。
- 方法应用:构建了包含248个基线变量的调整集(包括人口学、认知、家庭环境、睡眠、屏幕使用等)。对每个认知结局分别拟合COMPACT,得到二维得分空间。然后在该空间上估计ATE和CATE,并使用10,000次bootstrap(考虑家庭内聚类)进行推断。
- 结果:对于“晶体化认知”(crystallized cognition),COMPACT得分空间显示出良好的处理重叠(倾向得分非极端)。ATE显著为正(0.589, 95% CI [0.237,1.044]),而CATE异质性检验不显著,表明效应相对均匀。对于“图片词汇”(Picture Vocabulary)也得到了类似结果。
-
例子想说明什么:这个例子旨在展示COMPACT在实际应用中的完整工作流程:①自动学习一个低维调整表示;②提供可视化工具来诊断处理重叠和检查效应异质性;③支持完整的bootstrap推断。它验证了方法在处理高维、真实混杂问题时的实用性。
-
🔎 结论是否比证明窄:是的,存在几处。
- 线性CATE假设:Theorem 3的证明依赖于潜在响应曲面的Lipschitz连续性(Assumption 2c),但Proposition 1和Theorem 2的证明中,为了将广义特征空间与潜在变量连接起来,使用了线性CATE模型(式5)和线性条件均值假设(式4)。作者在Section 8的讨论中承认了“当前线性形式仅能恢复通过特征线性组合表达的信息”,并提到“核方法扩展”作为未来方向。因此,论文的核心理论结果(Proposition 1, Theorem 2)是在一个线性-可加-参数化的模型下严格证明的,但其声称的“因果一致性”(Theorem 3)则依赖于更一般的平滑性假设,这两者之间存在一个gap:Theorem 3的假设是否在论文的核心参数模型下自动满足?作者并未明确讨论。
- 线性可检测性:图论准则(Theorem 1)是基于d-分离的,但谱系实现(式12)将其转化为线性相关系数。这意味着如果依赖关系是非线性的(例如,\(S_\beta\)与\(T\)通过一个非线性函数相关,但线性相关系数为0),则COMPACT会错误地认为该方向不满足准则。作者在Section 8的讨论中承认了这一点。
- Bootstrap有效性:Theorem 4的证明假设下游使用OLS,并且模型是正确设定的(式19)。对于更一般的下游学习器(如随机森林、神经网络),bootstrap的有效性并未被证明。作者在Section 6.3中明确将下游模型限定为OLS。
四、开放问题¶
-
非线性扩展与核方法:作者在讨论中承认“当前线性形式仅能恢复通过特征线性组合表达的信息”,并提到“核方法扩展”作为未来方向。扎根点:Section 8, "Second, the current linear formulation recovers only information expressible through linear combinations of the supplied features, although transformations or kernel extensions could enlarge this function class." 一个具体的开放问题是:如何将COMPACT的广义特征值框架扩展到再生核希尔伯特空间(RKHS),并保持其计算效率和理论保证?
-
区分预设变量与代理变量:作者提到COMPACT目前无法区分预设的调节变量(如已知的效应修饰因子)和代理变量系统。扎根点:Section 8, "Third, COMPACT does not currently distinguish prespecified variables Z, such as established moderators, from the proxy system." 一个开放问题是:如何设计一个两阶段程序,先对Z进行残差化,再对残差应用COMPACT,并正式证明其性质?
-
多处理/多结局的扩展:图论准则(Theorem 1)是针对标量处理和标量结局推导的。扎根点:Section 8, "Finally, the graph-theoretic criterion is derived for a scalar treatment and outcome. Multiple treatments or outcomes may yield additional treatment-effect-invariant dependence restrictions and potentially more informative adjustment representations." 一个开放问题是:对于多值处理或多个结局,COMPACT的准则和谱系算法应如何推广?得分空间的维度是否会增加?
-
统计-计算权衡:论文未讨论是否存在信息论上更优但计算上不可行的估计量。COMPACT是一个多项式时间算法,但它是否达到了某种意义上的最优(例如,在minimax意义下)?扎根点:论文未引用任何关于统计-计算权衡的文献。一个开放问题是:在给定的代理变量模型下,COMPACT的收敛速率是否是最优的?是否存在一个“计算-统计缺口”,即存在一个更慢的、但能达到更优统计效率的算法?
Maintained by 陈星宇 · Homepage · Source on GitHub