Mixed-effects Outcome-Adaptive Lasso for Propensity Score Estimation under Partial Interference¶
作者: Satoshi Nakashima, Akira Okazaki, Shuichi Kawano
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.16365
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是在部分干扰(partial interference)设定下,通过倾向得分逆概率加权(IPW)估计因果效应时,如何选择协变量以提升估计效率。部分干扰假设个体可划分为互不干扰的组,组内存在干扰。此时组级倾向得分(group-level propensity score)是组内所有个体处理分配概率的乘积(再对随机效应积分),极易取极端值,导致IPW估计量方差膨胀。当协变量维度较高时,这一问题尤为严重。因此,需要一种能在倾向得分模型中自动筛选出混杂因子和预后因子、同时排除工具变量和噪音变量的方法。
发展脉络(history)¶
- 奠基工作:部分干扰下的因果效应定义与识别
- Hudgens & Halloran (2008) 在两阶段随机试验中定义了直接、间接、总、整体效应,奠定了部分干扰下因果推断的框架。
- Sobel (2006) 和 Rosenbaum (2007) 较早讨论了干扰对经典因果推断的挑战。
-
Tchetgen Tchetgen & VanderWeele (2012) 将IPW推广至部分干扰的观察性研究,提出用混合效应逻辑回归模型估计组级倾向得分,并给出识别条件(条件可交换性、正性)。这是本文直接依赖的估计框架。
-
IPW估计量的改进
- Liu et al. (2016) 指出组级倾向得分易取极端值,提出Hájek型稳定化IPW估计量,并证明其渐近正态性。该文是本文IPW部分的核心参考。
- Liu et al. (2019) 进一步提出双重稳健(DR)估计量,允许倾向得分或结果回归之一正确设定即可一致估计。
-
Kilpatrick et al. (2025) 提出G-估计方法处理部分干扰,可应对较大组规模。
-
倾向得分中的协变量选择
- Brookhart et al. (2006) 和 Schisterman et al. (2009) 通过模拟和理论指出:在倾向得分中包含强处理预测因子但不与结果相关的变量(工具变量)会增大方差,而包含预后因子可提升效率。
- Shortreed & Ertefaie (2017) 提出Outcome-Adaptive Lasso(OAL),利用结果回归系数的绝对值构造自适应L1惩罚权重,在逻辑回归倾向得分模型中同时选择混杂因子和预后因子、排除工具变量和噪音变量,并证明oracle性质。这是本文方法论的直接前身。
-
Baldé et al. (2023) 提出广义OAL(GOAL),用弹性网替代Lasso以处理协变量相关情形,本文在讨论中提及作为未来扩展方向。
-
混合效应模型与多水平数据
- Lee et al. (2022) 提出部分池化倾向得分模型处理多水平数据中的未观测组级混杂,本文在讨论中引用作为扩展方向。
-
Groll & Tutz (2014) 开发了glmmLasso包,本文的数值算法基于该包修改。
-
本文的位置
本文首次将OAL从个体级逻辑回归推广到混合效应逻辑回归,用于部分干扰下的组级倾向得分估计。它填补了“在部分干扰下进行倾向得分协变量选择”的空白——作者在引言中明确说:“to the best of our knowledge, propensity score estimation using OAL under partial interference and the effect of covariate selection on causal effect estimation have not been sufficiently studied.” 本文同时证明了混合效应OAL的oracle性质以及基于其的IPW估计量的渐近正态性,并给出方差缩减的理论保证(Proposition 2)。
子线索聚类¶
-
线索A:部分干扰下的因果效应估计方法
包括Tchetgen & VanderWeele (2012)、Liu et al. (2016, 2019)、Kilpatrick et al. (2025)、Imai et al. (2021)。这些工作关注识别、IPW、DR、G-估计等,但均未系统处理协变量选择问题。 -
线索B:倾向得分中的协变量选择
包括Shortreed & Ertefaie (2017)、Baldé et al. (2023)、Brookhart et al. (2006)、Schisterman et al. (2009)。这些工作聚焦于个体级倾向得分,未考虑组级倾向得分和随机效应。 -
线索C:多水平/混合效应倾向得分模型
包括Lee et al. (2022)、Tchetgen & VanderWeele (2012)中的混合效应模型。这些工作考虑了组间异质性,但未结合协变量选择。
本文位于线索A与线索B的交汇处,并引入了线索C的混合效应结构。
这个方向在追问的核心问题¶
-
在部分干扰下,如何稳定估计组级倾向得分以避免极端权重?
当前主流方法:Hájek型IPW(Liu et al. 2016)、双重稳健估计(Liu et al. 2019)、G-估计(Kilpatrick et al. 2025)。瓶颈:组级倾向得分是乘积形式,组越大越易极端;高维协变量加剧此问题。 -
在倾向得分模型中,应选择哪些协变量以平衡偏差与效率?
已知:包含工具变量有害,包含预后因子有益(Brookhart et al. 2006)。但现有OAL仅适用于个体级逻辑回归,无法处理组级倾向得分中的随机效应。 -
如何将协变量选择方法与混合效应模型结合,并给出理论保证?
本文直接回答此问题。
⚠️ 作者的framing¶
作者将缺口frame为:“现有OAL基于逻辑回归模型,不能直接应用于混合效应逻辑回归模型”(引言第3段)。因此本文的“显然的下一步”是将OAL的权重构造和惩罚框架移植到混合效应模型,并证明oracle性质。作者淡化了以下竞争路线: - 双重稳健方法(Liu et al. 2019)可以容忍倾向得分模型部分错误,但本文未与之比较(模拟中未包含DR估计量)。 - G-估计(Kilpatrick et al. 2025)可处理大组,但本文未讨论其与协变量选择的结合。 - 部分池化倾向得分(Lee et al. 2022)也处理组间异质性,但本文仅在讨论中提及。
什么明显该被引/该存在、却没出现在intro里?
- 关于高维倾向得分估计的文献(如Lasso-based propensity score, 如Belloni et al. 2014, 2017的post-double selection)未被引用。这些方法也处理协变量选择,但侧重个体级、无干扰。
- 干扰下的双重稳健估计(Liu et al. 2019)虽被引用,但本文未在模拟中将其作为baseline,而是用了“全模型GLMM”和“已知真模型Targ”。这可能是因为DR估计量需要结果回归模型,而本文的OAL也依赖结果回归,但作者未说明为何不比较。
- 网络干扰下的协变量选择(如Bhattacharya et al. 2020)被引用但仅作为背景,未深入讨论其与部分干扰的差异。
张力¶
未见明显对立引用。所有被引工作基本一致认为:包含工具变量有害、包含预后因子有益;部分干扰下IPW方差大;混合效应模型可捕捉组间异质性。本文是在这些共识上的增量贡献。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号
- \(G\):组数(groups)。
- \(N_g\):第\(g\)组的个体数,\(\sum_{g=1}^G N_g = N\)。
- \(i=1,\dots,N_g\):组内个体索引。
- \(A_{gi} \in \{0,1\}\):个体\(i\)在组\(g\)的处理分配(1=处理,0=对照)。
- \(X_{gi} \in \mathbb{R}^p\):个体\(i\)的协变量向量。
- \(Y_{gi} \in \mathbb{R}\):个体\(i\)的观测结果。
- \(\mathbf{A}_g = (A_{g1},\dots,A_{gN_g})\):组\(g\)的处理分配向量。
- \(\mathbf{A}_{g(-i)}\):组\(g\)去掉个体\(i\)后的处理分配向量。
- \(\mathbf{X}_g = (X_{g1},\dots,X_{gN_g})\):组\(g\)的协变量矩阵。
- \(Y_{gi}(\mathbf{a}_g)\):当组\(g\)的处理分配为\(\mathbf{a}_g\)时个体\(i\)的潜在结果(部分干扰假设下只依赖本组分配)。
- \(\theta \in (0,1)\):伯努利分配策略参数,即每个个体独立以概率\(\theta\)接受处理。
- \(\pi(\mathbf{a}_g;\theta) = \prod_{i=1}^{N_g} \theta^{a_{gi}}(1-\theta)^{1-a_{gi}}\):在策略\(\theta\)下组\(g\)得到分配\(\mathbf{a}_g\)的概率。
- \(f(\mathbf{a}_g \mid \mathbf{X}_g)\):组级倾向得分,即给定协变量下组\(g\)实际得到分配\(\mathbf{a}_g\)的概率。
- \(\psi = (\alpha^\top, \sigma^2)^\top\):混合效应逻辑回归模型的参数,其中\(\alpha\)是固定效应系数,\(\sigma^2\)是随机效应方差。
- \(b_g \sim N(0,\sigma^2)\):组\(g\)的随机截距。
- \(\bar{Y}(a;\theta)\):在策略\(\theta\)下,接受处理\(a\)的个体的平均潜在结果(总体平均)。
- \(\bar{Y}(\theta)\):在策略\(\theta\)下的边际平均潜在结果。
- 直接效应:\(\text{DE}(\theta) = \bar{Y}(1;\theta) - \bar{Y}(0;\theta)\)。
- 间接效应:\(\text{IE}(\theta_1,\theta_0) = \bar{Y}(0;\theta_1) - \bar{Y}(0;\theta_0)\)。
- 总效应:\(\text{TE}(\theta_1,\theta_0) = \bar{Y}(1;\theta_1) - \bar{Y}(0;\theta_0)\)。
- 整体效应:\(\text{OE}(\theta_1,\theta_0) = \bar{Y}(\theta_1) - \bar{Y}(\theta_0)\)。
模型
- 处理分配机制:混合效应逻辑回归模型
组级倾向得分是积分形式:
- 结果模型(用于构造OAL权重):线性回归
其中\(\beta_j\)是结果回归系数,用于构造OAL的惩罚权重\(\hat{\omega}_j = |\tilde{\beta}_j|^{-\zeta}\)(\(\zeta>1\))。
- 识别假设:组级条件可交换性 \(Y_g(\mathbf{a}_g) \perp\!\!\!\perp \mathbf{A}_g \mid \mathbf{X}_g\),正性 \(f(\mathbf{a}_g \mid \mathbf{X}_g) > 0\),因果一致性。
可观测数据
- 实际观测到的是\(\{ (X_{gi}, A_{gi}, Y_{gi}) : g=1,\dots,G, i=1,\dots,N_g \}\)。
- 不可观测的是潜在结果\(Y_{gi}(\mathbf{a}_g)\)(对所有\(\mathbf{a}_g \neq \mathbf{A}_g\))以及随机效应\(b_g\)。
- 组级倾向得分\(f(\mathbf{A}_g \mid \mathbf{X}_g)\)未知,需估计。
第二步:最小内核¶
最简特例:考虑所有组大小相等且为2(\(N_g=2\)),协变量维度\(p=4\),且无随机效应(\(\sigma^2=0\),即个体独立)。此时组级倾向得分退化为个体倾向得分的乘积:
协变量分类:\(X_1,X_2\)是混杂因子(同时影响处理和结果),\(X_3\)是预后因子(只影响结果),\(X_4\)是工具变量(只影响处理)。结果模型:\(Y_{gi} = 3A_{gi} + 2A_{g,-i} + 0.6X_{gi1}+0.6X_{gi2}+0.6X_{gi3} + \varepsilon_{gi}\),因此\(\beta = (0.6,0.6,0.6,0)^\top\)。OAL的惩罚权重\(\hat{\omega}_j = |\tilde{\beta}_j|^{-2}\),其中\(\tilde{\beta}_j\)是结果回归的MLE。由于\(\tilde{\beta}_4\)依概率收敛到0,\(\hat{\omega}_4\)发散到无穷,从而在倾向得分模型中\(\alpha_4\)被强惩罚至0。而\(\hat{\omega}_1,\hat{\omega}_2,\hat{\omega}_3\)为有限值,对应的\(\alpha_1,\alpha_2,\alpha_3\)被保留。这就是OAL的核心机制:用结果回归系数的绝对值倒数作为惩罚权重,使得与结果无关的变量被排除。
在这个特例下,Proposition 1的oracle性质退化为:\(\hat{\alpha}_4\)以概率趋于1被设为0,而\(\hat{\alpha}_1,\hat{\alpha}_2,\hat{\alpha}_3\)的渐近分布与已知正确模型(只包含\(X_1,X_2,X_3\))的MLE相同。证明的关键在于:当\(\lambda_G/\sqrt{G} \to 0\)且\(\lambda_G G^{\zeta/2-1} \to \infty\)时,对\(j \in \mathcal{A}^c\)(即\(\alpha_j^*=0\)),惩罚项\(\lambda_G \hat{\omega}_j |\alpha_j|\)的梯度在原点处发散,迫使解为0;而对\(j \in \mathcal{A}\),惩罚项渐近可忽略。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在部分干扰的观察性研究中,如何通过协变量选择稳定估计组级倾向得分,进而提升IPW因果效应估计的效率。
- 核心工具/方法:提出混合效应Outcome-Adaptive Lasso(mixed-effects OAL),在混合效应逻辑回归的似然函数上施加自适应L1惩罚,惩罚权重由结果回归系数的绝对值倒数构造。
- 主要结论:该估计量具有oracle性质(变量选择一致性和渐近正态性);基于其的IPW估计量(HT型和Hájek型)相合且渐近正态,且渐近方差小于使用已知倾向得分时的方差(Proposition 2)。
关键设定与假设¶
- 部分干扰:组间无干扰,组内任意干扰。
- 组级倾向得分模型:混合效应逻辑回归,随机截距\(b_g \sim N(0,\sigma^2)\),固定效应\(\alpha\)。
- 结果回归模型:用于构造OAL权重的线性模型(或广义线性模型),要求其系数估计\(\tilde{\beta}_j\)满足:对\(j \in \mathcal{A}\)(与结果相关),\(\tilde{\beta}_j \xrightarrow{p} \beta_j^* \neq 0\);对\(j \in \mathcal{A}^c\),\(\tilde{\beta}_j = O_p(G^{-1/2})\)(条件(E))。
- 正则条件(A)-(E)(附录B):包括i.i.d.组观测、Fisher信息阵正定、正确设定的简化模型、对数似然的二阶和三阶导数有界、结果回归系数估计的相合性。
- 惩罚参数条件:\(\lambda_G/\sqrt{G} \to 0\)(保证\(\sqrt{G}\)-相合性)且\(\lambda_G G^{\zeta/2-1} \to \infty\)(保证变量选择一致性),其中\(\zeta>1\)是OAL权重中的指数。
- 相比已有文献:相比Shortreed & Ertefaie (2017)的OAL,本文增加了随机效应结构,因此需要处理积分似然和非凸优化;相比Liu et al. (2016)的IPW,本文增加了协变量选择步骤。
主要结果¶
- Lemma 1(\(\sqrt{G}\)-相合性):在条件(A)-(E)及\(\lambda_G/\sqrt{G} \to 0\)下,存在局部极小点\(\hat{\psi}\)满足\(\|\hat{\psi} - \psi^*\|_2 = O_p(G^{-1/2})\)。
- Proposition 1(Oracle性质):在额外条件\(\lambda_G G^{\zeta/2-1} \to \infty\)下,该局部极小点满足:
(i) 变量选择一致性:\(\lim_{G\to\infty} P(\hat{\alpha}_j = 0 \mid j \in \mathcal{I} \cup \mathcal{S}) = 1\);
(ii) 渐近正态性:\(\sqrt{G}(\hat{\psi}_{\mathcal{A}} - \psi^*_{\mathcal{A}}) \xrightarrow{d} N(0, I_{11}^{-1})\),其中\(I_{11}\)是活跃参数对应的Fisher信息子矩阵。
这意味着混合效应OAL像“知道”哪些变量是活跃的一样有效。 - Lemma 2:活跃参数的得分函数在\(\hat{\psi}_{\mathcal{A}}\)处为\(o_p(G^{1/2})\),这是后续IPW推断的基础。
- Proposition 2(IPW估计量的渐近性质):基于混合效应OAL估计的倾向得分,HT型和Hájek型IPW估计量(直接效应等)渐近正态,且渐近方差小于使用已知倾向得分时的方差(即\(\Sigma_{h,\text{est}}^D \leq \Sigma_{h,\text{fix}}^D\))。证明通过联合估计方程(IPW方程+得分方程)的M-估计框架,利用块矩阵求逆得到方差分解,其中第二项非负。
- 模拟结果(Section 5):
- 混合效应OAL以高频率选择混杂因子(\(X_1,X_2\))和预后因子(\(X_3,X_4\)),以低频率选择工具变量(\(X_5,X_6\))和噪音变量(\(X_7,\dots\))。
- 直接效应和间接效应的估计偏差小,方差小于全模型GLMM,与已知真模型Targ相当。
- Hájek型IPW比HT型更稳定。
- 协变量相关性增强时,选择频率略有变化(预后因子选择频率上升),但IPW方差增大。
- 真实数据例子(Section 6):刚果民主共和国DHS疟疾数据,531个组(DHS调查簇),7598名儿童,36个候选协变量。混合效应OAL选择出身高、身高/年龄、体重/年龄等营养指标(与已知流行病学证据一致),而性别、居住地等未被选择。基于OAL的IPW估计量置信区间比全模型GLMM窄得多,例如在\(\theta=0.7\)时,直接效应估计为-0.039 (95% CI: -0.068, -0.019) vs 全模型0.054 (95% CI: -0.079, 0.095)。
证明路线与技术技巧¶
整体路线(Proposition 1的证明):
1. 局部二次近似:将惩罚负对数似然在真值\(\psi^*\)处泰勒展开,得到\(\tilde{V}(u) = -u^\top Z + \frac{1}{2} u^\top I u + \text{惩罚项} + o_p(1)\),其中\(u = \sqrt{G}(\psi - \psi^*)\)。
2. 惩罚项分析:对活跃变量(\(\alpha_j^* \neq 0\)),\(\lambda_G \hat{\omega}_j (|\alpha_j^* + u_j/\sqrt{G}| - |\alpha_j^*|) \xrightarrow{p} 0\)(因为\(\lambda_G/\sqrt{G} \to 0\));对非活跃变量(\(\alpha_j^* = 0\)),该项非负且当\(\lambda_G G^{\zeta/2-1} \to \infty\)时,在原点处产生“尖峰”,迫使解为0。
3. 局部凸性:在球面\(\|u\|=M\)上,\(\tilde{V}(u)\)以概率趋于正,因此存在局部极小点,且\(\|\hat{\psi} - \psi^*\| = O_p(G^{-1/2})\)。
4. Oracle性质:利用Geyer (1994)的局部argmin定理,得到活跃参数的渐近分布;通过比较惩罚似然在\((\hat{\psi}_{\mathcal{A}},0)\)和\((\hat{\psi}_{\mathcal{A}},\hat{\alpha}_{\mathcal{A}^c})\)的值,证明非活跃参数以概率1被设为0。
关键跳跃点:
- 处理混合效应似然的非凸性:证明仅局部成立,依赖于真值附近的正则条件。
- 惩罚项中\(\hat{\omega}_j = |\tilde{\beta}_j|^{-\zeta}\)的随机性:需要条件(E)保证\(\tilde{\beta}_j\)对活跃变量收敛到非零常数,对非活跃变量为\(O_p(G^{-1/2})\),从而\(\hat{\omega}_j\)对非活跃变量发散到无穷。
- 在证明变量选择一致性时,需要处理\(\partial \ell_G / \partial \alpha_{\mathcal{A}^c}\)的阶数:对工具变量(\(\alpha_j^*=0\)但\(\alpha_j\)可能非零)和噪音变量(\(\alpha_j^*=0\)且\(\alpha_j\)真为零)分别处理,最终得到\(\ell_G(\psi_{\mathcal{A}},\alpha_{\mathcal{A}^c}) - \ell_G(\psi_{\mathcal{A}},0) = -O_p(G) \sum_{j\in\mathcal{A}^c} |\alpha_j|\),从而惩罚项\(\lambda_G \hat{\omega}_j |\alpha_j| = O_p(\lambda_G G^{\zeta/2}) |\alpha_j|\)占主导。
技术技巧点名:
- 局部二次展开(Fan & Li 2001的经典技巧)。
- Geyer (1994)的局部argmin定理:处理非凸惩罚似然的渐近分布。
- M-估计的联合估计方程(Proposition 2):将IPW估计方程与倾向得分得分方程联立,通过块矩阵求逆得到方差缩减公式。
- Sandwich方差估计:用于构造置信区间。
- wAMD准则(Shortreed & Ertefaie 2017)选择调谐参数,而非交叉验证。
真实例子与应用¶
- 数据:2013-2014刚果民主共和国DHS数据,531个组(DHS调查簇),7598名6-59月龄儿童,36个候选协变量(年龄、性别、营养指标、居住地、家庭特征等)。处理变量:是否使用杀虫剂处理蚊帐(ITN)。结果变量:疟疾阳性。
- 方法应用:用混合效应OAL估计组级倾向得分(混合效应逻辑回归,随机截距对应簇),然后计算Hájek型IPW估计量(直接、间接、总、整体效应),参考策略\(\theta=0.5\)。调谐参数通过wAMD在\(\Theta=\{0.1,\dots,0.9\}\)上平均选择。置信区间通过1000次bootstrap获得。
- 结果:
- 混合效应OAL频繁选择身高、身高/年龄、体重/年龄等营养指标(与已知文献一致),而性别、居住地、户主特征等几乎未被选择。
- 直接效应在中等分配水平为负(如\(\theta=0.5\)时-0.028, 95% CI: -0.057, -0.003),表明ITN使用降低个体疟疾风险。
- 间接效应在\(\theta>0.5\)时为正(如\(\theta=0.7\)时0.041, 95% CI: 0.005, 0.085),表明高覆盖率产生群体保护。
- 与全模型GLMM相比,混合效应OAL的置信区间窄得多,例如直接效应在\(\theta=0.7\)时全模型为0.054 (95% CI: -0.079, 0.095),而OAL为-0.039 (95% CI: -0.068, -0.019)。
- 这个例子想说明:排除与结果无关的协变量可以显著提升IPW估计的有限样本精度,且选择结果与领域知识一致,增强了方法的可信度。
🔎 结论是否比证明窄¶
- Proposition 1的oracle性质是局部的:证明中明确说“all the results below are local results in a neighborhood of \(\psi^*\)”(Section 3.1)。这意味着当初始值远离真值时,oracle性质可能不成立。论文未讨论全局收敛性。
- Proposition 2的方差缩减:证明中假设倾向得分模型正确设定(条件(C))。如果模型错误,方差缩减结论不成立。论文在模拟中仅考虑了正确设定的情形。
- 真实数据中的因果解释:论文谨慎指出“the results should be interpreted as sensitivity to propensity score model specification rather than as evidence that either estimator is unbiased”(Section 6)。但未进行正式的敏感性分析。
- 调谐参数选择:wAMD准则依赖于结果回归系数\(\tilde{\beta}_j\),而\(\tilde{\beta}_j\)本身来自一个可能错误设定的结果模型。论文未讨论wAMD对结果模型错误的稳健性。
四、开放问题¶
- 结果模型错误设定下的表现:作者在结论中承认“the proposed method relies on the outcome regression model... may fail to select appropriate covariates when the outcome regression model is misspecified”(Section 7)。具体而言,Cho & Yang (2025) 指出此类方法在结果模型错误时可能失效。扎根于:Section 7第一段。
- 协变量相关时的改进:模拟显示强相关下IPW方差增大,作者建议引入弹性网型惩罚(GOAL, Baldé et al. 2023)。扎根于:Section 7最后一段。
- 推广至更一般的干扰结构:本文仅处理部分干扰,而实际中网络结构可能未知。作者提及可扩展至更一般的干扰结构。扎根于:Section 7第三段。
- 调谐参数选择的理论性质:wAMD准则缺乏理论保证(如选择一致性或最优收敛速度)。扎根于:Section 3.2仅给出定义,未提供理论分析。
- 随机效应方差\(\sigma^2\)的推断:Proposition 1的渐近正态性覆盖了\(\sigma^2\),但模拟和真实数据中未报告其估计值或置信区间。扎根于:Proposition 1(ii)包含\(\sigma^2\),但实证部分未展示。
Maintained by 陈星宇 · Homepage · Source on GitHub