Optimal Control Variates for Survey Sampling and Causal Inference¶
作者: Jinglong Zhao
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2608.15333
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:在基于设计的(design-based)有限总体推断和因果推断中,如何系统性地降低逆概率加权(IPW)类估计量的方差。IPW估计量(如Horvitz-Thompson估计量)无偏,但方差极大,尤其在抽样/处理/暴露概率很小时。该方向的核心是构造方差缩减技术,使得在给定设计下,估计量的方差尽可能小,从而提高统计功效。当前成熟度较高,已有大量启发式或特定场景下的方法,但缺乏一个统一的、可推导出最优解的框架。
发展脉络(history)¶
- 奠基工作:Horvitz and Thompson (1952) 正式提出IPW估计量,证明了其无偏性,但方差问题随之暴露。Hansen and Hurwitz (1943) 更早提出了不等概率抽样的基本思想。
- 主要进展(方差缩减的启发式方法):
- Hajek估计量 (Basu 1971):通过自归一化(除以估计的1)来降低方差,被广泛认为比HT更稳定,但缺乏最优性保证。
- 归一化估计量 (Trotter and Tukey 1956):推广了Hajek的思想,引入一个可调的归一化参数λ。
- AIPW估计量 (Cassel et al. 1976, Robins et al. 1994):通过引入一个结果模型(outcome model)来“增强”IPW,实现双稳健性(doubly robust)和半参数效率。
- TMLE (Van Der Laan and Rubin 2006):通过一个“瞄准”步骤(targeting step)来减少对结果模型的依赖,同样达到半参数效率。
- 控制变量法 (Hesterberg 1988, 1995):在模拟文献中,建议使用重要性权重(即逆概率)作为控制变量来缩减方差。
- 当前frontier:上述方法虽然有效,但作者指出它们都共享一个核心思想:通过抵消HT估计量的部分随机性来缩减方差。然而,它们都使用了一个特定的、固定的“基”(basis),即IPW基(
a_i = 1/π_i)。作者认为,这个基并非最优,尤其是在有限样本下。 - 本文的位置:本文首次将上述所有方法统一在“控制变量”的视角下,并提出了一个系统性的框架来寻找最优的控制变量基。这个最优基由设计结构(协方差矩阵Σ)和结果不确定性(结果的均值和方差)共同决定,通过求解一个特征值问题得到。这为方差缩减提供了一个理论上的“天花板”,并解释了为什么IPW基在特定条件下(如大样本、Bernoulli抽样)是渐近最优的。
子线索聚类¶
这些被引文献大致落在以下2-3条子线索上: 1. 基于设计的方差缩减(Design-based variance reduction):核心是利用抽样/处理指示符本身的随机性来构造控制变量。代表工作:Hajek估计量、归一化估计量。这些方法不依赖结果模型,纯粹从设计出发。 2. 基于模型的方差缩减(Model-assisted variance reduction):核心是利用辅助变量(协变量)或结果模型来“解释”部分结果变异,从而缩减方差。代表工作:AIPW、TMLE、回归调整(regression adjustment, e.g., Lin 2013)。这些方法需要估计一个结果模型。 3. 控制变量法在模拟中的应用:核心是将重要性权重作为控制变量。代表工作:Hesterberg (1988, 1995)。本文的工作可以看作是对这一线索的严格理论化和推广。
这个方向在追问的核心问题¶
- 如何系统性地构造最优控制变量? 现有方法(Hajek, AIPW, TMLE)都是特定选择,能否找到一个统一的、可求解的最优解?
- 最优控制变量与设计、结果分布的关系是什么? 方差缩减的极限由什么决定?是设计结构(如抽样概率的异质性、依赖结构)还是结果的不确定性(如方差、信噪比)?
- 在网络干扰等复杂设定下,最优控制变量如何计算? 当暴露概率高度异质且相关时,问题变得非凸,如何找到近似解?
- 已知瓶颈:IPW基在有限样本下不是最优的;网络干扰下,Hajek估计量忽略了两个控制变量之间的相关性,导致方差缩减不足。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么:作者将现有方法(Hajek, AIPW, TMLE)统一解释为“使用IPW基的控制变量估计量”,并指出“IPW基不是最优的”。因此,本文的“显然的下一步”就是:在控制变量框架下,寻找比IPW基更好的基,即最优基。作者通过引入一个随机优化问题(将结果视为随机变量)来形式化这个“更好”,并证明最优基由设计协方差矩阵和结果矩矩阵的联合特征向量决定。
- 哪些竞争路线被他淡化或回避了:
- 使用协变量作为控制变量的传统方法(Deville and Särndal 1992, Fieller and Hartley 1954):作者明确说“本文使用抽样指示符作为控制变量,这与使用协变量的工作形成对比”。他将这条路线完全排除在本文框架之外,并在未来工作中才提及“将设计诱导的控制变量与协变量结合”。
- 回归调整(Regression adjustment):在网络干扰部分,作者提到“这与使用协变量作为控制变量的回归调整工作形成对比”(Basse and Feller 2018, Gao and Ding 2025, Lin 2013等)。他同样将其排除。
- Khan and Ugander (2023) 的自适应归一化估计量:作者承认其工作与本文的IPW基控制变量估计量有联系,但指出他们“没有研究如何选择最优控制变量”。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 半参数效率理论(Semiparametric efficiency theory):本文的核心结果(最优基由特征向量决定)与半参数效率界(efficiency bound)有深刻联系。最优控制变量估计量的方差应该逼近半参数效率界。作者在引言中完全没有提及效率理论,尽管在正文中提到了AIPW和TMLE是“efficient estimator”。这是一个值得研究者去查的问题:本文的最优控制变量是否达到了半参数效率界?它与Efficient Influence Function (EIF) 有何关系?
- 高阶影响函数(Higher-order influence functions, HOIF):本文的方差缩减是通过投影到控制变量张成的空间来实现的。这与使用高阶影响函数进行偏差校正的思路有相似之处。作者没有提及HOIF,这可能是一个连接点。
张力¶
未见明显对立引用。所有被引工作都承认IPW方差大,并试图改进。本文的统一框架和最优性结果是对这些工作的一个理论升华,而非挑战。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
n: 有限总体中的个体数。Y_i: 个体i的结果(outcome),是固定的、未知的常数(在design-based视角下)。µ_n = (1/n) Σ_i Y_i: 目标 estimand,即有限总体均值。W_i ∈ {0, 1}: 抽样/处理指示符。W_i = 1表示个体i被抽中/接受处理。π_i = Pr(W_i = 1): 个体i的边际抽样/处理概率,已知。Π = diag(π_1, ..., π_n): 由π_i构成的对角矩阵。Σ = Var(W): 抽样/处理指示符向量的协方差矩阵,已知(由设计决定)。a = (a_1, ..., a_n)^T: 控制变量的“基”(basis),是我们需要选择的常数向量。bX = (1/n) Σ_i a_i 1{W_i = 1}: 控制变量本身。γ: 控制变量的系数。bµ_HT = (1/n) Σ_i Y_i 1{W_i = 1} / π_i: Horvitz-Thompson估计量,基线估计量。bµ_CV(γ) = bµ_HT - γ (bX - E[bX]): 控制变量估计量。
-
模型:
- 设计模型(Design model):
W的联合分布完全由已知的随机化设计决定(如Bernoulli抽样、无放回抽样、分层抽样)。这是唯一的随机性来源。Y被视为固定常数。 - 结果模型(Outcome model,用于寻找最优基):为了在
Y未知的情况下选择a,作者假设Y_i是来自某个未知分布Y的i.i.d.样本。这个模型仅用于推导最优基,不用于推断。
- 设计模型(Design model):
-
可观测数据:
- 可观测:对于被抽中的个体(
W_i = 1),我们观测到Y_i。对于所有个体,我们知道π_i和Σ(因为设计已知)。 - 想要但观测不到:所有未被抽中的个体的
Y_i值。这是因果推断和抽样中的核心缺失数据问题。
- 可观测:对于被抽中的个体(
第二步:讲最小内核¶
最简特例:Bernoulli抽样,所有单位有相同抽样概率 π,且结果方差为0(即所有 Y_i 等于同一个常数 y)。
在这个特例下:
- 记号简化:π_i = π,Σ = π(1-π) I_n(对角矩阵)。
- HT估计量:bµ_HT = (1/n) Σ_i Y_i 1{W_i=1} / π = (y/π) * (1/n) Σ_i 1{W_i=1}。它的方差完全由抽样计数 (1/n) Σ_i 1{W_i=1} 的随机性决定。
- 控制变量:bX = (1/n) Σ_i a_i 1{W_i=1}。如果我们选择 a_i = 1/π(即IPW基),那么 bX = (1/π) * (1/n) Σ_i 1{W_i=1}。
- 核心思路:bµ_HT 的随机性完全来自于 (1/n) Σ_i 1{W_i=1}。而 bX 也完全由这个随机变量决定。因此,我们可以通过选择合适的系数 γ,用 bX 完美地抵消 bµ_HT 的随机性。
- 最优解:在这个特例下,bµ_HT = y * bX。所以,如果我们选择 γ = y,那么 bµ_CV(γ) = y*bX - y*(bX - E[bX]) = y*E[bX] = y,方差为0。而根据定理2,最优基 a* 正是 c * Π^{-1} 1_n = c/π * 1_n,即IPW基。这验证了Corollary 1。
- 为什么这个例子是内核:它揭示了控制变量法的本质:找到一个与HT估计量高度相关的随机变量(控制变量),通过减去其中心化版本,来消除HT估计量中的随机波动。当结果没有不确定性时,HT的波动完全由设计驱动,而控制变量(由设计构造)可以完美地捕捉并抵消这种波动。论文的一般情形(结果有方差、设计更复杂)只是在这个内核上“加壳”:结果的不确定性使得我们无法完美抵消,只能寻求在期望意义下的最优投影。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在基于设计的调查抽样和因果推断(含网络干扰)中,如何构造最优的控制变量来缩减Horvitz-Thompson估计量的方差。
- 核心工具/方法:将Hajek、AIPW、TMLE等估计量统一解释为使用特定基(IPW基)的控制变量估计量;然后通过一个随机优化问题(将结果视为随机变量)来刻画最优基,该最优基由设计协方差矩阵和结果矩矩阵的联合特征向量决定。
- 主要结论:在无干扰的设定下,最优基由矩阵
M的最大特征向量给出,期望方差缩减由最大特征值决定;在网络干扰下,最优基求解一个非凸二次优化问题,作者给出了1/2近似解和交替局部搜索启发式算法。实证表明,该方法能实现显著的方差缩减。
关键设定与假设¶
- Assumption 1 (Positivity & Dependency Neighborhood):抽样/暴露概率不能太小(
π_i ≥ π n^{-β}),且相关性局限在邻域内(|N_i| ≤ d n^α)。这比标准假设(如π_i > 0常数)更弱,允许概率随n缓慢衰减。这是为了证明渐近性质(一致性、方差等价、正态性)而设的,不同性质对α, β的要求不同(如一致性要求3α+4β < 1)。 - Assumption 2 (Boundedness & Non-degeneracy of Basis):控制变量的基
a_i有界,且a^T Σ a以n的速度增长(即控制变量方差不能太小)。这是为了保证估计的系数bγ_HT表现良好。 - Assumption 3 (i.i.d. Outcomes):结果
Y_i是来自某个未知分布的i.i.d.样本。这个假设仅用于推导最优基,不用于推断。它使得我们可以计算E[Y Y^T],从而将问题转化为一个可解的优化问题。这是一个关键的“模型辅助”假设。 - Assumption 4 (Known Exposure Mapping):在网络干扰下,潜在结果仅通过一个已知的、低维的暴露映射(exposure mapping)依赖于处理分配向量。这是网络干扰文献中的标准假设,用于简化问题。
- 相比已有文献:Assumption 1 比标准假设(如
π_i有正常数下界)更弱。Assumption 3 是本文特有的,它将一个纯设计问题转化为一个设计-模型混合问题,从而允许进行最优性分析。
主要结果¶
- Theorem 1 (Survey Sampling, Asymptotics):证明了使用估计系数
bγ_HT的控制变量估计量bµ_CV(bγ_HT)是相合的、渐近方差与使用最优系数的相同、且渐近正态。这为使用估计系数提供了理论基础。 - Theorem 2 (Optimal Control Variate, Survey Sampling):这是核心理论结果。它给出了在期望方差最小化意义下的最优基
a*。a*正比于Σ^{-1/2} u_1(M),其中M = Σ^{1/2} Π^{-1} (σ^2 I_n + μ^2 1_n 1_n^T) Π^{-1} Σ^{1/2}。期望方差缩减等于λ_1(M) / n^2。这个结果将最优基与设计(Σ, Π)和结果分布(μ, σ^2)的矩联系起来。 - Theorem 4 (Optimal Control Variates, Network Interference):将结果推广到网络干扰。最优基
B*需要求解一个非凸的二次优化问题max_{B∈B} Tr[(B^T Ω B)^{-1} B^T Ω^{1/2} M Ω^{1/2} B]。期望方差缩减的上界为(λ_1(M) + λ_2(M)) / n^2。 - Theorem 5 (1/2-Approximation):对于网络干扰下的非凸问题,给出了一个1/2近似解。该解通过求解一个秩1的Rayleigh商问题得到,计算简单。
- Theorem 6 (Monotone Convergence):提出的交替局部搜索启发式算法单调收敛到一个局部最优解。
- Corollary 1 & 3 (Noiseless Outcomes):当结果方差为0时,最优基退化为IPW基。这为Hajek等估计量在特定条件下的最优性提供了理论解释。
- Proposition 2 (Asymptotic Optimality of IPW Basis):在Bernoulli抽样下,当
n很大时,最优基收敛到IPW基。这解释了为什么IPW基(从而Hajek等估计量)是渐近有效的。
证明路线与技术技巧(理论型必写,要具体)¶
以Theorem 2(调查抽样下的最优基)为例:
-
整体路线:
- 写出目标函数:最小化期望方差
E_Y[Var(bµ_CV(γ*))]。由于Var(bµ_CV(γ*))是Y的函数,我们对其取期望。 - 转化为最大化问题:期望方差等于一个常数减去一个与
a相关的项。因此,最小化方差等价于最大化E_Y[(Y^T Π^{-1} Σ a)^2 / (a^T Σ a)]。 - 计算期望:利用Assumption 3(
Y_ii.i.d.),计算E_Y[Y Y^T] = σ^2 I_n + μ^2 1_n 1_n^T。代入后,目标变为最大化(a^T Σ Π^{-1} (σ^2 I_n + μ^2 1_n 1_n^T) Π^{-1} Σ a) / (a^T Σ a)。 - 变量变换:令
v = Σ^{1/2} a / ||Σ^{1/2} a||,将问题转化为标准的Rayleigh商问题:最大化v^T M v,其中M = Σ^{1/2} Π^{-1} (σ^2 I_n + μ^2 1_n 1_n^T) Π^{-1} Σ^{1/2}。 - 应用Rayleigh商定理:最大值就是
M的最大特征值λ_1(M),最优的v就是对应的特征向量u_1(M)。 - 反解出
a:由v = Σ^{1/2} a得到a* = c Σ^{-1/2} u_1(M)。
- 写出目标函数:最小化期望方差
-
关键跳跃点:
- 从“固定Y”到“随机Y”:这是最关键的跳跃。如果
Y已知,我们可以直接设a = Π^{-1} Y将方差降为0。但Y未知,所以作者引入了一个随机模型,将问题转化为“在期望意义下”的最优。这个跳跃使得问题从“不可能”变为“可解”。 - 期望的计算:将
E[Y Y^T]分解为σ^2 I_n + μ^2 1_n 1_n^T是关键的代数步骤。它揭示了最优基依赖于结果的方差和均值,即信噪比。
- 从“固定Y”到“随机Y”:这是最关键的跳跃。如果
-
技术技巧点名:
- Rayleigh商定理 (Rayleigh Quotient, Lemma EC.3):用于求解最大化
v^T M v问题,直接给出最优解为最大特征向量。 - Fan's Principle (Lemma EC.4):在Theorem 4的网络干扰设定下,用于将问题转化为迹最大化问题,并给出上界。
- 依赖邻域中心极限定理 (Dependency Neighborhood CLT, Lemma EC.2):用于证明Theorem 1和3中的渐近正态性,处理弱相关的抽样/处理指示符。
- 矩阵代数和伪逆:大量使用矩阵的平方根、伪逆等工具进行变量变换和简化表达。
- Rayleigh商定理 (Rayleigh Quotient, Lemma EC.3):用于求解最大化
真实例子与应用¶
-
应用1:Swiss Environmental Panel Survey Data
- 数据:瑞士环境面板调查,n=14961个受邀者,其中3185人回应。目标是估计加权后的家庭食物浪费占比。
- 方法:将回应率作为抽样概率
π_i。比较了HT、Hajek和三种控制变量估计量(常数基、IPW基、样本分裂最优基)。 - 结果:所有控制变量估计量和Hajek都几乎将标准误降低了45.6%,而点估计几乎相同。
- 说明:这个例子展示了在抽样概率不太极端的情况下,即使使用简单的控制变量(如常数基),也能获得与Hajek相当的巨大方差缩减。它验证了理论,但未能展示最优基相对于IPW基的优势(因为在这个数据中,IPW基已经足够好)。
-
应用2:Insurance Network Experimental Data (Cai et al. 2015)
- 数据:中国农村保险推广实验,研究社交网络对保险购买的影响。目标是估计“多一个朋友参加强化培训”的边际效应。
- 方法:定义了三个目标总体(
n_1=881, n_2=481, n_3=168),比较了HT、Hajek和三种控制变量估计量(IPW基、样本分裂1(1/2近似解)、样本分裂2(交替搜索后))。使用了自归一化系数来提高数值稳定性。 - 结果:在三个面板中,控制变量估计量一致地优于HT。在面板B和C中,控制变量估计量也优于Hajek。在面板C(小样本)中,Hajek表现极差(标准误增加了94.3%),而控制变量估计量依然稳健。
- 说明:这个例子展示了在网络干扰下,当暴露概率高度异质且样本量有限时,本文提出的最优控制变量方法相对于Hajek的显著优势。它验证了理论中关于“考虑两个控制变量之间相关性”的重要性。
🔎 结论是否比证明窄¶
- Theorem 4 的上界:作者证明的是期望方差缩减的上界
(λ_1(M) + λ_2(M))/n^2,但并未证明这个上界是紧的(tight),即存在一个可行的B能达到这个上界。在SUTVA特例下(Corollary 2),这个上界是紧的,但在一般网络干扰下,它只是一个上界。作者在结论中声称“最优方差缩减由...特征值决定”,但严格来说,他证明的是“上界由特征值决定”。这是一个细微但重要的区别。 - Theorem 5 的1/2近似:作者证明了一个1/2近似解的存在,但并未证明这个近似解在实际中的表现如何。模拟和实证中,它表现良好,但理论保证是常数因子,而非渐近最优。
- 对协方差的处理:在网络干扰下,作者假设
σ(1,0) = 0(即两个潜在结果独立)来构造代理矩阵fM。这个假设在现实中通常不成立,作者也承认这是一个局限性。因此,结论中关于最优基的公式在实际应用中依赖于一个可能错误的假设。
四、开放问题¶
-
对矩误设的鲁棒性:最优基依赖于未知的矩(
μ, σ^2),作者使用样本分裂来估计。但估计误差会影响方差缩减效果。能否发展出对矩误设(misspecification)鲁棒的基选择方法?例如,使用minimax准则或贝叶斯方法?(扎根于:Section 6, "First, the optimal bases depend on moments of the outcome distribution... It remains a future research direction to develop robust choices of bases that perform well under misspecified moment assumptions.") -
处理估计概率:本文假设抽样/处理概率
π_i已知。在观察性研究中,这些概率需要估计。估计概率的误差会如何影响控制变量估计量的方差和偏差?能否将本文的框架与倾向得分估计(如IPW、AIPW)结合起来?(扎根于:Section 6, "Second, throughout the paper we take the sampling, treatment, or exposure probabilities as known... It remains a future research direction to develop the theory for estimated probabilities.") -
结合协变量:本文仅使用设计诱导的指示符作为控制变量,未使用协变量。如何将协变量信息(如通过回归调整)与本文的最优控制变量框架结合起来,以获得更大的方差缩减?(扎根于:Section 6, "Third, we use the sampling, treatment, or exposure indicators as control variates. We do not use auxiliary variables such as covariates... It remains a future research direction to combine the design-induced control variates studied in this paper with auxiliary variables.")
-
与半参数效率界的联系:本文的最优控制变量估计量的方差是否达到了半参数效率界(semiparametric efficiency bound)?在SUTVA下,AIPW和TMLE是半参数有效的,而本文的框架声称能进一步缩减方差。这是否意味着本文的估计量超越了半参数效率界?如果不是,它与效率界的关系是什么?(扎根于:本文声称AIPW和TMLE是“efficient estimator”,但本文的最优控制变量又比它们更好。这是一个需要澄清的张力点。研究者可以去读Robins et al. (1994) 或 Van Der Laan and Rubin (2006) 的效率界结果,并与本文的Theorem 2进行对比。)
Maintained by 陈星宇 · Homepage · Source on GitHub