跳转至

Causal inference in two-sided randomization designs: factorial regression, two-way clustering, and covariate adjustment

作者: Pengfei Tian, Jizhou Liu, Lei Shi, Peng Ding
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.22761


一、领域脉络与小综述

  • 这个方向是什么:本文研究的是双边随机化实验(two-sided randomization designs)中的因果推断问题。这类实验的核心特征是,实验单元并非独立个体,而是由两个不同群体(如买家与卖家)之间的配对互动构成。研究者对两个群体分别独立进行随机化,每个配对(dyad)的暴露状态由双方的处理分配共同决定,从而形成四种暴露条件。该子方向要解决的根本问题是:在存在干扰(interference) 和双向依赖结构的实验设计中,如何对总效应、溢出效应和交互效应进行基于设计的(design-based)因果推断,即仅利用随机化机制而不依赖结果模型假设进行估计和推断。当前该方向正处于快速发展期,已有工作(Masoero et al., 2026; Sudijono et al., 2026; Liu et al., 2025)建立了估计量的渐近理论,但方差估计的保守性和协变量调整的效率增益问题仍是活跃的研究前沿。

  • 发展脉络(history):

    • 奠基工作:本文的框架建立在有限总体(finite population) 和设计基推断(design-based inference) 的传统之上。文中引用的 Abadie et al. (2020) 明确区分了基于抽样与基于设计的推断不确定性,为本文从随机化机制出发推导方差提供了理论基础。同时,Cornfield and Tukey (1956) 的"鸽笼"(pigeonhole)框架为处理双向分类数据中的均值比较提供了早期方法。
    • 主要进展:针对双边实验的现代理论由 Masoero et al. (2026) 和 Sudijono et al. (2026) 建立,他们提出了基于矩估计的效应估计量并推导了渐近方差,但方差估计较为保守。Liu et al. (2025) 则从随机化推断(randomization inference)的角度提出了另一种方差估计思路。本文作者(Tian, Liu, Shi, Ding)在此前的工作(Tian et al., 2026)中建立了分层置换统计量的协方差表示,为本文的方差分解提供了技术工具。
    • 当前 frontier:当前的前沿问题包括:(i) 如何构造更不保守的方差估计量,以在保持有效性的前提下提高检验功效;(ii) 如何将协变量调整纳入设计基框架并保证效率增益;(iii) 如何将双边随机化推广到更复杂的网络干扰结构。本文正是针对前两个问题提出了解决方案。
  • 子线索聚类:被引文献大致落在以下三条子线索上:

    1. 设计基推断与方差估计:以 Abadie et al. (2020, 2023) 为代表,关注回归分析中不确定性的来源(抽样 vs 设计),以及聚类稳健标准误的适用条件。本文在此基础上,针对双边随机化的特殊结构,证明了传统双向聚类方差估计量的渐近保守性。
    2. 干扰下的实验设计:以 Johari et al. (2022)、Wager and Xu (2021)、Munro et al. (2025) 为代表,关注市场平台实验中因交互产生的干扰偏差,通常借助市场均衡模型进行刻画。本文则采用局部干扰(local interference) 假设(即 Assumption 2),将干扰限制在配对内部,从而绕开复杂的均衡分析。
    3. 随机化推断与置换检验:以 Liu et al. (2025) 为代表,利用处理分配的置换分布进行精确推断。本文的方差估计量在构造上借鉴了置换检验的思想,但通过 Hajék 投影实现了渐近正态近似,从而支持 Wald 型置信区间。
  • 这个方向在追问的核心问题:

    1. 效应估计的一致性:在双边随机化下,如何构造总效应、溢出效应和交互效应的估计量,并保证其相合性?
    2. 方差估计的有效性:如何估计这些估计量的渐近方差?传统的双向聚类稳健方差估计量是否有效(即是否渐近保守或渐近精确)?
    3. 协变量调整的效率:如何利用预处理协变量提高估计精度,同时保证推断的有效性?不同的调整方式(如 Fisher 式与 Lin 式)在效率上有何差异?
    4. 推断的稳健性:在有限样本下,基于正态近似的置信区间是否具有正确的覆盖概率?方差估计量的保守性是否会随处理比例变化?
  • ⚠️ 作者的 framing(这是作者的说法):作者将本文的贡献框架为"回归视角下的统一理论"。他们声称,通过饱和回归的表示,可以将双边随机化下的效应估计、方差估计和协变量调整纳入一个统一的框架,从而"证明"传统双向聚类方差估计量的渐近保守性,并"推荐"一种更优的方差估计量。作者淡化了其理论贡献的局限性——特别是局部干扰假设(Assumption 2) 的强约束性——而将重点放在"实践可用性"上:研究者只需运行一个标准的线性回归,并使用双向聚类标准误,即可获得有效的推断。这种 framing 将本文定位为"显然的下一步":既然已有文献(Masoero et al., 2026; Sudijono et al., 2026)建立了估计量的渐近理论,那么下一步自然是简化其方差估计的复杂性,使其对应用研究者更友好。作者回避了更复杂的干扰结构(如网络干扰)和非线性的结果模型,这些方向被留给了未来工作。

  • 张力:被引文献之间未见明显对立结论,但存在方法论的张力:Masoero et al. (2026) 和 Sudijono et al. (2026) 的方差估计量基于逐暴露条件分解,而本文的优化估计量则强调保留配对内的联合依赖结构。这种张力体现在 Proposition 3 中:本文的估计量在理论上总是优于(即不差于)现有方法的保守目标。此外,Liu et al. (2025) 的随机化推断方法与本文的渐近方法在哲学上存在差异——前者强调有限样本精确性,后者强调大样本近似——但本文通过证明其方差估计量与置换方差的一致性,将两者联系起来。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型与可观测数据

在展开技术细节之前,先建立以下记号。这是理解全文的基础。

  • 群体与配对:设有 \(I\) 个买家(buyers),索引为 \(i \in [I] := \{1, \dots, I\}\);\(J\) 个卖家(sellers),索引为 \(j \in [J] := \{1, \dots, J\}\)。分析单元是买家-卖家配对 \((i, j)\),总共有 \(IJ\) 个配对。
  • 处理分配:
  • 买家侧处理向量:\(W^B = (W^B_1, \dots, W^B_I)^\top \in \{0,1\}^I\),其中 \(W^B_i = 1\) 表示买家 \(i\) 被分配到处理组。
  • 卖家侧处理向量:\(W^S = (W^S_1, \dots, W^S_J)^\top \in \{0,1\}^J\),其中 \(W^S_j = 1\) 表示卖家 \(j\) 被分配到处理组。
  • 处理组人数固定:\(\sum_i W^B_i = I_1\),\(\sum_j W^S_j = J_1\)。定义处理比例 \(e^B_p = I_p/I\),\(e^S_q = J_q/J\),其中 \(p, q \in \{0,1\}\)。
  • 暴露条件:配对 \((i,j)\) 的暴露状态由 \((W^B_i, W^S_j)\) 共同决定,共有四种:\((1,1), (1,0), (0,1), (0,0)\)。
  • 潜在结果:在局部干扰假设(Assumption 2) 下,配对 \((i,j)\) 的潜在结果只取决于其自身的暴露状态,记为 \(Y_{ij}(p, q)\),其中 \(p, q \in \{0,1\}\)。这里 \(Y_{ij}(p, q)\) 是固定有限总体中的确定性量,而非随机变量。
  • 观测结果:观测到的结果为 \(Y^{obs}_{ij} = Y_{ij}(W^B_i, W^S_j)\)。
  • 暴露条件指示:定义 \(G_{pq,ij} = \mathbf{1}\{W^B_i = p, W^S_j = q\}\),表示配对 \((i,j)\) 是否处于暴露条件 \((p,q)\)。
  • 暴露条件样本量:\(I_p J_q = \sum_{i,j} G_{pq,ij}\)。
  • 暴露条件均值:观测到的暴露条件均值 \(\hat{Y}(p,q) = (I_p J_q)^{-1} \sum_{i,j} G_{pq,ij} Y^{obs}_{ij}\)。
  • 有限总体均值:潜在结果的有限总体均值 \(\bar{Y}(p,q) = (IJ)^{-1} \sum_{i,j} Y_{ij}(p,q)\)。
  • 目标估计量:感兴趣的效应是 \(\bar{Y}\) 的线性组合,即 \(\tau_\beta = \beta^\top \bar{Y}\),其中 \(\beta = (\beta_{11}, \beta_{10}, \beta_{01}, \beta_{00})^\top\) 是给定的对比向量。例如,总效应 \(\tau_{tot} = \bar{Y}(1,1) - \bar{Y}(0,0)\) 对应 \(\beta = (1,0,0,-1)\)。
  • 估计量:\(\hat{\tau}_\beta = \beta^\top \hat{Y}\),其中 \(\hat{Y} = (\hat{Y}(1,1), \hat{Y}(1,0), \hat{Y}(0,1), \hat{Y}(0,0))^\top\)。
  • 协变量:\(X_{ij} \in \mathbb{R}^d\) 为配对的预处理协变量(固定量),\(\bar{X} = (IJ)^{-1} \sum_{i,j} X_{ij}\) 为其有限总体均值。
  • 关键记号:\(\rho_{I,J} = I^{-1} + J^{-1}\),表示渐近收敛的速率。

可观测数据:研究者观测到的是 \(\{Y^{obs}_{ij}, X_{ij}, W^B_i, W^S_j\}_{i \in [I], j \in [J]}\),即所有配对的结果、协变量以及两侧的处理分配。不可观测的是完整的潜在结果矩阵 \(\{Y_{ij}(p,q)\}\)。

第二步:最小内核——为什么双向聚类方差估计量是保守的?

本文的核心数学问题可以归结为:如何估计 \(\hat{\tau}_\beta\) 的方差? 传统做法是使用双向聚类稳健方差估计量,但本文证明该估计量是渐近保守的。要理解这一点,需要先看方差从何而来。

方差的来源:由于处理分配是随机的,\(\hat{Y}(p,q) - \bar{Y}(p,q)\) 的波动来自两个独立的随机化:买家侧和卖家侧。因此,估计量的方差可以分解为两部分:

  1. 买家侧方差:来自买家处理分配 \(W^B\) 的随机性。固定卖家分配,改变哪些买家被处理,会导致暴露条件均值的变化。
  2. 卖家侧方差:来自卖家处理分配 \(W^S\) 的随机性。固定买家分配,改变哪些卖家被处理,同样会导致暴露条件均值的变化。

这两部分方差是可加的,因为两个随机化是独立的。用公式表示,\(\hat{\tau}_\beta\) 的渐近方差为:

\[\sigma^2_\beta = \underbrace{\frac{e^B_1 e^B_0}{I} S^2_{A,\Delta}}_{\text{买家侧}} + \underbrace{\frac{e^S_1 e^S_0}{J} S^2_{B,\Delta}}_{\text{卖家侧}}\]

其中 \(S^2_{A,\Delta}\) 和 \(S^2_{B,\Delta}\) 是某种"投影得分"的有限总体方差(见文中公式 (11) 和 (8))。

双向聚类方差估计量的缺陷:双向聚类方差估计量(Cameron et al., 2011)试图通过"聚类"来捕捉这种双向依赖。它计算买家聚类和卖家聚类的得分贡献,然后相加并减去交集项。然而,本文的关键洞察(Proposition 1)是:这种估计量在渐近上等于一个更保守的目标:

\[\beta^\top \hat{\Omega}_{2w} \beta \to \underbrace{\frac{e^B_1}{I} S^2_{A,1} + \frac{e^B_0}{I} S^2_{A,0}}_{\text{买家侧(按状态分解)}} + \underbrace{\frac{e^S_1}{J} S^2_{B,1} + \frac{e^S_0}{J} S^2_{B,0}}_{\text{卖家侧(按状态分解)}}\]

而不是真实的方差 \(\sigma^2_\beta\)。关键在于,真实方差中的买家侧项是 \(S^2_{A,\Delta}\),即跨处理状态的差分的方差;而双向聚类估计量收敛到的是 \(S^2_{A,1}\) 和 \(S^2_{A,0}\) 的加权和,即各状态内部的方差之和。

为什么保守? 因为三角不等式:

\[S_{A,\Delta} = S_{A,1 - A,0} \le S_{A,1} + S_{A,0}\]
所以:
\[\sigma^2_\beta \le \frac{e^B_1 e^B_0}{I} (S_{A,1} + S_{A,0})^2 + \frac{e^S_1 e^S_0}{J} (S_{B,1} + S_{B,0})^2 = \beta^\top \hat{\Omega}_{2w} \beta\]

最小内核的直观解释:想象一个极端情况:如果每个买家的效应完全一致(即 \(A_i(1) - A_i(0)\) 对所有 \(i\) 都相同),那么买家侧的真实方差 \(S^2_{A,\Delta} = 0\)。但双向聚类估计量仍然会估计出正的方差 \(S^2_{A,1} + S^2_{A,0} > 0\),因为它无法区分"状态间差异"和"状态内差异"。它把状态内的异质性也当成了处理效应估计的不确定性来源,从而高估了方差。

本文的解决方案:作者提出的优化估计量(公式 (13))直接估计 \(S_{A,\Delta}\) 和 \(S_{B,\Delta}\),即只对跨状态的差分进行方差估计,从而避免了不必要的保守性。这个估计量在数学上等价于对饱和回归的聚类得分进行一种特殊的"状态内中心化"后再聚合。

这个最小内核揭示了本文的核心贡献:它不仅仅是提出一个新的方差估计量,而是揭示了双向聚类方差估计量在双边随机化下的保守性来源,并给出了一个理论上更优的替代方案。这个洞察对于任何涉及双向随机化的实验设计(如双边市场实验)都具有直接的实践意义。


三、这篇论文做了什么

  • 三句话:

    1. 研究了什么问题:在双边随机化实验(如双边市场)中,如何对总效应、溢出效应和交互效应进行基于设计的渐近有效推断,并解决现有方差估计量过度保守的问题。
    2. 核心工具 / 方法:利用饱和线性回归的表示,结合 Hajék 投影和分层置换统计量的协方差分解,推导出估计量的渐近分布;在此基础上,提出一种新的"优化"方差估计量,该估计量通过保留状态内联合依赖结构来减少保守性;并将协变量调整(Fisher 式与 Lin 式)纳入同一框架。
    3. 主要结论:① 传统双向聚类稳健方差估计量在双边随机化下是渐近保守的;② 本文提出的优化方差估计量在理论上更优(更不保守),且保持渐近有效性;③ 协变量调整可以保证效率增益,且 Lin 式调整(允许斜率随暴露条件变化)在效率上不劣于 Fisher 式调整,并推荐一种 ANOVA 分解的协变量表示以确保效率增益。
  • 关键设定与假设:

    • Assumption 1(独立双边完全随机化):买家侧和卖家侧的处理分配是独立的完全随机化,且处理组人数固定。这是整个推断的基础,保证了买家侧和卖家侧的随机化不确定性可以分离。
    • Assumption 2(局部干扰):配对 \((i,j)\) 的潜在结果只取决于其自身的暴露状态 \((W^B_i, W^S_j)\),而不受其他配对处理状态的影响。这是核心识别假设,它将复杂的网络干扰问题简化为四暴露条件模型。相比更一般的干扰模型(如 Wager and Xu, 2021),此假设较强,但也是本文方法可行的关键。
    • Condition 1(矩条件与正则性):要求处理比例有界、潜在结果存在有界 \((2+\delta)\) 阶矩、以及协变量矩阵非奇异。这些条件保证了 Hajék 投影的余项可忽略,以及 Lyapunov 中心极限定理的适用。
    • Condition 2(协变量正则性):要求协变量的二阶矩和四阶矩有界,且总体协方差矩阵非奇异。这是协变量调整渐近理论的标准条件。
    • Conditions 3-6(调整后矩条件):分别对 Fisher 和 Lin 调整后的潜在结果施加与 Condition 1 类似的矩条件,以保证调整后估计量的渐近正态性。
  • 主要结果:

    • Theorem 1(向量 CLT):在 Assumptions 1-2 和 Condition 1 下,\(\hat{Y}\) 的联合分布渐近正态,协方差矩阵为 \(\Sigma\)(公式 8)。这是后续所有推断的基础。
    • Proposition 1(双向聚类方差估计量的保守性):双向聚类方差估计量 \(\hat{\Omega}_{2w}\) 收敛到一个确定性目标 \(\Omega^\circ_{2w}\),且 \(\Omega^\circ_{2w} \succeq \Sigma\)(在 Loewner 序下)。这意味着基于 \(\hat{\Omega}_{2w}\) 的 Wald 置信区间是渐近保守的。
    • Proposition 2(优化方差估计量的有效性):本文提出的优化估计量 \(\hat{V}_{opt,\beta}\) 一致估计真实方差 \(\sigma^2_\beta\),因此基于它的置信区间是渐近精确的。
    • Proposition 3(方差估计量的比较):对于任何对比 \(\beta\),优化估计量的目标 \(V^\circ_{opt,\beta}\) 满足 \(\sigma^2_\beta \le V^\circ_{opt,\beta} \le \beta^\top \Omega^\circ_{2w} \beta\),即优化估计量在保守性和精确性之间取得了更好的平衡。
    • Theorem 2-5(协变量调整):Fisher 和 Lin 调整后的估计量均满足 CLT,且其双向聚类方差估计量同样渐近保守。Lin 调整在效率上不劣于 Fisher 调整。
    • Proposition 4(ANOVA 分解的协变量调整):将协变量分解为买家、卖家和交互成分后,ANOVA 分解的 Lin 调整在无额外条件下保证效率增益(\(\Sigma_{AL} \preceq \Sigma\)),而 ANOVA 分解的 Fisher 调整需要额外条件。
  • 证明路线与技术技巧:

    • 整体路线:证明分为三步。第一步,利用 Hajék 投影将 \(\hat{Y} - \bar{Y}\) 分解为买家侧和卖家侧两个独立的一阶项之和,忽略交互余项。第二步,利用分层置换统计量的协方差表示(Tian et al., 2026),计算投影项的协方差矩阵,得到 \(\Sigma\)。第三步,对双向聚类方差估计量进行代数展开,证明其收敛到 \(\Omega^\circ_{2w}\),并通过矩阵不等式比较 \(\Omega^\circ_{2w}\) 与 \(\Sigma\)。
    • 关键技巧:
      1. Hajék 投影:这是处理有限总体置换统计量的标准工具。作者将 \(\hat{Y}(p,q) - \bar{Y}(p,q)\) 投影到买家侧和卖家侧的线性函数空间,使得投影后的两项独立,从而简化协方差计算。
      2. 状态内中心化:在构造优化方差估计量时,作者对聚类得分进行了状态内中心化,即减去该状态内的均值。这一操作消除了状态间差异对方差估计的贡献,从而避免了保守性。
      3. 矩阵不等式:为了证明保守性,作者使用了 Loewner 序下的矩阵比较。关键不等式是 \(S^2_{A,\Delta} \le (S_{A,1} + S_{A,0})^2\),这源于三角不等式。
      4. Frisch-Waugh-Lovell 定理:在协变量调整部分,利用该定理将回归系数表示为残差化结果的均值,从而将调整后的估计量纳入统一的框架。
      5. Polarization 技巧:在 Lemma S9 中,为了证明样本协方差矩阵的一致性,作者利用极化恒等式将矩阵范数转化为标量平方和,从而简化了矩条件的验证。
  • 真实例子与应用:

    • 模拟研究:论文包含两个模拟实验。第一个是高斯因子模型,验证了优化方差估计量在有限样本下的表现优于双向聚类估计量(更短的置信区间,且覆盖概率接近名义水平)。第二个是战略市场设计(Sudijono et al., 2026),模拟了更真实的市场互动,结果与第一个模拟一致。
    • 实证应用:论文使用了一个来自尼泊尔的家户金融网络数据(Prina, 2015; Comola and Prina, 2021)。该实验随机向部分家户提供储蓄账户,研究者关注这一干预如何通过家户间的借贷网络影响金融行为。作者将家户分为"受冲击"(买家)和"未受冲击"(卖家)两类,构建双边随机化框架,估计了总效应和溢出效应。结果显示,优化方差估计量给出的置信区间比双向聚类估计量窄约 5-10%,且结论不变(效应不显著)。这个例子展示了方法在实际数据分析中的可用性。
  • 🔎 结论是否比证明窄:

    • Theorem 1 的 CLT 是逐点收敛,而非一致收敛:作者证明了对于固定的对比向量 \(\beta\),\(\hat{\tau}_\beta\) 渐近正态。但并未证明该 CLT 在 \(\beta\) 的某个函数类上一致成立。这意味着如果研究者需要同时推断多个对比(如所有成对比较),可能需要额外的工具(如联合置信域或多重检验校正),论文未提供这方面的理论保证。
    • Proposition 1 的保守性是在 Loewner 序下,而非标量序下:作者证明了 \(\Omega^\circ_{2w} \succeq \Sigma\),这意味着对于任何 \(\beta\),\(\beta^\top \Omega^\circ_{2w} \beta \ge \beta^\top \Sigma \beta\)。但并未证明 \(\Omega^\circ_{2w}\) 的每个对角元素都大于 \(\Sigma\) 的对应元素。因此,对于某些特定的对比,双向聚类方差估计量可能并不保守(尽管整体上是保守的)。论文未讨论这种"逐坐标"的保守性。
    • 协变量调整的效率增益是渐近的,且未给出有限样本保证:Proposition 4 证明了 \(\Sigma_{AL} \preceq \Sigma\),这是渐近意义上的。在有限样本下,协变量调整可能引入额外的变异性,导致效率下降。论文的模拟研究显示在 \(I=200, J=150\) 时表现良好,但未提供理论上的有限样本界。
    • 局部干扰假设(Assumption 2)的检验:论文将 Assumption 2 作为识别假设,但未提供任何检验方法。如果实际数据中存在超出配对范围的干扰(如网络效应),本文的方法可能产生偏误。论文在实证应用中直接假设该条件成立,未进行敏感性分析。

四、开放问题

  1. 放松局部干扰假设:本文的核心假设是配对间的干扰不存在。在现实的双边市场中,干预效应可能通过更复杂的网络结构传播(如买家之间的社交影响)。如何将本文的框架推广到网络干扰或市场均衡效应(如 Wager and Xu, 2021; Munro et al., 2025)下,是一个重要的开放问题。具体而言,需要推导在存在跨配对干扰时,估计量的偏差表达式,并设计相应的敏感性分析或稳健推断方法。
  2. 有限样本下的精确推断:本文的推断基于渐近正态近似。在样本量较小或处理比例极端(如 \(I_1\) 或 \(J_1\) 很小)时,正态近似的精度可能不足。一个自然的延伸是发展基于随机化检验(randomization test) 的精确推断方法,类似于 Fisher 精确检验在完全随机化实验中的角色。Liu et al. (2025) 已在这方面有所探索,但将其与本文的优化方差估计量结合,并建立其与渐近方法的理论联系,仍是一个开放问题。
  3. 协变量调整的有限样本性质:Proposition 4 给出了渐近效率增益,但未回答"在什么条件下,协变量调整在有限样本下保证不损害效率"这一问题。特别是,当协变量维度 \(d\) 随样本量增长时,调整后的估计量可能出现过拟合,导致方差增大。研究高维协变量下的正则化调整(如 Lasso 或 Ridge)及其对推断有效性的影响,是一个有潜力的方向。
  4. 多边与动态实验的推广:本文只考虑了两个群体(买家、卖家)的静态随机化。现实中的平台实验可能涉及多个群体(如买家、卖家、物流方)或动态序贯决策(如多轮实验)。将本文的方差分解技术推广到多边随机化和序贯随机化,需要新的理论工具,例如多线性置换统计量的 CLT 和更复杂的依赖结构分析。
  5. 最优实验设计:本文关注给定随机化机制下的推断问题。一个互补的问题是:在双边随机化下,如何设计处理分配(如选择 \(I_1, J_1\) 或采用分层随机化)以最小化目标对比的渐近方差?这涉及到对 \(\Sigma\) 的显式表达式进行优化,并可能导出与单边实验不同的最优分配比例。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论