跳转至

Generated outcomes as generated regressors: Equivalences in recursive causal estimation

作者: Wisse Rutgers, Rahul Singh
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2606.29009


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是递归因果估计量之间的代数等价性。具体来说,在时间变化处理效应、替代变量识别效应和中介效应等纵向因果推断设定中,目标参数被识别为一系列递归的条件期望(g-computation formula)。研究者面临多种估计策略:递归插件估计量(递归地回归生成结果)、递归平衡权重估计量(递归地平衡生成回归变量)和递归双稳健估计量(将前两者结合)。这个方向要回答的根本问题是:这些看似不同的估计量之间是否存在精确的代数关系? 当前,该方向正从横截面(T=1)的已知等价性向纵向(T≥2)的递归设定扩展。

发展脉络(history)

奠基工作: - Robins (1986):提出g-computation formula,将时间变化处理效应下的反事实均值识别为递归的条件期望,奠定了递归回归的识别基础。 - Robins et al. (1994):将双稳健估计引入因果推断,为后续的等价性研究提供了核心对象。 - Robins et al. (2007):首次系统性地证明了在横截面设定下,某些回归、平衡权重和双稳健估计量是数值等价的。这是本文最直接的先驱工作之一。

主要进展: - Bang and Robins (2005):提出了时间变化处理设定下的递归双稳健估计量,将双稳健思想从横截面推广到纵向。 - Chernozhukov et al. (2022b):将递归函数形式化,定义了“递归函数”(recursive functionals)这一统一框架,并建立了其Neyman正交性和混合偏差性质。本文直接建立在该框架之上。 - Bruns-Smith et al. (2025):证明了在横截面设定下,当结果模型和Riesz representer都用岭回归估计时,增广估计量代数等价于一个单一的欠光滑结果回归。这是本文最直接的先驱,本文将其从T=1推广到T≥2。 - Rotnitzky et al. (2025):将Bruns-Smith et al. (2025)的等价性推广到混合偏差线性泛函类。本文则将其推广到递归函数类。

当前Frontier与本文位置: - Chernozhukov et al. (2022b)Rotnitzky et al. (2017) 等建立了递归因果参数的概率性收敛性质(正交性、一致性、渐近正态性)。 - 本文则研究一个互补的问题:这些估计量之间的代数性等价关系。它不提出新的平衡准则,而是揭示当递归回归和递归平衡权重在相同字典下线性时,它们何时精确相等、何时近似相等。

子线索聚类

  1. 横截面等价性(T=1):这是本文的参考点。核心工作是Robins et al. (2007)、Bruns-Smith et al. (2025)、Rotnitzky et al. (2025)。这一簇证明了在单期设定下,OLS回归、平衡权重和双稳健估计量之间的代数等价性,以及岭正则化下的收缩解释。
  2. 递归平衡权重:这一簇提出并分析纵向设定下的递归平衡准则。包括Bang and Robins (2005)(参数)、Kallus and Santacatterina (2021)(核方法)、Viviano and Bradic (2021)(高维线性)、Chernozhukov et al. (2022b)(通用机器学习)。本文不提出新准则,而是分析这些准则与递归回归之间的代数关系。
  3. 递归双稳健估计:这一簇建立递归因果参数的渐近性质。包括Molina et al. (2017)、Luedtke et al. (2017)、Rotnitzky et al. (2017)、Chernozhukov et al. (2022b)。本文研究的是这些估计量的代数结构,而非其概率性质。

这个方向在追问的核心问题

  1. 等价性是否从横截面推广到纵向? 当T≥2时,递归插件、递归平衡权重和递归双稳健估计量是否仍然精确相等?
  2. 正则化下的收缩解释是否成立? 在横截面中,双稳健估计被解释为向OLS收缩(欠光滑)。在纵向中,这种解释是否仍然成立?收缩的强度如何随时期数T变化?
  3. 一般凸惩罚下的结构是什么? 当惩罚不是岭回归时,是否还有类似的代数恒等式?

已知瓶颈:纵向设定中,生成结果和生成回归变量之间的递归耦合使得代数分析远比横截面复杂。每个阶段的估计误差会通过递归结构向前/向后传播。

⚠️ 作者的framing

  • 作者把缺口frame成什么:作者将Bruns-Smith et al. (2025)的横截面等价性视为“直接先驱”,并声称本文将其“推广到递归函数类”。作者将Chernozhukov et al. (2022b)的递归函数框架作为基础,然后问“这些估计量如何代数相关?”——这是一个与“概率收敛性质”互补的问题。
  • 哪些竞争路线被淡化或回避:作者明确说“Our contribution is not to propose a new balancing criterion”(我们不提出新的平衡准则)。这意味着本文不参与“哪种递归平衡方法更好”的竞争,而是专注于揭示已有方法之间的关系。作者也回避了与Viviano and Bradic (2021)的“动态协变量平衡”(DCB)方法的直接比较,仅在2.3.3节末尾指出在字典饱和于处理路径时两者一致,否则不同。
  • 什么明显该被引/该存在、却没出现在intro里? 未见明显缺失。作者引用了横截面等价性的关键文献(Robins et al., 2007; Bruns-Smith et al., 2025; Rotnitzky et al., 2025)和递归估计的关键文献(Bang and Robins, 2005; Chernozhukov et al., 2022b; Viviano and Bradic, 2021等),覆盖全面。

张力

未见明显对立引用。各被引工作之间是互补关系:有的研究横截面等价性,有的研究递归估计的渐近性质,有的提出递归平衡准则。本文将它们统一在一个代数框架下。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - T:时期数(阶段数)。T=1是横截面,T≥2是纵向。 - W:所有可观测随机变量的串联。研究者观测到n个i.i.d.副本。 - Zt:第t阶段的条件变量(conditioning variables)。例如,在时间变化处理中,Zt = (X1, D1, ..., Xt, Dt)。 - Y:最终结果变量(仅在最后阶段T出现)。 - ft(zt) = Et[mt+1(W; ft+1) | Zt = zt]:第t阶段的结果回归函数(outcome regression)。它是给定Zt时,对“生成结果”mt+1(W; ft+1)的条件期望。ft是要估计的未知函数(参数/非参数)。 - mt(W; g):一个线性泛函,将函数g映射为一个随机变量。它通常涉及对g进行反事实替换(例如,将处理变量设为某个值)。mt(W; ft+1)被称为生成结果(generated outcome)。 - αt(Zt):第t阶段的Riesz representer。它满足Et-1[αt-1(Zt-1) mt(W; g)] = Et[αt(Zt) g(Zt)]。αt是要估计的未知函数。 - θ0:目标参数,一个反事实均值。由θ0 = E0[m1(W; f1)]识别。 - ϕt: Zt → R^kt:第t阶段的字典(basis functions)。假设ft和αt都是ϕt的线性组合:ft(Zt) = ϕt' βt, αt(Zt) = ϕt' ηt。 - ϕt^d:字典ϕt在泛函mt下的像:(ϕt^d)_j := mt(W; ϕt,j)。当mt涉及反事实替换时,ϕt^d就是ϕt在处理变量被改写后的版本。 - βt, ηt:系数向量。βt是结果回归的系数,ηt是Riesz回归的系数。 - ˆGt = Êt[ϕt ϕt']:第t阶段的样本Gram矩阵。 - ˆMt = Êt[ϕt (ϕ_{t+1}^d)']:连接第t和t+1阶段的样本交叉矩矩阵。 - λt, δt:正则化参数。λt用于结果回归,δt用于Riesz回归。 - Pt, Qt:凸惩罚函数。

模型: - 数据生成机制由递归函数类定义。参数θ0由(1)-(3)式的递归条件期望识别。这是一个半参数模型:我们只假设θ0是这个递归函数,而不对ft和αt的函数形式做全局参数假设。但在本文的代数分析中,我们进一步假设ft和αt是字典ϕt的线性组合。 - 识别θ0需要因果假设(如序贯可忽略性、替代有效性等),但本文的代数等价性不依赖于这些假设的正确性——它只依赖于估计量的代数形式。

可观测数据: - 研究者观测到n个i.i.d.副本的W。W包含了所有时期的所有变量(协变量、处理、中介、结果等)。 - 想要但观测不到的量:反事实结果Y(d1, d2, ...)以及真实的回归函数ft和Riesz representer αt。这些只能通过假设和估计来获得。

第二步:讲最小内核

本文的最小内核是T=2、无正则化(OLS) 的特例。这个特例已经包含了递归因果推断的全部核心代数结构。

最简特例:T=2, OLS

设定: - T=2。有两个阶段。 - 所有估计都用OLS,即λ1 = λ2 = δ1 = δ2 = 0。 - 假设所有Gram矩阵ˆG1, ˆG2可逆。

可观测数据:W = (Z1, Z2, Y)。Z1是第一阶段的变量,Z2是第二阶段的变量,Y是最终结果。

估计量: 1. 递归插件估计量 (ˆθ^P): - 第2阶段:ˆβ2^OLS = ˆG2^{-1} Ê2[Y ϕ2] - 第1阶段:ˆβ1^OLS = ˆG1^{-1} ˆM1 ˆβ2^OLS - 插件估计:ˆθ^P = Ê0[(ϕ1^d)' ˆβ1^OLS]

  1. 递归平衡权重估计量 (ˆθ^Q)

    • 第1阶段:ˆη1^OLS = ˆG1^{-1} Ê0[ϕ1^d]
    • 第2阶段:ˆη2^OLS = ˆG2^{-1} ˆM1' ˆη1^OLS
    • 平衡权重估计:ˆθ^Q = Ê2[Y ϕ2'] ˆη2^OLS
  2. 递归双稳健估计量 (ˆθ^DR)

    • 使用(23)式,其中ˆεt是OLS残差。

核心命题(Theorem 1的特例): 当所有阶段都用OLS时,这三个估计量在任意有限样本下精确相等: ˆθ^P = ˆθ^Q = ˆθ^DR

为什么成立? - 每个校正项都为零:因为OLS残差与回归变量正交,而Riesz representer ˆαt = ϕt' ˆηt^OLS在ϕt的张成空间中,所以Êt[ˆαt ˆεt] = 0。因此双稳健估计退化为插件估计:ˆθ^DR = ˆθ^P。 - 所有中间项都相等:通过OLS的正规方程,可以证明(ˆηt^OLS)' ˆGt ˆβt^OLS对所有t都等于同一个值,且等于ˆθ^P和ˆθ^Q。具体地,从t=T开始,ˆθ^Q = (ˆηT^OLS)' ˆGT ˆβT^OLS。然后利用前向FOC (ˆηt^OLS)' ˆMt = (ˆη_{t+1}^OLS)' ˆG_{t+1}和后向FOC ˆMt ˆβ_{t+1}^OLS = ˆGt ˆβt^OLS,可以逐步回推,证明所有阶段的(ˆηt^OLS)' ˆGt ˆβt^OLS都相等,最终等于ˆθ^P。

这个特例说明了什么? 它揭示了递归因果估计中一个深刻的代数事实:递归地回归生成结果,与递归地平衡生成回归变量,在OLS下是同一回事。这个等价性不依赖于模型是否正确设定,只依赖于每个阶段都使用OLS。这是本文最核心的发现,也是所有后续正则化分析的基础。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在时间变化处理效应、替代变量识别效应和中介效应等递归因果设定(T≥2)中,递归插件、递归平衡权重和递归双稳健估计量之间的代数等价关系。
  2. 核心工具/方法:在“线性于字典”的估计框架下,通过分析OLS、岭回归和一般凸惩罚下的正规方程和FOC,推导出这些估计量之间的精确代数恒等式。
  3. 主要结论:①在OLS下,三种估计量在任意有限样本下精确相等;②在岭惩罚下,双稳健估计量可表示为各阶段惩罚回归与OLS回归的向后递归混合,且OLS权重随时期数T几何衰减;③对于一般凸惩罚,推导了每阶段的恒等式。

关键设定与假设

  • 线性于字典:每个阶段的nuisance函数(ft和αt)都是给定字典ϕt的线性组合。这是本文代数分析的基础。作者指出许多非参数估计量(级数、lasso、核方法)都满足此性质。
  • Gram矩阵可逆:在OLS和部分岭回归分析中,假设每个阶段的样本Gram矩阵ˆGt可逆(即kt ≤ nt且字典在样本中满秩)。对于高维或核方法,用Moore-Penrose伪逆代替。
  • 递归函数类:参数θ0由Chernozhukov et al. (2022b)定义的递归函数类识别。本文的代数分析不依赖于识别假设的正确性。
  • 相比已有文献:本文的设定与Bruns-Smith et al. (2025)相同(线性于字典),但将其从T=1推广到T≥2。与Chernozhukov et al. (2022b)相比,本文不研究概率收敛性质,而是研究代数等价性。

主要结果

Theorem 1 (OLS等价性): - 陈述:当所有2T个nuisance函数都用OLS估计时,递归插件、递归平衡权重和递归双稳健估计量在任意有限样本下精确相等:ˆθ^DR = ˆθ^P = ˆθ^Q。 - 直觉:OLS的正交性使得每个双稳健校正项都为零,且所有中间项都通过正规方程联系起来。 - 必要条件:每个ˆGt可逆。 - 解决的技术难点:证明了递归结构下,OLS的等价性仍然成立,且不依赖于模型正确设定。

Theorem 2 (递归岭收缩): - 陈述:当Riesz representer用岭回归估计(惩罚δt),而结果回归用任意线性估计量(ˆβt^Gen)时,双稳健估计量ˆθ^DR等价于一个单一的递归结果回归,其系数由后向递归定义: - ˆβ_T^Aug = (I - A_T) ˆβ_T^Gen + A_T ˆβ_T^OLS - ˆβ_t^Aug-OLS = ˆG_t^{-1} ˆM_t ˆβ_{t+1}^Aug - ˆβ_t^Aug = (I - A_t) ˆβ_t^Gen + A_t ˆβ_t^Aug-OLS 其中A_t = (ˆG_t + δ_t)^{-1} ˆG_t是岭收缩算子。 - 直觉:每个阶段的增广系数是惩罚回归系数和OLS回归系数的仿射混合。但外层的OLS目标不是简单的ˆβ_t^OLS,而是对“增广生成结果”的OLS回归系数ˆβ_t^Aug-OLS。 - 必要条件:每个ˆGt可逆。 - 解决的技术难点:通过归纳法,将T阶段问题分解为1个阶段和(T-1)个阶段的问题,证明了增广系数的递归结构。

Corollary 1 (OLS权重的几何衰减): - 陈述:在标量对角情形(ˆGt = σ_t^2 I)下,增广系数中纯OLS插件系数ˆβ_1^OLS的权重为∏_{t=1}^T a_t,其中a_t = σ_t^2 / (σ_t^2 + δ_t) ∈ (0,1)。 - 直觉:随着时期数T增加,双稳健估计量中“纯OLS”成分的权重呈几何级数衰减。这意味着在纵向设定中,双稳健估计量越来越不像“向OLS收缩”,而是更多地依赖于惩罚回归。 - 必要条件:标量对角Gram矩阵。

Theorem 3 (一般凸惩罚下的望远镜恒等式): - 陈述:对于任意Riesz系数ˆηt和任意结果回归ˆβ_t^Gen,双稳健估计量满足:ˆθ^DR = ˆθ^OLS + ∑_{t=1}^T c_t' (ˆβ_t^Gen - ˆβ_t^OLS),其中c_t = ˆτ_t - ˆG_t ˆη_t是Riesz残差。 - 直觉:双稳健估计量等于OLS加上每个阶段的校正项之和。每个校正项是Riesz残差与惩罚-OLS系数差距的内积。 - 必要条件:每个ˆGt可逆(用于定义ˆβ_t^OLS)。 - 解决的技术难点:通过代数推导,将双稳健估计量分解为平衡权重估计量加上一个校正项,再结合平衡权重估计量的望远镜恒等式,得到最终结果。

证明路线与技术技巧

Theorem 1的证明路线: 1. 证明每个校正项为零:利用OLS的正规方程,证明每个阶段的残差ˆεt与回归变量ϕt正交。由于ˆαt在ϕt的张成空间中,所以Êt[ˆαt ˆεt] = 0。因此ˆθ^DR = ˆθ^P。 2. 证明所有中间项相等:从ˆθ^Q = (ˆη_T^OLS)' ˆG_T ˆβ_T^OLS开始。利用前向FOC (ˆη_t^OLS)' ˆM_t = (ˆη_{t+1}^OLS)' ˆG_{t+1}和后向FOC ˆM_t ˆβ_{t+1}^OLS = ˆG_t ˆβ_t^OLS,逐步回推,证明(ˆη_t^OLS)' ˆG_t ˆβ_t^OLS对所有t都相等,且等于ˆθ^P。

Theorem 2的证明路线: 1. 归纳法:对时期数T进行归纳。 2. 基例 (T=1):直接验证,与Bruns-Smith et al. (2025)的Proposition 3.2一致。 3. 归纳步骤:假设对T-1阶段成立。将T阶段的双稳健估计量拆分为第一阶段的校正项和剩余(T-1)阶段的双稳健估计量。剩余部分的外层目标变为ˆM_1' ˆη_1^R。由归纳假设,这部分等于(ˆη_1^R)' ˆM_1 ˆβ_2^Aug。代入并整理,得到ˆθ^DR = w' ˆβ_1^Aug,其中w = Ê0[ϕ_1^d]。

Theorem 3的证明路线: 1. 证明ˆθ^DR = ˆθ^Q + ∑ c_t' ˆβ_t^Gen:展开双稳健估计量的定义,利用Riesz残差c_t的定义(ˆG_t ˆη_t = ˆτ_t - c_t)和关系式ˆη_t' ˆM_t = ˆη_{t+1}' ˆG_{t+1} + c_{t+1}',通过代数化简得到。 2. 证明ˆθ^Q = ˆθ^OLS - ∑ c_t' ˆβ_t^OLS(Lemma 3):利用OLS的后向FOC和Riesz残差定义,通过望远镜求和得到。 3. 合并:将两式相减,得到ˆθ^DR = ˆθ^OLS + ∑ c_t' (ˆβ_t^Gen - ˆβ_t^OLS)。

技术技巧点名: - 归纳法:用于Theorem 2的证明,将T阶段问题递归地分解。 - 望远镜求和:用于Lemma 3和Theorem 3的证明,将跨阶段的项消去。 - FOC/正规方程:OLS和岭回归的FOC是推导所有代数恒等式的核心工具。 - Riesz残差:c_t = ˆτ_t - ˆG_t ˆη_t是本文引入的关键概念,它量化了Riesz回归的“不平衡”程度,是连接不同估计量的桥梁。

真实例子与应用

本文为纯理论论文,无实证例子。作者在Section 2.2中给出了三个T=2的示例(时间变化处理、替代变量、中介分析),但这些仅用于说明递归函数类如何涵盖这些设定,并非用于验证理论结果的模拟或数据应用。

🔎 结论是否比证明窄

  • Theorem 1的结论是精确的:在OLS下,三种估计量在任意有限样本下精确相等。证明是严格的,没有额外条件。
  • Theorem 2的结论是精确的:双稳健估计量等于一个单一的递归结果回归,其系数由(31)-(33)式定义。证明是严格的。
  • Corollary 1的结论是精确的:在标量对角Gram矩阵下,OLS权重为∏ a_t。证明是严格的。
  • Theorem 3的结论是精确的:ˆθ^DR = ˆθ^OLS + ∑ c_t' (ˆβ_t^Gen - ˆβ_t^OLS)。证明是严格的。
  • 总体来看,结论没有比证明窄。所有主要定理的陈述都精确对应其证明中的条件和推导。作者在Section 6的“Conclusion”中提出的两个takeaway(等价性推广到纵向;欠光滑解释弱化)都直接源于定理的结论。

四、开放问题

  1. 非线性字典/非参数设定下的等价性:本文的代数分析严格依赖于“线性于字典”的假设。当ft和αt用更复杂的非参数方法(如深度神经网络、随机森林)估计时,这些代数等价性是否仍然成立?或者是否存在某种近似等价性?(扎根于Section 2.3的线性框架假设,以及Appendix E对核方法的扩展——核方法本质上仍是线性于特征映射的。)

  2. 概率性收敛性质:本文只研究了代数等价性。一个自然的问题是:这些等价性在概率意义上意味着什么?例如,在OLS等价性下,是否意味着递归插件、递归平衡权重和递归双稳健估计量具有相同的渐近分布?在岭回归下,增广系数递归是否有助于推导双稳健估计量的收敛速率?(扎根于Section 1.1,作者明确区分了本文的“代数”分析与已有文献的“概率”分析。)

  3. 一般凸惩罚下的“增广系数”表示:Theorem 3给出了一个望远镜恒等式,但不像Theorem 2那样能给出一个单一的“增广系数”递归。对于一般的凸惩罚(如lasso),是否也存在类似的“增广系数”表示?或者,Riesz残差c_t的结构是否可以被进一步刻画,从而得到更简洁的表达式?(扎根于Section 5,作者指出一般凸惩罚下“closed forms break down”,但Theorem 3的恒等式仍然成立。)

  4. 与“混合偏差性质”的更深层联系:Theorem 3的分解(43)与混合偏差性质(9)在形式上非常相似。这种相似性是否暗示了更深层的联系?例如,是否可以用混合偏差性质来推导有限样本下的偏差界?(扎根于Appendix F,作者指出“The finite-sample decomposition is the algebraic counterpart of the mixed-bias property”。)


Maintained by 陈星宇 · Homepage · Source on GitHub

评论