跳转至

Robust improvement of efficiency using information on covariate distribution

作者: Lu Mao
来源: Electronic Journal of Statistics
主题: 效率理论 / Debiased ML
相关性: 7/10
链接: https://doi.org/10.1214/24-ejs2311


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是:在边际推断(marginal inference)问题中,如何利用协变量分布的结构信息(而非仅仅利用协变量与处理/结果的独立性)来提升估计效率,同时保持对结果-协变量关系模型误设的稳健性。其核心统计问题是:给定一个关于结果变量 \(Y\) 的标准估计函数(如 \(Y - \mu\)),如何利用协变量 \(X\) 的分布信息(如已知的完全参数模型、部分参数模型或独立性结构)构造一个更高效的估计量,且该估计量在结果模型误设时仍保持无偏。该方向当前成熟度中等:已有若干利用协变量分布提升效率的工作,但缺乏一个统一的、基于切空间投影的框架来系统处理不同协变量分布结构。

发展脉络(history)

  • 奠基工作Robins et al. (1992) 在纵向数据中提出了利用协变量历史信息提升效率的“增强型逆概率加权”(AIPW)估计量,其核心思想是通过在估计函数中减去一个条件期望项来获得正交性。该工作奠定了“投影到切空间”的雏形,但主要针对缺失数据与处理效应估计,而非纯粹的边际推断。
  • 主要进展Tsiatis (2006) 系统发展了半参数理论中的切空间与影响函数方法,为“如何利用协变量信息提升效率”提供了严格的数学框架。他证明了:在随机试验中,利用协变量-处理独立性进行协变量调整,等价于将初始影响函数投影到由协变量函数张成的切空间上。Zhang et al. (2008) 进一步将这一思想推广到利用协变量分布的先验知识(如已知的协变量分布模型),但他们的方法依赖于对协变量分布的正确指定,且未考虑结果模型误设时的稳健性。
  • 当前 frontierMao (2024) 的本文是当前前沿的代表。它统一了上述两条线索:既利用协变量分布的结构信息(如完全参数化、部分参数化、独立性),又通过“工作回归模型”的投影操作保证对结果模型误设的稳健性。作者在引言中明确指出:“This differs from standard covariate adjustment in randomized trials, which exploits covariate-treatment independence rather than knowledge on the covariate distribution.” 这表明本文有意与协变量调整文献划清界限,聚焦于“分布信息”而非“独立性信息”。
  • 本文的位置:本文是上述两条线索的交叉点——它继承了Tsiatis的切空间投影框架,但将投影对象从“协变量函数”扩展为“协变量分布模型下的条件期望”;同时继承了Robins等人的稳健性思想,但将其应用于边际推断而非处理效应估计。

子线索聚类

  1. 基于协变量-处理独立性的协变量调整(如 Tsiatis 2006, Zhang et al. 2008 中的一部分):利用随机化保证的协变量与处理独立性,通过回归调整提升效率。该线索的瓶颈是:它不适用于观察性研究或协变量分布已知但处理非随机的情形。
  2. 基于协变量分布先验知识的效率提升(如本文的焦点):假设协变量分布有结构(如完全参数化、部分参数化、独立性),利用该结构构造更高效的估计量。该线索的瓶颈是:协变量分布模型本身可能误设,且现有方法对结果模型误设的稳健性不足。
  3. 稳健估计与正交得分(如 Robins et al. 1992, van der Laan & Robins 2003 中的AIPW):通过构造正交估计函数,使估计量在部分模型误设时仍保持无偏。该线索的瓶颈是:正交性通常依赖于对协变量条件期望的估计,而非对协变量分布本身的利用。

这个方向在追问的核心问题

  1. 如何系统刻画“协变量分布信息”对效率提升的贡献? 即:给定一个协变量分布模型,其切空间是什么?投影后的估计函数的影响函数是什么?效率界如何计算?
  2. 如何保证对结果模型误设的稳健性? 即:当工作回归模型错误时,投影后的估计量是否仍保持无偏?其方差是否会增大?
  3. 如何将协变量分布信息与结果分布信息结合? 即:当结果分布也有结构时(如参数化),能否进一步提升效率?
  4. 该方法能否推广到更复杂的因果推断设定? 如工具变量、中介分析、近端因果推断等,其中协变量分布的结构可能更复杂。

⚠️ 作者的 framing

作者将缺口 frame 成:现有方法要么依赖协变量-处理独立性(不适用于协变量分布已知但处理非随机的情形),要么依赖对协变量分布的正确指定(不稳健)。本文的贡献是提供一个统一的、基于切空间投影的框架,该框架同时利用协变量分布信息对结果模型误设的稳健性。作者淡化了以下竞争路线: - 直接使用非参数协变量调整(如通过核回归或样条估计条件期望):作者在引言中未提及,但这类方法在协变量维度高时效率损失大,且不利用分布结构。 - 基于似然的完全参数方法:作者回避了“如果协变量分布模型也误设怎么办”的问题——本文假设协变量分布模型是已知的(如完全参数化、部分参数化、独立性),但未讨论模型误设时的稳健性。

什么明显该被引/该存在、却没出现在intro里? - van der Laan & Robins (2003) 的“Uniformly Most Powerful”估计量:该工作系统讨论了在协变量分布已知时如何构造最优估计量,但本文未引用。 - Bickel et al. (1993) 的《Efficient and Adaptive Estimation for Semiparametric Models》:这是半参数效率理论的经典著作,其中关于“利用已知分布信息提升效率”的章节与本文直接相关,但本文未引用。 - 近期的“数据融合”文献(如 combining internal and external data):这些工作也涉及利用外部协变量分布信息提升效率,但本文未提及。

张力

未见明显对立引用。所有被引工作(Robins, Tsiatis, Zhang等)在“利用协变量信息提升效率”这一大方向上是一致的,分歧仅在于具体利用哪种信息(独立性 vs. 分布结构)以及如何保证稳健性。本文试图调和这些分歧。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \(Y\):结果变量(随机变量,标量)。
  • \(X\):协变量向量(随机变量,可能高维)。
  • \(\mu = \mathbb{E}[Y]\):边际均值,是我们要估计的目标参数(estimand)。
  • \(m(x) = \mathbb{E}[Y \mid X = x]\):条件均值函数,即工作回归模型。注意:\(m(x)\) 是未知的,我们用一个参数化或非参数模型去估计它。
  • \(\psi(Y; \mu) = Y - \mu\):初始估计函数(estimating function),其期望为零当且仅当 \(\mu = \mathbb{E}[Y]\)
  • \(h(X) = \mathbb{E}[\psi(Y; \mu) \mid X] = \mathbb{E}[Y \mid X] - \mu = m(X) - \mu\):初始估计函数在给定 \(X\) 下的条件期望。
  • \(\mathcal{T}\):完整数据 \((Y, X)\) 的联合切空间(tangent space),由所有均值为零、平方可积的函数构成,且与参数化方向正交。
  • \(\mathcal{T}_X\):协变量分布模型对应的切空间,由仅依赖于 \(X\) 的函数构成。
  • \(\Pi(\psi \mid \mathcal{T}_X)\):将 \(\psi\) 投影到 \(\mathcal{T}_X\) 上的投影算子,即 \(\mathbb{E}[\psi \mid X]\)
  • 模型
  • 我们有一个随机样本 \((Y_i, X_i), i=1,\dots,n\),独立同分布于某个联合分布 \(P\)
  • 我们对 \(P\)唯一先验知识是:协变量 \(X\) 的边际分布属于某个已知的模型族 \(\mathcal{M}_X\)(如完全参数化、部分参数化、独立性结构)。结果分布 \(P_{Y \mid X}\) 完全未知。
  • 目标:估计 \(\mu = \mathbb{E}[Y]\),并希望利用 \(\mathcal{M}_X\) 的信息提升效率。
  • 可观测数据
  • 我们能观测到 \((Y_i, X_i)\) 的完整样本。
  • 我们不能直接观测到 \(m(X) = \mathbb{E}[Y \mid X]\),但可以通过工作回归模型估计它。
  • 我们知道(或假设知道)协变量分布模型 \(\mathcal{M}_X\) 的具体形式(如 \(X \sim N(\theta, \Sigma)\),或 \(X\) 的各分量独立),但不知道其参数值。

第二步:讲最小内核

最简特例:假设协变量 \(X\)标量,且其分布完全已知(即 \(\mathcal{M}_X\) 退化为一个已知分布,如 \(X \sim N(0,1)\))。这是本文第一个例子的简化版。

问题:给定 \(n\) 个独立同分布样本 \((Y_i, X_i)\),其中 \(X_i \sim N(0,1)\) 已知,\(Y_i\) 的条件分布 \(P_{Y \mid X}\) 完全未知。我们要估计 \(\mu = \mathbb{E}[Y]\)

标准估计量:样本均值 \(\hat{\mu}_{\text{naive}} = \frac{1}{n} \sum_{i=1}^n Y_i\)。其方差为 \(\text{Var}(Y)/n\)

核心思路:利用已知的 \(X\) 分布,我们可以构造一个更高效的估计量。具体地,考虑初始估计函数 \(\psi(Y; \mu) = Y - \mu\)。其条件期望为 \(h(X) = \mathbb{E}[Y \mid X] - \mu = m(X) - \mu\)。由于 \(X\) 分布已知,我们可以计算 \(h(X)\)\(X\) 分布下的期望:\(\mathbb{E}[h(X)] = \mathbb{E}[m(X)] - \mu = \mu - \mu = 0\)。因此,\(h(X)\) 本身是一个均值为零的随机变量,且与 \(Y\) 相关。我们可以从 \(\psi\) 中减去 \(h(X)\),得到一个新的估计函数:

\[\psi_{\text{eff}}(Y, X; \mu) = (Y - \mu) - (m(X) - \mu) = Y - m(X).\]

注意:\(\psi_{\text{eff}}\) 的期望为零(因为 \(\mathbb{E}[Y - m(X)] = 0\)),且其方差为 \(\text{Var}(Y - m(X)) = \text{Var}(Y) - \text{Var}(m(X)) \leq \text{Var}(Y)\)。因此,基于 \(\psi_{\text{eff}}\) 的估计量 \(\hat{\mu}_{\text{eff}} = \frac{1}{n} \sum_{i=1}^n (Y_i - m(X_i)) + \hat{\mu}\) 的方差小于样本均值的方差。但这里有一个问题\(m(X)\) 是未知的,我们需要估计它。如果我们用一个工作回归模型 \(\hat{m}(X)\) 来估计 \(m(X)\),那么 \(\psi_{\text{eff}}\) 变为 \(\hat{\psi}_{\text{eff}} = Y - \hat{m}(X)\)。如果 \(\hat{m}(X)\)\(m(X)\) 的一致估计,那么 \(\hat{\mu}_{\text{eff}}\) 是渐近有效的。但如果 \(\hat{m}(X)\) 是错的(即不一致),那么 \(\mathbb{E}[Y - \hat{m}(X)] \neq 0\),估计量有偏。

本文的关键想法:我们不直接减去 \(\hat{m}(X)\),而是减去 \(\hat{m}(X)\) 在已知协变量分布下的条件期望。由于 \(X\) 分布已知,我们可以计算 \(\mathbb{E}[\hat{m}(X)]\)(即 \(\hat{m}(X)\)\(X\) 分布下的期望)。然后构造:

\[\psi_{\text{robust}}(Y, X; \mu) = (Y - \mu) - (\hat{m}(X) - \mathbb{E}[\hat{m}(X)]).\]

注意:即使 \(\hat{m}(X)\)\(m(X)\) 的错误估计,\(\mathbb{E}[\hat{m}(X) - \mathbb{E}[\hat{m}(X)]] = 0\),因此 \(\psi_{\text{robust}}\) 的期望仍为零。同时,如果 \(\hat{m}(X)\) 是正确估计,那么 \(\mathbb{E}[\hat{m}(X)] = \mu\),且 \(\psi_{\text{robust}} = Y - \hat{m}(X)\),达到局部效率。这就是“稳健性”的来源:减去项 \(\hat{m}(X) - \mathbb{E}[\hat{m}(X)]\) 始终渐近中心化,无论工作模型是否正确。

这个最小内核的本质:将初始估计函数 \(\psi\) 投影到协变量分布模型对应的切空间 \(\mathcal{T}_X\) 上。投影算子就是条件期望 \(\mathbb{E}[\cdot \mid X]\)。减去投影后的部分,得到与 \(\mathcal{T}_X\) 正交的残差,该残差在协变量分布模型下是“无信息”的,从而提升效率。而“减去 \(\mathbb{E}[\hat{m}(X)]\)”这一步保证了即使投影估计有偏,残差仍保持无偏。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在边际推断中,如何利用协变量分布的结构信息(完全参数化、部分参数化、独立性)来提升估计效率,同时保证对结果-协变量关系模型误设的稳健性。
  2. 核心工具/方法:通过将初始估计函数投影到协变量分布模型对应的切空间上,并减去投影后的条件期望项,构造一个稳健且局部高效的估计函数。该投影操作等价于计算初始估计函数在给定协变量下的条件期望,再减去该条件期望在协变量分布下的期望。
  3. 主要结论:当工作回归模型正确时,投影后的估计量达到局部效率(即其渐近方差等于半参数效率界);当工作回归模型错误时,估计量仍保持无偏(因为减去项始终渐近中心化)。若结果分布也有结构,可进一步投影到联合切空间,进一步提升效率。

关键设定与假设

  • 设定:我们有一个随机样本 \((Y_i, X_i), i=1,\dots,n\),独立同分布于联合分布 \(P\)。目标参数 \(\mu = \mathbb{E}[Y]\)
  • 假设1(协变量分布模型):协变量 \(X\) 的边际分布属于一个已知的模型族 \(\mathcal{M}_X\)。该模型族可以是:
  • 完全参数化\(X \sim f(x; \theta)\),其中 \(\theta\) 是有限维参数。
  • 部分参数化\(X\) 的某些分量服从参数模型,其他分量无约束。
  • 独立性结构\(X\) 的各分量相互独立(但边际分布未知)。
  • 假设2(工作回归模型):我们有一个工作回归模型 \(\hat{m}(x)\),用于估计 \(m(x) = \mathbb{E}[Y \mid X = x]\)。该模型可以是参数化或非参数的,但不要求其正确
  • 假设3(正则性条件):估计函数 \(\psi(Y; \mu) = Y - \mu\) 满足通常的正则性条件(如平方可积、可微等),以保证切空间投影的良定义。
  • 相比已有文献的放宽/强化
  • 相比 Tsiatis (2006) 的协变量调整方法,本文放宽了对协变量-处理独立性的依赖,转而利用协变量分布信息。
  • 相比 Zhang et al. (2008) 的方法,本文强化了对结果模型误设的稳健性——Zhang等人的方法要求协变量分布模型正确,且未考虑结果模型误设;本文允许工作回归模型错误。
  • 相比 Robins et al. (1992) 的AIPW,本文聚焦于边际推断而非处理效应,且利用的是协变量分布信息而非倾向性得分。

主要结果

本文没有给出显式的定理编号,但核心结果可以归纳为以下两个命题:

  • 结果1(稳健性):对于任意工作回归模型 \(\hat{m}(x)\),估计量

    \[\hat{\mu}_{\text{robust}} = \frac{1}{n} \sum_{i=1}^n \left[ Y_i - \hat{m}(X_i) + \mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)] \right]\]
    \(\mu\) 的无偏估计,其中 \(\mathbb{E}_{\mathcal{M}_X}[\cdot]\) 表示在协变量分布模型 \(\mathcal{M}_X\) 下计算的期望。证明思路\(\mathbb{E}[Y_i - \hat{m}(X_i) + \mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]] = \mu - \mathbb{E}[\hat{m}(X)] + \mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\)。由于 \(\mathbb{E}[\hat{m}(X)]\)\(\hat{m}(X)\) 在真实分布下的期望,而 \(\mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\) 是在模型分布下的期望,两者不一定相等。但作者的关键观察是:如果 \(\hat{m}(X)\)\(X\) 的函数,且 \(X\) 的分布属于 \(\mathcal{M}_X\),那么 \(\mathbb{E}[\hat{m}(X)] = \mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\)。因此,只要协变量分布模型正确,即使工作模型错误,估计量仍无偏。技术难点:需要证明 \(\mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\) 是可计算的(即模型 \(\mathcal{M}_X\) 的参数可估计),且该期望的估计误差不影响渐近无偏性。

  • 结果2(局部效率):如果工作回归模型 \(\hat{m}(x)\)\(m(x) = \mathbb{E}[Y \mid X = x]\) 的一致估计(即 \(\hat{m}(x) \xrightarrow{p} m(x)\)),那么 \(\hat{\mu}_{\text{robust}}\) 的渐近方差等于半参数效率界,即 \(\text{Var}(Y - m(X))\)证明思路:当 \(\hat{m}\) 一致时,\(\hat{\mu}_{\text{robust}} \approx \frac{1}{n} \sum_{i=1}^n [Y_i - m(X_i)] + \mu\),其方差为 \(\text{Var}(Y - m(X))/n\)。该方差是半参数效率界,因为它是将初始估计函数投影到协变量分布切空间后的残差方差。必要条件:工作回归模型必须是一致估计,且协变量分布模型正确。

  • 结果3(进一步效率提升):如果结果分布 \(P_{Y \mid X}\) 也有结构(如参数化),那么可以进一步将估计函数投影到联合切空间上,获得比仅利用协变量分布信息更高的效率。直觉:联合切空间包含协变量分布和结果分布的信息,投影后的残差方差更小。

证明路线与技术技巧

整体路线(以完全参数化协变量为例): 1. 定义初始估计函数\(\psi(Y; \mu) = Y - \mu\)。 2. 计算条件期望\(h(X) = \mathbb{E}[\psi(Y; \mu) \mid X] = m(X) - \mu\)。 3. 投影到协变量分布切空间:由于协变量分布完全参数化,其切空间 \(\mathcal{T}_X\) 由所有形如 \(s(X; \theta)\) 的函数张成,其中 \(s\) 是得分函数。投影算子为 \(\Pi(\psi \mid \mathcal{T}_X) = \mathbb{E}[\psi \mid X] = h(X)\)。 4. 构造稳健估计函数\(\psi_{\text{robust}} = \psi - \Pi(\psi \mid \mathcal{T}_X) + \mathbb{E}_{\mathcal{M}_X}[\Pi(\psi \mid \mathcal{T}_X)]\)。注意:\(\mathbb{E}_{\mathcal{M}_X}[\Pi(\psi \mid \mathcal{T}_X)] = \mathbb{E}_{\mathcal{M}_X}[m(X)] - \mu\)。由于 \(\mathbb{E}_{\mathcal{M}_X}[m(X)] = \mu\)(因为协变量分布模型正确),所以 \(\psi_{\text{robust}} = Y - m(X)\)。 5. 用工作模型替换:用 \(\hat{m}(X)\) 估计 \(m(X)\),得到 \(\hat{\psi}_{\text{robust}} = Y - \hat{m}(X) + \mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\)。 6. 证明无偏性\(\mathbb{E}[\hat{\psi}_{\text{robust}}] = \mu - \mathbb{E}[\hat{m}(X)] + \mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)] = \mu\)(因为 \(\mathbb{E}[\hat{m}(X)] = \mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\) 当协变量分布模型正确)。 7. 证明局部效率:当 \(\hat{m} \xrightarrow{p} m\) 时,\(\hat{\psi}_{\text{robust}} \xrightarrow{p} Y - m(X)\),其方差达到效率界。

关键跳跃点: - 跳跃点1:从“减去条件期望”到“减去条件期望后再加回其在模型下的期望”。这一步保证了稳健性:即使 \(\hat{m}\) 有偏,\(\mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\) 的加入抵消了偏差。难点:需要证明 \(\mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\) 是可估计的,且其估计误差不影响渐近性质。 - 跳跃点2:将投影操作与切空间理论联系起来。作者指出,减去 \(\Pi(\psi \mid \mathcal{T}_X)\) 等价于将 \(\psi\) 投影到 \(\mathcal{T}_X\) 的正交补空间上,从而获得与协变量分布信息正交的残差。难点:需要严格定义切空间及其投影算子,并证明投影后的残差方差等于效率界。

技术技巧点名: - 切空间投影:核心工具,用于将初始估计函数分解为“有信息部分”和“无信息部分”。用在了步骤3-4。 - 条件期望的迭代期望定律:用于证明 \(\mathbb{E}[\hat{\psi}_{\text{robust}}] = \mu\)。用在了步骤6。 - Delta方法:用于推导渐近方差。用在了步骤7。 - 经验过程理论:可能用于证明 \(\hat{m}\) 的一致性和 \(\mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\) 的估计误差可忽略。作者未明确提及,但这是半参数估计的标准工具。

真实例子与应用

本文包含三个例子,均无真实数据,而是模拟或理论演示:

  1. 完全参数化协变量:假设 \(X \sim N(\theta, 1)\),其中 \(\theta\) 未知。工作回归模型 \(\hat{m}(x) = \hat{\beta}_0 + \hat{\beta}_1 x\)(线性回归)。作者演示了:即使线性模型错误(真实 \(m(x)\) 非线性),估计量仍无偏;当线性模型正确时,达到效率界。
  2. 部分参数化协变量:假设 \(X = (X_1, X_2)\),其中 \(X_1\) 服从参数模型(如指数分布),\(X_2\) 无约束。工作回归模型仅利用 \(X_1\) 的信息。作者演示了:投影到 \(X_1\) 的切空间上,可提升效率,但不如利用全部协变量信息。
  3. 相互独立协变量:假设 \(X = (X_1, \dots, X_p)\) 各分量独立(但边际分布未知)。工作回归模型为可加模型 \(\hat{m}(x) = \sum_{j=1}^p \hat{f}_j(x_j)\)。作者演示了:利用独立性结构,投影后的估计量效率高于忽略独立性的估计量。

这些例子想说明什么: - 例子1:验证了完全参数化情形下的稳健性与局部效率。 - 例子2:展示了部分参数化情形下,即使只利用部分协变量分布信息,也能获得效率提升。 - 例子3:展示了独立性结构这一非参数协变量分布信息也能被利用,且工作回归模型的可加性假设可被放松。

🔎 结论是否比证明窄

  • 窄结论1:作者在引言中声称“该方法可推广到任何协变量分布模型”,但证明仅针对完全参数化、部分参数化和独立性三种情形。对于更复杂的协变量分布结构(如图模型、隐变量模型),投影算子的计算可能不平凡,且稳健性证明可能不直接成立。具体语句:作者在结论部分说“The same idea can be applied to other structured covariate distributions”,但未给出证明。
  • 窄结论2:作者声称“即使工作模型错误,估计量仍保持无偏”,但这一结论依赖于“协变量分布模型正确”这一假设。如果协变量分布模型也误设(如假设 \(X \sim N(\theta,1)\) 但真实分布是t分布),那么 \(\mathbb{E}[\hat{m}(X)] \neq \mathbb{E}_{\mathcal{M}_X}[\hat{m}(X)]\),估计量可能有偏。作者未讨论这一情形。
  • 窄结论3:作者在例子中假设工作回归模型是参数化的(如线性回归),但未讨论非参数工作模型(如核回归、随机森林)下的理论性质。非参数工作模型的收敛速度可能影响投影估计量的渐近方差。

四、开放问题

  1. 协变量分布模型误设时的稳健性:本文假设协变量分布模型 \(\mathcal{M}_X\) 正确。如果该模型误设,估计量是否仍保持无偏?其方差会如何变化?扎根点:作者在引言中明确说“under the covariate distribution model”,未讨论模型误设情形。
  2. 非参数工作回归模型的理论性质:本文的例子均使用参数化工作模型。如果使用非参数工作模型(如核回归、样条、随机森林),投影估计量的收敛速度和渐近方差如何?是否需要交叉拟合(cross-fitting)来避免过拟合偏差?扎根点:作者在结论部分提到“The working model can be any regression method”,但未给出非参数情形的理论。
  3. 推广到更复杂的因果推断设定:本文聚焦于边际均值 \(\mu = \mathbb{E}[Y]\)。能否将该投影方法推广到处理效应(ATE)、工具变量(IV)或近端因果推断(proximal causal inference)中的估计函数?扎根点:作者在结论部分说“The idea can be extended to other estimating functions”,但未给出具体例子。
  4. 协变量分布模型的选择与检验:如何在实际数据中选择协变量分布模型?是否可以通过假设检验来验证模型正确性?扎根点:本文未讨论模型选择问题,仅假设模型已知。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论