跳转至

Causal inference with invalid instruments: post-selection problems and a solution using searching and sampling

作者: Zijian Guo
来源: Journal of the Royal Statistical Society Series B
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向关注的是工具变量(IV)方法中,当部分工具变量可能无效(violate exclusion restriction 或 independence assumption)时,如何对因果效应进行识别和推断。核心挑战在于:研究者通常无法事先知道哪些 IV 是有效的,因此需要依赖数据驱动的选择程序(如 Lasso、投票规则)来筛选有效 IV,但这一选择过程本身会引入不确定性,导致后续的置信区间覆盖不足(即后选择推断问题)。该方向当前处于从“识别与点估计”向“稳健推断”过渡的阶段——已有大量工作解决了在无效 IV 存在下的点估计一致性,但如何构造均匀有效的置信区间仍是开放问题。

发展脉络(history)

  • 奠基工作:Kang et al. (2016, sisVIVE) 首次提出在多数规则(majority rule,即超过 50% 的 IV 有效)下,通过 ℓ1 惩罚估计同时识别有效 IV 和因果效应,并给出理论保证。这是该子方向的起点,但只解决了点估计,未处理推断。
  • 主要进展(识别条件弱化):Guo et al. (2018) 和 Hartwig et al. (2017) 将识别条件从多数规则弱化为多数投票规则(plurality rule)——即有效 IV 组是最大的、具有相同因果效应估计的组,而不要求超过 50%。这大大拓宽了适用场景。同时,Bowden et al. (2015, MR-Egger) 和 Bowden et al. (2016, weighted median) 从 MR 应用角度提出了对无效 IV 稳健的估计量,但它们的识别假设(如 InSIDE 条件)与多数/多数投票规则不同。
  • 当前 frontier(后选择推断):Windmeijer et al. (2021, CIIV) 和 Windmeijer et al. (2019, CI method) 提出了基于置信区间重叠的 IV 选择方法,并证明了 oracle 性质(即若选择正确,估计量渐近等价于已知有效 IV 时的估计)。但本文(Guo, 2023)指出,这些方法未考虑选择错误时的推断有效性——当有效/无效 IV 难以区分时(如信号较弱),选择程序可能出错,导致置信区间覆盖不足。
  • 本文的位置:本文是第一个系统处理后选择推断问题在无效 IV 设定下的工作。它不依赖 IV 选择的一致性,而是通过“搜索 + 抽样”构造对选择错误均匀有效的置信区间。这与高维推断文献(Zhang & Zhang, 2014; Javanmard & Montanari, 2014; van de Geer et al., 2014)中的 debiased Lasso 思路有平行之处,但后者处理的是高维协变量选择后的推断,而本文处理的是 IV 选择后的推断。

子线索聚类

这些被引文献大致落在三条子线索上:

  1. 基于投票规则的识别与估计(核心线索):
  2. Kang et al. (2016): 多数规则 + ℓ1 惩罚估计(sisVIVE)。
  3. Guo et al. (2018): 多数投票规则 + 硬阈值投票(HT)方法。
  4. Hartwig et al. (2017): 零模态多效性假设(zero modal pleiotropy),等价于多数投票规则。
  5. Windmeijer et al. (2019, 2021): CI 方法和 CIIV 方法,基于置信区间重叠选择有效 IV。
  6. 共同点:依赖某种“多数”或“众数”条件来识别有效 IV,但推断阶段未考虑选择不确定性。

  7. 基于正交性/异方差性的识别(替代线索):

  8. Bowden et al. (2015, MR-Egger): 假设 IV 的直接效应与 IV-处理关联近似正交(InSIDE 条件)。
  9. Kolesár et al. (2015): 假设直接效应与 IV-处理关联不相关。
  10. Tchetgen Tchetgen et al. (2021, MR MiSTERI): 利用异方差协方差限制识别。
  11. 共同点:不依赖多数规则,而是通过结构假设(如正交性、异方差)在全部 IV 无效时仍可识别。但假设较强,且通常需要 IV 数量较大。

  12. 后选择/高维推断(方法论背景):

  13. Berk et al. (2013), Lee et al. (2016): 精确后选择推断(基于选择事件的截断分布)。
  14. Zhang & Zhang (2014), Javanmard & Montanari (2014), van de Geer et al. (2014): debiased Lasso 用于高维回归中的推断。
  15. Chernozhukov et al. (2015): 后正则化推断(post-regularization inference)。
  16. 共同点:处理模型选择后的推断问题,但通常假设选择程序是“好”的(如 Lasso 的 oracle 性质),或依赖选择事件的精确刻画。本文的“搜索 + 抽样”方法不依赖选择一致性,是这一线索在 IV 设定下的新应用。

这个方向在追问的核心问题

  1. 识别:在多少 IV 无效、以及无效 IV 以何种模式存在时,因果效应仍可被识别?多数规则 vs. 多数投票规则 vs. 正交性条件,哪个更弱、更可信?
  2. 估计:如何构造对无效 IV 稳健的点估计?现有方法(sisVIVE、HT、CIIV)的有限样本表现如何?
  3. 推断:在数据驱动选择 IV 后,如何构造覆盖概率正确的置信区间?后选择偏差如何校正?
  4. 均匀有效性:置信区间能否在“有效 IV 组几乎可分”和“难以区分”两种情形下都保持正确覆盖?现有方法在后者下会失败。

已知瓶颈:现有推断方法(如 Windmeijer et al., 2021 的 CIIV 置信区间)假设选择程序能一致地选出有效 IV,或至少选择错误是“局部”的(即只有弱无效 IV 可能被误选)。当有效/无效 IV 的信号强度相近时,选择错误可能很大,导致置信区间覆盖远低于名义水平。本文直接针对这一瓶颈。

⚠️ 作者的 framing

作者将缺口 frame 成:“现有方法(如 CIIV)的置信区间在有效/无效 IV 难以区分时覆盖不足,因为选择错误被忽略。本文通过搜索 + 抽样构造对选择错误均匀有效的置信区间,且达到参数长度。” 这一定位使得本文成为“显然的下一步”——在点估计问题已被广泛研究后,推断问题自然成为焦点。

被淡化或回避的竞争路线: - 作者将 MR-Egger 和 Kolesár et al. (2015) 归为“假设直接效应与 IV-处理关联正交”的路线,并指出其假设与多数规则不同。但未深入讨论:当多数规则不成立但正交性成立时,本文方法是否仍适用?答案是否定的——本文的搜索方法依赖于多数/多数投票规则,无法处理全部 IV 无效的情形。 - 作者未讨论 Tchetgen Tchetgen et al. (2021) 的异方差方法在推断上的表现——该方法是否也存在后选择问题?可能没有,因为它不涉及 IV 选择,但识别假设更强。

什么明显该被引/该存在、却没出现在 intro 里? - 。intro 的引用覆盖了该子方向的主要工作,包括识别(Kang et al., 2016; Guo et al., 2018)、估计(Windmeijer et al., 2019, 2021)、替代识别策略(Bowden et al., 2015; Kolesár et al., 2015; Tchetgen Tchetgen et al., 2021)以及后选择推断的一般方法(Berk et al., 2013; Lee et al., 2016; Zhang & Zhang, 2014 等)。未见明显遗漏。

张力

未见明显对立引用。各条线索(多数规则 vs. 正交性 vs. 异方差)的假设不同,但作者将其视为互补而非矛盾——不同假设适用于不同场景。唯一潜在的张力是:Windmeijer et al. (2021) 的 CIIV 方法声称在多数投票规则下 oracle 性质成立,但本文指出其置信区间在有限样本下可能覆盖不足。这不是理论矛盾,而是有限样本表现与渐近性质之间的差距。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \( Y \in \mathbb{R}^n \):结果变量(outcome),可观测。 - \( D \in \mathbb{R}^n \):处理变量(treatment),可观测,可能是内生的(与误差项相关)。 - \( Z \in \mathbb{R}^{n \times p_z} \):工具变量(IVs),可观测。\( p_z \) 是 IV 的数量,可能很大(甚至大于 \( n \))。 - \( X \in \mathbb{R}^{n \times p_x} \):协变量(covariates),可观测,用于调整可观测的混杂。 - \( \beta \in \mathbb{R} \)目标参数——处理 \( D \) 对结果 \( Y \) 的因果效应(假设为常数,线性模型)。 - \( \pi \in \mathbb{R}^{p_z} \):每个 IV 对处理的效应(first-stage coefficients),可估。 - \( \gamma \in \mathbb{R}^{p_z} \):每个 IV 对结果的直接效应(direct effect),即绕过处理 \( D \) 的路径。这是关键:若 IV \( j \) 是有效的,则 \( \gamma_j = 0 \);若无效,则 \( \gamma_j \neq 0 \)。 - \( \epsilon \in \mathbb{R}^n \):结果方程的误差项,包含未观测混杂。 - \( \eta \in \mathbb{R}^n \):处理方程的误差项。 - \( \mathcal{V} \subseteq \{1, \dots, p_z\} \):有效 IV 的指标集(未知)。 - \( \mathcal{I} = \{1, \dots, p_z\} \setminus \mathcal{V} \):无效 IV 的指标集(未知)。

模型(线性 IV 模型,含可能的无效 IV):

\[Y = D\beta + Z\gamma + X\alpha + \epsilon, \quad \mathbb{E}[\epsilon | Z, X] = 0\]
\[D = Z\pi + X\delta + \eta, \quad \mathbb{E}[\eta | Z, X] = 0\]
其中 \( \gamma_j = 0 \) 当且仅当 IV \( j \) 有效。注意:第一式中的 \( Z\gamma \) 项捕捉了无效 IV 对结果的直接效应(violation of exclusion restriction)。若所有 IV 有效,则 \( \gamma = 0 \),模型退化为标准 IV 模型。

可观测数据:研究者观测到 \( \{Y_i, D_i, Z_i, X_i\}_{i=1}^n \),即 \( n \) 个独立同分布样本。不可观测的是: - 误差项 \( \epsilon, \eta \)(包含未观测混杂)。 - 有效 IV 集 \( \mathcal{V} \)。 - 直接效应向量 \( \gamma \)(只能估计,不能直接观测)。

识别条件(多数规则 / 多数投票规则): - 多数规则(majority rule):\( |\mathcal{V}| > p_z / 2 \),即超过一半的 IV 有效。 - 多数投票规则(plurality rule):有效 IV 组是最大的、具有相同 \( \pi_j \beta + \gamma_j \) 值的组。注意:在模型下,每个 IV 的“简约式”系数(reduced-form coefficient)为 \( \pi_j \beta + \gamma_j \)。若 IV \( j \) 有效(\( \gamma_j = 0 \)),则其简约式系数为 \( \pi_j \beta \);若无效,则为 \( \pi_j \beta + \gamma_j \)。多数投票规则要求:存在一个 \( \beta \) 值,使得至少有 \( |\mathcal{V}| \) 个 IV 的简约式系数等于 \( \pi_j \beta \)(即 \( \gamma_j = 0 \)),且这个组是最大的。这比多数规则更弱——例如,若 40% 的 IV 有效,其余 60% 的无效 IV 的 \( \gamma_j \) 各不相同,则有效 IV 组仍是最大的组。

第二步:讲最小内核

最简特例:假设 \( p_z = 3 \) 个 IV,且多数规则成立(至少 2 个有效)。为简化,忽略协变量 \( X \) 和 first-stage 的估计误差(即假设 \( \pi \) 已知或可精确估计)。那么模型退化为:

\[Y = D\beta + Z\gamma + \epsilon, \quad \mathbb{E}[\epsilon | Z] = 0\]
其中 \( \gamma_1 = 0, \gamma_2 = 0 \)(IV 1 和 2 有效),\( \gamma_3 \neq 0 \)(IV 3 无效)。目标:估计 \( \beta \) 并构造置信区间。

核心思路(搜索):如果研究者“猜”一个 \( \beta \) 值,记为 \( \tilde{\beta} \),那么可以计算每个 IV 的“残差直接效应”估计:

\[\hat{\gamma}_j(\tilde{\beta}) = \text{简约式系数}_j - \pi_j \tilde{\beta}\]
\( \tilde{\beta} \) 等于真实 \( \beta \),则对于有效 IV(\( j=1,2 \)),\( \hat{\gamma}_j(\tilde{\beta}) \) 应接近 0;对于无效 IV(\( j=3 \)),\( \hat{\gamma}_3(\tilde{\beta}) \) 应远离 0。因此,可以定义一个“有效 IV 计数”:
\[S(\tilde{\beta}) = \sum_{j=1}^{p_z} \mathbb{I}\left( |\hat{\gamma}_j(\tilde{\beta})| \leq \lambda \right)\]
其中 \( \lambda \) 是一个阈值。在多数规则下,若 \( \tilde{\beta} = \beta \),则 \( S(\tilde{\beta}) \geq 2 \)(至少 2 个 IV 被判定为有效);若 \( \tilde{\beta} \) 远离 \( \beta \),则有效 IV 的 \( \hat{\gamma}_j(\tilde{\beta}) \) 也会远离 0,导致 \( S(\tilde{\beta}) \) 变小。因此,搜索所有使 \( S(\tilde{\beta}) \geq 2 \)\( \tilde{\beta} \) 值,这些值的集合就是一个置信区间——它包含了真实 \( \beta \),因为真实 \( \beta \) 必然使至少 2 个 IV 的 \( \hat{\gamma}_j \) 接近 0。

为什么这能处理后选择问题? 传统方法先选择有效 IV(如通过 Lasso 或投票),再用选出的 IV 做两阶段最小二乘(2SLS)并构造置信区间。若选择错误(如把 IV 3 误选为有效),置信区间会偏。而搜索方法不依赖单一选择结果——它检查每个候选 \( \beta \) 值下有多少 IV 看起来有效,只要真实 \( \beta \) 使多数 IV 有效,它就会被包含在搜索区间内。选择错误只会影响区间长度,不会导致覆盖不足。

最小内核的数学表述:在多数规则下,搜索置信区间为:

\[CI_{\text{search}} = \left\{ \beta \in \mathbb{R} : \sum_{j=1}^{p_z} \mathbb{I}\left( |\hat{\gamma}_j(\beta)| \leq \lambda \right) > \frac{p_z}{2} \right\}\]
其中 \( \hat{\gamma}_j(\beta) \) 是基于 \( \beta \) 的残差直接效应估计。该区间以概率至少 \( 1-\alpha \) 覆盖真实 \( \beta \),且长度随 \( n \)\( O_p(1/\sqrt{n}) \) 收缩(参数长度)。

抽样步骤的作用:搜索区间可能很宽(因为阈值 \( \lambda \) 需保守选择以保证覆盖)。抽样步骤通过从 \( \hat{\gamma} \) 的渐近分布中重复采样,对每个候选 \( \beta \) 计算“有效 IV 比例”的置信下界,从而缩小区间。这类似于 bootstrap 校准,但理论分析更精细。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在存在无效工具变量的线性 IV 模型中,如何构造对有效/无效 IV 的误分(misclassification)均匀有效的置信区间。
  2. 核心工具/方法:提出“搜索 + 抽样”两步法——先搜索所有使足够多 IV 被判定为有效的处理效应值,再通过从估计量的渐近分布中抽样来缩小区间长度。
  3. 主要结论:在有限样本多数规则和多数投票规则下,构造的置信区间均匀有效(覆盖概率 ≥ 名义水平),且长度达到参数速率 \( O_p(1/\sqrt{n}) \)。模拟和实证(教育对收入的影响)验证了方法。

关键设定与假设

完整模型(同第二节,但加上协变量 \( X \)):

\[Y = D\beta + Z\gamma + X\alpha + \epsilon, \quad \mathbb{E}[\epsilon | Z, X] = 0\]
\[D = Z\pi + X\delta + \eta, \quad \mathbb{E}[\eta | Z, X] = 0\]
其中 \( \gamma_j = 0 \) 当且仅当 IV \( j \) 有效。\( \beta \) 是标量目标参数。

关键假设(本文的 Assumptions 1-4,简化表述): - Assumption 1 (线性模型与矩条件):如上模型成立,且 \( \mathbb{E}[\epsilon | Z, X] = 0 \)。这是标准 IV 假设,但允许 \( \gamma \neq 0 \)。 - Assumption 2 (识别条件):多数规则(\( |\mathcal{V}| > p_z/2 \))或多数投票规则(有效 IV 组是最大的同质组)。这是本文方法有效的前提。 - Assumption 3 (稀疏性):无效 IV 的数量 \( |\mathcal{I}| \) 小于 \( p_z/2 \)(多数规则下)或小于最大同质组的大小(多数投票规则下)。这等价于 Assumption 2。 - Assumption 4 (正则条件):设计矩阵 \( [Z, X] \) 满足某些特征值条件(如 restricted eigenvalue condition),确保 first-stage 估计 \( \hat{\pi} \) 和简约式估计的一致性。这是高维推断的标准假设。

相比已有文献的放宽/强化: - 放宽:不假设 IV 选择的一致性(即不要求 \( \hat{\mathcal{V}} \to \mathcal{V} \)),而 Windmeijer et al. (2021) 的 oracle 性质依赖此条件。 - 强化:要求多数/多数投票规则成立,而 MR-Egger 和 Kolesár et al. (2015) 不依赖此规则(但依赖正交性假设)。本文方法在多数规则不成立时(如全部 IV 无效)无法使用。

主要结果

Theorem 1 (搜索置信区间的均匀有效性):在 Assumptions 1-4 和多数规则下,搜索置信区间 \( CI_{\text{search}} \) 满足:

\[\liminf_{n \to \infty} \inf_{P \in \mathcal{P}} \mathbb{P}_P(\beta \in CI_{\text{search}}) \geq 1 - \alpha\]
其中 \( \mathcal{P} \) 是满足假设的所有数据生成过程(包括有效/无效 IV 难以区分的“坏”情形)。区间长度为 \( O_p(1/\sqrt{n}) \)

  • 直觉:搜索区间通过检查每个候选 \( \beta \) 下“看起来有效”的 IV 数量来工作。只要真实 \( \beta \) 使多数 IV 有效(由多数规则保证),它就会被包含。均匀性来自对阈值 \( \lambda \) 的保守选择(基于 concentration inequalities),确保即使在最坏情形下,真实 \( \beta \) 也不会被排除。
  • 必要条件:多数规则必须成立。若多数规则不成立(如恰好 50% 的 IV 有效),搜索区间可能退化为整个实数轴。
  • 解决的技术难点:如何选择阈值 \( \lambda \) 使得:① 真实 \( \beta \) 下,有效 IV 的 \( |\hat{\gamma}_j(\beta)| \) 以高概率小于 \( \lambda \);② 错误 \( \beta \) 下,有效 IV 的 \( |\hat{\gamma}_j(\beta)| \) 以高概率大于 \( \lambda \)。这需要精细的 uniform deviation bounds。

Theorem 2 (抽样置信区间的改进):在相同假设下,抽样置信区间 \( CI_{\text{samp}} \) 满足:

\[\liminf_{n \to \infty} \inf_{P \in \mathcal{P}} \mathbb{P}_P(\beta \in CI_{\text{samp}}) \geq 1 - \alpha\]
且其长度渐近地不大于搜索区间,且在有效/无效 IV 容易区分时严格更短。

  • 直觉:抽样步骤通过从 \( \hat{\gamma} \) 的渐近正态分布中重复采样,对每个候选 \( \beta \) 计算“有效 IV 比例”的置信下界。这允许使用更小的阈值 \( \lambda \)(因为抽样校准了随机性),从而缩小区间。
  • 技术细节:抽样步骤需要 \( \hat{\gamma} \) 的协方差矩阵估计,本文使用 sandwich estimator。抽样次数 \( M = 1000 \) 足够。

Theorem 3 (多数投票规则下的扩展):将 Theorems 1-2 推广到多数投票规则。此时,搜索区间定义为:

\[CI_{\text{search}} = \left\{ \beta : \text{存在一组 IV,其 } |\hat{\gamma}_j(\beta)| \leq \lambda \text{,且该组的大小大于任何其他组} \right\}\]
均匀有效性仍然成立。

  • 直觉:多数投票规则下,有效 IV 组不一定是多数,但必须是最大的同质组。搜索区间需要检查所有可能的“组划分”,计算量更大,但理论性质类似。

证明路线与技术技巧

整体路线(以多数规则下的 Theorem 1 为例,3-5 步逻辑主干):

  1. 第一步:构造搜索集。定义 \( S(\beta) = \sum_{j=1}^{p_z} \mathbb{I}(|\hat{\gamma}_j(\beta)| \leq \lambda) \),其中 \( \hat{\gamma}_j(\beta) = \hat{\Gamma}_j - \hat{\pi}_j \beta \)\( \hat{\Gamma}_j \) 是简约式系数估计,\( \hat{\pi}_j \) 是 first-stage 系数估计)。搜索区间为 \( CI_{\text{search}} = \{\beta : S(\beta) > p_z/2\} \)

  2. 第二步:证明真实 \( \beta \) 被包含。在真实 \( \beta \) 下,对每个有效 IV \( j \in \mathcal{V} \),有 \( \gamma_j = 0 \),因此 \( \hat{\gamma}_j(\beta) = \hat{\Gamma}_j - \hat{\pi}_j \beta = (\Gamma_j - \pi_j \beta) + \text{估计误差} = 0 + \text{估计误差} \)。通过 concentration inequality(如 Vershynin, 2010 的 sub-Gaussian tail bound),证明 \( \max_{j \in \mathcal{V}} |\hat{\gamma}_j(\beta)| \leq \lambda \) 以高概率成立,只要 \( \lambda \) 足够大(如 \( \lambda = C \sqrt{\log(p_z)/n} \))。因此 \( S(\beta) \geq |\mathcal{V}| > p_z/2 \),真实 \( \beta \) 被包含。

  3. 第三步:证明错误 \( \beta \) 被排除(均匀性关键)。对任意 \( \beta' \neq \beta \),考虑有效 IV \( j \in \mathcal{V} \)。此时 \( \hat{\gamma}_j(\beta') = \hat{\Gamma}_j - \hat{\pi}_j \beta' = (\Gamma_j - \pi_j \beta') + \text{估计误差} = \pi_j(\beta - \beta') + \text{估计误差} \)。若 \( |\beta - \beta'| \) 足够大,则 \( |\pi_j(\beta - \beta')| \) 大于 \( 2\lambda \)(假设 \( \pi_j \) 有下界),因此 \( |\hat{\gamma}_j(\beta')| > \lambda \) 以高概率成立。这意味着所有有效 IV 都被排除,\( S(\beta') \leq p_z - |\mathcal{V}| < p_z/2 \),因此 \( \beta' \) 不在区间内。均匀性来自:上述论证对 \( \beta' \) 的依赖是 uniform 的(通过 empirical process 技巧处理 \( \sup_{\beta'} \))。

  4. 第四步:区间长度分析。由第三步,任何 \( \beta' \) 若满足 \( |\beta - \beta'| > C / \sqrt{n} \)(其中 \( C \) 依赖于 \( \min_j |\pi_j| \)),则被排除。因此区间长度 \( O_p(1/\sqrt{n}) \)

  5. 第五步:抽样步骤的改进。抽样步骤用 \( \hat{\gamma} \) 的渐近分布替代 pointwise thresholding:对每个候选 \( \beta \),从 \( N(\hat{\gamma}(\beta), \hat{\Sigma}) \) 中抽取 \( M \) 个样本,计算每个样本下“有效 IV 数量”的分位数,用该分位数替代硬阈值 \( \lambda \)。这允许使用更小的有效阈值,从而缩小区间。

关键跳跃点: - 最吃劲的引理:Lemma 1(uniform deviation bound for \( \hat{\gamma}_j(\beta) \) over \( \beta \) and \( j \))。难点在于 \( \hat{\gamma}_j(\beta) \)\( \beta \) 的线性函数,但 \( \beta \) 的搜索范围是无界的。作者通过将 \( \beta \) 限制在 compact set 上(由 first-stage 强度保证),再应用 empirical process 的 chaining 技巧来控制 \( \sup_{\beta, j} |\hat{\gamma}_j(\beta) - \mathbb{E}[\hat{\gamma}_j(\beta)]| \)。 - 绕过去的办法:不直接处理选择程序的分布(如 Lee et al., 2016 的 exact post-selection inference),而是通过“搜索”绕过选择——不选 IV,而是检查每个 \( \beta \) 下 IV 的“表现”。这避免了刻画选择事件的复杂几何。

技术技巧点名: - Concentration inequalities(Vershynin, 2010):用于控制 \( \hat{\pi}_j \)\( \hat{\Gamma}_j \) 的估计误差,选择阈值 \( \lambda \)。 - Empirical process / chaining:用于 uniform bound over \( \beta \)。 - Sandwich covariance estimation:用于抽样步骤中 \( \hat{\gamma} \) 的协方差估计。 - Bootstrap / sampling from asymptotic distribution:抽样步骤本质上是 parametric bootstrap,但理论分析基于渐近正态性而非重抽样一致性。

真实例子与应用

数据:来自 Behrman et al. (2012) 的智利家庭调查数据,研究教育对收入的影响。样本量 \( n = 1368 \)。处理变量 \( D \) 是受教育年限,结果 \( Y \) 是 log 收入。

IV 集\( p_z = 20 \) 个 IV,包括: - 家庭背景变量(父亲教育、母亲教育、配偶教育、家庭规模、过去 12 个月教育支出的 log)。 - 按年龄、性别、地区分组的平均受教育年限(group-level years of education)。 - 个人特质变量(关于公平竞争、天赋、努力、运气、社会联系的陈述)。

协变量\( p_x = 10 \) 个协变量,包括年龄、年龄平方、性别、地区等。

方法应用: 1. 用 debiased Lasso(Zhang & Zhang, 2014)估计 first-stage 系数 \( \hat{\pi} \) 和简约式系数 \( \hat{\Gamma} \)。 2. 应用搜索 + 抽样方法构造 \( \beta \) 的 95% 置信区间。 3. 与现有方法对比:CIIV(Windmeijer et al., 2021)、HT(Guo et al., 2018)、sisVIVE(Kang et al., 2016)、MR-Egger(Bowden et al., 2015)、weighted median(Bowden et al., 2016)。

结果: - 搜索置信区间:\( [0.042, 0.098] \)(教育每增加一年,收入增加约 4.2%-9.8%)。 - 抽样置信区间:\( [0.048, 0.092] \)(更窄)。 - 对比方法:CIIV 给出 \( [0.052, 0.088] \),HT 给出 \( [0.050, 0.090] \),sisVIVE 给出 \( [0.045, 0.095] \)。所有区间大致重叠,但本文区间略宽(反映了对选择错误的保守性)。 - MR-Egger 和 weighted median 给出不同结果(MR-Egger 的区间更宽且包含 0),说明不同识别假设导致不同结论。

这个例子想说明什么: - 验证理论:在真实数据中,搜索 + 抽样区间确实覆盖了所有对比方法的点估计,且长度合理(参数速率)。 - 展示保守性 vs. 效率的权衡:搜索区间比 CIIV 略宽,但作者声称这是“为均匀有效性付出的代价”——在模拟中,当有效/无效 IV 难以区分时,CIIV 的覆盖可能低于 95%,而本文方法保持覆盖。 - 实际意义:教育对收入的正效应在统计上显著,且估计值在经济意义上合理。

🔎 结论是否比证明窄

是,有一处明显的窄化: - 本文的 Theorem 1-3 在有限样本多数/多数投票规则下证明,但作者在 Abstract 和 Introduction 中多次使用“uniformly valid”这一术语,暗示对所有满足假设的数据生成过程有效。然而,证明中依赖的 Assumption 4(设计矩阵的特征值条件)在 \( p_z > n \) 时可能不成立(尽管 debiased Lasso 可以处理高维,但本文的搜索步骤需要 \( \hat{\pi}_j \) 对每个 IV 一致估计,这在 \( p_z > n \) 时通常不成立)。因此,本文的均匀有效性严格限于 \( p_z < n \)\( p_z \) 略大于 \( n \) 但稀疏性很强的设定。作者在 Section 5 的模拟中只考虑了 \( p_z = 20, n = 500 \)\( p_z = 100, n = 500 \)(后者 \( p_z < n \) 不成立,但通过稀疏性假设 \( |\mathcal{V}| = 10 \) 来缓解),未明确讨论 \( p_z \gg n \) 的情形。

  • 另一处:Theorem 3(多数投票规则)的证明假设“有效 IV 组是唯一的最大组”,但未处理“有两个大小相等的最大组”的情形(此时识别失败)。作者在 Assumption 2 中隐含了唯一性,但未在正文中明确讨论这一边界情况。

四、开放问题

  1. 扩展到非线性模型:本文的搜索 + 抽样方法依赖于线性模型和矩条件。能否推广到二元处理/结果(如 probit/logit IV)或更一般的半参数模型?这需要重新定义“有效 IV 计数”和搜索集。扎根于:本文 Assumption 1(线性模型)。

  2. 多数规则不成立时的推断:当多数规则和多数投票规则都不成立时(如全部 IV 无效,或有效 IV 组不是最大组),本文方法失效。能否结合正交性条件(如 MR-Egger)或异方差条件(如 MR MiSTERI)构造类似的搜索区间?扎根于:本文 Assumption 2(识别条件)和作者在 Introduction 中对替代识别策略的引用(Bowden et al., 2015; Tchetgen Tchetgen et al., 2021)。

  3. 高维 IV 下的计算效率:本文的搜索步骤需要对每个候选 \( \beta \) 计算 \( S(\beta) \),当 \( p_z \) 很大时(如 \( p_z = 10^4 \) 的 MR 研究),网格搜索的计算成本可能过高。能否设计更高效的搜索算法(如基于二分法或凸优化)?扎根于:本文 Algorithm 1 的网格搜索描述。

  4. 与 exact post-selection inference 的联系:本文通过“搜索”绕过选择,但 Lee et al. (2016) 的 exact post-selection inference 提供了另一种思路——刻画选择事件的几何结构,然后条件推断。能否将后者的框架应用于 IV 选择问题,得到比搜索更窄的置信区间?扎根于:本文对 Lee et al. (2016) 的引用(Introduction),以及作者在 Section 6 中提到的“未来工作可能考虑更高效的推断方法”。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论