跳转至

What No First Stage Can Detect: Functional-Form Contamination in Linear IV

作者: Parush Arora
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.18172


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是工具变量(IV)方法中"一阶段强度诊断"与"函数形式设定"之间的交叉地带。具体而言,它研究的是:在应用微观经济学最常用的线性 IV 设定(2SLS)下,当协变量以线性形式进入模型时,一阶段 F 统计量(包括 Sanderson-Windmeijer 条件 F)作为工具变量强度的"认证"工具,其有效性边界在哪里。这个子方向要解决的根本问题是:一个被报告为"很强"的一阶段,是否真的为第二阶段估计提供了可信的识别? 当前成熟度:这是一个正在快速发展的领域,核心共识(一阶段 F 是必要但不充分的诊断)已经建立,但"不充分"的具体机制和检测方法仍在活跃研究中。

发展脉络

奠基工作:一阶段强度的诊断传统。 这条线从 Staiger and Stock (1997) 的弱工具变量渐近框架开始,确立了"一阶段 F 统计量"作为弱工具诊断的标准做法。随后 Stock and Yogo (2005) 给出了基于偏误容忍度的 F 阈值(如 10),Montiel Olea and Pflueger (2013) 提出了对非 i.i.d. 误差稳健的有效 F 统计量,Andrews et al. (2019) 则系统综述了弱工具检验的理论与实践。这条线的核心假设是:一阶段强度(F 的大小)是第二阶段估计可信度的充分统计量。作者引用这些工作作为"被挑战的对象"——它们共同构成了"报告一阶段 F 即完成强度认证"的实践惯例。

主要进展:一阶段强度的"非充分性"被发现。 第二条线揭示了 F 统计量的盲区。Imbens and Angrist (1994) 和 Angrist et al. (1996) 建立了 LATE 解释框架,使研究者意识到 2SLS 估计量的解释依赖于工具变量与协变量的关系。Heckman and Vytlacil (2005) 的 essential heterogeneity 框架进一步表明,在异质性处理效应下,2SLS 估计量可能偏离任何有意义的因果参数。最直接的挑战来自 Słoczyński (2022) 和 Goldsmith-Pinkham et al. (2024):前者证明在恰好识别情形下,线性协变量调整会导致 2SLS 估计量不再是 LATE 的凸组合;后者给出了一般性的 contamination bias 分析,表明协变量调整会引入跨处理组的污染。Zhao et al. (2025) 则给出了一个精确条件:一致的交互 2SLS 要求工具变量倾向得分与协变量的乘积在协变量中线性。这条线的核心发现是:一阶段强度与第二阶段解释力可以完全脱钩。

当前 frontier:诊断的"方向性"与"不可检测性"。 第三条线是本文的直接对话对象。Blandhol et al. (2022) 建议直接检验工具变量倾向得分 E[Z|X] 的线性性(用 Ramsey RESET),这是对"函数形式"的诊断。Słoczyński et al. (2026) 综合了强度与异质性诊断,给出了实践指南。Krumme and Westphal (2026) 独立地提出,诊断必须"指向结果"而非仅看倾向得分。本文的位置是:它证明了一个更强的负面结果——不仅一阶段 F 无法检测污染,而且任何基于 (Z, D, X) 联合分布的函数都无法检测某种特定的污染(结果侧污染),同时给出了一个能检测另一种污染(一阶段侧污染)的测试。

子线索聚类

这些被引文献大致落在三条子线索上:

  1. 弱工具诊断的统计理论(Staiger-Stock, Stock-Yogo, Montiel Olea-Pflueger, Andrews et al.):关注"一阶段强度如何度量、阈值如何设定"。核心工具是渐近理论、偏误近似、尺寸控制。这条线默认的设定是:协变量线性进入、误差同方差或异方差但结构已知。

  2. LATE 解释与异质性处理效应(Imbens-Angrist, Heckman-Vytlacil, Słoczyński, Goldsmith-Pinkham et al., Zhao et al.):关注"2SLS 在异质性下到底估计了什么"。核心工具是潜在结果框架、单调性假设、权重分解。这条线揭示了线性协变量调整的 contamination bias,但主要停留在"分解"层面,较少讨论"如何检测"。

  3. 设定检验与诊断程序(Blandhol et al., Słoczyński et al., Krumme-Westphal):关注"实践中如何检验函数形式假设"。核心工具是 RESET、条件矩检验、交互项检验。这条线是本文的直接竞争者——它们都试图给出可操作的诊断,但本文证明其中一些(基于一阶段或倾向得分的)在原理上存在盲区。

这个方向在追问的核心问题

  1. 一阶段 F 的"认证"功能是否可靠? 即:一个大的 F 是否足以保证第二阶段估计的因果解释?——本文的回答:否,且不可修复(对结果侧污染)。
  2. 函数形式污染(contamination)何时发生、如何度量? 即:协变量线性进入的假设被违反时,2SLS 估计量偏离目标参数多少?——本文给出了精确的分解(Lemma 1)和可报告的份额(ϱ)。
  3. 是否存在不依赖结果、仅基于 (Z, D, X) 的检测方法? 即:能否在不看 Y 的情况下诊断污染?——本文的回答:对一阶段侧污染可以(Proposition 5),对结果侧污染不可以(Proposition 3)。
  4. 修正污染的代价是什么? 即:从线性协变量调整转向灵活(饱和)设定,会损失多少识别强度?——本文的回答:恰好等于污染份额 ϱ(Corollary 2)。

⚠️ 作者的 framing(这是作者的说法)

作者把缺口 frame 成:"一阶段 F 报告惯例"与"函数形式污染"之间存在一个未被检查的盲区。他声称:(i) 现有文献(Blandhol et al. 2022)推荐的 RESET 检验只检查倾向得分,无法检测结果侧污染;(ii) 不存在任何基于 (Z, D, X) 的统计量能检测结果侧污染(Proposition 3);(iii) 因此需要一个新的、指向结果的测试(Section 4)和一个可报告的污染份额(Section 5)。他淡化的竞争路线包括:Krumme and Westphal (2026) 的联合检验(作者声称自己的测试在弱识别下仍有效,而对方需要强一阶段)、以及 Goldsmith-Pinkham et al. (2024) 的多处理组 contamination 分析(作者只处理单处理组情形)。什么明显该被引却没出现:作者没有引用 Bound et al. (1995) 关于"一阶段 F 大但 IV 估计仍不可靠"的早期经验证据,也没有引用 Angrist and Pischke 关于"饱和设定作为默认做法"的教科书讨论——这两者都可能削弱他"现有实践完全依赖一阶段 F"的 framing 的准确性。

张力

未见明显对立引用。但有一个值得注意的张力:Blandhol et al. (2022) 的 RESET 建议(检查 E[Z|X] 线性性)与本文的 Proposition 3(任何 (Z,D,X) 函数无法检测结果侧污染)之间存在微妙关系——前者是"充分条件"的检验(线性性成立则无污染),后者是"必要条件"的检验(污染存在但不可检测)。两者并不矛盾,但作者没有明确讨论:如果研究者同时做 RESET 和本文的测试,如何整合两个结果?这是一个未被作者处理的内部张力。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

符号(逐个点名):

  • Z ∈ R:标量工具变量。这是可观测的随机变量。在本文的设定中,Z 可以是二值的(如保险资格)或连续的(如距离)。
  • D ∈ R:标量处理变量。这是可观测的随机变量,可能是内生的(与误差项相关)。
  • Y ∈ R:标量结果变量。这是可观测的随机变量。
  • X ∈ R^{d_x}:协变量向量。这是可观测的随机变量,进入模型的方式(线性 vs. 非线性)是本文的核心关注点。
  • e(x) = E[Z | X = x]:工具变量倾向得分(propensity score)。这是不可观测的(需要估计),是"一阶段"的核心对象。
  • ℓ(x) = L(Z | 1, X)(x):Z 对 (1, X) 的线性投影。这是可观测数据可计算的(给定样本),是"线性控制"所隐含的设定。
  • h(x) = e(x) − ℓ(x):倾向得分的曲率(curvature),即倾向得分偏离其线性投影的部分。这是不可观测的(因为 e 不可观测),是本文的核心 nuisance 参数。
  • m_D(x) = E[D | X = x]、m_Y(x) = E[Y | X = x]:处理与结果的水平函数(level functions)。这是不可观测的。
  • β_2SLS:2SLS 估计量的概率极限(population estimand),即研究者实际报告的数。
  • L̄ = S_Y / S_D:饱和(saturated)设定下的 estimand,即完全交互的 2SLS 所对应的目标参数。在二值处理、二值工具的 LATE 模型中,L̄ 是条件 LATE 的凸组合。
  • S_D = E[Cov(Z, D | X)]、S_Y = E[Cov(Z, Y | X)]:信号项,即条件协方差的平均。
  • θ_D = Cov(h(X), m_D(X))、θ_Y = Cov(h(X), m_Y(X)):污染项,即倾向得分曲率与水平函数的协方差。
  • ϱ = θ_D / E[Z̃D]:污染份额,一阶段协方差中由曲率贡献的比例。

模型(数据生成机制):

研究者观测 i.i.d. 样本 {(Y_i, D_i, Z_i, X_i)}_{i=1}^n。没有对处理分配机制(如单调性、可忽略性)施加任何结构——本文的分解是纯代数/投影性质的,只依赖线性投影的定义。核心设定是:

  1. 线性设定:研究者估计 Y = βD + X'γ + ε,用 Z 作为 D 的工具变量,X 线性进入。
  2. 饱和设定(基准):研究者估计完全交互的模型,允许 D 与 X 的所有函数形式交互。这个设定的 estimand 是 L̄。
  3. 关键对象:Z̃ = Z − ℓ(X) 是线性投影残差。2SLS 估计量的分母是 E[Z̃D],分子是 E[Z̃Y]。

可观测 vs. 不可观测:

  • 可观测:(Y, D, Z, X) 的联合分布,以及由此可计算的任何函数(如线性投影残差 Z̃、线性回归系数)。
  • 不可观测:倾向得分 e(x)、曲率 h(x)、水平函数 m_D(x)、m_Y(x)。这些是潜在/反事实量,只能通过假设或估计来逼近。

第二步:最小内核

最简特例:二值工具 Z ∈ {0,1}、二值处理 D ∈ {0,1}、单个协变量 X ∈ R、无其他控制变量。这是 LATE 模型的教科书设定。

在这个特例下,支撑整篇论文的最小内核是以下分解:

Lemma 1(特例形式):2SLS 估计量的分母(一阶段协方差)可以分解为:

E[Z̃D] = E[Cov(Z, D | X)] + Cov(h(X), m_D(X))

其中:

  • 第一项 S_D = E[Cov(Z, D | X)] 是"信号":在给定 X 的层内,Z 对 D 的协方差的平均。这是饱和设定(完全交互)会使用的识别信息。
  • 第二项 θ_D = Cov(h(X), m_D(X)) 是"污染":倾向得分曲率 h(X) = e(X) − ℓ(X) 与处理水平函数 m_D(X) 的协方差。这是线性设定额外使用的识别信息。

为什么这个分解是核心:2SLS 估计量 β_2SLS = E[Z̃Y] / E[Z̃D] 的分子和分母都包含信号和污染。饱和设定的 estimand 是 L̄ = S_Y / S_D,只使用信号。因此:

β_2SLS − L̄ = (θ_Y − L̄ θ_D) / (S_D + θ_D)

这个差就是污染造成的偏误。当工具与协变量近似共线(collinear)时,S_D → 0,但 θ_D 不消失,于是:

  • 分母 S_D + θ_D 被 θ_D 主导——一阶段强度由污染制造;
  • 分子 S_Y + θ_Y 同样被 θ_Y 主导——估计量收敛到 θ_Y / θ_D,一个没有因果含义的"协变量对比"。

为什么一阶段 F 无法检测:F 统计量(或条件 F)度量的是 Z̃ 对 D 的预测力,即 E[Z̃D] 的大小。当 S_D → 0 而 θ_D ≠ 0 时,F 可以任意大(因为 E[Z̃D] = θ_D ≠ 0),但估计量是纯污染。F 大只说明 Z̃ 与 D 相关,不说明这种相关来自层内变异(信号)还是层间曲率(污染)。

为什么 (Z, D, X) 的函数无法检测结果侧污染:Proposition 3 的核心是,污染偏误 θ_Y − L̄ θ_D 依赖 Y 的条件分布(通过 m_Y 和 S_Y),而 (Z, D, X) 的联合分布完全不包含 Y 的信息。因此,任何只使用 (Z, D, X) 的统计量——无论多么复杂——都无法区分"θ_D 大但 θ_Y = L̄ θ_D"(无害曲率)和"θ_D 大且 θ_Y ≠ L̄ θ_D"(有害曲率)。检测必须使用 Y。

最小内核的完整逻辑链:

  1. 线性 2SLS 的 estimand = (信号 + 污染) / (信号 + 污染);
  2. 饱和设定的 estimand = 信号 / 信号;
  3. 两者之差 = 污染造成的偏误;
  4. 一阶段 F 只度量分母的大小,无法区分信号和污染;
  5. 因此,F 大既可能意味着"强识别"(信号大),也可能意味着"强污染"(污染大);
  6. 检测污染必须使用 Y,且必须检验 θ_Y − L̄ θ_D = 0 这一条件矩条件。

这个最小内核的数学本质:它是一个投影分解——将工具变量 Z 分解为"层内变异"(Z − e(X),与 X 正交)和"层间曲率"(h(X),X 的函数)。线性设定错误地将后者当作前者使用。污染发生的条件是:曲率 h(X) 与水平函数 m_D(X)、m_Y(X) 相关。当 X 是连续变量而研究者只用线性控制时,这个相关性几乎是必然的。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在线性 IV 设定下,当协变量以线性形式进入模型时,一阶段 F 统计量(包括 Sanderson-Windmeijer 条件 F)无法检测由工具变量倾向得分曲率与协变量水平函数之间的协方差所造成的污染偏误,且这种偏误在原理上不可被任何基于 (Z, D, X) 的统计量检测。
  2. 核心工具/方法:将 2SLS 估计量分解为信号项(饱和设定 estimand)和污染项(曲率-水平协方差),基于此分解构建有向条件矩检验(screening test 和 bias-targeting test)、偏误修正估计量,以及可报告的污染份额 ϱ。
  3. 主要结论:一阶段 F 与污染偏误可以完全脱钩——F 可以任意大而估计量是纯污染(模式 a,制造强度),也可以 F 诚实而估计量仍被污染(模式 b,结果侧偏误);不存在基于 (Z, D, X) 的检测方法;但存在基于 Y 的有向检验和修正估计量,且修正的代价(识别损失)恰好等于污染份额。

关键设定与假设

在第二节最小记号的基础上,本文的完整设定如下:

  • 核心假设:条件有效性(conditional validity,Assumption 1)——{Y(d,z), D(z)} ⊥⊥ Z | X,以及排除限制 Y(d,1) = Y(d,0) ≡ Y(d)。这是 IV 解释的基准假设,本文不挑战它,而是在其下研究函数形式污染。
  • 单调性(Assumption 2):仅在二值处理、二值工具的 LATE 解释中需要,用于将 L̄ 读作条件 LATE 的凸组合。本文的分解本身不依赖它。
  • 线性设定(Assumption 4):研究者估计 Y = βD + X'γ + ε,这是被检验的对象,不是假设。
  • 正则性(Assumption 5):有限二阶矩、非奇异设计矩阵。标准条件。
  • 测试正则性(Assumption 7):i.i.d.、四阶矩、基函数非奇异。用于检验的渐近理论。

相比已有文献的放宽/强化:

  • 放宽:不要求工具变量倾向得分线性(Blandhol et al. 2022 的检验隐含此假设),不要求处理效应同质(LATE 文献的常见简化),不要求单调性(用于分解)。
  • 强化:要求条件有效性(Assumption 1)——本文不处理工具变量无效的情形,只处理"工具有效但函数形式错误"的情形。这是一个重要的边界:如果研究者怀疑工具变量本身无效(违反排除限制),本文的诊断不适用。

主要结果

结果 1(Lemma 1,分解):β_2SLS = (S_Y + θ_Y) / (S_D + θ_D),其中 S_W = E[Cov(Z, W|X)] 是信号,θ_W = Cov(h(X), m_W(X)) 是污染。这是全文的基础,所有后续结果都从它推导。

结果 2(Proposition 1,强度-偏误同一性):污染项 θ_D 同时进入估计量偏误(分子)和一阶段强度(分母)。因此,同一个 nuisance 既制造偏误又制造强度。这是"一阶段 F 无法检测污染"的代数根源。

结果 3(Proposition 2,共线性极限):在工具与协变量近似共线的序列下(Var(Z|X) → 0),信号 S_D → 0 而污染 θ_D 不消失,估计量收敛到 θ_Y/θ_D——一个纯协变量对比,无因果内容。同时,条件 F 发散(因为分母 Var(Z̃) 也由曲率主导)。这是"制造强度"(模式 a)的严格形式。

结果 4(Corollary 1,F 不警告):条件 F 沿共线性序列发散,而偏误同时发散。F 大不仅不排除污染,反而在共线性极限下是污染的必然结果。

结果 5(Proposition 3,不可检测性):设 T 为任何基于 (Z, D, X) 联合分布的可测函数。则存在两个数据生成过程,具有相同的 (Z, D, X) 边际分布(因此 T 取值相同),但污染偏误 β_2SLS − L̄ 任意不同。这是全文最核心的负面结果——它证明了一阶段诊断(无论多么精细)在原理上无法检测结果侧污染。

结果 6(Proposition 4,有向检验):构建 screening test(H₀: θ_D = θ_Y = 0)和 bias-targeting test(H₀: θ_Y − L̄ θ_D = 0)。检验统计量基于简约式回归的矩条件,不涉及内生回归子 D,因此不受弱识别影响。screening test 是充分条件检验(拒绝则必有污染),bias-targeting test 是必要条件检验(不拒绝则无偏误)。

结果 7(Proposition 5,弱识别下的尺寸控制):screening test 和 bias-targeting test 的尺寸在弱识别序列下仍受控,因为检验统计量不除以一阶段协方差。这是与 IV 估计量(小分母问题)的关键区别。

结果 8(Proposition 6,正交化检验):当倾向得分用机器学习估计时,通过 Neyman 正交化(8)消除一阶段估计误差的一阶影响,只需 ∥ê − e∥·∥m̂_W − m_W∥ = o_p(n^{-1/2}) 即可获得渐近正态性。

结果 9(Proposition 9,修正估计量):估计量 (15) 用灵活估计的倾向得分残差 Z − ê(X) 替代线性投影残差 Z̃,一致估计 L̄。只需 ∥ê − e∥ = o_p(1),无需正交性条件。

结果 10(Proposition 10,无免费午餐):修正估计量的一阶段协方差恰好是信号 S_D,因此其强度比线性设定的报告值低 ϱ。修正的代价是识别强度的损失,且损失量可预先计算。

结果 11(Corollary 2,识别-污染恒等式):S_D = (1 − ϱ)E[Z̃D]。修正后的一阶段 = 报告的一阶段 × (1 − ϱ)。

证明路线与技术技巧

整体路线(3-5 步逻辑主干):

  1. 分解:将 Z̃ = Z − ℓ(X) 分解为 (Z − e(X)) + h(X),代入 2SLS 的矩条件,得到 Lemma 1 的分解。这一步是纯代数,不需要任何统计假设。
  2. 共线性极限:构造 Var(Z|X) → 0 的序列,证明信号消失而污染不消失(Proposition 2)。关键技巧是控制 h(X) 的收敛(Assumption 6(ii))和水平函数的收敛(Assumption 6(iii)),使得 θ_D 和 θ_Y 有非零极限。
  3. 不可检测性:固定 (Z, D, X) 的联合分布,构造两个不同的 Y 条件分布,使得 (Z, D, X) 边际相同但 θ_Y 不同。关键技巧是注意到 θ_Y = E[h(X)Y] 只依赖 Y 在 h(X) 方向上的投影,而 (Z, D, X) 的分布不约束这个投影。
  4. 检验统计量:将 θ_Y − L̄ θ_D 重写为 E[h(X)(Y − L̄D)],用简约式回归的残差估计。关键技巧是避免除以一阶段协方差,从而在弱识别下保持尺寸。
  5. 修正估计量:用灵活估计的 ê(X) 替代线性投影,证明一致性只需 L² 收敛。关键技巧是注意到 (Z − e(X)) 与 X 正交,因此不需要正交化。

关键技术技巧:

  • 投影分解:将工具变量分解为"层内变异 + 层间曲率",这是全文的代数核心。它把函数形式问题转化为一个协方差计算问题。
  • 共线性序列:用 Var(Z|X) → 0 而非传统的"弱工具"(E[Z̃D] → 0)序列。区别在于:传统弱工具是信号消失,这里是信号消失但污染不消失,因此 F 发散而偏误也发散。
  • 不可检测性证明:通过构造 Y 的条件分布来展示 (Z, D, X) 边际的不充分性。这个证明非常简洁——它不需要复杂的渐近理论,只需要注意到 θ_Y 是 Y 的线性泛函,而 (Z, D, X) 的分布不约束它。
  • Neyman 正交化:在机器学习倾向得分时,通过 (8) 消除一阶段估计误差的一阶影响。这是标准的 double/debiased ML 技巧(Chernozhukov et al. 2018),但应用于检验而非估计。
  • 自归一化检验:bias-targeting 检验用自归一化统计量(t-ratio),避免估计 nuisance 方差,在弱识别下保持渐近 pivotal。

真实例子与应用

本文包含三个实证应用:

应用 1(模式 b):丈夫健康保险与妻子劳动供给(Olson 1998)。这是全文最详细的例子。数据为 n = 22,272 名已婚女性。工具变量 Z 为丈夫是否通过自己的工作获得健康保险,处理 D 为妻子是否被丈夫的保险覆盖,结果 Y 为妻子每周工作小时数,控制变量包括丈夫收入(线性进入)。条件 F 超过 36,000,污染份额 ϑ̂ = 0.09,看似完全可信。但 bias-targeting 检验 p < 10⁻³,拒绝无污染假设。修正后的估计值为 −4.45(95% CI [−5.14, −3.81]),而线性设定的报告值为 −1.87,修正后估计值翻倍以上。这个例子展示了模式 b 的典型特征:一阶段完全诚实(F 巨大、ϑ 小),但结果侧污染仍然严重,因为丈夫收入对妻子劳动供给的影响是高度非线性的。

应用 2(模式 a):401(k) 资格与家庭金融资产(Wooldridge 2010)。n = 9,275 户家庭。工具变量 Z 为 401(k) 资格,处理 D 为参与,结果 Y 为净金融资产。条件 F 超过 7,000,污染份额 ϑ̂ = 0.03。线性收入控制的估计值为 8.40,修正后为 12.6(95% CI [9.0, 16.0]),二次收入控制为 13.66,自然样条为 13.05。线性估计低估约三分之一。这个例子展示了即使污染份额很小(3%),结果侧偏误仍可显著,因为 θ_Y 可以远大于 L̄ θ_D。

应用 3(模式 a 的极端形式):奴隶贸易与信任(Nunn-Wantchekon 2011)。n = 17,371 名个体,156 个族群聚类。工具变量 Z 为族群到海岸的距离,处理 D 为历史奴隶出口,结果 Y 为当前信任水平。未聚类的 F 超过 1,200,但聚类后降至 17。污染份额 ϑ̂ = 0.52(95% CI [0.13, 1.00]),约一半的报告强度来自地理曲率。修正后的一阶段 F 降至 2.4,工具变量实际上接近弱识别。这个例子展示了模式 a 的极端形式:报告的一阶段强度大部分是制造出来的。

这些例子共同说明:模式 b(结果侧污染)在"一阶段诚实但结果非线性"时发生,模式 a(制造强度)在"工具与协变量近似共线"时发生。两种模式都无法被一阶段 F 检测,但都可以被本文的检验检测。

🔎 结论是否比证明窄

是,存在几处:

  1. Proposition 3 的表述比证明宽。命题声称"不存在基于 (Z, D, X) 的函数能检测偏误",但证明只处理了"固定 (Z, D, X) 边际分布、变化 Y 条件分布"的情形。它没有排除这样的可能性:某些 (Z, D, X) 的函数(如条件 F 的某种非线性变换)在所有数据生成过程中都能提供关于偏误的部分信息(即使不是完全检测)。作者在 Remark 3 中承认了这一点("非拒绝只证明在探测方向上无污染"),但 Proposition 3 的陈述没有这个限定。

  2. Proposition 5 的"弱识别"定义比标准定义窄。作者定义的弱识别序列是 Var(Z|X) → 0(共线性),而非传统的"一阶段系数趋近于零"(E[Z̃D] → 0)。在传统弱工具序列下(工具与处理的相关性弱,但与协变量无关),本文的检验是否仍保持尺寸?作者没有讨论。这是一个重要的边界:如果工具是"弱但干净"的,本文的检验可能不适用。

  3. 修正估计量 (15) 的渐近正态性需要额外条件。Proposition 9 只证明了 ∥ê − e∥ = o_p(1) 下的一致性。但推论中使用的置信区间需要渐近正态性,这需要 ∥ê − e∥·∥m̂_W − m_W∥ = o_p(n^{-1/2})(Proposition 6 的条件)。作者在正文中没有明确区分"一致性"和"可推断性"的条件,读者可能误以为 (15) 的置信区间在更弱的条件下也有效。

  4. ϑ 的估计。作者给出了 ϑ 的点估计和 bootstrap 置信区间,但没有证明 ϑ 的渐近正态性。在 ϑ 接近 0 或 1 时,bootstrap 可能失效。这是一个未解决的推断问题。

  5. 多工具变量情形。全文只处理了标量工具 Z。在多工具变量(Z 为向量)情形下,contamination 分解需要矩阵版本,且"污染份额"的定义不再唯一(取决于工具组合的权重)。作者在结论中提到了这一点,但没有给出任何结果。


四、开放问题

  1. 多工具变量与多处理的 contamination 分解。作者在结论中承认,向量工具和向量处理是"实质性前沿",但没有给出任何结果。具体要解决的是:当 Z 为向量时,2SLS 的 contamination 分解如何推广?ϑ 的定义是否依赖于工具组合的权重?Goldsmith-Pinkham et al. (2024) 的多处理组 contamination 与本文的单处理组函数形式 contamination 如何交互?(扎根于 Section 9:"Multiple, that is vector, treatments are the substantive frontier.")

  2. 非线性协变量设定的推广。本文的分解依赖"线性投影"这一具体设定。如果研究者使用多项式或样条控制(而非线性),contamination 会如何变化?是否存在一个"最优"控制函数形式使得 contamination 最小化?这需要将本文的分解推广到非参数回归框架。(扎根于 Section 9 对"flexible propensity"的讨论。)

  3. ϑ 的推断理论。作者给出了 ϑ 的点估计和 bootstrap 置信区间,但没有证明渐近正态性。在 ϑ 接近边界(0 或 1)时,bootstrap 是否仍然有效?能否构造基于影响函数的置信区间?(扎根于 Section 5 和 Table B.12 的 bootstrap 覆盖概率。)

  4. 检验的功效分析。作者证明了检验的尺寸控制(Proposition 5),但没有给出功效分析。在什么条件下(contamination 大小、样本量、基函数选择),检验能可靠地检测污染?是否存在一个"最小可检测 contamination"?(扎根于 Section 6.6 的 power sweep,但没有理论功效边界。)

  5. 与工具变量有效性检验的关系。本文的检验与传统的过度识别检验(Sargan/Hansen J)和 Durbin-Wu-Hausman 检验有何关系?在工具变量有效但函数形式错误的情况下,这些传统检验是否会误报?反之,本文的检验是否能检测工具变量无效?(扎根于 Section 4 的讨论,但作者没有与 Sargan 检验做正式比较。)

  6. 机器学习倾向得分的最优基函数选择。Proposition 6 要求 ∥ê − e∥·∥m̂_W − m_W∥ = o_p(n^{-1/2})。在实践中,如何选择基函数(多项式阶数、样条节点数)使得这一条件满足?是否存在数据驱动的方法?(扎根于 Proposition 6 的讨论,但没有给出基函数选择的指导。)


顺带提醒:要确认上述开放问题是否是真 gap,建议去读以下近期文献的 intro(约 5 篇):Słoczyński et al. (2026) 的实践指南、Krumme and Westphal (2026) 的联合检验、Goldsmith-Pinkham et al. (2024) 的多处理组 contamination、以及 Zhao et al. (2025) 的交互 2SLS 一致性条件。如果这些文献的 intro 都指向"函数形式污染不可检测"作为开放问题,那么本文的 Proposition 3 就是对该共识的重要修正;如果它们已经讨论了类似的检验,那么本文的新颖性主要在 ϑ 的报告框架而非检验本身。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论