跳转至

Closed-form estimation and uniform inference in additively separable triangular models with a nonseparable first stage

作者: Keita Sunada
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.22605


一、领域脉络与小综述

这个方向是什么

本文研究的核心问题是:在三角联立方程模型(triangular simultaneous equations model)中,如何对结果方程(outcome function)g(x) 进行非参数识别、估计与推断。该模型包含一个内生解释变量 X 和一个连续工具变量 Z,其关键特征是第一阶段方程允许不可分(nonseparable first stage),即 X = h(Z, η),其中 η 是不可观测的标量扰动。这与传统假设第一阶段可加可分(如 X = h(Z) + η)的文献形成对比。该方向的核心统计挑战在于:由于 X 的内生性(ε 与 η 相关),直接回归 Y 对 X 会得到有偏估计;而传统的非参数工具变量(NPIV)方法需要求解一个积分方程,这通常是一个不适定逆问题(ill-posed inverse problem),导致估计收敛速度慢且需要正则化。本文试图通过利用第一阶段的结构信息,找到一个闭式(closed-form)的识别表达式,从而避免不适定问题。

发展脉络(history)

  1. 奠基工作:三角模型的可加可分设定。Newey, Powell, and Vella (1999) 提出了一个两步非参数估计量,用于可加可分三角模型 Y = g(X) + ε, X = h(Z) + η。他们的方法依赖于均值独立性条件 E[ε|η, Z] = E[ε|η],并利用控制函数(control function)方法。其估计量的收敛速度由两阶段中较慢的那个决定。留下的口子:该方法不适用于第一阶段不可分的情形,且其识别策略依赖于可加性。

  2. 主要进展:非可加可分系统的识别。一系列工作研究了完全非可加的系统 Y = g(X, ε)。Imbens and Newey (2009) 关注分位数、平均和政策效应,而非直接估计 g。D’Haultfœuille and Février (2015) 和 Torgovitsky (2015) 利用二元工具变量给出了点识别的充分条件,但未提供清晰的估计方法。Torgovitsky (2015, Theorem S1) 在连续 Z 下以非构造性的方式证明了 g 的点识别。留下的口子:这些识别结果要么不直接给出 g 的表达式,要么不便于构造估计量。

  3. 当前 Frontier:闭式识别与估计。Chiappori, Komunjer, and Kristensen (2015) 研究了非参数变换模型,其识别结果给出了 g 本身的闭式表达式,并基于此构造了估计量。留下的口子:他们的模型和识别条件与本文不同,且其估计量是渐近线性的(parametric rate),而本文的估计量由于需要从归一化点积分,无法达到参数率。

  4. 本文的位置:本文在 Torgovitsky (2015) 的非构造性识别基础上,为可加可分但第一阶段不可分的模型(1.1)首次提供了 g 的闭式表达式(Proposition 2.6)。这个表达式是条件累积分布函数(CDF)的一个泛函。基于此,本文构造了一个无需正则化的 plug-in 估计量,并证明了其收敛速度是极小极大最优的。此外,本文还利用经验 bootstrap 构造了同时一致置信带(uniform confidence band),这在 NPIV 文献中是一个活跃但充满挑战的领域。

子线索聚类

  • 线索一:基于控制函数的方法(Control Function Approach)。以 Newey, Powell, and Vella (1999) 为代表。核心思想是估计第一阶段残差 η̂,并将其作为额外回归元加入第二阶段。该方法依赖于第一阶段的可加可分性。本文的工作可视为在不可分第一阶段下,通过更复杂的识别策略(利用条件 CDF 的导数)来构造一个类似控制函数的量。
  • 线索二:非参数工具变量(NPIV)方法。以 Newey and Powell (2003), Darolles et al. (2011) 为代表。该方法不依赖第一阶段的结构,直接求解 E[Y|Z] = E[g(X)|Z] 这个积分方程。其核心困难是不适定性,需要正则化,导致收敛速度慢。Horowitz and Lee (2012), Chen and Christensen (2018), Chen et al. (2025) 等在此基础上发展了统一置信带。本文的方法完全避开了这一线索,通过利用第一阶段信息将不适定问题转化为一个良态(well-posed)的估计问题。
  • 线索三:非可加系统的识别与估计。以 Chesher (2003), Imbens and Newey (2009), Torgovitsky (2015, 2017) 为代表。这些工作处理更一般的模型,但识别结果往往是非构造性的,或者估计方法(如 Torgovitsky (2017) 的最小距离法)计算复杂。本文的模型是这类模型的一个特例,但通过利用可加可分的结果方程,得到了一个极其简洁的闭式估计量。

这个方向在追问的核心问题

  1. 识别:在给定模型假设下,结果函数 g(x) 是否可以被唯一确定?需要什么样的条件(如工具变量独立性、单调性、支撑条件)?
  2. 估计:如何构造一个计算可行、收敛速度快且无需正则化的估计量?其收敛速度是多少?是否是极小极大最优的?
  3. 推断:如何构造 g(x) 的逐点置信区间和同时一致置信带?这些推断工具是否对模型假设的轻微违反具有稳健性(honest)?
  4. 与 NPIV 的比较:利用第一阶段结构信息(即使不可分)能否在理论上和实践上带来显著优势(如更快的收敛速度、更简单的计算)?

⚠️ 作者的 framing

作者将缺口 frame 为:在可加可分结果方程但第一阶段不可分的三角模型中,缺乏一个闭式的、无需正则化的估计方法。作者声称,其贡献在于: - 提供了 g 的闭式表达式(Proposition 2.6),这是对 Torgovitsky (2015) 非构造性识别的具体化。 - 基于此构造的估计量收敛速度为 n^{-m/(2m+1)},且是极小极大最优的(Proposition 3.6),与不存在内生性时的非参数回归率相同。这意味着不可分的第一阶段没有降低估计 g 的速率。 - 构造了统一置信带,且该置信带不继承 NPIV 方法的不适定性。

被淡化或回避的竞争路线: - NPIV 方法:作者明确指出 NPIV 方法需要正则化且收敛速度慢,但并未深入讨论在弱工具变量或工具变量与内生变量关系复杂时,本文方法是否依然稳健。本文方法依赖于 ∇zV(x|z) 非零,这本质上要求工具变量对 X 的条件分布有足够强的“移动”能力,这可能是另一种形式的“强工具”假设。 - Torgovitsky (2017) 的估计方法:作者提到 Torgovitsky (2017) 提供了一个估计方法,但将其限制在 g 是有限维参数化的情形。作者并未详细比较其非参数方法与 Torgovitsky (2017) 的“最小距离法”在计算复杂度和有限样本表现上的优劣。

什么明显该被引 / 该存在、却没出现在 intro 里? - 关于弱工具变量(weak instruments)的文献:本文的识别和估计强烈依赖于 ∇zV(x|z) 非零。当工具变量很弱时,这个导数会很小,导致估计量的方差非常大。作者在 Proposition 3.6 的证明中提到了“更强的工具不会提高速率”,但这与弱工具下的有限样本问题不同。引用如 Staiger and Stock (1997) 或更近期的弱 IV 文献会更有帮助。 - 关于高维协变量的文献:作者在 Remark 2.9 中提到了离散协变量可以逐单元处理,但连续协变量会降低速率。然而,对于如何在高维协变量下进行变量选择或降维(如使用双机器学习 DML),作者没有提及。这可能是未来工作的一个自然方向。

张力

未见明显对立引用。文献脉络清晰,不同方法(控制函数 vs. NPIV vs. 非可加系统)处理不同设定,彼此之间是互补而非矛盾的关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • Y:结果变量(标量,可观测)。
    • X:内生解释变量(标量,可观测)。
    • Z:工具变量(标量,可观测)。
    • ε:结果方程的不可观测误差(标量)。
    • η:第一阶段方程的不可观测误差(标量)。
    • g(·):结果函数(未知,待估)。
    • h(·,·):第一阶段函数(未知,但仅需其某些性质)。
    • FY|X,Z(y|x,z):给定 X=x, Z=z 时 Y 的条件 CDF。
    • fY|X,Z(y|x,z):给定 X=x, Z=z 时 Y 的条件 PDF。
    • V(x|z) = FX|Z(x|z):给定 Z=z 时 X 的条件 CDF。
    • ∇zV(x|z):V(x|z) 关于 z 的偏导数。
    • ∇xV(x|z):V(x|z) 关于 x 的偏导数。
    • m:模型施加的光滑性阶数(如 g 和密度函数有 m 阶有界导数)。
    • n:样本量。
    • hx, hy, hz:核估计的带宽参数。
    • µ(y,z):权重函数,用于对 (y,z) 进行积分平均。
  • 模型:

    • 结果方程:Y = g(X) + ε。这是可加可分的。
    • 第一阶段方程:X = h(Z, η)。这是不可分的,即 h 不是 Z 和 η 的简单和。
    • 关键假设:(ε, η) ⊥ Z(工具变量与所有不可观测项独立)。h(z,·) 对每个 z 是严格递增的(单调性)。g 是连续可微的,且 g(0) = 0(归一化)。
  • 可观测数据:研究者观测到 {Yi, Xi, Zi}_{i=1}^n,即 (Y, X, Z) 的独立同分布样本。

  • 不可观测 / 潜在量:ε 和 η 是不可观测的。g 和 h 是未知函数。FY|X,Z 和 V 是未知的条件分布函数,但可以通过可观测数据非参数地估计。

第二步:讲最小内核

本文的核心数学思想是:利用工具变量的独立性,将 g 的导数 ∇xg(x) 表达为可观测数据的条件 CDF 及其导数的闭式泛函。这个表达式是 Proposition 2.6 的核心。

最简特例:考虑一个极端简化的情形,其中所有随机变量都是连续的,且我们只关心在某个特定点 (x, y, z) 上的识别。

  1. 关键等式:由于 (ε, η) ⊥ Z,且 h(z,·) 是单调的,我们可以将 X 的分布转化为 η 的分布。具体地,V(X|Z) = Fη(η) 几乎必然成立。这意味着 V(X|Z) 是 η 的一个单调变换,因此 (ε, V(X|Z)) 与 Z 独立。

  2. 重写条件 CDF:利用上述独立性,我们有: FY|X,Z(y|x,z) = P(ε ≤ y - g(x) | X=x, Z=z) = P(ε ≤ y - g(x) | V(X|Z)=V(x|z), Z=z) = Fε|V(X|Z)(y - g(x) | V(x|z))。 这个等式将 FY|X,Z 与 ε 的条件分布联系起来,并且消去了对 Z 的直接依赖(除了通过 V(x|z))。

  3. 对 x 和 z 求导:现在,固定 y,对上述等式两边分别关于 x 和 z 求导(应用链式法则),得到三个关键方程(见附录 A 的 (A.1)-(A.3)):

    • fY|X,Z(y|x,z) = fε|V(...) (A.1)
    • ∇xFY|X,Z(y|x,z) = -∇xg(x) * fε|V(...) + ∇xV(x|z) * ∇vFε|V(...) (A.2)
    • ∇zFY|X,Z(y|x,z) = ∇zV(x|z) * ∇vFε|V(...) (A.3)
  4. 消去不可观测项:方程 (A.1)-(A.3) 中包含了不可观测的 fε|V 和 ∇vFε|V。我们的目标是解出 ∇xg(x)。从 (A.3) 中解出 ∇vFε|V,代入 (A.2),再利用 (A.1) 消去 fε|V,最终得到: ∇xg(x) = [ ∇xV(x|z) / ∇zV(x|z) * ∇zFY|X,Z(y|x,z) - ∇xFY|X,Z(y|x,z) ] / fY|X,Z(y|x,z)。

这个表达式就是 Proposition 2.6 的核心结果。它表明,g 在点 x 处的导数,完全由可观测数据 (Y, X, Z) 的条件 CDF FY|X,Z 和 V 及其一阶导数决定。这个表达式是闭式的,因为它不涉及求解任何方程,只是一个关于这些条件分布的直接公式。

为什么这个特例抓住了核心:即使在全文中,g(x) 是通过对 ∇xg(u) 从 0 到 x 积分得到的,其估计量的主要统计行为(收敛速度为 (nhx)^{-1/2})也完全由这个导数表达式的估计所驱动。积分操作只是将点 x 处的误差和归一化点 0 处的误差组合起来。因此,理解这个导数表达式是如何从独立性假设和链式法则中推导出来的,就抓住了整篇论文的数学内核。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在可加可分结果方程但第一阶段不可分的三角模型 Y = g(X) + ε, X = h(Z, η) 中,研究 g(x) 的非参数识别、估计与统一推断。
  2. 核心工具 / 方法:利用工具变量独立性假设,将 g 的导数 ∇xg(x) 识别为条件 CDF FY|X,Z 和 V 的闭式泛函(Proposition 2.6);基于此构造了 plug-in 核估计量 ĝLS 和 ĝLAD;使用经验 bootstrap 构造统一置信带。
  3. 主要结论:g 被点识别;其估计量的收敛速度为 n^{-m/(2m+1)},且是极小极大最优的(Proposition 3.6);估计量在适当带宽下是渐近正态的(Theorem 3.5);基于 bootstrap 的统一置信带具有渐近正确的覆盖概率(Theorem 3.8)。

关键设定与假设

  • 模型:Y = g(X) + ε, X = h(Z, η)。
  • 关键假设:
    • Assumption 2.1 (绝对连续性与凸支撑):Y, X, Z 绝对连续,X 的支撑是凸的。这是技术性假设,保证密度和 CDF 存在。
    • Assumption 2.2 (光滑性与归一化):g 连续可微,且 g(0)=0。归一化是识别非可加模型所必需的。
    • Assumption 2.3 (工具变量独立性与单调性):(ε, η) ⊥ Z(全文最关键的假设,比 Newey et al. (1999) 的均值独立性更强),h(z,·) 严格递增。独立性是推导闭式表达式的核心;单调性保证了 V(X|Z) 与 η 的一一对应。
    • Assumption 2.4 (正则性条件):对 V 和 FY|X,Z 的光滑性、导数非零、密度正性等要求。这些是技术性条件,确保链式法则和除法运算有效。
    • Assumption 2.5 (支撑不变性):Y 和 X 的支撑不随 Z 变化。这简化了理论,使得闭式表达式在更大范围内成立。
    • Assumption 3.2 (核函数与权重函数):核函数 K 是 m 阶的,有足够的光滑性和尾部衰减。权重函数 µ 光滑、紧支撑且积分为 1。
    • Assumption 3.3 (估计区域的正则性):在估计区域 Yµ × X̃0 × Zµ 上,密度和导数有界且远离零。这是保证核估计量一致收敛和比率估计稳定的关键。
    • Assumption 3.4 (带宽条件):带宽以幂律形式衰减,并满足一系列条件,以确保偏差和方差项的高阶项可忽略。特别地,它要求 √(nhx) * hx^m → 0(欠平滑)和 √(nhx) * Rn → 0(剩余项可忽略)。

主要结果

  • Theorem 3.5 (渐近正态性):对于 x ∈ X0(远离归一化点 0 的紧集),在欠平滑带宽下,√(nhx)(ĝ(x) - g(x)) ⇝ N(0, σ²(x) + σ²(0))。方差由两部分组成:来自点 x 处的核估计和来自归一化点 0 处的核估计。关键点:收敛速度是 (nhx)^{-1/2},即一维非参数回归的速度,而不是 NPIV 中更慢的速度。这得益于闭式表达式避免了不适定逆问题。
  • Proposition 3.6 (极小极大最优速率):在给定的光滑性假设下,任何估计量在点 x 处的收敛速度都不可能快于 n^{-m/(2m+1)}。关键点:本文的估计量在最优带宽下可以达到这个速率,因此是极小极大最优的。这证明了不可分的第一阶段没有带来额外的统计代价。
  • Theorem 3.8 (统一置信带):基于经验 bootstrap 的 sup-t 置信带 Cn(x) 具有渐近正确的覆盖概率:P(g(x) ∈ Cn(x) for all x ∈ X0) → 1-α。关键点:该置信带是“同时”的,覆盖整个函数 g 在 X0 上的形状,而不仅仅是逐点覆盖。证明依赖于 Chernozhukov et al. (2014, 2016) 的高斯耦合和反集中不等式。

证明路线与技术技巧(理论型)

  • 整体路线:

    1. 线性化:将 ĝLS(x) - g(x) 表示为对核估计量误差(Φ̂-Φ, f̂-f 等)的线性泛函,加上一个高阶剩余项 Op(Rn)(Lemma B.1, B.2, B.3)。这一步是标准的“线性化”或“von Mises 展开”。
    2. 识别主导项:通过巧妙的代数操作(利用欧拉齐次函数定理 (B.5) 和分部积分),将线性化后的表达式简化为两个边界项 Tn(x) 和 Tn(0) 的和,加上一个 Donsker 类平均 n^{-1} Σ ρx(Wi)(Lemma B.3, B.5)。关键跳跃:Tn(a) 是一个一维核平均,形式为 (nhx)^{-1} Σ K((Xi-a)/hx) ca(Wi),其中 ca 是一个“影响函数”。这表明,尽管估计量涉及多维核平滑,但其主导统计行为仅由 X 方向的一维核平滑决定。
    3. 处理主导项:证明 Tn(x) - Tn(0) 是渐近正态的,方差为 σ²(x) + σ²(0)。这通过标准的中心极限定理和协方差计算完成(Lemma B.5 证明 (iv))。证明 n^{-1} Σ ρx(Wi) 是 Op(n^{-1/2}) 的,因为 {ρx} 是 Donsker 类(Lemma B.4)。
    4. 处理 LAD 估计量:证明 ĝLAD 与 ĝLS 是渐近等价的(Theorem 3.5 证明末尾)。
    5. 统一置信带:证明 √(nhx)(ĝ(x) - g(x)) 的标准化经验过程可以被一个高斯过程耦合(Lemma D.3, D.4)。然后利用反集中不等式(Chernozhukov et al., 2014)将 bootstrap 分位数与高斯过程的分位数联系起来,从而证明覆盖概率(Theorem 3.8 证明)。
  • 关键跳跃点:

    • 从多维核估计到一维核平均:这是最核心的跳跃。它依赖于两个事实:(a) 闭式表达式中的 ∇zFY|X,Z 和 ∇xFY|X,Z 等项在积分 ∫∫ µ(y,z) ... dy dz 后,y 和 z 方向的平滑被平均掉,只剩下 x 方向的核。(b) 积分 ∫₀ˣ du 与 x 方向的核相互作用,通过分部积分产生两个边界项 Tn(x) 和 Tn(0)。
    • 处理边界项:Tn(a) 本身不是一个标准的 U-统计量或经验过程,而是一个“核平均”。证明其渐近正态性需要处理其偏差和方差,并证明 Tn(x) 和 Tn(0) 渐近不相关。
    • Bootstrap 有效性:证明 bootstrap 过程 √(nhx)(ĝ*(x) - ĝ(x)) 能够正确逼近 √(nhx)(ĝ(x) - g(x)) 的分布。这依赖于对 bootstrap 版本的线性化(Lemma D.4)以及高斯耦合理论。
  • 技术技巧点名:

    • 经验过程理论(Empirical Process Theory):用于证明 {ρx} 是 Donsker 类(Lemma B.4)和核估计量的均匀收敛速度(Lemma B.1 证明中的 VC 类型参数)。
    • 高斯耦合(Gaussian Coupling):使用 Chernozhukov et al. (2016) 的定理,将样本和 bootstrap 的 sup-t 统计量与一个共同的高斯过程的 sup 进行耦合(Lemma D.3, D.4)。
    • 反集中不等式(Anti-concentration Inequality):使用 Chernozhukov et al. (2014) 的引理,将耦合误差转化为分布函数之间的 Kolmogorov 距离(Theorem 3.8 证明 Step 4)。
    • 欧拉齐次函数定理(Euler's Homogeneous Function Theorem):用于简化线性化表达式,消去对 (Φ, f) 等对的线性化项(Lemma B.3 证明中的 (B.5))。
    • 分部积分(Integration by Parts):用于处理 ÂΦx 和 Âfx 项,将积分内的导数转化为边界项(Lemma B.3 证明末尾)。

真实例子与应用

本文包含一个 Monte Carlo 模拟研究(Section 4)。 - 数据生成:Yi = sin(Xi) + εi, Xi = 6L(-Zi + ηi) - 3,其中 L 是 logistic 函数。(ε, η) 通过 Frank copula 相关,Z 独立。这个设计满足模型假设,且第一阶段不可分。 - 方法应用:作者实现了 ĝLS 和 ĝLAD 估计量,并与 Newey et al. (1999) 的级数估计量(NPV)进行比较。带宽通过一个简单的网格搜索选择。 - 结果: - ĝLAD 在 RMSE 上优于 ĝLS 和 NPV(在最优 p 下)。 - NPV 的偏差不随样本量增加而减小(因为其模型设定错误),而本文的估计量偏差随 n 减小。 - 基于 bootstrap 的统一置信带在模拟中表现出略高于名义水平的覆盖概率(over-coverage),但作者指出理论误差界在 n=1000 时并不小。 - 例子想说明什么:验证了理论结果(估计量收敛、bootstrap 带有效),并展示了在有限样本下,本文方法相对于错误设定的 NPV 方法的优势,以及 LAD 相对于 LS 的稳健性。

🔎 结论是否比证明窄

  • 关于统一置信带的“诚实性”(Honesty):作者在 Remark 3.9 中明确指出,Theorem 3.8 只证明了在单一分布下的渐近覆盖概率,并未证明该置信带在一类分布上是一致有效的(即“诚实的”)。作者列出了需要加强的三个条件(对分布类进行量化、σ²(0) 的下确界、学生化量的均匀收敛速度),并指出这些是未来工作。因此,论文的结论(“构造了统一置信带”)比其证明所覆盖的范围要窄——它只对点假设有效,而非对一类分布有效。
  • 关于带宽选择:模拟中使用的带宽选择规则(数据驱动的支撑选择、固定的带宽指数 0.15)不在理论覆盖范围内。作者在脚注 4 中明确指出了这一点,称其为“理论之外的实现特征”。这意味着模拟的成功并不能完全由 Theorem 3.8 保证,其有限样本表现可能对带宽选择敏感。
  • 关于 ĝLAD 的渐近等价性:Theorem 3.5 的证明中,对 ĝLAD 的渐近正态性证明依赖于一个引理,该引理声称 |ĝLAD(x) - ĝLS(x)| = Op(∆_n^LAD),且 √(nhx) ∆_n^LAD √(logn) → 0。这个引理的证明被引用为“Chiappori et al. (2015, Theorem 2) 的论证,并适应于均匀性”。这个“适应”过程可能包含额外的技术条件,论文没有完全展开,因此 ĝLAD 的结论可能比 ĝLS 的结论稍弱。

四、开放问题

  1. 诚实的统一置信带(Honest Uniform Confidence Bands):如 Remark 3.9 所述,本文的置信带仅在单一分布下有效。要证什么:构造一个在一类分布(如 Proposition 3.6 中定义的 P)上具有一致渐近覆盖概率的置信带。扎根于:Remark 3.9 和 Theorem 3.8 的证明。
  2. 数据驱动的带宽选择:模拟中使用的带宽选择是启发式的,且不在理论覆盖范围内。要估什么:开发一个理论上有效的、数据驱动的带宽选择方法(如某种形式的交叉验证或插件法),使得估计量达到最优收敛速度,且置信带保持有效。扎根于:Section 4.1 中关于“没有现成的带宽选择准则”的讨论,以及脚注 4。
  3. 扩展到高维协变量:作者在 Remark 2.9 中提到了连续协变量会降低速率。要估什么:将本文的框架扩展到包含高维协变量 W 的情形,例如通过假设 g(X, W) 具有某种稀疏结构(如部分线性模型),并利用双机器学习或高维统计工具进行估计和推断。扎根于:Remark 2.9。
  4. 弱工具变量下的行为:本文的识别依赖于 ∇zV(x|z) 非零。要研究什么:当工具变量很弱(即 ∇zV 很小)时,本文估计量的有限样本偏差和方差行为如何?是否存在一个“弱工具变量”的渐近框架,可以刻画这种情形下的推断问题?扎根于:Proposition 2.6 的表达式和 Assumption 3.3 (iii) 中对 |∇zV| 远离零的要求。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论