Closed-form estimation and uniform inference in additively separable triangular models with a nonseparable first stage¶
作者: Keita Sunada
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.22605
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:在连续工具变量(IV) 设定下,如何对可加可分三角模型中的结果方程(outcome function)进行非参数识别与估计。该模型允许第一阶段方程(first stage)是不可分的(nonseparable),即内生变量X与工具变量Z和不可观测项η以任意方式交互。这一设定比传统的第一阶段可加可分假设(如Newey et al., 1999)更具一般性,也更符合许多经济学应用(如需求估计中由均衡条件产生的工具变量)。该方向当前的核心挑战在于:如何在避免正则化(regularization)的前提下,实现非参数估计,并构造有效的推断工具。
发展脉络(history)¶
- 奠基工作:Newey, Powell, and Vella (1999) 提出了一个两步非参数估计量,用于可加可分三角模型。他们的方法依赖于第一阶段方程的可加可分性(
X = h(Z) + η)和均值独立性条件(E[ε|η, Z] = E[ε|η])。该估计量的收敛速率由两个阶段中较慢的那个决定,在本文的设定下(两个阶段均为单变量且光滑阶数相同),其均方误差速率为n^{-2m/(2m+1)},平方根后与本文的速率一致。留下的口子:该方法不适用于第一阶段不可分的情形。 - 主要进展(完全不可分系统):Imbens and Newey (2009) 研究了完全不可分三角系统,但聚焦于分位数、平均和政策效应,而非直接估计g。D'Haultfœuille and Février (2015) 和 Torgovitsky (2015) 使用离散工具变量,提供了完全不可分函数
g(x, w, e)的点识别条件,但未给出清晰的估计方法。Torgovitsky (2015, Theorem S1) 使用连续工具变量,以非构造性方式建立了g的点识别。留下的口子:识别是非构造性的,无法直接用于估计。 - 当前frontier(闭式估计与均匀推断):Chiappori, Komunjer, and Kristensen (2015) 研究了非参数变换模型,其识别结果给出了g本身的闭式表达式,并基于此构造了估计量。本文的估计方法直接受其启发。Chen and Christensen (2018) 和 Chen, Christensen, and Kankanala (2025) 在非参数IV回归(NPIV)的框架下,使用系列估计量(sieve estimator)获得了最优sup-norm速率和均匀置信带,但所有这些工作都继承了逆问题的不适定性(ill-posedness),导致估计量收敛速率较慢。留下的口子:NPIV方法需要正则化,速率受限于不适定性。
- 本文的位置:本文在Torgovitsky (2015) 的非构造性识别基础上,首次为可加可分三角模型(允许第一阶段不可分)提供了结果函数g的闭式表达式。这一表达式避免了正则化,使得plug-in估计量能够达到与不存在内生性时相同的非参数速率(
n^{-m/(2m+1)}),并且是极小极大最优的。同时,本文利用经验bootstrap构造了均匀置信带,该置信带不继承NPIV方法中的不适定性。
子线索聚类¶
- 基于控制函数的方法(Control Function Approach):以Newey et al. (1999) 为代表,通过估计第一阶段残差作为控制函数来消除内生性。这类方法通常要求第一阶段可加可分或具有特定的结构。本文属于此类,但允许第一阶段不可分。
- 基于非参数IV回归的方法(NPIV):以Newey and Powell (2003), Darolles et al. (2011), Horowitz and Lee (2012), Chen and Christensen (2018) 为代表。这类方法通过求解积分方程
E[Y|Z] = E[g(X)|Z]来识别g,通常需要正则化处理不适定逆问题,收敛速率较慢。 - 基于变换模型的方法(Transformation Models):以Chiappori et al. (2015) 为代表。这类模型在特定条件下(如条件独立性)也能得到闭式表达式,但模型结构与本文不同(本文是三角系统,他们是变换模型)。
这个方向在追问的核心问题¶
- 识别:在允许第一阶段不可分的情况下,如何非参数地识别结果函数g?需要哪些关键假设(如工具变量独立性、单调性)?
- 估计速率:在避免正则化的前提下,g的估计能达到的最优收敛速率是多少?这个速率是否受第一阶段不可分性的影响?
- 推断:如何构造在紧集上同时有效的均匀置信带?能否避免NPIV方法中因不适定性导致的速率退化?
- 调参:对于核估计量,如何选择带宽以实现最优的估计和推断?是否存在数据驱动的选择方法?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将主要缺口定位为:在允许第一阶段不可分的情况下,缺乏一个构造性的、闭式的识别结果,以及一个无需正则化的、能达到最优速率的估计量和均匀推断方法。作者通过提供闭式表达式,将问题从不适定的积分方程求解,转化为对条件分布函数的非参数估计,从而绕过了正则化。
- 哪些竞争路线被他淡化或回避了:作者淡化了NPIV方法。虽然承认NPIV方法也能处理内生性,但强调其需要正则化且速率较慢。作者将本文的方法定位为一种更简洁、更快的替代方案。作者也回避了完全不可分系统(如Imbens and Newey, 2009)中直接估计g的困难,而是利用模型的可加可分性(结果方程)来简化问题。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:论文没有引用关于高维工具变量或机器学习方法(如DML) 在非参数IV中的应用。这些方法在处理高维或复杂数据时可能具有优势,但本文的设定是单变量连续IV,因此不直接相关。此外,没有引用关于弱工具变量的文献,这可能是一个值得研究者去查的问题:本文的识别和估计对工具变量的强度有何要求?
张力¶
未见明显对立引用。各条线索(控制函数、NPIV、变换模型)在各自的假设下成立,彼此之间没有直接的矛盾。主要差异在于模型设定(可加可分 vs. 完全不可分)、识别策略(闭式 vs. 积分方程)和估计方法(plug-in vs. 正则化)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
Y:结果变量(outcome),可观测的标量随机变量。X:内生解释变量(treatment),可观测的连续标量随机变量。Z:工具变量(instrument),可观测的连续标量随机变量。ε:结果方程中的不可观测误差项(unobservable)。η:第一阶段方程中的不可观测误差项(unobservable)。g(·):结果函数(outcome function),未知的、待估计的非参数函数。h(·,·):第一阶段函数(first-stage function),未知的非参数函数。F_{Y|X,Z}(y|x,z):给定X=x, Z=z时Y的条件累积分布函数(CDF)。F_{X|Z}(x|z):给定Z=z时X的条件累积分布函数(CDF),文中记为V(x|z)。f_{Y|X,Z}(y|x,z):给定X=x, Z=z时Y的条件概率密度函数(PDF)。m:模型施加的光滑阶数(smoothness order),即g和h的联合密度具有m阶有界导数。n:样本量。h_x, h_y, h_z:核估计中的带宽参数(bandwidth)。
-
模型:
- 结果方程:
Y = g(X) + ε。这是一个可加可分的结构方程,内生性来源于X与ε的相关。 - 第一阶段方程:
X = h(Z, η)。这是一个不可分的方程,允许Z和η以任意方式交互。 - 关键假设:工具变量
Z与不可观测项(ε, η)独立((ε, η) ⊥⊥ Z)。这是识别的基础。 - 其他假设:
h(z, ·)对每个z严格递增(单调性);g连续可微;g(0) = 0(水平归一化)。
- 结果方程:
-
可观测数据:
- 研究者能观测到的是来自上述模型的独立同分布样本
{Y_i, X_i, Z_i}_{i=1}^n。 - 不可观测的是
ε_i和η_i。识别和估计的关键在于,利用Z与(ε, η)的独立性,通过可观测的条件分布F_{Y|X,Z}和F_{X|Z}来表达g。
- 研究者能观测到的是来自上述模型的独立同分布样本
第二步:讲最小内核¶
本文的核心数学思想可以浓缩为:在给定假设下,结果函数的导数 g'(x) 可以表示为条件分布函数及其偏导数的闭式泛函,从而避免了求解不适定的积分方程。
最简特例:考虑一个极端简化的情形,其中所有分布都是光滑的,且我们只关心在某个特定点 (x, y, z) 处的导数。假设我们已知条件分布 F_{Y|X,Z}(y|x,z) 和 F_{X|Z}(x|z)(即 V(x|z)),并且它们足够光滑。
核心思路:从模型 Y = g(X) + ε 出发,给定 X=x, Z=z,我们有:
F_{Y|X,Z}(y|x,z) = P(ε ≤ y - g(x) | X=x, Z=z)。
由于 X = h(Z, η) 且 h(z, ·) 严格递增,X 和 Z 的信息等价于 V(X|Z) 和 Z 的信息。又因为 (ε, η) ⊥⊥ Z,V(X|Z) = F_η(η) 是 η 的单调变换。因此,条件分布可以写为:
F_{Y|X,Z}(y|x,z) = F_{ε|V(X|Z)}(y - g(x) | V(x|z))。
现在,对上述等式两边分别关于 x 和 z 求偏导,并利用链式法则,可以得到一个关于 g'(x) 的线性方程组:
- 对
x求导:∂_x F_{Y|X,Z} = -g'(x) f_{Y|X,Z} + (∂_x V) * (∂_v F_{ε|V}) - 对
z求导:∂_z F_{Y|X,Z} = (∂_z V) * (∂_v F_{ε|V})
从第二个方程解出 ∂_v F_{ε|V},代入第一个方程,并利用 f_{Y|X,Z} = f_{ε|V},即可得到闭式表达式:
g'(x) = [ (∂_x V(x|z)) / (∂_z V(x|z)) * ∂_z F_{Y|X,Z}(y|x,z) - ∂_x F_{Y|X,Z}(y|x,z) ] / f_{Y|X,Z}(y|x,z)
这个表达式就是整个论文的数学内核。它表明,g'(x) 完全由可观测数据的条件分布 F_{Y|X,Z} 和 F_{X|Z} 及其偏导数决定。一旦估计出这些条件分布,就可以直接代入公式得到 g'(x) 的估计,再通过积分 g(x) = ∫_0^x g'(u) du 得到 g(x)。整个过程不需要求解任何积分方程,因此无需正则化。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在允许第一阶段方程不可分、且工具变量与不可观测项独立的连续IV设定下,研究可加可分三角模型中结果函数
g的非参数识别、估计与推断。 - 核心工具 / 方法:推导出
g的导数g'作为条件分布F_{Y|X,Z}和F_{X|Z}的闭式泛函,并基于此构造了无需正则化的plug-in核估计量(LS和LAD两种形式)。 - 主要结论:该估计量在点处的收敛速率为
n^{-m/(2m+1)},该速率是极小极大最优的;通过经验bootstrap构造了在紧集上同时一致的置信带,其覆盖误差渐近趋于零。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- Assumption 2.1 (连续性):Y, X, Z 绝对连续分布;X 的支撑集是凸集。
- Assumption 2.2 (光滑性与归一化):g 连续可微;g(0) = 0(水平归一化,用于确定积分常数)。
- Assumption 2.3 (工具变量独立性):(ε, η) ⊥⊥ Z(全文最关键的假设,比Newey et al. (1999) 的均值独立性更强);h(z, ·) 严格递增(单调性,用于保证 V(X|Z) 与 η 的一一对应)。
- Assumption 2.4 (正则性条件):在识别点 (x,y,z) 附近,V(x|·) 连续可微且导数非零,F_{Y|X,Z} 及其偏导数存在且连续,密度 f_{Y|X,Z} > 0。这些条件保证了闭式表达式中分母非零且链式法则可行。
- Assumption 2.5 (支撑集不变性):Y 和 X 的条件支撑集不随 z 变化。这简化了后续估计的支撑集处理。
- Assumption 3.2 (核函数与权重):核函数 K 是 m 阶的,可微且具有多项式尾部衰减。权重函数 µ(y,z) 具有紧支撑且光滑。
- Assumption 3.3 (估计区域的正则性):在估计区域 Y_µ × ˜X_0 × Z_µ 上,所有相关的密度、条件分布及其导数都有界且远离零。这是保证核估计量一致收敛和线性化成立的关键。
- Assumption 3.4 (带宽条件):带宽 h_y, h_x, h_z 以特定速率趋于0,确保核估计的偏差和方差项可被控制,特别是使得线性化后的余项为 o_p((nh_x)^{-1/2})。
相比已有文献: - 放宽:相比Newey et al. (1999),放宽了第一阶段可加可分的假设。 - 强化:相比NPIV方法(如Darolles et al., 2011),本文不需要“完备性”(completeness)条件来保证积分方程解的唯一性,但需要更强的工具变量独立性(而非均值独立性)。
主要结果¶
- Proposition 2.6 (识别):在Assumptions 2.1-2.4下,结果函数的导数
g'(x)由公式(2.2)识别。这是全文的理论基石。 - Theorem 3.5 (渐近正态性):在Assumptions 2.1-2.5, 3.2-3.4下,对于
x ∈ X_0(紧集,且排除归一化点0),√(nh_x)(ˆg_LS(x) - g(x))渐近服从均值为0、方差为σ²(x) + σ²(0)的正态分布。LAD估计量有相同的极限分布。- 直觉:方差由两项组成,一项来自
x点处的核平均,另一项来自归一化点0处的核平均。这两项渐近不相关。 - 必要条件:
σ²(0) > 0,即归一化点处的方差非零。 - 解决的技术难点:成功地将估计误差线性化为两个核平均
T_n(x)和T_n(0)的差,并证明了余项可忽略。
- 直觉:方差由两项组成,一项来自
- Proposition 3.6 (极小极大下界):在给定光滑类
P上,任何估计量˜g_n(x)的收敛速率都不可能快于n^{-m/(2m+1)}。这证明了Theorem 3.5中估计量的速率是最优的。- 证明思路:通过构造一个子类
P_0,其中ε与(η, Z)独立(即不存在内生性),将问题退化为标准的非参数回归。然后应用Stone (1980) 的极小极大下界结果。
- 证明思路:通过构造一个子类
- Theorem 3.8 (均匀置信带):在Theorem 3.5和Assumption 3.7(学生化估计量的收敛速率条件)下,由经验bootstrap构造的置信带(3.2)在
X_0上具有渐近覆盖概率1-α。- 证明路线:利用Chernozhukov et al. (2014, 2016) 的耦合(coupling)和反集中(anti-concentration)技术,将样本和bootstrap的studentized supremum与一个共同的Gaussian过程的supremum进行比较,从而控制覆盖误差。
证明路线与技术技巧(理论型)¶
整体路线(以Theorem 3.5为例):
1. 线性化:将估计量 ˆg_LS(x) 的误差 ˆg_LS(x) - g(x) 表示为对核估计量 (ˆF, ˆV, ˆf, ˆp) 的线性泛函,加上一个可忽略的余项 O_p(R_n)。这是通过将 ˆS 在真值 S 附近进行一阶泰勒展开实现的(Lemma B.1, B.2)。
2. 利用齐次性简化:注意到 S 是 (Φ, f, Ψ, p) 的零次齐次函数,因此线性化后的泛函在真值处为零。这意味着可以用 ˆΦ 代替 ˆΦ - Φ 等,简化了表达式(Lemma B.3)。
3. 分离边界项:在将线性化泛函展开为样本平均时,有两个项(涉及 ˆΦ_x 和 ˆf_x)在积分 ∫_0^x du 后会产生边界项 B_n(x)。其余十项构成一个Donsker类 ρ_x 的样本平均,其阶为 O_p(n^{-1/2})(Lemma B.4)。
4. 识别主导项:边界项 B_n(x) 可以进一步简化为两个核平均的差:T_n(x) - T_n(0)(Lemma B.5)。其中 T_n(a) 是一个以 a 为中心的、带宽为 h_x 的一维核平均。这是整个估计误差的主导项。
5. 中心极限定理:证明 √(nh_x)(T_n(x) - T_n(0)) 满足Lindeberg-Feller CLT的条件,从而得到渐近正态性。
关键跳跃点:
- 从闭式表达式到线性化:如何将复杂的、由多个核估计量比值构成的 ˆS 线性化为一个可处理的样本平均?关键在于反复使用比值展开公式 ˆa/ˆb - a/b = (ˆa-a)/b - a(ˆb-b)/b² + ...,并利用核估计的一致收敛速率来控制高阶余项。
- 处理边界项:ˆΦ_x 和 ˆf_x 是 u 的导数,在积分 ∫_0^x du 中,通过分部积分将导数转移到系数 D* 上,从而产生 u=0 和 u=x 处的边界项。这些边界项没有被积分平均掉,因此成为主导项。
技术技巧点名:
- 核估计与一致收敛速率:使用VC类理论和指数不等式(Giné and Guillou, 2002)来建立核估计量及其导数的一致收敛速率。
- 线性化与齐次性:利用泛函的齐次性简化线性化表达式。
- 分部积分:用于处理被积函数中的导数项,分离出边界项。
- Donsker类:证明 ρ_x 类函数是P0-Donsker的,从而其样本平均为 O_p(n^{-1/2})。
- 耦合与反集中不等式:用于证明bootstrap置信带的有效性,这是处理非Donsker类(如 F_n)中supremum的现代标准工具。
真实例子与应用¶
- 数据:蒙特卡洛模拟数据。设计为
Y_i = sin(X_i) + ε_i,X_i = 6L(-Z_i + η_i) - 3,其中L是Logistic函数。(ε, η)通过Frank copula相关,Z独立于(ε, η)。第一阶段X = h(Z, η)是不可分的。 - 方法应用:将本文提出的LS和LAD估计量应用于模拟数据,并与Newey et al. (1999) 的系列估计量(NPV)进行比较。
- 结果:
- 点估计:LAD估计量的RMSE优于LS和NPV(在最优系列长度
p=3时两者相当)。LAD的偏差随样本量增加而下降,而NPV的偏差不下降(因为模型设定错误)。 - 置信带:构造的均匀置信带在名义水平为90%和95%时,实际覆盖率分别为95%和98%(略有过度覆盖)。点wise区间在同时覆盖所有点时覆盖率很低(55%),而均匀带通过更宽的宽度实现了同时覆盖。
- 点估计:LAD估计量的RMSE优于LS和NPV(在最优系列长度
- 这个例子想说明什么:
- 验证理论:展示了本文估计量在有限样本下的良好表现,特别是其偏差随样本量下降的特性,与理论预测一致。
- 展示相对优势:通过与NPV估计量的对比,说明了当第一阶段不可分时,本文的估计量(基于正确的模型设定)比错误设定的NPV估计量更可靠(偏差随样本量下降)。
- 展示均匀带的实用性:证明了均匀带能够提供比点wise区间更可靠的同时覆盖,且宽度在可接受范围内。
🔎 结论是否比证明窄¶
- 是。Theorem 3.5和3.8的证明依赖于一系列技术性假设(Assumptions 3.2-3.4, 3.7),这些假设在实际应用中可能难以验证。例如:
- 带宽选择:证明中要求带宽以特定速率趋于0(Assumption 3.4),但模拟中使用的带宽选择规则(数据驱动、基于RMSE)并不严格满足这些条件。作者在模拟部分明确指出了这一点(Section 4, footnote 4)。
- 学生化估计量:Assumption 3.7要求学生化估计量
ˆs_n(x)以o_p(1/log n)的速率收敛到¯σ(x)。这个条件很强,作者在Lemma D.5中只证明了其收敛速率为O_p(√(log n/(nh_x)) + s_n + ¯h^m + h_x),并声称在Assumption 3.4下该速率为o_p(1/log n)。这需要仔细验证,尤其是在有限样本下。 - 均匀带的“诚实性”:作者在Remark 3.9中明确指出,Theorem 3.8并未证明该置信带是“诚实的”(honest),即覆盖误差不能保证在某个分布类上一致趋于零。这限制了该方法的理论适用范围。
四、开放问题(点到为止,扎根具体语句)¶
- 带宽选择:如何为本文的估计量选择带宽,以实现最优的估计和推断?模拟中使用的数据驱动规则(基于RMSE)缺乏理论保证。作者在Section 4.1末尾指出:“its selection remains an open problem”。这是一个直接且具体的开放问题。
- 扩展到高维或多阶段:本文处理的是单变量连续IV。如何将闭式表达式和估计方法推广到高维内生变量或多阶段设定?作者在Remark 2.9中提到了离散协变量可以逐单元处理,但连续协变量会提高核估计的维度并降低速率。这是一个自然的推广方向。
- 放松完全独立性假设:本文的识别依赖于
(ε, η) ⊥⊥ Z这一强假设。能否将其放松为均值独立性E[ε|Z, η] = E[ε|η](如Newey et al., 1999)?作者在Assumption 2.3后明确指出:“Our identification result exploits the full independence, and cannot be weakened to this mean independence.” 这表明这是一个根本性的限制,值得探索是否存在其他识别策略。 - 构造“诚实”的置信带:Theorem 3.8的置信带不是“诚实的”。如何构造一个在某个非参数分布类上具有均匀覆盖误差的置信带?作者在Remark 3.9中讨论了实现“诚实性”需要满足的三个条件(统一的有界性假设、
σ²(0)的下确界、学生化估计量的均匀收敛速率),这为后续研究指明了方向。
Maintained by 陈星宇 · Homepage · Source on GitHub