Closed-form estimation and uniform inference in additively separable triangular models with a nonseparable first stage¶
作者: Keita Sunada
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.22605
一、领域脉络与小综述¶
这个方向是什么¶
本子方向研究非参数工具变量(IV)模型中内生变量与结果变量之间结构关系的识别与估计问题。核心挑战在于:当内生变量 X 与误差项 ε 相关时,直接回归 Y 对 X 会得到有偏估计。经典的非参数 IV 方法(如 Newey & Powell, 2003)通过求解积分方程 E[Y|Z] = E[g(X)|Z] 来识别 g,但这通常是一个不适定逆问题(ill-posed inverse problem),需要正则化,导致估计收敛速度慢,且推断复杂。本文研究的可加可分离三角模型(additively separable triangular model) 是另一种路径:通过引入一个控制函数(control function) 来消除内生性,从而将问题转化为一个更简单的非参数回归问题,避免了不适定性。该方向的成熟度较高,已有奠基性工作(Newey et al., 1999),但本文针对的是第一阶段方程不可分离这一更一般、更现实的设定。
发展脉络(history)¶
-
奠基工作:可分离第一阶段的三角模型。Newey, Powell & Vella (1999) 提出了非参数三角联立方程模型的两步估计法。其模型为
Y = g(X) + ε,X = h(Z) + η,即第一阶段是可加可分离的。他们利用E[ε|η, Z] = E[ε|η]的均值独立性假设,通过非参数估计第一阶段残差η̂,然后将η̂作为额外回归元放入第二阶段回归。他们的估计量收敛速度由两个阶段中较慢的那个决定(Stone, 1982)。留下的口子:第一阶段必须可分离,这在许多经济应用中(如由均衡条件导出的工具变量)不现实。 -
主要进展:非可分离三角模型的识别。一系列工作研究了更一般的完全非可分离模型
Y = g(X, ε),X = h(Z, η)。Chesher (2003) 提供了g的导数的识别条件。Imbens & Newey (2009) 关注分位数、平均和处理效应,而非直接估计g。D'Haultfœuille & Février (2015) 和 Torgovitsky (2015) 使用二元工具变量给出了g的点识别条件。Torgovitsky (2015, Theorem S1) 还使用连续Z以非构造性方式证明了g的点识别。留下的口子:这些识别结果要么不提供g的闭式表达式(因此难以直接构造估计量),要么局限于二元工具变量。Chiappori, Komunjer & Kristensen (2015) 研究了非参数变换模型,在不同于本文的假设下得到了g本身的闭式表达式,并构造了估计量。留下的口子:他们的识别结果给出g本身,而本文的结果给出g',需要积分才能得到g,这导致了不同的渐近性质。 -
当前 Frontier:不适定逆问题路径的推断。在不利用第一阶段结构的情况下,估计
g需要求解不适定逆问题。Newey & Powell (2003) 提出了基于完备性条件的非参数 IV 估计。Darolles et al. (2011) 发展了基于 Tikhonov 正则化的估计。在推断方面,Horowitz & Lee (2012) 使用 bootstrap 构造了均匀置信带;Chen & Christensen (2018) 为非线性泛函构造了均匀置信带;Chen, Christensen & Kankanala (2025) 提出了自适应选择筛维数的方法。留下的口子:所有这些方法都受困于不适定性,导致估计收敛速度慢,且置信带的构造依赖于正则化参数的选择。Babii (2020) 为 Tikhonov 正则化估计量构造了诚实置信集,但同样受限于不适定性。 -
本文的位置:本文回到三角模型路径,但将 Newey et al. (1999) 的可分离第一阶段推广到非可分离第一阶段
X = h(Z, η)。其核心贡献是:在(ε, η) ⟂ Z的完全独立性假设下,证明了g的导数∇g存在一个闭式表达式,是条件累积分布函数(CDF)的泛函。由此构造的 plug-in 估计量无需正则化,收敛速度达到一维非参数回归的极小极大最优速率n^{-m/(2m+1)},且可以构造均匀置信带。这避免了不适定逆问题路径的所有困难。
子线索聚类¶
- 线索一:可分离三角模型(Additively Separable Triangular Models)。代表工作:Newey et al. (1999)。核心思路是利用第一阶段的加性结构构造控制函数。本文的工作是这条线索的推广。
- 线索二:完全非可分离三角模型(Fully Nonseparable Triangular Models)。代表工作:Chesher (2003), Imbens & Newey (2009), D'Haultfœuille & Février (2015), Torgovitsky (2015), Ishihara (2021)。核心思路是使用更复杂的识别策略(如分位数、单调性、完备性),但通常不提供易于估计的闭式表达式。
- 线索三:非参数 IV 的不适定逆问题(Ill-posed Inverse Problems in NPIV)。代表工作:Newey & Powell (2003), Darolles et al. (2011), Horowitz & Lee (2012), Chen & Christensen (2018), Chen et al. (2025), Babii (2020)。核心思路是直接求解积分方程,但需要正则化,导致收敛速度慢。
- 线索四:变换模型(Transformation Models)。代表工作:Chiappori et al. (2015)。核心思路是研究一个不同的模型结构,但其估计方法(对闭式表达式进行积分平均)与本文直接相关。
这个方向在追问的核心问题¶
- 识别:在什么条件下,结构函数
g或其导数可以被唯一确定?需要什么样的工具变量和假设(独立性、完备性、单调性)? - 估计速率:在给定光滑性条件下,
g的估计可以达到的最优收敛速率是多少?这个速率是否受内生性、第一阶段的可分离性、或工具变量的强度影响? - 推断:如何构造
g的逐点置信区间和均匀置信带?在不适定问题中,推断尤其困难,需要处理正则化偏差。 - 调参:如何数据自适应地选择正则化参数(如筛维数、带宽)以平衡偏差和方差,并实现最优推断?
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口 frame 为“现有方法要么要求第一阶段可分离(Newey et al., 1999),要么面临不适定逆问题的困难(NPIV 文献),要么只提供非构造性的识别结果(Torgovitsky, 2015)”。因此,本文的“显然的下一步”是:在一个非可分离第一阶段的三角模型中,找到一个闭式表达式,从而构造一个无需正则化、速率最优、且能进行均匀推断的估计量。
- 被淡化或回避的竞争路线:作者明确淡化了不适定逆问题路径,指出其“需要正则化方案来处理不适定逆问题,这通常导致估计量收敛速度较慢”。作者也淡化了完全非可分离模型路径,指出其“没有为估计提供清晰的指导”。作者将本文的模型定位为 Torgovitsky (2015, Theorem S1) 的一个特例,但强调其贡献在于提供了闭式表达式。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:作者没有引用任何关于高维工具变量或许多弱工具变量的文献。本文假设
Z是连续的标量,但实际应用中可能有多个或高维的工具变量。将本文的闭式估计量推广到高维Z是一个明显的开放问题。此外,作者没有引用关于半参数效率界的文献。本文的估计量是否达到了半参数效率界?这是一个值得研究者去查的问题。
张力¶
未见明显对立引用。各条线索的假设和设定不同,因此结论并不直接矛盾。例如,Newey et al. (1999) 的均值独立性假设弱于本文的完全独立性假设,但他们的模型要求第一阶段可分离。本文的完全独立性假设更强,但允许第一阶段非可分离。这是一个权衡,而非矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
Y:结果变量(标量,可观测)。X:内生解释变量/处理变量(标量,可观测)。Z:工具变量(标量,可观测)。ε:结果方程中的不可观测误差项(标量,不可观测)。η:第一阶段方程中的不可观测误差项(标量,不可观测)。g(·):未知的结构函数(目标 estimand)。h(·, ·):未知的第一阶段函数。F_{Y|X,Z}(y|x,z):给定X=x, Z=z时Y的条件累积分布函数(CDF)。f_{Y|X,Z}(y|x,z):给定X=x, Z=z时Y的条件概率密度函数(PDF)。V(x|z) = F_{X|Z}(x|z):给定Z=z时X的条件 CDF。m:模型施加的光滑阶数(如g和h的导数阶数)。n:样本量。h_x, h_y, h_z:核估计的带宽参数。
-
模型:
- 数据生成机制由两个方程组成:
- 结果方程:
Y = g(X) + ε。这是可加可分离的,即ε以加法形式进入。 - 第一阶段方程:
X = h(Z, η)。这是非可分离的,即Z和η可以以任意方式交互。
- 结果方程:
- 关键假设:工具变量
Z与不可观测项(ε, η)独立,即(ε, η) ⟂ Z。 - 其他假设:
g是连续可微的;h(z, ·)对每个z是严格递增的(单调性);X的支撑集是凸集;g(0) = 0(水平归一化)。
- 数据生成机制由两个方程组成:
-
可观测数据:
- 研究者可以观测到来自联合分布
(Y, X, Z)的独立同分布样本{Y_i, X_i, Z_i}_{i=1}^n。 - 不可观测的是
ε和η。它们的存在导致了X的内生性(即X与ε相关),使得直接回归Y对X有偏。 - 识别策略依赖于
Z与(ε, η)的独立性,以及模型的结构(可加可分离的结果方程 + 非可分离的第一阶段)。
- 研究者可以观测到来自联合分布
第二步:讲最小内核¶
本文的核心数学思想是:利用工具变量 Z 的变异性来“控制”不可观测的 η,从而将内生变量 X 的变异性分解为外生部分(由 Z 驱动)和内生部分(由 η 驱动),最终通过一个闭式表达式消除内生性。
最简特例:考虑一个极端简化的情形,其中 g(x) = βx 是线性的,且 h(z, η) = z + η 也是线性和可加的。但为了体现本文的核心思想,我们保留 h 的非可分离性,但假设 g 是线性的。这个特例虽然简单,但足以展示核心逻辑。
- 设定:
Y = βX + ε,X = h(Z, η),(ε, η) ⟂ Z。我们想估计β。 - 核心思路:由于
X与ε相关,我们不能直接回归。关键想法是找到一个与ε无关但能捕捉X中内生部分的变量。这个变量就是控制函数。在本文的设定中,控制函数是V(X|Z) = F_{X|Z}(X|Z)。 - 为什么
V(X|Z)是控制函数?- 由单调性,
h(z, ·)可逆,记其逆为τ(z, ·)。则η = τ(Z, X)。 - 由独立性,
V(X|Z) = F_{X|Z}(X|Z) = P(h(Z, η) ≤ X | Z) = P(η ≤ τ(Z, X) | Z) = F_η(η),其中F_η是η的边际 CDF。 - 因此,
V(X|Z)是η的一个单调变换,它包含了X中所有由η驱动的内生信息。更重要的是,由于(ε, η) ⟂ Z,我们有(ε, V(X|Z)) ⟂ Z。
- 由单调性,
- 如何利用控制函数?
- 考虑条件期望
E[Y | X, Z]。由于Y = βX + ε,且ε与(X, Z)相关,这个条件期望不是βX。 - 但是,考虑
E[Y | V(X|Z), Z]。由于(ε, V(X|Z)) ⟂ Z,我们有E[Y | V(X|Z), Z] = E[βX + ε | V(X|Z), Z] = βE[X | V(X|Z), Z] + E[ε | V(X|Z)]。这里E[ε | V(X|Z)]是一个未知函数,但它只依赖于V(X|Z),而不依赖于Z。 - 这并没有直接给出
β。本文的洞察是,通过对Z求导,可以消去这个未知函数,从而得到β的表达式。
- 考虑条件期望
- 闭式表达式的推导(核心):
- 考虑
F_{Y|X,Z}(y|x,z) = P(ε ≤ y - βx | X=x, Z=z)。 - 由于
(ε, V(X|Z)) ⟂ Z,且V(X|Z)是X的单调函数,我们有F_{Y|X,Z}(y|x,z) = F_{ε|V(X|Z)}(y - βx | V(x|z))。 - 对
x和z分别求导(链式法则),得到三个方程(即论文中的 (A.1)-(A.3)):f_{Y|X,Z}(y|x,z) = f_{ε|V}(y - βx | V(x|z))∇_x F_{Y|X,Z}(y|x,z) = -β f_{ε|V}(...) + ∇_x V(x|z) ∇_v F_{ε|V}(...)∇_z F_{Y|X,Z}(y|x,z) = ∇_z V(x|z) ∇_v F_{ε|V}(...)
- 从第三个方程解出
∇_v F_{ε|V},代入第二个方程,并利用第一个方程替换f_{ε|V},得到:β f_{Y|X,Z}(y|x,z) = (∇_x V(x|z) / ∇_z V(x|z)) * ∇_z F_{Y|X,Z}(y|x,z) - ∇_x F_{Y|X,Z}(y|x,z) - 因此,
β = [ (∇_x V / ∇_z V) * ∇_z F - ∇_x F ] / f_{Y|X,Z}。这就是∇g(x)的闭式表达式(在g为线性时,∇g(x) = β)。
- 考虑
- 这个特例说明了什么?
- 整个证明的核心是链式法则和独立性假设。独立性允许我们将
F_{Y|X,Z}表示为F_{ε|V}的函数,从而将Z的变异性(通过∇_z V和∇_z F)引入来识别β。 - 最终表达式是条件 CDF 及其导数的泛函,不涉及求解任何积分方程。因此,可以用核估计等非参数方法直接 plug-in,无需正则化。
- 在一般情形下,
g不是线性的,上述推导给出的是∇g(x)的表达式。然后通过积分g(x) = ∫_0^x ∇g(u) du得到g(x)。这个积分操作引入了归一化点0处的误差,这是估计量无法达到参数速率的原因。
- 整个证明的核心是链式法则和独立性假设。独立性允许我们将
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在允许第一阶段方程非可分离的可加可分离三角模型
Y = g(X) + ε, X = h(Z, η)中,研究结果函数g的非参数识别、估计与推断问题。 - 核心工具 / 方法:利用
(ε, η) ⟂ Z的独立性假设,推导出g的导数∇g的闭式表达式,该表达式是条件 CDFF_{Y|X,Z}和F_{X|Z}及其导数的泛函。基于此构造了 plug-in 核估计量,并使用经验 bootstrap 构造均匀置信带。 - 主要结论:该 plug-in 估计量无需正则化,在点处的收敛速率达到极小极大最优的
n^{-m/(2m+1)}。通过 undersmoothing 可以实现渐近正态性,并构造了渐近精确的均匀置信带。
关键设定与假设¶
- 模型:
Y = g(X) + ε,X = h(Z, η)。X是连续标量内生变量,Z是连续标量工具变量,ε, η是标量不可观测项。 - 关键假设:
- 独立性 (Assumption 2.3(i)):
(ε, η) ⟂ Z。这是最关键的假设,比 Newey et al. (1999) 的均值独立性E[ε|η, Z] = E[ε|η]更强。它使得V(X|Z) = F_{X|Z}(X|Z)成为η的函数,从而可以作为控制函数。 - 单调性 (Assumption 2.3(ii)):
h(z, ·)对每个z严格递增。这是标准假设,保证了V(X|Z)与η的一一对应关系。 - 光滑性 (Assumptions 2.2, 3.3):
g连续可微;联合密度f_{Y,X,Z}是m次可微的。这控制了核估计的偏差。 - 支撑条件 (Assumptions 2.1, 2.5, 3.3):
X的支撑集是凸集;Y, X, Z的支撑集不随条件变化;估计和推断在X支撑集内部的紧集X_0上进行,且排除归一化点0。 - 正则条件 (Assumption 2.4):保证闭式表达式中的分母(如
∇_z V,f_{Y|X,Z})非零且导数存在。
- 独立性 (Assumption 2.3(i)):
- 相比已有文献的放宽或强化:
- 放宽:相比 Newey et al. (1999),允许第一阶段非可分离。
- 强化:相比 Newey et al. (1999) 的均值独立性,要求完全独立性
(ε, η) ⟂ Z。相比不适定逆问题路径,不需要完备性条件。
主要结果¶
- 定理 3.5 (渐近正态性):在 undersmoothing 条件下(
√(nh_x) h_x^m → 0),对于x ∈ X_0,有√(nh_x) (ĝ(x) - g(x)) ⇝ N(0, σ²(x) + σ²(0))。- 直觉:估计量的方差由两部分组成:
σ²(x)来自在点x处的核平均,σ²(0)来自在归一化点0处的核平均。这两部分渐近不相关,因此方差相加。 - 必要条件:
σ²(0) > 0,即归一化点处的方差非零。X_0必须远离归一化点0。 - 解决的技术难点:证明的核心是将
ĝ(x) - g(x)线性化为两个核平均T_n(x) - T_n(0)加上可忽略的余项。这需要处理复杂的非参数估计误差,并通过一系列引理(B.1-B.5)将ĝ的偏差分解为可处理的线性项和边界项。
- 直觉:估计量的方差由两部分组成:
- 命题 3.6 (极小极大最优速率):对于
x ≠ 0,g(x)的估计不可能比n^{-m/(2m+1)}收敛得更快。- 直觉:通过构造一个子模型(其中
ε独立于(η, Z)),将问题简化为估计一个一维非参数回归函数在点x处的值。Stone (1980) 的结果表明,对于m次可微的函数,最优速率为n^{-m/(2m+1)}。由于这个子模型是原模型的特例,原模型的最优速率不可能更快。 - 意义:这表明非可分离的第一阶段没有降低
g的估计速率。这个速率与不存在内生性时的一维非参数回归速率相同。
- 直觉:通过构造一个子模型(其中
- 定理 3.8 (均匀置信带):在 Assumption 3.7(学生化量的收敛速度足够快)下,由 bootstrap 临界值构造的 sup-t 带
C_n(x)渐近地以概率1-α同时覆盖g(x)在所有x ∈ X_0上的值。- 解决的技术难点:由于
√(nh_x)(ĝ(x) - g(x))作为x的函数不是 tight 的(其包络随n增长),不能使用传统的极值理论。证明依赖于 Chernozhukov et al. (2014, 2016) 的耦合(coupling) 和反集中(anti-concentration) 技术,将样本和 bootstrap 的 sup-statistic 与一个共同的 Gaussian 过程的 sup-statistic 进行比较。
- 解决的技术难点:由于
证明路线与技术技巧¶
-
整体路线:
- 线性化 (Linearization):将
ĝ(x) - g(x)表示为T_n(x) - T_n(0)加上可忽略的余项(Lemma B.5)。T_n(a)是一个以a为中心的核平均。这一步是证明的核心,需要将复杂的ĝ展开为关于核估计误差的线性泛函,并证明高阶项可忽略。 - 边界项处理:线性化过程中,对
u的积分会产生在u=x和u=0处的边界项。这些边界项恰好构成了T_n(x)和T_n(0)。其余项(如ρ_x的样本平均)是 Donsker 类,因此是O_p(n^{-1/2})。 - 中心极限定理:
T_n(x) - T_n(0)是一个独立同分布三角阵列的部分和。通过计算其均值和方差,并验证 Lyapunov 条件,得到渐近正态性。 - 极小极大下界:构造一个子模型,将问题映射到 Stone (1980) 的一维非参数回归下界。
- 均匀推断:将
√(nh_x)(ĝ(x) - g(x))的 studentized 版本视为一个经验过程。使用 Chernozhukov et al. (2016) 的耦合定理,将其 sup-statistic 与一个 Gaussian 过程的 sup-statistic 耦合。然后使用 Chernozhukov et al. (2014) 的反集中不等式,将两个 sup-statistic 分布函数之间的差异转化为耦合误差和反集中函数的函数。最后,通过 bootstrap 来估计 Gaussian 过程的临界值。
- 线性化 (Linearization):将
-
关键跳跃点:
- 从
ĝ到T_n的线性化:这是最吃功夫的部分。ĝ是多个核估计量(F̂,V̂,f̂,p̂及其导数)的复杂非线性函数。证明需要反复使用比率展开(â/ b̂ - a/b的线性近似),并证明所有二次项和交叉项都是o_p((nh_x)^{-1/2})。这依赖于 Assumption 3.4 中带宽条件的精心设计,以确保所有非参数估计的误差足够小。 - 边界项的主导地位:证明中关键的一步是发现,在积分
∫_0^x du中,对u求导的项(如Φ̂_x)经过分部积分后,其内部项被吸收进ρ_x的 Donsker 类,而边界项T_n(x)和T_n(0)成为主导项。这解释了为什么估计量的收敛速率是(nh_x)^{-1/2}而非n^{-1/2}。
- 从
-
技术技巧点名:
- 核估计与比率展开:用于构造
F̂,V̂等非参数估计量,并对其进行线性化。 - VC 类型类与均匀收敛速率:用于控制核估计量及其导数在紧集上的 uniform error(Lemma B.1 证明中的速率显示)。
- Donsker 定理:用于证明
ρ_x类(线性化后的剩余项)是 P0-Donsker 的,从而其样本平均是O_p(n^{-1/2})(Lemma B.4)。 - 分部积分:用于处理对
u求导的项,将内部积分转化为边界项。 - 耦合(Coupling):Chernozhukov et al. (2016) 的 Gaussian coupling,用于将样本和 bootstrap 的 sup-statistic 与 Gaussian 过程联系起来。
- 反集中不等式(Anti-concentration):Chernozhukov et al. (2014) 的 anti-concentration 不等式,用于将 sup-statistic 分布函数之间的差异转化为其值之间的差异。
- 核估计与比率展开:用于构造
真实例子与应用¶
- 数据 / 场景:使用 Monte Carlo 模拟。数据生成过程为
Y_i = sin(X_i) + ε_i,X_i = 6L(-Z_i + η_i) - 3,其中L(a) = (1 + exp(-a))^{-1}是 logistic 函数。(ε_i, η_i)通过 Frank copula 连接,Z_i独立于(ε_i, η_i)。 - 方法应用:将本文提出的 LAD 和 LS 估计量应用于模拟数据,并与 Newey et al. (1999) 的级数估计量(NPV)进行比较。
- 结果:
- LAD 估计量在 RMSE 上优于 LS 估计量。
- 在
n=1000时,LAD 估计量与选择最优p的 NPV 估计量表现相当。 - 随着样本量增加,LAD 和 LS 的偏差下降,而 NPV 的偏差不下降(因为其模型设定错误)。
- 构造的均匀置信带在
α=0.10时覆盖率为 0.950,略高于名义水平,表明其表现合理。
- 这个例子想说明什么:
- 验证理论:展示了估计量在有限样本下的表现,支持了理论结果(如 LAD 优于 LS,偏差随样本量下降)。
- 展示相对 baseline 的优势:当第一阶段确实非可分离时,本文的估计量(LAD)在偏差上优于设定错误的 NPV 估计量,且随着样本量增大,这种优势变得更加明显。
- 展示推断方法:展示了均匀置信带的实际表现,其宽度随
|x|增大而增大(因为方差中包含σ²(0)),且覆盖率达到名义水平。
🔎 结论是否比证明窄¶
- 窄结论 1:定理 3.5 和 3.8 的结论依赖于
X_0是X内部的一个紧集,且排除归一化点0。这意味着在0点附近或支撑集边界处,结论不成立。作者在 Remark 2.7 和 Theorem 3.5 后的讨论中明确指出了这一点。 - 窄结论 2:定理 3.5 的渐近正态性需要 undersmoothing 条件
√(nh_x) h_x^m → 0。这意味着要达到最优收敛速率n^{-m/(2m+1)}(此时h_x ≍ n^{-1/(2m+1)}),该定理不适用。作者在定理后明确说明,最优速率和极限分布是在不同带宽下达到的。 - 窄结论 3:均匀置信带的构造依赖于 Assumption 3.7,该假设要求学生化量
ŝ_n和ŝ*_n以o_p(1/log n)的速度收敛到σ̄。作者在 Lemma D.5 中验证了 plug-in 估计量满足此条件,但明确指出对于 bootstrap 标准差估计量(3.3),该条件“尚未在此建立”("not established here")。因此,定理 3.8 的结论严格来说只对满足 Assumption 3.7 的学生化方法成立。 - 窄结论 4:Remark 3.9 明确指出,定理 3.8 建立的置信带是渐近精确的,但不是诚实的(honest),即覆盖误差不能保证在某个分布类上一致趋于零。作者指出了实现诚实性需要额外条件(如假设中的界要一致、
σ²(0)要一致有下界等)。
四、开放问题¶
-
数据驱动的带宽选择:本文的估计量依赖于带宽
h_x, h_y, h_z的选择。模拟中使用了基于 RMSE 的网格搜索,但作者指出“在存在内生性时,交叉验证准则不一定能估计均方误差,因此不是选择筛维数的有意义准则”(引用 Chen et al., 2025)。扎根点:Section 4.1 最后一段:“Nothing of the kind is available for a bandwidth here, and its selection remains an open problem.” 这是一个明确的开放问题。 -
诚实置信带(Honest Confidence Bands):本文的置信带是渐近精确的,但不是诚实的。扎根点:Remark 3.9 详细讨论了实现诚实性所需的额外条件(如假设中的界要一致、
σ²(0)要一致有下界等)。如何构造一个在更广泛分布类上诚实的置信带是一个开放问题。 -
扩展到连续协变量:本文的模型没有包含协变量。作者在 Remark 2.9 中简要提到,离散协变量可以逐单元处理,但连续协变量会提高核估计的维度,降低收敛速度。扎根点:Remark 2.9:“Continuous covariates are a different matter, since they enter the kernel estimators and raise their dimension; the rate falls with each one added.” 如何在高维协变量下保持估计和推断的有效性是一个重要的扩展方向。
-
第一阶段非可分离性的检验:本文的方法假设第一阶段是非可分离的。一个自然的开放问题是,如何检验这个假设?即,如何检验
X = h(Z, η)是否可以被简化为X = h(Z) + η?扎根点:本文没有提供这样的检验,但这是一个在应用中选择使用 Newey et al. (1999) 方法还是本文方法的关键问题。
Maintained by 陈星宇 · Homepage · Source on GitHub