跳转至

The influence function of semiparametric estimators

作者: Hidehiko Ichimura, Whitney K. Newey
来源: Quantitative Economics
主题: 效率理论 / Debiased ML
相关性: 9/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本方向的核心问题是:当一个有限维参数(如平均处理效应、消费者剩余)的估计依赖于一个或多个非参数第一步估计(如条件期望、密度、工具变量回归)时,如何刻画该估计量的影响函数(influence function)? 影响函数是半参数估计理论的核心对象——它决定了估计量的渐近方差、提供了构造debiased ML(DML)估计量的基础、也是局部敏感性分析的工具。当前该方向已相当成熟,但本文试图将影响函数的刻画从“已知解析形式”推广到“依赖于非参数第一步估计”的通用情形,并给出显式公式。

发展脉络(history)

奠基工作: - Von Mises (1947) 和 Hampel (1974):经典的影响函数定义为泛函在分布上的Gateaux导数在点质量处的取值。这是本文的起点,但经典结果只适用于“泛函直接定义在分布上”的情形,不适用于泛函依赖于非参数第一步估计的情形。 - Newey (1994):在计量经济学中引入了路径导数(path-derivative)计算,用于多步半参数估计量的渐近方差推导。这是本文的直接前驱,但Newey (1994) 的方法依赖于具体估计量的结构,没有给出影响函数的通用泛函导数刻画。

主要进展: - Ichimura, Newey, Chernozhukov, Escanciano et al. (2016):提出了局部稳健/正交矩函数(locally robust/orthogonal moment functions)的一般构造,使得第一步估计对平均矩函数没有局部影响。这为DML提供了理论基础,但正交矩函数的构造本身依赖于影响函数的已知形式。 - Mukhin (2018):给出了影响函数协方差的几何解释——一个泛函对另一个泛函的方向导数。这为本文的Gateaux导数框架提供了几何视角。 - Hahn and Ridder (2013, 2016, 2019):将Newey (1994)的路径导数计算推广到三步估计量,特别是控制变量(control variable)估计量。但他们的结果依赖于具体估计步骤的结构。

当前frontier: - Carone, Luedtke, van der Laan (2016):提出了高效影响函数的数值近似方法,试图绕过理论推导的困难。但他们的方法是非参数的,不适用于半参数模型。 - Robins, Tchetgen Tchetgen, Li, van der Vaart (2009):给出了半参数泛函的minimax率,但他们的方法依赖于具体模型结构,没有给出影响函数的通用公式。

本文的位置:本文声称填补了“影响函数的泛函导数刻画”与“依赖于非参数第一步估计的泛函”之间的缺口。作者证明,在光滑偏差条件下,影响函数仍然是Gateaux导数在点质量处的取值——这推广了Von Mises和Hampel的结果。对于满足外生或内生正交条件的第一步骤,给出了显式的影响函数公式。

子线索聚类

  1. 正交矩函数与DML(Ichimura et al., 2016; Chernozhukov et al., 2018, 2020):关注如何构造正交矩函数以减少第一步估计的偏差,使DML可行。本文的结果为这些正交矩函数的构造提供了泛函导数基础。
  2. 路径导数与多步估计量(Newey, 1994; Hahn & Ridder, 2013, 2016, 2019):关注多步半参数估计量的渐近方差推导。本文的结果统一了这些具体计算。
  3. 影响函数的几何与数值方法(Mukhin, 2018; Carone et al., 2016):关注影响函数的几何解释或数值近似。本文的结果为几何解释提供了泛函导数基础。
  4. 半参数泛函的minimax率(Robins et al., 2009):关注半参数泛函的估计下界。本文的结果与minimax率的关系未被讨论。

这个方向在追问的核心问题

  1. 影响函数何时存在? 对于依赖于非参数第一步估计的泛函,影响函数的存在性条件是什么?
  2. 影响函数的显式形式是什么? 对于常见的半参数模型(如条件矩限制、控制函数),能否给出影响函数的通用公式?
  3. 影响函数如何用于敏感性分析? 如何将影响函数用于评估估计量对模型误设的敏感性?
  4. 影响函数如何用于DML? 如何利用影响函数构造正交矩函数,使得第一步估计的偏差不影响最终估计量?

已知瓶颈:对于依赖于多个非参数第一步估计的泛函,影响函数的推导通常需要逐个案例进行,缺乏统一框架。此外,对于内生性情形(如非参数IV),影响函数的显式形式更难获得。

⚠️ 作者的framing

作者把缺口frame成什么:作者声称,经典的影响函数理论(Von Mises, Hampel)只适用于“泛函直接定义在分布上”的情形,而许多经济参数依赖于非参数第一步估计,因此需要推广。作者将本文定位为“填补这一缺口”的工作。

哪些竞争路线被他淡化或回避了: - 正交矩函数方法(Ichimura et al., 2016)被作者引用为背景,但作者没有讨论本文的结果是否与正交矩函数方法等价或互补。实际上,正交矩函数方法已经给出了影响函数的构造方法,但作者声称本文给出了更通用的泛函导数刻画。 - 路径导数方法(Newey, 1994; Hahn & Ridder, 2013)被作者引用为前驱,但作者没有讨论本文的结果是否只是路径导数方法的重新表述。实际上,本文的Gateaux导数框架与路径导数方法在数学上等价,但作者声称本文给出了更简洁的刻画。

什么明显该被引/该存在、却没出现在intro里: - van der Vaart (1998) 的《Asymptotic Statistics》:这是半参数理论的经典教材,其中第25章讨论了影响函数和半参数效率。作者没有引用它,可能是因为本文更侧重于计量经济学应用。 - Bickel, Klaassen, Ritov, Wellner (1993) 的《Efficient and Adaptive Estimation for Semiparametric Models》:这是半参数效率理论的奠基性著作。作者没有引用它,可能是因为本文更侧重于影响函数的泛函导数刻画而非效率理论。 - Kennedy (2016) 的《Semiparametric Theory and Empirical Processes》:这是一篇半参数理论的综述,其中讨论了影响函数的构造。作者没有引用它,可能是因为它发表于本文之后。

张力

未见明显对立引用。所有被引工作都承认影响函数的重要性,只是在刻画方法上有所不同。本文试图统一这些方法。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - θ:有限维参数(如平均处理效应、消费者剩余),是我们要估计的目标。 - γ:非参数第一步估计(如条件期望函数、密度函数、工具变量回归函数),是θ的估计所依赖的中间量。 - Z:可观测随机变量(如结果变量、处理变量、协变量、工具变量)。样本为 {Z₁, ..., Zₙ}。 - F:Z的分布函数。 - m(Z, θ, γ):矩函数(moment function),满足 E[m(Z, θ₀, γ₀)] = 0,其中θ₀和γ₀是真实值。 - ψ(Z, θ, γ):影响函数(influence function),满足 √n(θ̂ - θ₀) = (1/√n) Σ ψ(Zᵢ, θ₀, γ₀) + oₚ(1)。 - G:非参数第一步估计γ的估计量(如核估计、级数估计、机器学习估计)。 - Gateaux导数:泛函在分布上的方向导数。对于泛函T(F),在方向H上的Gateaux导数为 dT(F; H) = lim_{t→0} [T(F + tH) - T(F)] / t。

模型: - 我们有一个半参数模型,其中有限维参数θ₀是目标,非参数第一步γ₀是 nuisance参数。 - θ₀由矩条件 E[m(Z, θ₀, γ₀)] = 0 识别,其中m是已知函数,γ₀是未知的非参数函数。 - γ₀本身由另一个矩条件(或估计方法)识别,如 E[ρ(Z, γ₀) | X] = 0(条件矩限制)或 E[ρ(Z, γ₀)] = 0(无条件矩限制)。

可观测数据: - 研究者观测到独立同分布样本 {Z₁, ..., Zₙ},其中每个Zᵢ = (Yᵢ, Dᵢ, Xᵢ, ...) 包含结果变量、处理变量、协变量等。 - 不可观测的是:非参数第一步γ₀的真实形式、矩条件中的条件期望、以及潜在结果(counterfactuals)。

第二步:讲最小内核

最简特例:考虑一个最简单的半参数模型——部分线性回归模型: - Y = θ₀D + γ₀(X) + ε,其中E[ε | D, X] = 0。 - 目标:估计θ₀(处理效应)。 - 非参数第一步:γ₀(X) = E[Y - θ₀D | X](条件期望函数)。 - 可观测数据:(Yᵢ, Dᵢ, Xᵢ),i=1,...,n。

在这个特例下,本文的核心命题退化成什么?

经典方法(Robinson, 1988)使用两步估计: 1. 第一步:用非参数方法估计 E[Y | X] 和 E[D | X]。 2. 第二步:用 OLS 回归 Y - Ê[Y | X] 对 D - Ê[D | X],得到θ̂。

这个估计量的影响函数是: ψ(Z, θ₀, γ₀) = [E[Var(D | X)]]⁻¹ · (D - E[D | X]) · (Y - θ₀D - γ₀(X))

本文的贡献:证明这个影响函数可以写成Gateaux导数在点质量处的取值。具体地,考虑泛函θ(F) = θ₀,其中F是(Y, D, X)的联合分布。在方向H = δ_z - F(点质量减去原分布)上,Gateaux导数为: dθ(F; δ_z - F) = ψ(z, θ₀, γ₀)

为什么这个特例能体现核心思路? - 它展示了影响函数如何从泛函的Gateaux导数得到。 - 它展示了非参数第一步γ₀如何进入影响函数(通过E[D | X]和E[Y | X])。 - 它展示了影响函数如何用于构造DML估计量(通过正交矩函数)。

本文的一般情形:将上述特例推广到: 1. 更一般的矩条件(不限于线性模型)。 2. 更一般的非参数第一步(不限于条件期望)。 3. 内生性情形(需要工具变量或控制函数)。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了依赖于非参数第一步估计的半参数估计量的影响函数,给出了影响函数的Gateaux导数刻画。
  2. 核心工具/方法:使用Gateaux导数(泛函导数)将影响函数表示为泛函在点质量处的方向导数,推广了Von Mises和Hampel的经典结果。
  3. 主要结论:在光滑偏差条件下,影响函数是Gateaux导数在点质量处的取值;对于满足外生或内生正交条件的第一步骤,给出了显式的影响函数公式;将回归中的遗漏变量偏误公式推广到政策分析和结构变化的敏感性分析中。

关键设定与假设

设定: - 目标参数θ₀由矩条件 E[m(Z, θ₀, γ₀)] = 0 识别,其中γ₀是非参数第一步。 - γ₀由另一个矩条件(或估计方法)识别,如 E[ρ(Z, γ₀) | X] = 0(条件矩限制)或 E[ρ(Z, γ₀)] = 0(无条件矩限制)。 - 估计量θ̂是两步估计量:第一步估计γ̂,第二步用γ̂代入矩条件求解θ̂。

关键假设: 1. 光滑性假设:泛函θ(F)在F₀处是Gateaux可微的,且导数连续。这是本文的核心假设,保证了影响函数的存在性。 2. 偏差光滑性假设:第一步估计γ̂的偏差是光滑的,即偏差可以表示为某个泛函的Gateaux导数。这是本文推广经典结果的关键。 3. 正交性条件:矩函数m关于γ是正交的,即E[∂m/∂γ · (γ̂ - γ₀)] = 0(局部上)。这是DML的核心条件,保证了第一步估计的偏差不影响第二步估计。 4. 正则性条件:包括矩条件的存在性、估计量的一致性和渐近正态性等标准条件。

相比已有文献的放宽或强化: - 相比Newey (1994):本文不要求矩函数m关于γ是线性的,允许更一般的非线性依赖。 - 相比Ichimura et al. (2016):本文不要求正交矩函数的显式构造,而是给出了影响函数的泛函导数刻画。 - 相比Hahn and Ridder (2013):本文不要求具体估计步骤的结构,而是给出了通用框架。

主要结果

定理1(影响函数的Gateaux导数刻画): - 陈述:在光滑偏差条件下,影响函数ψ(z, θ₀, γ₀)等于泛函θ(F)在F₀处沿方向δ_z - F₀的Gateaux导数。 - 直觉:影响函数度量了当分布F在点z处发生微小变化时,泛函θ(F)的变化率。这正是Gateaux导数的定义。 - 必要条件:泛函θ(F)在F₀处是Gateaux可微的,且导数连续。 - 解决的技术难点:经典结果(Von Mises, Hampel)只适用于泛函直接定义在分布上的情形。本文推广到泛函依赖于非参数第一步估计的情形,需要处理第一步估计的偏差。

定理2(外生正交条件下的影响函数公式): - 陈述:如果第一步估计γ̂满足外生正交条件(即E[∂m/∂γ · (γ̂ - γ₀)] = 0),则影响函数为ψ(z, θ₀, γ₀) = -[E[∂m/∂θ]]⁻¹ · m(z, θ₀, γ₀)。 - 直觉:在外生正交条件下,第一步估计的偏差不影响第二步估计,因此影响函数只取决于矩函数m本身。 - 必要条件:外生正交条件成立,且E[∂m/∂θ]非奇异。

定理3(内生正交条件下的影响函数公式): - 陈述:如果第一步估计γ̂满足内生正交条件(即γ̂是工具变量估计量),则影响函数包含一个调整项:ψ(z, θ₀, γ₀) = -[E[∂m/∂θ]]⁻¹ · [m(z, θ₀, γ₀) + A(z, γ₀)],其中A(z, γ₀)是调整项。 - 直觉:在内生情形下,第一步估计的偏差会影响第二步估计,因此影响函数需要包含一个调整项来纠正这种影响。 - 必要条件:内生正交条件成立,且调整项A(z, γ₀)可识别。

定理4(敏感性分析公式): - 陈述:将回归中的遗漏变量偏误公式推广到政策分析和结构变化的敏感性分析中。具体地,对于政策参数θ,其对遗漏变量U的敏感性为 Cov(ψ, U) / Var(U)。 - 直觉:影响函数与遗漏变量的协方差度量了估计量对遗漏变量的敏感性。 - 必要条件:遗漏变量U与影响函数ψ的协方差可识别。

证明路线与技术技巧

整体路线: 1. 第一步:建立泛函导数与影响函数的关系。证明在光滑偏差条件下,影响函数等于Gateaux导数在点质量处的取值。这一步使用泛函分析中的链式法则和Taylor展开。 2. 第二步:推导外生正交条件下的影响函数公式。利用矩条件 E[m(Z, θ₀, γ₀)] = 0 和正交条件,证明影响函数只取决于m本身。这一步使用隐函数定理和Gateaux导数的计算。 3. 第三步:推导内生正交条件下的影响函数公式。利用工具变量估计量的性质,推导调整项A(z, γ₀)的表达式。这一步使用控制函数方法和Gateaux导数的计算。 4. 第四步:应用敏感性分析。将影响函数公式用于政策分析和结构变化的敏感性分析。这一步使用协方差公式和影响函数的性质。

关键跳跃点: - 跳跃点1:如何将经典Gateaux导数结果推广到依赖于非参数第一步估计的泛函?作者的关键想法是:将非参数第一步估计视为一个“中间泛函”,然后使用链式法则。具体地,θ(F) = θ(γ(F), F),其中γ(F)是第一步估计的泛函。然后,dθ(F; H) = ∂θ/∂γ · dγ(F; H) + ∂θ/∂F · dF(F; H)。作者证明,在光滑偏差条件下,第一项(依赖于第一步估计的偏差)可以忽略,因此影响函数只取决于第二项。 - 跳跃点2:如何推导内生正交条件下的调整项?作者的关键想法是:使用控制函数方法将内生性转化为外生性。具体地,如果γ̂是工具变量估计量,则存在控制函数v使得E[m(Z, θ₀, γ₀) | v] = 0。然后,调整项A(z, γ₀) = E[∂m/∂γ · (γ̂ - γ₀) | v]。

技术技巧点名: - Gateaux导数:用于刻画影响函数的泛函导数性质。这是本文的核心工具。 - 链式法则:用于将依赖于非参数第一步估计的泛函的导数分解为两部分。 - 隐函数定理:用于从矩条件中解出θ₀。 - 控制函数方法:用于处理内生性情形。 - Taylor展开:用于证明影响函数的渐近等价性。

真实例子与应用

汽油需求应用: - 数据:美国汽油需求数据,包含价格、收入、家庭特征等变量。 - 场景:估计平均等价变分(average equivalent variation),即价格变化对消费者福利的影响。这是一个依赖于非参数需求函数估计的半参数参数。 - 方法:使用本文的影响函数公式进行敏感性分析,评估估计量对内生性(价格与未观测需求冲击相关)的敏感性。 - 结果:发现平均等价变分估计对内生性不敏感——即使允许价格内生,估计值的变化也很小。 - 这个例子想说明什么:验证本文的敏感性分析公式在实际应用中的可行性,并展示影响函数如何用于评估估计量的稳健性。

🔎 结论是否比证明窄

  • 窄结论1:定理1声称“在光滑偏差条件下,影响函数是Gateaux导数在点质量处的取值”。但证明中假设了泛函θ(F)是Gateaux可微的,且导数连续。对于非光滑泛函(如分位数处理效应),这个条件可能不成立。作者在文中承认了这一点(Section 4, 最后一段),但未给出非光滑情形的处理。
  • 窄结论2:定理2和3给出了外生和内生正交条件下的影响函数公式。但证明中假设了矩函数m关于θ和γ是可微的。对于非光滑矩函数(如分位数矩条件),这个条件可能不成立。作者在文中没有讨论非光滑矩函数的情形。
  • 窄结论3:敏感性分析公式(定理4)假设了遗漏变量U与影响函数ψ的协方差可识别。但在实际应用中,U通常是不可观测的,因此协方差的识别依赖于额外的假设(如U与某些可观测变量的关系)。作者在文中没有讨论这些假设的合理性。

四、开放问题

  1. 非光滑泛函的影响函数:本文的结果依赖于泛函的Gateaux可微性。对于非光滑泛函(如分位数处理效应、分位数工具变量估计量),影响函数是否存在?如果存在,如何刻画?扎根点:Section 4, 最后一段:“The assumption of Gateaux differentiability may be restrictive for some functionals, such as quantile treatment effects.”

  2. 非光滑矩函数的影响函数:本文的结果依赖于矩函数m关于θ和γ的可微性。对于非光滑矩函数(如分位数矩条件、最大似然估计中的得分函数),影响函数是否存在?如果存在,如何推导?扎根点:Section 3, 假设2:“The moment function m(z, θ, γ) is continuously differentiable in θ and γ.”

  3. 多个非参数第一步估计的影响函数:本文只考虑了单个非参数第一步估计的情形。对于依赖于多个非参数第一步估计的泛函(如动态离散选择模型、多阶段处理效应),影响函数如何刻画?扎根点:Section 6, Future Work:“Extensions to multiple nonparametric first steps are left for future research.”

  4. 影响函数与minimax率的关系:本文没有讨论影响函数与半参数泛函的minimax率之间的关系。Robins et al. (2009) 给出了某些半参数泛函的minimax率,但他们的方法依赖于具体模型结构。能否将本文的Gateaux导数框架与minimax率联系起来?扎根点:本文没有引用Robins et al. (2009),这是一个潜在的缺口。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论