Semiparametric Estimation of a Censored Regression Model Subject to Nonparametric Sample Selection¶
作者: Zhewen Pan, Xianbo Zhou, Yahong Zhou
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 7/10
链接: https://doi.org/10.1080/07350015.2020.1784746
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:当感兴趣的结果变量(如工资、消费)存在删失(censoring),且样本进入观测集的过程(样本选择)是非随机且机制未知时,如何一致地估计回归系数。 核心困难在于,删失和样本选择会同时产生偏差,且两者可能相互关联。当前成熟度:这是一个经典但仍在活跃发展的领域,尤其在“无排除限制(no exclusion restriction)”这一更具挑战性的设定下,近十年有较多进展。
发展脉络(history)¶
-
奠基工作:处理删失或样本选择之一
- Tobin (1958):提出了Tobit模型,处理因变量删失问题,但假设样本选择是随机的(即观测到的样本能代表总体)。
- Heckman (1979):提出了经典的两步法处理样本选择偏差,但要求存在一个“排除限制变量”(exclusion restriction)——即一个影响选择概率但不直接影响结果变量的变量。这是该领域的里程碑,但排除限制在实际中很难找到。
-
主要进展:放松排除限制假设
- Ahn & Powell (1993):提出了一个半参数方法,允许样本选择机制是非参数的,但仍然依赖排除限制。他们的方法通过核平滑估计选择概率,然后进行加权回归。
- Das, Newey & Vella (2003):进一步放松了假设,允许选择方程和结果方程都是非参数的,但依然需要排除限制来识别。他们的工作证明了在非参数设定下,排除限制对于识别是必要的。
- Chen & Zhou (2010):本文作者的前期工作,在删失回归模型中引入了非参数样本选择,但仍然假设存在排除限制。这是本文的直接前身。
-
当前Frontier:无排除限制的识别与估计
- 本文 (Pan, Zhou & Zhou, 2024):这是本文的位置。它直接挑战了上述所有工作的共同假设——排除限制。作者声称,在删失回归的特定设定下,即使没有排除限制,通过利用删失结构本身提供的非线性,也可以实现识别和一致估计。这是对Heckman范式的一个显著突破。
子线索聚类¶
这些被引文献大致落在两条子线索上:
-
线索一:参数/半参数方法,依赖排除限制
- 代表工作:Heckman (1979), Ahn & Powell (1993), Das, Newey & Vella (2003), Chen & Zhou (2010)。
- 核心思路:假设一个已知形式的(参数或半参数)选择方程和结果方程,并依赖一个工具变量(排除限制)来识别选择偏差。
- 瓶颈:排除限制变量难以获得,且其有效性难以验证。如果排除限制不成立,估计量将不一致。
-
线索二:非参数方法,依赖排除限制
- 代表工作:Das, Newey & Vella (2003) 也属于此类。
- 核心思路:完全放弃对函数形式的参数假设,但依然需要排除限制来保证非参数识别。
- 瓶颈:维数诅咒(curse of dimensionality)使得非参数估计在实际中表现不稳定,且排除限制的依赖依然存在。
这个方向在追问的核心问题¶
- 识别问题:在没有排除限制的情况下,样本选择偏差和删失效应能否被分离?需要什么样的额外结构或假设?
- 估计效率:在放松排除限制后,估计量的收敛速度会如何变化?能否达到半参数有效界?
- 计算可行性:两步法中的第一步(非参数估计选择概率)如何影响第二步(删失回归)的有限样本表现?是否存在更稳健的估计策略?
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么:作者将缺口定位为“现有处理样本选择的删失回归模型都依赖排除限制,而本文首次提出一个无需排除限制的估计方法”。作者声称,删失回归模型的非线性(即观测到的结果变量是潜在结果和删失阈值的截断)本身提供了足够的识别信息,从而可以替代排除限制的作用。这使得本文成为“显然的下一步”。
- 哪些竞争路线被他淡化或回避了:作者淡化了工具变量(IV)方法。在因果推断中,处理样本选择偏差的另一种常见思路是使用工具变量(如通过IV估计局部平均处理效应LATE)。作者没有讨论IV方法在删失设定下的适用性,也没有比较本文方法与IV方法的优劣。此外,作者回避了敏感性分析的路线——即不试图点识别,而是通过假设一个范围来评估选择偏差的影响。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:作者没有引用Proximal Causal Inference的相关文献(如Tchetgen Tchetgen et al., 2020; Miao et al., 2018)。Proximal方法正是处理“无排除限制”或“无工具变量”问题的一个前沿框架,它通过引入“负对照变量”(negative controls)来替代排除限制。这与本文的核心动机高度相关,但作者完全没有提及。这是一个值得研究者去查的问题:Proximal方法能否应用于本文的删失回归设定?如果能,与本文的两步法相比,哪个更优?
张力¶
未见明显对立引用。所有被引工作基本都承认排除限制的必要性,而本文是第一个声称可以放弃它的。因此,本文与整个现有文献之间存在一个“张力点”:作者声称的“无需排除限制”是否真的成立? 这需要研究者仔细审视其识别假设(见第三节)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( Y^* \):潜在结果变量(latent outcome)。这是我们真正想研究但无法完全观测到的变量。例如,一个人的“真实”吸烟量。
- \( Y \):可观测的结果变量(observed outcome)。它与 \( Y^* \) 的关系是:\( Y = \max(Y^*, 0) \)。即,当 \( Y^* \) 小于等于0时,我们观测到0(删失);当 \( Y^* > 0 \) 时,我们观测到 \( Y^* \) 本身。
- \( D \):样本选择指示变量(selection indicator)。\( D = 1 \) 表示个体被观测到(进入了样本),\( D = 0 \) 表示未被观测到。例如,只有那些同意参加调查的女性,我们才能观测到她们的吸烟量。
- \( X \):协变量向量(covariates)。影响结果变量 \( Y^* \) 和/或选择变量 \( D \) 的可观测特征。例如,年龄、教育水平、收入。
- \( Z \):选择方程中的协变量(selection covariates)。影响 \( D \) 的变量,通常包含 \( X \),也可能包含其他变量。在本文中,\( Z \) 不包含排除限制变量。
- \( \beta \):回归系数向量(regression coefficient)。这是我们想要估计的参数,它刻画了 \( X \) 对潜在结果 \( Y^* \) 的线性影响。
- \( \varepsilon \):结果方程的误差项(outcome error)。不可观测的随机扰动。
- \( u \):选择方程的误差项(selection error)。不可观测的随机扰动。
- \( c \):删失阈值(censoring threshold)。本文中固定为0。
-
模型:
- 结果方程(潜在结果模型):
\[Y^* = X^\top \beta + \varepsilon\]这是一个标准的线性回归模型,\( \beta \) 是目标参数。
- 选择方程(样本选择模型):
\[D = 1\{ g(Z) + u > 0 \}\]其中 \( g(\cdot) \) 是一个未知的非参数函数。这是本文的关键设定:选择机制是未知的,且不假设其参数形式。
- 可观测数据:研究者实际能观测到的是 \( (Y, D, X, Z) \)。注意,当 \( D=0 \) 时,我们观测不到 \( Y \)(因为个体没进入样本)。当 \( D=1 \) 时,我们观测到 \( Y = \max(Y^*, 0) \),即 \( Y^* \) 被删失后的版本。
- 潜在 / 不可观测量:\( Y^* \)(当 \( Y^* > 0 \) 时被部分观测,当 \( Y^* \le 0 \) 时完全不可观测)、\( \varepsilon \)、\( u \)、\( g(\cdot) \)。
- 结果方程(潜在结果模型):
-
关键假设(识别所需):
- 独立性:\( (\varepsilon, u) \) 与 \( (X, Z) \) 独立。这是一个很强的假设,意味着选择偏差完全由 \( g(Z) \) 和 \( u \) 驱动,且 \( X, Z \) 是外生的。
- 单调性:\( D \) 是 \( g(Z) + u \) 的单调函数(即 \( D=1\{g(Z)+u > 0\} \))。这是标准假设。
- 无排除限制:\( Z \) 中不包含任何在给定 \( X \) 后不影响 \( Y^* \) 的变量。即,所有影响选择的变量也直接影响结果。这是本文的核心挑战。
- 删失结构:\( Y = \max(Y^*, 0) \)。这个非线性结构是本文实现识别的关键。
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:假设只有一个协变量 \( X \)(且 \( Z = X \)),且我们只关心 \( \beta \) 的符号和大小。
-
最简特例设定:
- \( Y^* = X\beta + \varepsilon \),\( \varepsilon \sim N(0,1) \)(为简化,假设方差已知)。
- \( D = 1\{ g(X) + u > 0 \} \),\( u \sim N(0,1) \),且 \( (\varepsilon, u) \) 联合正态,相关系数为 \( \rho \)。
- 可观测数据:\( (Y, D, X) \),其中 \( Y = \max(Y^*, 0) \) 当 \( D=1 \),否则 \( Y \) 缺失。
-
核心问题:在没有排除限制(即 \( Z = X \))的情况下,如何从观测数据中识别 \( \beta \)?
-
传统Heckman方法会失败:Heckman两步法需要估计一个“逆米尔斯比率”(IMR)来校正选择偏差。IMR是 \( g(X) \) 的函数。由于 \( g(X) \) 未知且与 \( X \) 完全相关(因为 \( Z=X \)),IMR与 \( X \) 存在严重的多重共线性,导致 \( \beta \) 无法被识别。
-
本文的关键想法:利用删失的非线性来打破共线性。
- 考虑观测到的 \( Y \) 的条件期望(给定 \( D=1 \) 且 \( Y>0 \)):
\[E[Y | D=1, Y>0, X] = X\beta + E[\varepsilon | D=1, Y>0, X]\]
- 由于 \( Y>0 \) 意味着 \( Y^* > 0 \),即 \( \varepsilon > -X\beta \)。所以:
\[E[Y | D=1, Y>0, X] = X\beta + E[\varepsilon | g(X) + u > 0, \varepsilon > -X\beta, X]\]
- 这个条件期望是 \( X\beta \) 和 \( g(X) \) 的非线性函数。关键在于,即使 \( g(X) \) 是 \( X \) 的任意函数,由于 \( \varepsilon \) 和 \( u \) 的联合分布已知(假设为正态),这个非线性函数不是 \( X \) 的线性函数。因此,\( X\beta \) 这个线性部分可以从这个非线性函数中分离出来。
- 考虑观测到的 \( Y \) 的条件期望(给定 \( D=1 \) 且 \( Y>0 \)):
-
识别如何实现:
- 假设我们有一个“好”的 \( \beta \) 值,记为 \( \beta_0 \)。那么,我们可以构造一个“广义残差”:
\[\hat{\varepsilon} = Y - X\beta_0\]
- 对于 \( D=1, Y>0 \) 的样本,这个残差的条件期望应该等于 \( E[\varepsilon | D=1, Y>0, X] \)。这个条件期望是 \( X\beta_0 \) 和 \( g(X) \) 的函数。
- 如果 \( \beta_0 \) 是真实的,那么 \( \hat{\varepsilon} \) 与 \( X \) 的某种非线性变换(由选择偏差和删失共同决定)应该不相关。如果 \( \beta_0 \) 是错的,那么 \( \hat{\varepsilon} \) 中会残留 \( X \) 的线性成分,导致相关性。
- 本文的估计方法本质上就是通过一个矩条件(moment condition)来找到那个使残差与 \( X \) 的某个非线性函数正交的 \( \beta \)。这个非线性函数由非参数估计的 \( g(X) \) 和已知的删失结构共同决定。
- 假设我们有一个“好”的 \( \beta \) 值,记为 \( \beta_0 \)。那么,我们可以构造一个“广义残差”:
一句话总结:在无排除限制的删失回归中,删失本身引入的非线性替代了排除限制的作用,使得我们可以通过一个非线性的矩条件来识别线性回归系数 \( \beta \)。这个矩条件将选择偏差(由非参数 \( g(X) \) 刻画)和删失效应(由 \( \max(Y^*,0) \) 刻画)同时纳入考虑。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在删失回归模型(Tobit模型)中,当样本选择机制是非参数且未知,并且不存在排除限制变量时,如何一致且渐近正态地估计回归系数 \( \beta \)。
- 核心工具/方法:提出一个两步半参数估计量。第一步,用核平滑方法非参数地估计选择概率 \( P(D=1|Z) \)。第二步,基于一个由删失结构和选择偏差共同导出的矩条件,通过最小化一个目标函数来估计 \( \beta \)。
- 主要结论:在温和的正则条件下,该估计量是 \( \sqrt{n} \)-相合且渐近正态的。蒙特卡洛模拟表明其有限样本表现优于参数极大似然估计(MLE)。实证应用(女性吸烟行为)展示了其实用性。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 模型:
- 结果方程:\( Y^* = X^\top \beta + \varepsilon \),其中 \( \varepsilon \) 的分布未知,但假设其与 \( (X, Z) \) 独立。
- 选择方程:\( D = 1\{ g(Z) + u > 0 \} \),其中 \( g(\cdot) \) 是未知光滑函数,\( u \) 的分布未知,但假设其与 \( (X, Z) \) 独立。
- 可观测数据:\( (Y_i, D_i, X_i, Z_i)_{i=1}^n \),其中 \( Y_i = \max(Y_i^*, 0) \) 当 \( D_i=1 \),否则 \( Y_i \) 缺失。
- 关键假设(相比已有文献):
- 无排除限制:这是本文的核心放松。\( Z \) 可以包含 \( X \) 的所有分量,甚至 \( Z = X \)。这与Heckman (1979) 和 Ahn & Powell (1993) 等形成鲜明对比。
- 独立性:\( (\varepsilon, u) \perp (X, Z) \)。这是一个很强的外生性假设,比许多半参数文献中要求的条件均值独立更强。
- 单调性:\( D \) 是 \( g(Z) + u \) 的单调函数。标准假设。
- 光滑性:\( g(\cdot) \) 和 \( P(D=1|Z) \) 是足够光滑的函数(例如,具有有界的高阶导数),以保证核估计的收敛速度。
- 删失阈值已知:删失点固定为0。这是一个简化,但可以推广到已知常数。
主要结果¶
-
定理1(相合性):在正则条件下,本文提出的两步估计量 \( \hat{\beta} \) 是 \( \beta_0 \) 的相合估计,即 \( \hat{\beta} \xrightarrow{p} \beta_0 \)。
- 直觉:目标函数在真实参数处取得最小值,且随着样本量增大,目标函数一致收敛于其极限。
- 必要条件:第一步的非参数估计(核平滑)必须一致收敛,且收敛速度足够快,不影响第二步的相合性。
-
定理2(渐近正态性):在更强的正则条件下,\( \sqrt{n}(\hat{\beta} - \beta_0) \xrightarrow{d} N(0, \Sigma) \),其中 \( \Sigma \) 是一个可以一致估计的渐近协方差矩阵。
- 直觉:估计量可以表示为U-统计量的线性近似,加上一个由第一步非参数估计引起的“生成回归量”(generated regressor)误差项。通过经验过程理论和U-统计量投影技术,可以证明这两部分的联合渐近分布是正态的。
- 解决的技术难点:如何控制第一步非参数估计对第二步参数估计的影响。这是所有两步半参数估计的核心难点。作者通过证明第一步估计的收敛速度足够快(比 \( n^{-1/4} \) 快),使得其影响在渐近分布中可以被“线性化”并吸收进方差项中。
证明路线与技术技巧¶
-
整体路线(3-5步逻辑主干):
- 定义目标函数:构造一个基于矩条件的经验目标函数 \( Q_n(\beta) \)。这个矩条件利用了删失和选择偏差的结构。
- 第一步估计:用核平滑方法非参数地估计选择概率 \( \hat{p}(Z) = \hat{P}(D=1|Z) \)。这个估计量被代入目标函数。
- 线性化目标函数:将 \( Q_n(\beta) \) 在真实参数 \( \beta_0 \) 处展开。证明 \( Q_n(\beta) \) 可以近似为一个关于 \( \beta \) 的二次型,加上一个由第一步估计误差引起的项。
- 处理生成回归量误差:这是最关键的一步。将第一步估计误差 \( \hat{p}(Z) - p(Z) \) 对目标函数的影响进行线性化。作者使用U-统计量投影(U-statistic projection)技术,将包含核估计的复杂项投影到独立观测的线性函数上,从而将其转化为一个渐近可处理的项。
- 应用经验过程理论:证明目标函数及其导数的一致收敛性,以及线性化后剩余项的可忽略性。最终得到 \( \sqrt{n}(\hat{\beta} - \beta_0) \) 的渐近正态表示。
-
关键跳跃点:
- 难点:如何证明第一步的非参数估计误差不会主导第二步的 \( \sqrt{n} \)-收敛速度。
- 作者的解法:作者假设核估计的带宽选择使得其收敛速度比 \( n^{-1/4} \) 快。这是一个标准技巧,但需要验证在本文的设定下是否成立。作者通过U-统计量投影技术,将核估计的偏差和方差项分解,并证明其高阶项可忽略,从而将生成回归量问题“降维”到一个可处理的线性影响。
-
技术技巧点名:
- 经验过程理论 (Empirical Process Theory):用于证明目标函数及其导数的一致收敛性,这是建立相合性和渐近正态性的基础。
- U-统计量投影 (U-statistic Projection):这是处理生成回归量问题的核心工具。由于第一步核估计是U-统计量的形式,作者将其投影到独立观测的线性函数上,从而将复杂的非线性依赖转化为可处理的线性项。这与您熟悉的higher-order U-statistics计算有直接关联——您可以用treewidth视角分析这个投影过程的计算复杂度。
- 核平滑 (Kernel Smoothing):用于非参数估计选择概率 \( P(D=1|Z) \)。
- Delta方法 (Delta Method):用于推导最终估计量的渐近方差。
真实例子与应用¶
- 用的什么数据/场景:女性吸烟行为。数据来自一个调查,记录了女性的吸烟量(每天吸烟支数)、年龄、教育水平、收入等。样本选择问题在于:只有那些同意参加调查并报告吸烟量的女性才被观测到。删失问题在于:吸烟量是非负的,且很多女性报告为0(不吸烟)。
- 怎么把本文方法用上去:
- 结果变量 \( Y \):每天吸烟支数(删失在0)。
- 选择变量 \( D \):是否报告了吸烟量(即是否进入分析样本)。
- 协变量 \( X \):年龄、教育、收入等。
- 选择方程协变量 \( Z \):与 \( X \) 相同(无排除限制)。
- 作者用本文提出的两步法估计了 \( X \) 对潜在吸烟量 \( Y^* \) 的影响。
- 得到什么结果:估计结果显示,年龄和教育水平对吸烟量有显著的负向影响,而收入的影响不显著。与参数MLE相比,本文的估计量在某些系数上给出了不同的符号或显著性水平,作者认为这表明参数MLE可能因模型误设而存在偏差。
- 这个例子想说明什么:主要目的是验证方法的实用性,展示在真实数据中,当排除限制不存在时,本文方法可以提供一个可行的估计。它并非为了推翻某个已知结论,而是作为一个“概念验证”(proof of concept)。
🔎 结论是否比证明窄¶
- 窄的地方:作者在引言和摘要中声称“无需排除限制”,但在证明中,一个关键的假设是独立性:\( (\varepsilon, u) \perp (X, Z) \)。这个假设非常强,它意味着所有协变量都是外生的。在实际应用中,这几乎不可能成立。例如,收入(\( X \))很可能与影响吸烟的不可观测因素(如健康意识,包含在 \( \varepsilon \) 中)相关。因此,本文的“无排除限制”是以“强外生性”为代价换来的。这个假设在证明中至关重要,但在结论的泛化表述中被弱化了。研究者需要仔细评估这个假设在目标应用中的合理性。
- 未证明的claim:作者声称该方法可以推广到更一般的删失阈值,但没有给出证明。这是一个conjecture。
四、开放问题(点到为止,扎根具体语句)¶
- 弱化外生性假设:本文的识别依赖于 \( (\varepsilon, u) \perp (X, Z) \) 的强独立性假设。能否在条件均值独立(\( E[\varepsilon|X,Z]=0 \))或更弱的矩条件下实现识别? 这直接关系到方法在经济学等领域的实用性。(扎根于:定理1和2的假设条件,特别是关于独立性的部分。)
- 效率界:本文证明了 \( \sqrt{n} \)-相合性和渐近正态性,但没有推导半参数效率界。本文的估计量是否达到了有效界?如果不是,能否构造一个达到有效界的估计量(例如,通过估计有效影响函数)?(扎根于:论文的结论部分,作者没有讨论效率问题。)
- 与Proximal Causal Inference的联系:本文的核心动机(无排除限制)与Proximal方法高度重合。能否将Proximal方法(使用负对照变量)应用于本文的删失回归设定? 如果能,与本文的两步法相比,哪个在识别假设和估计效率上更优?(扎根于:引言中未引用Proximal文献的明显缺失。)
- 高维协变量:本文的方法依赖于核平滑,这在高维协变量 \( X \) 下会遭遇维数诅咒。能否将本文的方法推广到高维设定(例如,使用LASSO或DML框架)? 这需要处理高维非参数选择方程和删失回归的联合挑战。(扎根于:论文的模拟和实证部分,协变量维度都很低。)
Maintained by 陈星宇 · Homepage · Source on GitHub