跳转至

Inference for Fixed Effects Estimators when Panels are Unbalanced

作者: Daniel Czarnowske, Amrei Stammann
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2607.10246


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是面板数据中双向固定效应(two-way fixed effects)M-估计量的推断问题,核心挑战是“偶然参数问题”(incidental parameter problem):当横截面单元数 \(N\) 和时间期数 \(T\) 都很大时,个体效应 \(\alpha_i\) 和时间效应 \(\gamma_t\) 的个数(\(N+T\))随样本量增长,导致对共同参数 \(\beta\) 的 MLE/M-估计量产生 \(O(T^{-1})\)\(O(N^{-1})\) 量级的偏差,使得标准推断失效。该方向当前已相当成熟,但绝大多数理论工作假设面板是平衡的(balanced panel),即每个 \((i,t)\) 组合都被观测到。本文试图填补的缺口是:当面板因样本选择或损耗而非平衡(unbalanced)时,偏差结构如何变化,以及如何构造有效的偏差校正。

发展脉络

  • 奠基工作:Neyman and Scott (1948) 首次识别了偶然参数问题;Nickell (1981) 在动态线性面板模型中具体刻画了偏差。这两篇奠定了“固定效应估计存在 \(O(1/T)\) 偏差”这一基本认识。
  • 主要进展(偏差校正方法):Hahn and Newey (2004) 提出了分析校正和刀切校正;Dhaene and Jochmans (2015) 提出了分裂面板刀切法(split-panel jackknife)。这些方法主要针对单向固定效应(仅个体效应)。
  • 双向固定效应:Fernández-Val and Weidner (2016) 是本文最直接的先驱。他们首次为双向固定效应模型(同时含个体和时间效应)建立了渐近理论,推导了偏差的显式表达式,并提出了分析校正和分裂面板刀切校正。他们的设定允许回归量是严格外生或预确定的,但假设面板是平衡的
  • 当前 frontier 与本文位置:Fernández-Val and Weidner (2018) 在综述中猜想(conjecture)了非平衡面板下偏差表达式的形式,但未严格证明,且假设选择过程满足条件独立性。本文严格证明了非平衡面板下双向固定效应 M-估计量的渐近分布,将选择过程放宽到条件均值限制,并首次识别了由预确定的选择过程导致的“反馈偏差”(feedback bias)。本文还指出,Fernández-Val and Weidner (2018) 的一个猜想正则性条件(关于期望偶然参数 Hessian 的可逆性)是不充分的,需要加强。

子线索聚类

这些被引文献大致落在三条子线索上:

  1. 双向固定效应模型的偏差校正(核心线索):Fernández-Val and Weidner (2016, 2018) 是主线,Jochmans and Otsu (2019) 提供了基于似然校正的替代方法。本文直接建基于此。
  2. 特定模型或设定下的专门方法:Graham (2017), Yan et al. (2018), Dzemski (2019), Hughes (2026) 等聚焦于 logit 或网络模型,通常假设回归量严格外生。这些工作处理了更复杂的依赖结构(如网络),但牺牲了模型的一般性。
  3. 非平衡面板下的交互固定效应模型:Su, Wang, and Wang (2026) 和 Czarnowske and Stammann (2026b) 研究了交互固定效应(interactive fixed effects)模型在非平衡面板下的推断。这与本文的加法固定效应模型不同,但共享“非平衡”这一核心挑战。

这个方向在追问的核心问题

  1. 偏差结构:在非平衡面板下,偶然参数偏差的表达式是什么?它如何依赖于选择过程(deterministic vs. stochastic)?
  2. 反馈偏差:当回归量或选择过程是预确定时,是否会产生额外的偏差?如何校正?
  3. 校正方法:分析校正和刀切校正(如 split-panel jackknife)在非平衡面板下是否仍然有效?后者是否需要更强的同质性假设?
  4. 方差估计:非平衡面板是否引入额外的异方差性?如何构造一致的方差估计量?

已知瓶颈:分析校正需要估计高阶矩和谱密度,涉及带宽选择;刀切校正依赖于子样本的同质性,这在非平衡面板下可能被违反。

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者声称本文是“第一个完整的理论分析”(the first complete theoretical analysis),将选择过程从条件独立性放宽到条件均值限制,并首次识别了由预确定选择过程导致的反馈偏差。作者将本文定位为 Fernández-Val and Weidner (2016) 从平衡面板到非平衡面板的“显然的下一步”。
  • 哪些竞争路线被他淡化或回避了:作者在 Remark 4 中明确指出了 jackknife 校正(包括 Fernández-Val and Weidner 2016 的 split-panel jackknife 和 Higgins 2026 的 jackknife \(t_q\)-statistic)需要无条件同质性假设(unconditional homogeneity),而本文的分析校正不需要。这实际上是在暗示 jackknife 方法在非平衡面板下可能失效(模拟也证实了这一点)。作者淡化了 jackknife 方法的“自动性”和“计算简便性”优势。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 本文的参考文献列表很全面,涵盖了该方向的主要工作。未见明显缺失。但值得注意的是,作者引用了自己的另一篇工作 Czarnowske and Stammann (2026a) 来处理三维面板和网络数据,这暗示了本文方法的一个自然推广方向。

张力

未见明显对立引用。所有被引工作基本都认同“双向固定效应估计存在偏差,需要校正”这一共识,分歧主要在于校正方法的选择和适用条件。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \(i = 1, \dots, N\):横截面单元(个体)。
  • \(t = 1, \dots, T\):时间期数。
  • \(y_{it}\):结果变量(可观测)。
  • \(x_{it}\)\(K\)-维预确定回归量向量(可观测)。
  • \(s_{it} \in \{0, 1\}\):选择指示变量,\(s_{it}=1\) 表示 \((y_{it}, x_{it})\) 被观测到(可观测)。
  • \(d_{it} \in \{0, 1\}\):设计指示变量,\(\Phi\)-可测(不可观测,但由模型假设决定其性质)。
  • \(r_{it} \in \{0, 1\}\):响应指示变量,随机(不可观测,但由模型假设决定其性质)。\(s_{it} = d_{it} r_{it}\)
  • \(\alpha_i\):个体固定效应(不可观测,待估参数)。
  • \(\gamma_t\):时间固定效应(不可观测,待估参数)。
  • \(\beta\)\(K\)-维共同参数(待估参数,核心目标)。
  • \(\phi = (\alpha', \gamma')'\)\(L = N+T\) 维偶然参数向量。
  • \(\pi_{it}(\beta, \mu) = x_{it}'\beta + \mu\):线性指标。
  • \(\mu_{it}(\phi) = \alpha_i + \gamma_t\):加法固定效应。
  • \(\Phi\):由所有不可观测效应和初始条件生成的 \(\sigma\)-代数。

  • 模型

  • 条件均值模型\(\mathbb{E}[y_{it} \mid \mathcal{C}_i^t, \beta, \phi] = g(\pi_{it}(\beta, \mu_{it}(\phi)))\),其中 \(\mathcal{C}_i^t = \sigma(\{(x_{it'}, r_{it'}): t' \le t\})\) 是到时间 \(t\) 为止的信息集。\(g(\cdot)\) 是已知的连接函数。
  • 准则函数:M-估计量通过最小化 \(L_{NT}(\beta, \phi) = \frac{1}{\sqrt{NT}} \sum_{i=1}^N \sum_{t=1}^T s_{it} \psi_{it}(\pi_{it}(\beta, \mu_{it}(\phi))) + P_{NT}(\phi)\) 得到。\(\psi_{it}(\pi)\) 的伪得分满足 \(\partial \psi_{it}(\pi)/\partial \pi = w(\pi)(g(\pi) - y_{it})\),即它是条件均值的“自然”得分函数。\(P_{NT}(\phi)\) 是惩罚项,用于施加标准化 \(\sum_i \alpha_i = \sum_t \gamma_t = 0\)
  • 关键假设:回归量 \(x_{it}\) 和响应指示变量 \(r_{it}\)预确定的(predetermined),即它们可以依赖于过去的结果,但不能依赖于当期或未来的结果。选择过程可以是确定性的(\(r_{it}=1\))、随机的(\(d_{it}=1\))或混合的。

  • 可观测数据:研究者实际能观测到的是三元组 \(\{(y_{it}, x_{it}, s_{it}): i=1,\dots,N, t=1,\dots,T\}\)。当 \(s_{it}=0\) 时,\(y_{it}\)\(x_{it}\) 缺失。研究者无法观测到:

  • 个体效应 \(\alpha_i\) 和时间效应 \(\gamma_t\)(它们是待估参数)。
  • 设计指示变量 \(d_{it}\) 和响应指示变量 \(r_{it}\) 的分离(只能观测到它们的乘积 \(s_{it}\))。
  • 潜在结果(counterfactual outcomes),即如果 \(s_{it}=1\) 但实际未观测到的情况。
  • 选择过程的完整机制(只能通过假设来识别)。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:线性模型(OLS)、严格外生回归量、确定性选择

  • 特例设定
  • \(g(\pi) = \pi\)(线性模型),\(w(\pi) = 1\),则 \(\psi_{it}(\pi) = (y_{it} - \pi)^2 / 2\)
  • 回归量 \(x_{it}\)严格外生的(strictly exogenous),即 \(\mathbb{E}[y_{it} \mid x_{i1}, \dots, x_{iT}, \alpha_i, \gamma_t] = x_{it}'\beta + \alpha_i + \gamma_t\)
  • 选择过程是确定性的:\(r_{it} = 1\) 对所有 \(i,t\) 成立,因此 \(s_{it} = d_{it}\)\(d_{it}\)\(\Phi\)-可测的,例如,个体 \(i\) 的进入和退出时间完全由 \(\alpha_i\) 决定。

  • 在这个特例下,问题退化成什么?

  • 模型退化为:\(y_{it} = x_{it}'\beta + \alpha_i + \gamma_t + \varepsilon_{it}\),其中 \(\mathbb{E}[\varepsilon_{it} \mid X, \alpha, \gamma] = 0\)
  • 估计量是带个体和时间虚拟变量的 OLS(LSDV 估计量),但只使用 \(s_{it}=1\) 的观测。
  • 偏差来源:由于 \(d_{it}\) 依赖于 \(\alpha_i\),面板是非平衡的。LSDV 估计量 \(\hat{\beta}\) 仍然有偏差,但偏差结构比平衡面板更复杂。

    • 偶然参数偏差:来自 \(\alpha_i\)\(\gamma_t\) 的估计。在平衡面板下,这个偏差是 \(O(T^{-1}) + O(N^{-1})\)。在非平衡面板下,偏差的表达式依赖于 \(d_{it}\)
    • 反馈偏差:在这个特例中,由于回归量严格外生且选择过程是确定性的,没有反馈偏差。反馈偏差的出现需要回归量或选择过程是预确定的。
  • 核心思路(在这个特例下)

  • 写出 LSDV 估计量的一阶条件\(\hat{\beta}\) 满足 \(\sum_{i,t} s_{it} x_{it} (y_{it} - x_{it}'\hat{\beta} - \hat{\alpha}_i - \hat{\gamma}_t) = 0\)
  • \(\hat{\alpha}_i\)\(\hat{\gamma}_t\) 进行“剖面”展开:将 \(\hat{\alpha}_i\)\(\hat{\gamma}_t\) 表示为 \(\hat{\beta}\) 和数据的函数,代入一阶条件。
  • 识别偏差项:展开后,\(\hat{\beta}\) 的渐近分布会偏离零中心,偏差项由两部分组成:
    • \(B_{\alpha, \infty}\):来自个体效应 \(\alpha_i\) 的估计,量级为 \(O(T^{-1})\)。其表达式包含 \(\sum_{t} \mathbb{E}[s_{it} \tilde{x}_{it} (d^2\psi)_{it}]\) 等项,其中 \(\tilde{x}_{it}\)\(x_{it}\) 对个体和时间虚拟变量做加权最小二乘投影后的残差。
    • \(B_{\gamma, \infty}\):来自时间效应 \(\gamma_t\) 的估计,量级为 \(O(N^{-1})\)
  • 构造校正估计量\(\tilde{\beta} = \hat{\beta} + \hat{W}^{-1}(T^{-1} \hat{B}_\alpha + N^{-1} \hat{B}_\gamma)\),其中 \(\hat{W}\) 是渐近方差的估计,\(\hat{B}_\alpha\)\(\hat{B}_\gamma\) 是偏差项的样本模拟。校正后,\(\tilde{\beta}\) 的渐近分布中心化为零。

  • 为什么这个特例抓住了核心? 即使在这个最简单的设定下,非平衡面板也使得偏差表达式依赖于选择过程 \(d_{it}\),并且使得 jackknife 校正(依赖于子样本同质性)可能失效。本文的一般性在于:将上述思路推广到非线性连接函数 \(g(\cdot)\)、预确定回归量和预确定选择过程(引入反馈偏差),并给出了严格的证明。

三、这篇论文做了什么

  • 三句话
  • 研究了什么问题:在 \(N, T\) 同时增长的渐近框架下,推导了非平衡面板数据中双向固定效应 M-估计量的渐近分布,并提出了同时校正偶然参数偏差和反馈偏差的分析校正方法。
  • 核心工具 / 方法:基于 Legendre 变换和泰勒展开对剖面目标函数进行渐近展开,识别偏差项;使用截断谱密度估计量(truncated spectral-density estimator)估计由预确定变量引起的长期方差;构造分析偏差校正估计量。
  • 主要结论:未校正的估计量是渐近正态但非零中心的;校正后的估计量是渐近正态且中心化的,且渐近方差与未校正的相同;方差估计量是一致的。模拟实验验证了有限样本性能,并展示了 jackknife 校正因违反同质性假设而失效。

  • 关键设定与假设

  • 设定:见第二节“最小内核”中的符号和模型。本文考虑的是一般的 M-估计量,准则函数 \(\psi\) 由连接函数 \(g\) 和权重 \(w\) 决定,涵盖 OLS、Probit、Logit、Poisson 等常见模型。
  • 假设(Assumption 1)

    • (i) 渐近框架\(N, T \to \infty\)\(N/T \to \tau \in (0, \infty)\)。这是双向固定效应模型的标准框架。
    • (ii) 抽样:给定 \(\Phi\),个体间独立;个体内是 \(\alpha\)-混合的(强混合),混合系数以多项式速率衰减。关键:不要求 \(r_{it}\)\((y_{it}, x_{it})\) 条件独立(即不假设随机缺失 MAR),这比 Fernández-Val and Weidner (2018) 的猜想更弱。
    • (iii) 模型:条件均值限制 \(\mathbb{E}[y_{it} \mid \mathcal{C}_i^t] = g(\pi_{it}(\beta^0, \mu_{it}^0))\)关键:回归量和响应指示变量是预确定的,允许与过去结果相关。
    • (iv) 光滑性与矩:准则函数四阶连续可导,且存在一个控制函数 \(\Psi\)\(\delta\) 阶矩一致有界(\(\delta \ge 6 + \nu\))。这比 Fernández-Val and Weidner (2016) 的 \(\delta = 8 + \nu\) 更灵活。
    • (v) 凸性:期望二阶导数的条件期望一致有正下界(确保局部严格凸性);广义非共线性条件(确保 \(\beta\) 可识别)。
    • (vi) 设计:对 \(\Phi\)-可测的设计部分施加两个条件:每个个体被观测的时间比例一致有正下界;任意两个时间点共享的个体比例一致有正下界(连通性条件,防止 \(\alpha\)\(\gamma\) 的块状识别问题)。
  • 主要结果

  • Theorem 1(未校正估计量的渐近分布)\(\sqrt{NT}(\hat{\beta} - \beta^0) \xrightarrow{d} \mathcal{N}(-\tau^{1/2} W_\infty^{-1} B_{\alpha,\infty} - \tau^{-1/2} W_\infty^{-1} B_{\gamma,\infty}, W_\infty^{-1} \Sigma_\infty W_\infty^{-1})\)
    • 直觉:偏差由两个部分组成,分别来自个体效应(\(B_{\alpha,\infty}\),量级 \(O(T^{-1})\))和时间效应(\(B_{\gamma,\infty}\),量级 \(O(N^{-1})\))的估计。
    • 必要条件:Assumption 1 成立,且极限存在。
    • 解决的技术难点:在非平衡面板下,偏差表达式依赖于选择过程,且 \(B_{\alpha,\infty}\) 中包含一个由预确定变量引起的“反馈偏差”项(\(B_{\alpha,\infty}^\star\)),这在平衡面板下不存在。作者严格推导了这些表达式。
  • Theorem 2(校正后估计量的渐近分布)\(\sqrt{NT}(\tilde{\beta} - \beta^0) \xrightarrow{d} \mathcal{N}(0, W_\infty^{-1} \Sigma_\infty W_\infty^{-1})\),其中 \(\tilde{\beta} = \hat{\beta} + \hat{W}^{-1}(T^{-1} \hat{B}_\alpha + N^{-1} \hat{B}_\gamma)\)

    • 直觉:分析校正通过减去偏差的估计量来中心化渐近分布,且不改变渐近方差。
    • 必要条件:Assumption 1 成立,且带宽 \(h \asymp T^\zeta\) 满足 \(\zeta \in (0, (\kappa-1)/(2\kappa))\)
    • 解决的技术难点:证明 \(\hat{B}_\alpha\)\(\hat{B}_\gamma\)\(B_{\alpha,\infty}\)\(B_{\gamma,\infty}\) 的一致估计。这需要处理由预确定变量引起的序列相关性,作者使用了截断谱密度估计量,并给出了带宽选择的条件。同时,需要证明 \(\hat{W}\)\(\hat{\Sigma}\) 是一致的。
  • 证明路线与技术技巧

  • 整体路线
    1. 剖面目标函数展开:利用 Legendre 变换,将 \(\hat{\phi}(\beta)\) 表示为 \(\beta\) 的函数,代入目标函数得到剖面目标函数 \(\mathcal{L}_{NT}(\beta, \hat{\phi}(\beta))\)。然后对 \(\partial \mathcal{L}_{NT}(\beta, \hat{\phi}(\beta)) / \partial \beta\)\(\beta^0\) 附近进行四阶泰勒展开(Lemma S.1)。
    2. 识别主项和偏差项:展开式中的主项是 \(U_1\)(一个鞅差序列和)和 \(\sqrt{NT} W (\beta - \beta^0)\)。偏差项来自 \(U_2\)\(U_3\),它们分别对应偶然参数偏差和反馈偏差。证明其余高阶项(\(R^{(1)}(\beta)\))是 \(o_P(1)\)\(o_P(\sqrt{NT} \|\beta - \beta^0\|_2)\)
    3. 证明估计量的一致性:利用凸性条件和主项展开,证明 \(\|\hat{\beta} - \beta^0\|_2 = O_P((NT)^{-1/2})\)(Theorem 4)。
    4. 推导渐近分布:将 \(\hat{\beta}\) 代入展开式,得到 \(\sqrt{NT}(\hat{\beta} - \beta^0) = -W^{-1} U + o_P(1)\)。然后证明 \(U\) 的渐近分布是均值为偏差项、方差为 \(\Sigma_\infty\) 的正态分布。对 \(U_1\) 应用鞅差序列的 CLT(Lemma 1),对偏差项 \(U_2, U_3\) 证明其依概率收敛到常数。
    5. 构造并证明校正估计量:构造偏差和方差的样本模拟(\(\hat{B}_\alpha, \hat{B}_\gamma, \hat{W}, \hat{\Sigma}\)),证明它们是一致的(Theorem 5)。然后证明校正后的估计量 \(\tilde{\beta}\) 的渐近分布中心化为零。
  • 关键跳跃点
    • 处理反馈偏差\(B_{\alpha,\infty}\) 中的反馈偏差项 \(B_{\alpha,\infty}^\star\) 涉及一个双求和 \(\sum_{t=1}^T \sum_{t'=t}^T \mathbb{E}[s_{it'} \tilde{x}_{it'} (d^2\psi)_{it'} s_{it} (d^1\psi)_{it}]\)。证明其样本模拟 \(\hat{B}_{\alpha,1}\) 的一致性需要处理序列相关性,作者使用了截断谱密度估计量,并利用 \(\alpha\)-混合性质(Lemma S.4, S.5)来控制截断误差。
    • 处理非平衡设计:证明期望 Hessian \(\bar{H}\) 的可逆性(Lemma 2(ii))在非平衡设计下需要新的论证。作者通过一个连通性引理(Lemma S.2)来保证。
    • 处理高阶展开的余项:证明所有高阶泰勒余项(\(R^{(1)}(\beta)\))都是 \(o_P(1)\) 需要精细的范数估计,作者使用了矩阵范数不等式(Lemma S.3)和混合矩不等式(Lemma S.5, S.6)。
  • 技术技巧点名

    • Legendre 变换:用于将约束优化问题转化为无约束问题,便于泰勒展开。
    • \(\alpha\)-混合(强混合):用于刻画个体内的时间依赖性,并推导矩不等式和协方差不等式。
    • 截断谱密度估计量:用于估计由预确定变量引起的长期方差,是处理反馈偏差的关键。
    • 鞅差序列中心极限定理:用于证明主项 \(U_1\) 的渐近正态性。
    • Neumann 级数展开:用于近似逆矩阵(Lemma S.8, S.9)。
    • Rosenthal 不等式:用于推导混合序列的矩上界。
  • 真实例子与应用

  • 数据 / 场景:模拟实验,数据生成过程(DGP)是一个动态 Probit 模型,包含一个滞后因变量 \(y_{i(t-1)}\) 和一个严格外生回归量 \(x_{it}\)。选择过程是混合的:设计部分 \(d_{it}\) 由个体效应 \(\alpha_i\) 决定(某些个体提前退出),响应部分 \(r_{it}\) 是预确定的(依赖于 \(y_{i(t-1)}\)\(r_{i(t-1)}\))。
  • 如何应用:估计了 \(\beta_y\)(滞后项系数)和 \(\beta_x\)(外生变量系数)。比较了未校正估计量、分析校正估计量(带宽 \(h=0,1,2\))、以及两种 jackknife 校正估计量(split-panel jackknife 和 jackknife \(t_2\)-statistic)的表现。
  • 结果
    • 未校正估计量偏差严重,尤其对 \(\beta_y\)(偏差高达 -104%)。
    • 分析校正(\(h=1\)\(h=2\))显著降低了偏差,覆盖概率接近 95% 的名义水平。\(h=0\) 无法校正反馈偏差,对 \(\beta_y\) 无效。
    • Jackknife 校正对 \(\beta_y\) 过度校正(偏差变正),且 split-panel jackknife 覆盖概率偏低。这是因为设计部分 \(d_{it}\) 违反了 jackknife 所需的无条件同质性假设(子样本非同质)。Jackknife \(t_2\)-statistic 的覆盖概率较好,但区间长度显著增大。
    • 随着 \(T\) 增大,所有估计量的偏差和区间长度都减小,符合渐近理论。
  • 这个例子想说明什么

    1. 验证了理论结果:非平衡面板下偏差确实存在且严重。
    2. 展示了分析校正的有效性,特别是对于处理反馈偏差(需要正带宽)。
    3. 关键信息:实证展示了 jackknife 校正的局限性——当选择过程依赖于不可观测效应时,子样本非同质,jackknife 失效。这直接支持了作者“分析校正优于 jackknife”的论点。
  • 🔎 结论是否比证明窄

  • 作者在 Remark 2(iv) 中指出,如果施加更高阶矩的限制(如 Bartlett 恒等式成立),偏差和方差表达式可以简化。但本文的证明是在没有这些限制下完成的,因此结论更一般。然而,作者在 Remark 2(iv) 中提到的简化,在模拟中并未实现(模拟用的是 Probit 模型,不满足 Bartlett 恒等式)。因此,结论的适用范围(仅条件均值限制)比证明中使用的技术假设(需要高阶矩有界)要宽,但这是合理的,因为高阶矩有界是证明的技术需要,而非模型的核心假设。
  • 作者在 Remark 4 中声称 jackknife 校正“carry over unchanged to unbalanced panels”,但紧接着就指出这需要“an additional unconditional homogeneity assumption”。模拟实验表明,这个假设在实践中很容易被违反。因此,“carry over unchanged”这个说法在实践中是误导性的,它掩盖了 jackknife 方法在非平衡面板下的关键脆弱性。作者的证明并未涵盖 jackknife 在非平衡下的有效性,只是指出了其成立的条件。

四、开放问题

  1. 非光滑准则函数:作者在结论中提到“Extending the analysis to estimators with non-smooth criterion functions, such as quantile regression, is a natural direction for future work.”(Section 5)。本文的证明严重依赖于准则函数的四阶可导性。将结果推广到分位数回归等非光滑情形,需要全新的技术工具(如经验过程理论),是一个有挑战性的开放问题。
  2. 更一般的交互固定效应:本文处理的是加法固定效应(\(\alpha_i + \gamma_t\))。作者引用了 Su, Wang, and Wang (2026) 和 Czarnowske and Stammann (2026b) 关于交互固定效应(interactive fixed effects, \(\lambda_i' f_t\))在非平衡面板下的工作。将本文的偏差校正方法推广到交互固定效应模型,并处理更复杂的偏差结构,是一个自然但非平凡的推广。
  3. 最优带宽选择:Theorem 2 给出了带宽 \(h\) 的允许范围,并提到了一个率最优的指数 \(\zeta^*\),但未给出一个可操作的数据驱动选择准则。如何在实际应用中自动选择带宽(例如,基于某种交叉验证或 plug-in 方法),是一个对应用有价值的问题。
  4. 高维协变量:本文假设回归变量维数 \(K\) 固定。当 \(K\)\(N, T\) 增长时(高维面板),偏差校正的难度会急剧增加。如何在高维设定下进行有效的推断,是一个前沿问题。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论