Doubly robust semiparametric inference using regularized calibrated estimation with high-dimensional data¶
作者: Satyajit Ghosh, Zhiqiang Tan
来源: Bernoulli
主题: 因果推断
相关性: 9/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在高维数据(p >> n)的 semiparametric 框架下,如何对一个低维参数(如部分线性模型的系数、平均处理效应 ATE)进行有效的统计推断(点估计 + 置信区间),同时允许两个工作模型(倾向得分与结果回归)中有一个可能被错误指定。 核心挑战在于:高维正则化估计(如 Lasso)的收敛速度通常慢于 n^{-1/2},直接代入会导致目标估计量有不可忽略的偏差,从而破坏推断的有效性。当前的主流解决方案是“去偏”(debiasing)或“正交化”(Neyman orthogonality),但本文作者认为这些方法在有限样本下不够稳定,且对模型错误指定的鲁棒性不足。
发展脉络(history)¶
-
奠基工作:低维下的双重稳健估计与高维推断的起点
- Scharfstein et al. (1999) / Kang & Schafer (2007):确立了双重稳健(doubly robust, DR)估计的基本范式——当倾向得分模型或结果回归模型之一正确指定时,估计量仍保持一致性。Kang & Schafer [17] 的模拟研究揭示了 DR 估计量在有限样本下可能表现不佳(当倾向得分接近 0 或 1 时),这为后续改进埋下了伏笔。
- Zhang & Zhang (2011) [48] 与 van de Geer et al. (2014) [43]:开创了高维线性模型下的“去偏 Lasso”(debiased Lasso)方法。核心思想是:对 Lasso 估计量进行一次 Newton-Raphson 修正,消除正则化带来的偏差,从而得到渐近正态的估计量,进而构造置信区间。这是高维推断领域的里程碑式工作。
-
主要进展:从线性模型到广义线性模型,从单一模型到双重稳健
- Ning & Liu (2014) [24] 与 Neykov et al. (2015) [22]:将去偏思想推广到更一般的 M-估计和估计方程框架,提出了“去相关得分函数”(decorrelated score function)和“投影估计方程”方法,统一了高维推断的理论。
- Belloni, Chernozhukov & Hansen (2014) [19] 与 Farrell (2015) [21]:将双重稳健思想引入高维因果推断。他们利用“交叉拟合”(cross-fitting)和“Neyman 正交性”来放松对高维 nuisance 参数收敛速度的要求,证明了只要 nuisance 参数的收敛速度乘积快于 n^{-1/2},DR 估计量就能达到 n^{-1/2}-CAN。这为使用数据自适应方法(如 Lasso、随机森林)估计 nuisance 参数提供了理论基础。
- Tan (2018) [37] 与 Avagyan & Vansteelandt (2017) [1]:提出了“正则化校准估计”(regularized calibrated estimation)作为拟合倾向得分模型的一种替代方法。Tan [37] 证明,校准估计在模型错误指定下能更好地控制逆概率加权(IPW)估计量的偏差,并给出了高维下的理论保证。这是本文的直接前驱工作。
-
当前 Frontier 与本文的位置
- Smucler, Rotnitzky & Robins (2019) [32]:对高维下的双重稳健估计进行了统一,区分了两种类型(“Type I”和“Type II”),并给出了基于影响函数(influence function)的通用构造方法。他们强调,通过精心选择估计方程,可以避免对 nuisance 参数收敛速度的乘积条件。
- Bradic, Wager & Zhu (2019) [24] 与 Dukes & Vansteelandt (2020) [11]:进一步放松了稀疏性假设,提出了“稀疏性双重稳健”(sparsity double robust)方法,即只要两个模型之一满足“超稀疏”(ultra-sparse)条件,就能得到有效推断。
- 本文(Ghosh & Tan, 2022):作者认为,现有的去偏 Lasso 方法虽然在理论上优雅,但在有限样本下对模型错误指定敏感,且其置信区间覆盖概率不稳定。本文的定位是:将 Tan (2018) [37] 的正则化校准估计思想从单一的倾向得分模型推广到同时估计两个工作模型(倾向得分与结果回归),并证明由此得到的 DR 估计量在稀疏性假设下具有 n^{-1/2}-CAN 和有效的 Wald 置信区间。 作者声称,与去偏 Lasso 相比,该方法在有限样本下更稳定,尤其当两个模型都 misspecified 时。
子线索聚类¶
- 去偏 / 去相关方法:以 Zhang & Zhang (2011) [48], van de Geer et al. (2014) [43], Ning & Liu (2014) [24], Neykov et al. (2015) [22] 为代表。核心思路是直接修正正则化估计量的偏差,使其渐近正态。优点:理论成熟,适用于多种模型。缺点:通常需要较强的稀疏性假设,且对模型错误指定敏感。
- 基于 Neyman 正交性的双重稳健方法:以 Belloni et al. (2014) [19], Farrell (2015) [21], Chernozhukov et al. (2018) 为代表。核心思路是构造一个对 nuisance 参数估计误差“不敏感”的估计方程(即 Neyman 正交性),从而允许使用更慢速收敛的 nuisance 估计量。优点:对 nuisance 参数收敛速度要求更宽松。缺点:通常需要交叉拟合,且有限样本表现可能受样本分割影响。
- 正则化校准估计方法:以 Tan (2017) [22], Tan (2018) [37], Ning, Peng & Imai (2018) [23] 以及本文为代表。核心思路是直接优化一个与目标估计量(如 IPW 或 DR 估计量)的偏差相关的损失函数(校准损失),而不是最大化似然。优点:在模型错误指定下更鲁棒,有限样本表现更稳定。缺点:理论分析更复杂,计算上需要求解更复杂的优化问题。
这个方向在追问的核心问题¶
- 如何在高维下实现双重稳健推断? 即,当两个工作模型之一错误指定时,如何保证置信区间的有效性?现有方法(如去偏 Lasso)通常假设模型正确指定,而双重稳健方法则试图放松这一假设。
- 如何放松对 nuisance 参数收敛速度的要求? 经典的 DR 估计量要求 nuisance 参数的收敛速度乘积快于 n^{-1/2}。Neyman 正交性可以放松到单个 nuisance 参数收敛速度快于 n^{-1/4}。能否进一步放松?
- 如何在有限样本下提高推断的稳定性? 去偏 Lasso 等方法在有限样本下可能产生过宽的置信区间或较差的覆盖概率,尤其是在模型错误指定或信号较弱时。如何设计更稳定的估计量?
- 如何统一处理不同类型的 DR 估计量? Smucler et al. (2019) [32] 的工作是一个重要尝试,但不同 DR 估计量(如 Type I vs Type II)在理论性质和计算上仍有差异。
⚠️ 作者的 framing¶
- 这是作者的说法:作者将缺口 frame 成“现有高维推断方法(如去偏 Lasso)在有限样本下不稳定,且对模型错误指定敏感”。他们声称,正则化校准估计通过直接优化与目标估计量偏差相关的损失函数,能提供更稳定的推断,尤其是在两个模型都 misspecified 时。
- 被淡化或回避的竞争路线:
- 交叉拟合 + Neyman 正交性:作者在引言中承认了这条路线(如 Belloni et al. [19], Farrell [21]),但认为其“需要样本分割,可能损失效率”。然而,本文提出的两步算法(sequential estimation)本身也可能引入序贯估计的偏差,作者需要证明这种偏差能被校准估计控制住。
- Smucler et al. (2019) [32] 的统一框架:作者引用了 [32],但并未深入讨论其与本文方法的异同。Smucler et al. 的方法也旨在构造对 nuisance 参数不敏感的估计方程,但其核心工具是影响函数,而非校准损失。作者似乎有意回避了与这个更通用框架的直接比较。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- Chernozhukov et al. (2018) “Double/debiased machine learning for treatment and structural parameters”:这是 DML 框架的奠基性论文,是 Neyman 正交性 + 交叉拟合路线的集大成者。本文作为一篇讨论高维 DR 推断的论文,没有引用这篇是一个显著的遗漏。这可能是作者有意淡化竞争路线,也可能是论文投稿时该工作尚未被广泛接受(但本文发表于 2022 年,DML 论文早已是经典)。
- 关于“统计-计算权衡”的讨论:本文提出的两步算法涉及求解多个高维优化问题(Lasso + 校准估计),其计算复杂度与去偏 Lasso 相比如何?作者没有讨论。对于关心计算效率的研究者(如本研究者),这是一个值得追问的点。
张力¶
未见明显对立引用。各条子线索(去偏、正交性、校准)之间是互补而非矛盾的关系,它们都在试图解决同一个核心问题,只是技术路线不同。一个潜在的张力在于:去偏 Lasso 的理论分析更简洁,但有限样本表现可能不如校准估计;而校准估计的理论分析更复杂,但声称有更好的有限样本性质。 这种“理论优雅性”与“实际稳定性”之间的权衡,是研究者需要自己判断的。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
我们以部分线性模型(Partially Linear Model, PLM) 为例,这是本文讨论的核心应用之一。
-
符号:
Y:结果变量(标量,可观测)。Z:处理变量 / 感兴趣的标量协变量(标量,可观测)。X:高维协变量向量(p 维,p >> n,可观测)。θ:感兴趣的低维参数(标量)。在 PLM 中,它是Z的系数,即E[Y | Z, X] = θZ + g(X)中的θ。这是我们要估计和做推断的目标。g(X):X的非参数函数(未知,高维 nuisance 参数)。h(X):Z对X的条件期望,即E[Z | X](未知,高维 nuisance 参数)。f(X; γ):g(X)的工作模型,参数化为γ(高维参数)。例如,f(X; γ) = X^T γ(线性模型)。g(X; α):h(X)的工作模型,参数化为α(高维参数)。例如,g(X; α) = X^T α(线性模型)。n:样本量。p:协变量X的维数。Ẽ{·}:经验均值,即(1/n) Σ_{i=1}^n (·)。
-
模型:
- 数据生成机制:
(Y_i, Z_i, X_i)是 i.i.d. 样本,来自某个未知分布P。 - 部分线性模型假设:
E[Y | Z, X] = θZ + g(X)。注意,这里g(X)是未知的,我们用一个线性工作模型f(X; γ) = X^T γ去逼近它。 - 对
Z的模型:E[Z | X] = h(X)。我们用一个线性工作模型g(X; α) = X^T α去逼近它。 - 关键假设:真实模型
g(X)和h(X)是“近似稀疏”的,即它们可以被一个稀疏的线性组合很好地逼近。这是高维稀疏估计(如 Lasso)有效的前提。
- 数据生成机制:
-
可观测数据:
- 研究者可以观测到
(Y_i, Z_i, X_i),i = 1, ..., n。 - 想要但观测不到的量:真实的
g(X)和h(X),以及它们的参数化形式γ和α。这些是 nuisance 参数,需要通过数据来估计。θ是目标参数。
- 研究者可以观测到
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设 g(X) 和 h(X) 都是线性函数,且 p 固定(低维)。 在这个特例下,整个问题退化为一个标准的 semiparametric 问题,其核心思想是构造一个双重稳健的估计方程。
最简特例(低维线性 PLM):
-
设定:
- 真实模型:
Y = θZ + X^T γ* + ε,E[ε | Z, X] = 0。 - 对
Z的模型:Z = X^T α* + η,E[η | X] = 0。 - 这里
γ*和α*是低维(p 固定)的真实参数。
- 真实模型:
-
可观测数据:
(Y_i, Z_i, X_i),i=1,...,n。 -
核心思路:
- 一个“幼稚”的估计方法是:先用 OLS 估计
α̂(Z对X回归),得到残差Z - X^T α̂;再用 OLS 估计γ̂(Y对X回归);最后用 OLS 估计θ(Y - X^T γ̂对Z - X^T α̂回归)。这就是“部分线性回归”的两步估计。但这个方法不双重稳健:如果γ̂不一致(例如,g(X)不是线性的),那么θ的估计也会不一致。 - 一个双重稳健的估计方程是:
Ẽ{ (Y - θZ - X^T γ̂)(Z - X^T α̂) } = 0解这个方程得到θ̂。 - 为什么双重稳健?
- 如果
γ̂是一致的(即X^T γ̂正确指定了g(X)),那么E[Y - θZ - X^T γ* | Z, X] = 0。此时,即使α̂不一致,方程Ẽ{ (Y - θZ - X^T γ̂)(Z - X^T α̂) } = 0在期望下仍然成立(因为(Y - θZ - X^T γ̂)与(Z - X^T α̂)无关?不,这里需要更细致的论证。实际上,双重稳健性来自于:如果α̂一致,那么E[Z - X^T α* | X] = 0,此时即使γ̂不一致,方程在期望下也成立。更严格的论证是:该估计方程是 Neyman 正交的,其偏差是(γ̂ - γ*)(α̂ - α*)阶的,因此只要一个估计量一致,偏差就是o_p(1)。 - 最小内核:这个估计方程的本质是将两个模型的残差相乘。其偏差是两个估计误差的乘积。因此,只要其中一个误差足够小(趋于 0),乘积就趋于 0。这就是“双重稳健”的数学本质。
- 如果
- 一个“幼稚”的估计方法是:先用 OLS 估计
-
本文在高维下的推广:
- 当
p >> n时,我们不能直接用 OLS 估计γ和α,而需要用 Lasso 等正则化方法。但 Lasso 估计量γ̂和α̂的收敛速度是O_p(√(s log p / n))(其中s是稀疏度),通常慢于n^{-1/2}。 - 如果直接代入上述 DR 估计方程,偏差项
(γ̂ - γ*)(α̂ - α*)的阶是O_p(s log p / n)。要使其为o_p(n^{-1/2}),需要s log p / n = o(n^{-1/2}),即s = o(√n / log p)。这是一个很强的“超稀疏”条件。 - 本文的关键想法:不直接使用 Lasso 估计量,而是使用正则化校准估计。作者证明,通过精心设计的校准损失函数,得到的
γ̂和α̂可以达到更快的收敛速度(如ℓ₂范数o_p(n^{-1/4})),从而使得偏差项(γ̂ - γ*)(α̂ - α*) = o_p(n^{-1/2}),满足 DR 估计量渐近正态的条件。这个n^{-1/4}的收敛速度要求比n^{-1/2}宽松得多,是本文理论的核心。
- 当
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高维数据(p >> n)的 semiparametric 框架下,研究如何对依赖于两个工作模型的低维参数(如 PLM 系数、ATE)进行双重稳健推断,使得当任一工作模型正确指定时,都能得到有效的 Wald 置信区间。
- 核心工具 / 方法:提出了正则化校准估计(regularized calibrated estimation)作为通用方法,通过一个两步算法同时估计两个高维工作模型的参数,并证明该估计量能达到足够快的收敛速度(
ℓ₂范数o_p(n^{-1/4}))。 - 主要结论:在稀疏性假设下,基于正则化校准估计的 DR 估计量是
n^{-1/2}-一致且渐近正态的(n^{-1/2}-CAN),从而可以构造出渐近有效的 Wald 置信区间。数值实验表明,该方法在有限样本下比去偏 Lasso 更稳定,尤其是在模型错误指定时。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 目标参数
θ:由矩条件E[τ(U; θ, γ, α)] = 0定义,其中τ是一个已知的双重稳健估计函数,U = (Y, Z, X)。例如,对于 PLM,τ(U; θ, γ, α) = (Y - θZ - X^T γ)(Z - X^T α)。 - 工作模型:
f(X; γ):对g(X)的模型,参数γ ∈ R^p。g(X; α):对h(X)的模型,参数α ∈ R^p。- 假设
f和g是“近似稀疏”的,即存在稀疏的真实参数γ*和α*,使得f(X; γ*)和g(X; α*)是真实条件期望的良好逼近。
- 关键假设(简化表述):
- 稀疏性:
γ*和α*的非零元素个数s_γ和s_α满足s_γ log p / n → 0和s_α log p / n → 0。 - 正则化条件:设计矩阵
X满足某种“受限特征值”(Restricted Eigenvalue)条件,这是 Lasso 和校准估计收敛性分析的标准假设。 - 收敛速度条件:校准估计量
γ̂和α̂的ℓ₂范数收敛速度满足||γ̂ - γ*||_2 = O_p(√(s_γ log p / n))和||α̂ - α*||_2 = O_p(√(s_α log p / n))。这是通过校准损失函数的理论性质保证的。 - 双重稳健性:估计函数
τ满足 Neyman 正交性,即∂E[τ(U; θ, γ*, α*)] / ∂γ = 0和∂E[τ(U; θ, γ*, α*)] / ∂α = 0。这意味着τ对γ和α的局部估计误差不敏感。
- 稀疏性:
- 相比已有文献的放宽或强化:
- 放宽:相比去偏 Lasso(通常要求模型正确指定),本文允许一个工作模型错误指定。
- 强化:相比基于交叉拟合的 DML 方法(通常只需要
||γ̂ - γ*||_2 * ||α̂ - α*||_2 = o_p(n^{-1/2})),本文对单个估计量的收敛速度要求更严格(||γ̂ - γ*||_2 = o_p(n^{-1/4})和||α̂ - α*||_2 = o_p(n^{-1/4}))。但作者声称,校准估计可以达到这个速度,而 Lasso 在某些情况下不能。
主要结果¶
- 定理 1(校准估计量的收敛速度):在稀疏性假设下,正则化校准估计量
γ̂和α̂的ℓ₂范数收敛速度为O_p(√(s log p / n))。这是后续推断的基础。 - 定理 2(DR 估计量的渐近正态性):如果
||γ̂ - γ*||_2 = o_p(n^{-1/4})且||α̂ - α*||_2 = o_p(n^{-1/4}),那么基于γ̂和α̂的 DR 估计量θ̂满足:√n (θ̂ - θ*) → N(0, V)其中V是渐近方差,可以被一致估计。因此,可以构造渐近有效的 Wald 置信区间。- 直觉:
n^{-1/4}的收敛速度保证了 Neyman 正交性带来的偏差项(γ̂ - γ*)(α̂ - α*)是o_p(n^{-1/2}),从而不影响θ̂的渐近分布。 - 必要条件:
s log p / n = o(n^{-1/2}),即s = o(√n / log p)。这是一个比“超稀疏”s = o(√n / log p)稍弱但仍然是较强的条件。
- 直觉:
- 定理 3(双重稳健性):如果工作模型
f(X; γ)正确指定(即存在γ*使得f(X; γ*) = g(X)),那么即使g(X; α)错误指定,上述结论仍然成立。反之亦然。
证明路线与技术技巧¶
- 整体路线:
- 第一步(校准估计):证明正则化校准估计量
γ̂和α̂的收敛速度。这通过分析校准损失函数的“受限强凸性”(Restricted Strong Convexity)和“统计误差”来实现。校准损失函数被设计成对模型错误指定更鲁棒,其梯度条件比似然函数更宽松。 - 第二步(Neyman 正交性):证明估计函数
τ满足 Neyman 正交性。这是 DR 估计量的固有性质,作者通过直接计算偏导数来验证。 - 第三步(偏差分析):将
θ̂的偏差分解为两部分:一部分来自γ̂和α̂的估计误差,另一部分是随机噪声。利用 Neyman 正交性,第一部分偏差被证明是(γ̂ - γ*)(α̂ - α*)阶的。 - 第四步(渐近正态性):利用
γ̂和α̂的n^{-1/4}收敛速度,证明偏差项是o_p(n^{-1/2})。然后,对θ̂进行线性化(类似于一阶 Taylor 展开),得到其影响函数表示,并应用中心极限定理证明其渐近正态性。
- 第一步(校准估计):证明正则化校准估计量
- 关键跳跃点:
- 校准估计的收敛速度分析:这是本文最吃功夫的部分。与 Lasso 不同,校准估计的损失函数不是凸的(或至少不是标准的凸函数),其理论分析更复杂。作者需要证明,尽管是两步序贯估计(
γ̂依赖于α̂,反之亦然),但校准估计的收敛速度仍然可以达到O_p(√(s log p / n))。这需要处理序贯估计带来的依赖性。 - 序贯估计的偏差控制:两步算法中,第二步的估计依赖于第一步的估计。这种依赖性会引入额外的偏差。作者通过证明校准估计的“一阶不敏感性”(first-order insensitivity)来克服这个困难,即第一步的估计误差对第二步的收敛速度影响是二阶的。
- 校准估计的收敛速度分析:这是本文最吃功夫的部分。与 Lasso 不同,校准估计的损失函数不是凸的(或至少不是标准的凸函数),其理论分析更复杂。作者需要证明,尽管是两步序贯估计(
- 技术技巧点名:
- Empirical Process 理论:用于控制经验过程的最大值,这是高维统计推断的标准工具。
- 受限强凸性(RSC):用于分析高维 M-估计量的收敛速度,是 Negahban et al. (2009) [18] 框架的核心。
- Neyman 正交性:用于构造对 nuisance 参数不敏感的估计方程,是 Chernozhukov et al. (2018) 框架的核心。
- 校准损失函数:这是本文的核心创新。它被设计成对模型错误指定更鲁棒,其理论性质(如梯度条件)比似然函数更宽松。
真实例子与应用¶
本文包含了数值模拟,但没有真实数据例子。
- 模拟设置:作者考虑了三个模型:部分线性模型(PLM)、log-linear 模型和 logistic 模型。对于每个模型,他们生成了高维协变量
X(p = 200, n = 200 或 400),并设置了不同的稀疏度(s = 5 或 10)。 - 对比方法:主要与去偏 Lasso(debiased Lasso)进行比较。
- 评估指标:偏差(Bias)、标准差(SD)、均方根误差(RMSE)、95% 置信区间的覆盖概率(CP)和平均宽度(AW)。
- 核心发现:
- 当两个工作模型都正确指定时,本文方法(RCAL)和去偏 Lasso 的表现相当,都能达到名义覆盖概率。
- 当结果回归模型错误指定时,RCAL 的覆盖概率显著优于去偏 Lasso。去偏 Lasso 的覆盖概率严重偏低(例如,只有 70-80%),而 RCAL 仍能维持在 90% 以上。
- 当倾向得分模型错误指定时,结果类似,RCAL 更稳健。
- 当两个模型都错误指定时,RCAL 的优势更加明显。去偏 Lasso 的覆盖概率可能降至 50% 以下,而 RCAL 仍能保持在 85% 以上。
- 这个例子想说明什么:验证了本文的理论结果——正则化校准估计在模型错误指定下比去偏 Lasso 更鲁棒,能提供更可靠的推断。这直接支持了作者在引言中的 claim。
🔎 结论是否比证明窄¶
- 是。定理 2 的渐近正态性依赖于
||γ̂ - γ*||_2 = o_p(n^{-1/4})和||α̂ - α*||_2 = o_p(n^{-1/4})这个条件。作者在定理 1 中证明了校准估计量可以达到O_p(√(s log p / n))的收敛速度。因此,n^{-1/4}条件等价于s log p / n = o(n^{-1/2}),即s = o(√n / log p)。这是一个很强的稀疏性条件,比许多去偏 Lasso 论文中假设的s = o(n / log p)要严格得多。作者在文中承认了这一点(Section 5, Discussion),但声称这个条件在实践中可能仍然合理,且校准估计的有限样本优势可以弥补理论上的更严格假设。这是一个值得研究者注意的 gap:理论上的优势(双重稳健)是以更强的稀疏性假设为代价的。
四、开放问题¶
- 能否放松
n^{-1/4}的收敛速度条件? 本文的核心理论依赖于||γ̂ - γ*||_2 = o_p(n^{-1/4})和||α̂ - α*||_2 = o_p(n^{-1/4})。能否通过更精细的偏差分析(如高阶展开)或不同的估计方程构造,将这个条件放松到||γ̂ - γ*||_2 * ||α̂ - α*||_2 = o_p(n^{-1/2}),从而允许更慢的单个估计量收敛速度?这直接关系到能否处理更不稀疏的模型。(扎根于:Theorem 2 的条件 (C4) 和 (C5)) - 如何扩展到更一般的 nuisance 参数空间? 本文假设工作模型是线性的(或广义线性模型)。能否将正则化校准估计推广到非参数或高维非参数 nuisance 参数(如使用 RKHS 或深度神经网络)?这需要发展新的校准损失函数和理论分析工具。(扎根于:Section 5, Discussion 中提到的“extensions to nonparametric models”)
- 是否存在更高效的计算算法? 本文的两步算法涉及求解多个高维优化问题。对于超大规模数据(n 和 p 都很大),计算可能成为瓶颈。能否设计出更高效的算法,例如基于随机梯度下降或分布式计算的方法?(扎根于:Section 4 的算法描述,作者提到使用了 Fisher scoring descent,但未讨论大规模场景)
- 校准估计与去偏 Lasso 的“统计-计算权衡”是什么? 本文在数值上展示了校准估计的有限样本优势,但代价是更强的稀疏性假设和可能更高的计算复杂度。是否存在一个理论上的“权衡”:在什么条件下,去偏 Lasso 的推断是有效的,而校准估计不是,反之亦然?这需要更深入的理论比较。(扎根于:Section 5, Discussion 中作者承认了更强的稀疏性假设,但未深入讨论计算代价)
Maintained by 陈星宇 · Homepage · Source on GitHub