跳转至

Statistical Inference for Additive Monotone Models under the Fixed Lattice Design

作者: Huachen Ren
主题: 非参数 / 半参数
相关性: 6/10
链接: https://arxiv.org/abs/2609.08448


一、领域脉络与小综述

这个方向是什么

本方向研究形状约束(shape-constrained)非参数回归中的统计推断问题,具体聚焦于可加单调模型(additive monotone model)。该模型假设响应变量 \(Y\) 与 \(d\) 维协变量 \(X\) 的关系可分解为各分量单调函数之和:\(Y = \mu + \sum_{j=1}^d f_j^*(x_j) + \varepsilon\)。核心统计问题是:在固定格点设计(fixed lattice design)下,如何建立各分量最小二乘估计(LSE)的渐近分布,并基于此构造无需调参(tuning-free)的逐点置信区间。该方向当前成熟度中等:单变量保序回归(isotonic regression)的渐近理论已相当完备,但向可加模型(尤其是多分量、非平衡设计)的推广仍存在关键缺口。

发展脉络(history)

  1. 奠基工作:单变量保序回归

    • Ayer et al. (1955) 和 Brunk (1955) 提出了保序回归的LSE及其池相邻违反者算法(PAVA),奠定了形状约束回归的基础。
    • Prakasa Rao (1969) 和 Groeneboom (1985) 分别建立了单变量保序回归LSE的渐近分布,其极限为Chernoff分布(即 \( \arg\min_{h \in \mathbb{R}} \{W(h) + h^2\} \) 的分布,其中 \(W\) 是双边布朗运动)。这是本领域最核心的基准结果。
  2. 主要进展:可加单调模型与Oracle性质

    • Bacchetti (1989) 首次提出可加单调模型,并设计了循环PAVA算法来求解LSE。这是将形状约束从单变量推广到多变量的开创性工作。
    • Mammen and Yu (2007) 在随机设计(random design)下证明了可加单调模型LSE的Oracle性质:每个分量的LSE渐近等价于对应单变量保序回归的LSE。这是该方向的一个里程碑,但作者也指出其证明依赖于一个“LSE一致有界”的引理,该引理的完整证明至今仍不完整(见本文Remark 2.4)。
    • Guntuboyina and Sen (2018) 在固定格点设计下,通过一个关键引理(Lemma 3.1)将可加单调模型的LSE解耦为单变量保序回归LSE减去一个全局均值。这一发现是本文的直接理论基石。
  3. 当前Frontier:推断与枢轴性

    • Deng et al. (2021) 在多元保序回归中,利用LSE拟合区间的长度信息,构造了枢轴(pivotal)极限分布,从而实现了无需估计导数的逐点置信区间。这一“块大小标准化(block-size normalization)”技术是本文推断部分的核心灵感来源。
    • Han and Zhang (2020) 研究了多元保序回归中“块估计量”的极限分布理论,其技术(如处理嵌套min-max算子)与本文有直接关联。
  4. 本文的位置

    • 本文填补了固定格点设计下可加单调模型LSE的渐近分布与推断这一空白。它建立在Guntuboyina and Sen (2018)的解耦引理之上,将Deng et al. (2021)的枢轴推断方法从多元保序回归推广到可加模型,并首次揭示了不同坐标方向设计点数量(由 \(\beta_j\) 刻画)对极限分布形态的决定性影响。

子线索聚类

  1. 固定格点设计下的渐近理论:以Guntuboyina and Sen (2018)和本文为代表,利用格点乘积结构实现分量解耦,推导精确的渐近分布。优点是数学上清晰、可处理非平衡设计;缺点是设计假设强,不适用于随机或非乘积固定设计。
  2. 随机设计下的Oracle性质:以Mammen and Yu (2007)为代表,证明LSE的渐近等价性。优点是更贴近实际应用;缺点是证明存在缺口,且难以处理分量间的复杂依赖。
  3. 基于LSE的推断方法:以Deng et al. (2021)和本文为代表,利用LSE的min-max表征构造枢轴统计量。优点是无需调参;缺点是枢轴性仅在特定增长率(\(\beta_j > 1/3\))下成立,临界情形(\(\beta_j = 1/3\))下失效。

核心问题与瓶颈

  1. 如何建立多分量LSE的联合渐近分布? 瓶颈在于分量间的依赖关系。固定格点设计下,通过解耦引理可证明渐近独立性;随机设计下,依赖关系复杂,现有证明不完整。
  2. 如何构造无需调参的置信区间? 瓶颈在于极限分布通常依赖于未知的局部导数 \(f_j^{*\prime}(x_{0,j})\)。Deng et al. (2021)的块大小标准化技巧可以消除该依赖,但仅在 \(\beta_j > 1/3\) 时有效。在临界增长率 \(\beta_j = 1/3\) 时,该标准化失效,极限分布仍依赖于导数。
  3. 不同坐标方向设计点数量不平衡时,极限分布如何变化? 本文回答了这个问题:极限分布由 \(\beta_j\) 决定,分为三种形态(Chernoff、高斯、随机游走),且与维度 \(d\) 无关。

⚠️ 作者的Framing

  • 作者的缺口frame:作者将缺口明确frame为“固定格点设计下可加单调模型LSE的极限分布与推断尚未建立”。通过强调固定格点设计的数学可处理性(解耦引理)和实际相关性(许多实验设计是格点),作者将本文定位为“显然的下一步”。
  • 被淡化/回避的竞争路线:
    • 随机设计:作者在Remark 2.4中明确指出了Mammen and Yu (2007)证明的缺口,并以此作为回避随机设计的理由。这暗示了随机设计下的问题更难、更不成熟。
    • 样条/核方法:作者在引言开头就指出这些方法需要调参,而形状约束LSE是“无需调参”的。这强化了本文方法的优势,但回避了样条方法在光滑性和推断效率上可能具有的优势。
  • 值得研究者去查的问题:
    • Mammen and Yu (2007) Lemma 3的完整证明:作者声称该证明“still unavailable”。这是一个明确的、可验证的缺口。如果该引理被证明或证伪,将直接影响随机设计下可加单调模型的理论基础。
    • Deng et al. (2021) 的块大小标准化方法在其他形状约束(如凸性)下的推广:本文将其推广到可加模型,但能否推广到更一般的形状约束(如Deng et al. 2022对凸性的工作)?这可以检验该方法的普适性。
    • 是否存在其他无需调参的标准化方法,能在 \(\beta_j = 1/3\) 时实现枢轴性? 作者在Section 5中明确将此列为开放问题。

张力

未见明显对立引用。各工作之间是互补和递进关系:从单变量到多变量,从随机设计到固定设计,从点估计到推断。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型与可观测数据

  • 符号:

    • \(Y_i \in \mathbb{R}\):第 \(i\) 个观测的响应变量。
    • \(X_i = (x_{i,1}, \dots, x_{i,d})^T \in \mathbb{R}^d\):第 \(i\) 个观测的 \(d\) 维协变量。
    • \(n\):总样本量。
    • \(d\):协变量维度。
    • \(\mu^* \in \mathbb{R}\):未知的截距项。
    • \(f_j^*: [0,1] \to \mathbb{R}\):第 \(j\) 个分量的真实非递减函数,是待估参数。
    • \(\varepsilon_i\):独立同分布的误差,均值为0,方差为 \(\sigma^2\)。
    • \(\hat{\mu}, \hat{f}_j\):LSE,是估计量。
    • \(n_j\):沿第 \(j\) 个坐标方向的设计点数量。
    • \(\beta_j = \log n_j / \log n\):刻画第 \(j\) 个坐标方向设计点密度的指数,满足 \(\sum_{j=1}^d \beta_j = 1\)。
    • \(w_{n,j}\):\(\hat{f}_j\) 的局部收敛速率。
    • \(x_0 = (x_{0,1}, \dots, x_{0,d})^T\):我们想要进行推断的某个固定设计点。
    • \(f_j^{*\prime}(x_{0,j})\):\(f_j^*\) 在 \(x_{0,j}\) 处的导数(假设存在且为正)。
    • \(\hat{b}r_j, \hat{b}\ell_j\):LSE拟合的常数区间在 \(x_{0,j}\) 右侧和左侧的缩放宽度。
    • \(n_j(\hat{b}r_j, \hat{b}\ell_j)\):该拟合区间内包含的观测数。
    • \(D_{\beta, \alpha}\):极限随机变量,其分布取决于 \(\beta\) 和 \(\alpha = f_j^{*\prime}(x_{0,j})\)。
    • \(L_j\):枢轴极限随机变量,其分布不依赖于 \(f_j^{*\prime}(x_{0,j})\)。
  • 模型:

    \[Y_i = \mu^* + f_1^*(x_{i,1}) + \dots + f_d^*(x_{i,d}) + \varepsilon_i, \quad i=1,\dots,n.\]
    其中 \(f_j^*\) 是 \([0,1]\) 上的非递减函数。为保证可识别性,假设 \(\sum_{i=1}^n f_j^*(x_{i,j}) = 0\) 对所有 \(j\) 成立。

  • 可观测数据:

    • 研究者能观测到的是 \(\{(X_i, Y_i)\}_{i=1}^n\),其中 \(X_i\) 是固定的格点设计,即 \(X_i\) 取自笛卡尔积 \(\mathcal{X} = \prod_{l=1}^d \mathcal{X}_l\),\(\mathcal{X}_l = \{k/n_l: k=1,\dots,n_l\}\)。
    • 想要但观测不到的是:真实的函数 \(f_j^*\)、误差 \(\varepsilon_i\)、以及导数 \(f_j^{*\prime}(x_{0,j})\)。这些只能通过模型假设和估计来推断。

第二步:最小内核——单变量保序回归

本文的核心数学困难在于处理可加性和多分量。然而,其整个证明路线本质上是将问题解耦为一系列单变量保序回归问题。因此,理解单变量保序回归的LSE及其渐近分布,就是理解本文的最小内核。

最简特例:设 \(d=1\),模型退化为标准的单变量保序回归:

\[Y_i = f^*(x_i) + \varepsilon_i, \quad i=1,\dots,n,\]
其中 \(x_i \in [0,1]\) 是固定设计点(例如 \(x_i = i/n\)),\(f^*\) 非递减。LSE \(\hat{f}\) 是如下优化问题的解:
\[\hat{f} = \arg\min_{f \text{ nondecreasing}} \sum_{i=1}^n (Y_i - f(x_i))^2.\]

核心思路:\(\hat{f}(x_0)\) 的极限分布可以通过一个min-max表征来刻画。定义累积和过程 \(F_n(t) = \frac{1}{n} \sum_{i: x_i \le t} Y_i\)。那么,\(\hat{f}(x_0)\) 等于 \(F_n\) 的最大凸包络(greatest convex minorant, GCM)在 \(x_0\) 处的左导数。这个左导数可以写成:

\[\hat{f}(x_0) = \min_{r \ge 0} \max_{\ell > 0} \frac{F_n(x_0 + r w_n) - F_n(x_0 - \ell w_n)}{(r+\ell) w_n},\]
其中 \(w_n = n^{-1/3}\) 是收敛速率。这个min-max算子的含义是:在 \(x_0\) 附近寻找一个区间 \([x_0 - \ell w_n, x_0 + r w_n]\),使得该区间内 \(Y\) 的平均值最小化(通过选择 \(r\))和最大化(通过选择 \(\ell\))达到平衡,这个平衡值就是 \(\hat{f}(x_0)\)。

为什么难:这个min-max算子是一个嵌套的、非光滑的泛函。直接证明其收敛到Chernoff分布需要复杂的随机过程理论(如Prakasa Rao的“直接方法”或Groeneboom的“逆方法”)。

本文的关键想法:作者提出了一个Switching Lemma (Lemma C.3),将上述min-max算子转化为两个独立的最大值算子之差:

\[\{\hat{f}(x_0) \le t\} = \left\{ \min_{r \ge 0} \max_{\ell > 0} \frac{F_n(x_0 + r w_n) - F_n(x_0 - \ell w_n)}{(r+\ell) w_n} \le t \right\} = \left\{ \sup_{r \ge 0} \{ -Q_n(r) + tr \} + \sup_{\ell > 0} \{ -Q_n(-\ell) - t\ell \} \le 0 \right\},\]
其中 \(Q_n(s) = w_n^{-2} \{ F_n(x_0 + s w_n) - F_n(x_0) - s w_n f^*(x_0) \}\) 是一个中心化和缩放后的累积和过程。这个转换将问题从研究一个复杂的min-max泛函,简化为研究两个独立的部分和过程的最大值。由于 \(Q_n\) 在 \(x_0\) 左右两侧的增量是独立的,这两个最大值也是独立的,从而大大简化了极限分布的推导。

在这个特例下,\(Q_n\) 弱收敛到 \(Q(s) = \sigma W(s) + \frac{f^{*\prime}(x_0)}{2} s^2\),其中 \(W\) 是双边布朗运动。那么,\(\hat{f}(x_0)\) 的极限分布就是:

\[n^{1/3}(\hat{f}(x_0) - f^*(x_0)) \rightsquigarrow \min_{r \ge 0} \max_{\ell > 0} \frac{Q(r) - Q(-\ell)}{r+\ell} = \left[ 4\sigma^2 f^{*\prime}(x_0) \right]^{1/3} C,\]
其中 \(C = \arg\min_{h \in \mathbb{R}} \{W(h) + h^2\}\) 服从Chernoff分布。这就是本文所有复杂结果背后的最小内核。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在固定格点设计下,建立了可加单调模型各分量LSE的联合渐近分布,并基于此构造了无需调参的逐点置信区间。
  2. 核心工具/方法:利用Guntuboyina and Sen (2018)的解耦引理将问题转化为单变量保序回归;提出一个Switching Lemma (Lemma C.3) 将复杂的min-max算子转化为两个独立最大值算子,简化了极限分布推导;借鉴Deng et al. (2021)的块大小标准化技术构造枢轴统计量。
  3. 主要结论:各分量LSE的极限分布由该坐标方向的设计点增长率 \(\beta_j\) 决定,分为三种形态(\(\beta_j > 1/3\):Chernoff分布;\(\beta_j < 1/3\):高斯分布;\(\beta_j = 1/3\):随机游走极限),且不同分量的估计量渐近独立。当 \(\beta_j > 1/3\) 时,基于块大小标准化的置信区间具有渐近正确的覆盖率和枢轴性;当 \(\beta_j = 1/3\) 时,该标准化失效。

关键设定与假设

  • Assumption 1 (局部光滑性):每个 \(f_j^*\) 在目标点 \(x_{0,j}\) 处可导,且导数 \(f_j^{*\prime}(x_{0,j}) > 0\)。该假设是局部线性逼近和确定收敛速率的基础。相比已有文献(如Deng et al. 2021),这是标准假设。
  • Assumption 2 (固定格点设计):设计点是完整的笛卡尔格点 \(\mathcal{X} = \prod_{l=1}^d \mathcal{X}_l\),且 \(\beta_l = \log n_l / \log n\) 固定。这是本文最关键的假设,它使得Guntuboyina and Sen (2018)的解耦引理成立,从而将多变量问题简化为单变量问题。相比随机设计(Mammen and Yu, 2007),这是一个强化的假设,但也是本文理论得以清晰建立的基础。
  • 误差假设:\(\varepsilon_i\) i.i.d., 均值为0,方差 \(\sigma^2 < \infty\)。这是标准假设。
  • 可识别性假设:\(\sum_{i=1}^n f_j^*(x_{i,j}) = 0\) 和 \(\sum_{i=1}^n \hat{f}_j(x_{i,j}) = 0\)。这是处理截距项和分量函数平移模糊性的标准做法。

主要结果

  • Theorem 2.2 (联合渐近分布):这是本文的核心理论结果。它指出,在Assumptions 1和2下,各分量LSE的标准化误差 \(w_{n,j}^{-1}(\hat{f}_j(x_{0,j}) - f_j^*(x_{0,j}))\) 联合弱收敛到一个由相互独立的随机变量 \(D_1, \dots, D_d\) 组成的向量,其中 \(D_j\) 的分布由 \(\beta_j\) 和 \(f_j^{*\prime}(x_{0,j})\) 决定(见公式(9))。
    • 技术难点:证明分量间的渐近独立性。作者通过构造一个“去重叠”的伪估计量 \(\tilde{f}_{j,c}\)(见公式(31)),该估计量使用的数据与其它分量的估计量不重叠,从而天然独立。然后证明 \(\hat{f}_{j,c}\) 与 \(\tilde{f}_{j,c}\) 的差异在渐近意义下可忽略,从而将独立性传递回原始估计量。这个证明需要精细的局部化(Proposition A.4)和矩估计(公式(37)-(38))。
  • Theorem 3.1 (枢轴极限分布):当 \(\beta_j > 1/3\) 时,有
    \[\sqrt{n_j(\hat{b}r_j, \hat{b}\ell_j)} (\hat{f}_j(x_{0,j}) - f_j^*(x_{0,j})) \rightsquigarrow \sigma L_j,\]
    其中 \(L_j\) 是一个不依赖于未知导数 \(f_j^{*\prime}(x_{0,j})\) 的枢轴分布。
    • 直觉:拟合区间的长度 \(n_j(\hat{b}r_j, \hat{b}\ell_j)\) 包含了关于局部导数的信息。当 \(\beta_j > 1/3\) 时,这个信息恰好能抵消极限分布中对导数的依赖,从而实现枢轴性。
    • 证明路线:首先证明 \((\hat{f}_j(x_{0,j}), \hat{b}r_j, \hat{b}\ell_j)\) 的联合弱收敛(公式(48)),然后通过连续映射定理得到 \(\sqrt{n_j(\hat{b}r_j, \hat{b}\ell_j)} (\hat{f}_j(x_{0,j}) - f_j^*(x_{0,j}))\) 的极限,最后通过布朗运动的缩放性质证明该极限等于 \(\sigma L_j\)。
  • Proposition 3.4 (临界情形的非枢轴性):当 \(\beta_j = 1/3\) 时,同样的标准化统计量收敛到 \(L_j^{\text{crit}}(a_j) = \sqrt{r_{a_j}^* + \ell_{a_j}^*} G_{a_j}\),其分布依赖于 \(a_j = f_j^{*\prime}(x_{0,j})\),因此不是枢轴的。
    • 证明思路:通过分析 \(a_j \to \infty\) 和 \(a_j \to 0\) 时极限分布的行为来证明其非恒常性。当 \(a_j \to \infty\) 时,极限分布趋近于高斯分布;当 \(a_j \to 0\) 时,极限分布趋近于一个非高斯的枢轴分布(与 \(\beta_j > 1/3\) 时的极限相同)。由于这两个极限不同,所以分布必然依赖于 \(a_j\)。

证明路线与技术技巧(理论型)

  • 整体路线:

    1. 解耦:利用Guntuboyina and Sen (2018)的Lemma 3.1,将可加模型LSE \(\hat{f}_j\) 转化为单变量保序回归LSE \(\hat{f}_j^{or}\) 减去一个全局均值 \(\bar{Y}\)。由于 \(\bar{Y} = O_p(n^{-1/2})\) 相对于收敛速率 \(w_{n,j}\) 可忽略,问题简化为研究 \(\hat{f}_j^{or}\)。
    2. 局部化:证明 \(\hat{f}_j^{or}(x_{0,j})\) 几乎必然等于一个“局部化”版本 \(\hat{f}_{j,c}^{or}(x_{0,j})\),后者将min-max算子的搜索范围限制在 \(x_{0,j}\) 附近的一个紧区间 \([-c, c]\) 内(Proposition A.2)。这一步将无限维优化问题转化为有限维(或紧集上的)问题。
    3. Switching Lemma:应用Lemma C.3,将局部化后的min-max算子转化为两个独立的最大值算子之差。这步是技术核心,它将一个复杂的嵌套泛函问题分解为两个更简单的、关于部分和过程的问题。
    4. 过程收敛:证明中心化和缩放后的累积和过程 \(Q_n(s)\) 弱收敛到 \(Q(s) = \sigma W(s) + \frac{f_j^{*\prime}(x_{0,j})}{2} s^2\)(Lemma C.1)。这需要建立有限维分布收敛和 tightness。
    5. 连续映射定理:将Switching Lemma和过程收敛结合起来,得到局部化估计量的极限分布。然后通过“converging together”引理(Lemma C.4)将局部化结果推广到原始估计量。
    6. 联合独立性:通过构造“去重叠”的伪估计量,证明不同分量的局部化估计量渐近独立,从而得到联合渐近分布。
    7. 推断:对于 \(\beta_j > 1/3\),证明 \((\hat{f}_j(x_{0,j}), \hat{b}r_j, \hat{b}\ell_j)\) 的联合弱收敛,然后通过连续映射定理得到枢轴极限分布。
  • 关键跳跃点:

    • Switching Lemma (Lemma C.3):这是整个证明中最具原创性的技巧。它将一个看似无法直接处理的min-max泛函转化为两个独立的最大值,极大地简化了后续分析。这个引理本身可能具有独立价值,可用于其他涉及min-max算子的统计问题。
    • 局部化下界的证明 (Proposition A.4):为了证明分量间的渐近独立性,需要证明拟合区间的宽度 \(\hat{b}r_j\) 和 \(\hat{b}\ell_j\) 不仅不能太大(Proposition A.2),也不能太小(即不能小于 \(c^{-\gamma}\))。证明后者需要精细地控制噪声项,并利用导数 \(f_j^{*\prime}(x_{0,j}) > 0\) 来确保当区间过小时,确定性趋势(bias)会主导随机噪声,从而使得这样的区间不可能成为最优解。
  • 技术技巧点名:

    • Empirical process / Chaining:用于控制噪声项在区间上的最大值(Lemma C.2),证明局部化。
    • Doob's inequality:用于控制部分和过程的最大值,是Lemma C.2证明的核心。
    • Continuous mapping theorem:用于从过程收敛推导泛函的收敛。
    • Converging together lemma (Lemma C.4):用于将局部化结果推广到全局。
    • Characteristic function:用于证明分量间的渐近独立性(公式(33)-(40))。
    • Brownian scaling:用于将极限分布化简为枢轴形式(Theorem 3.1证明的最后部分)。
    • Reflection principle:用于控制布朗运动的最大值分布(Proposition A.4证明)。

真实例子与应用

本文为纯理论论文,没有真实数据例子。但包含数值模拟(Section 4),用于验证理论结果: * 验证渐近分布 (Section 4.1): * 数据:模拟生成 \(Y_i = f_1^*(x_{i,1}) + f_2^*(x_{i,2}) + \varepsilon_i\),其中 \(f_1^*(x) = x^2\)(中心化后),\(f_2^*(x) = x\)(中心化后),\(\varepsilon_i \sim N(0,1)\)。 * 方法:计算LSE \(\hat{f}_1\),并绘制 \(n^{1/3}(\hat{f}_1(x_{0,1}) - f_1^*(x_{0,1}))\) 的经验CDF。 * 结果:图1a显示,即使在小样本(25x25格点)下,经验分布也接近理论上的Chernoff分布。图1b的QQ图验证了不同分量LSE具有相同的极限分布。图1c验证了临界情形 \(\beta_1 = 1/3\) 下的随机游走极限。 * 目的:验证Theorem 2.2中关于极限分布的理论预测。 * 验证置信区间 (Section 4.2): * 数据:同上,格点大小100x100。 * 方法:构造95%置信区间(公式(5)),计算覆盖率和区间长度。 * 结果:图2a显示,在远离边界的设计点处,覆盖率接近95%。图2b显示,所提置信区间的长度接近基于真实导数的“oracle”区间长度。 * 目的:验证Theorem 3.1和Corollary 3.2中关于置信区间的理论。 * 验证临界情形的非枢轴性 (Section 4.3): * 数据:模拟 \(\beta_1 = 1/3\) 的情形(\(n_1=200, n_2=40000\)),并考虑两种不同的导数:\(f_1^{*\prime}(x_{0,1}) = 0.003\) 和 \(10\)。 * 方法:计算标准化统计量 \(\sqrt{n_1(\hat{b}r_1, \hat{b}\ell_1)} (\hat{f}_1(x_{0,1}) - f_1^*(x_{0,1}))\) 的直方图。 * 结果:图2c显示,两种导数下的直方图形状和散布明显不同,直观地证明了Proposition 3.4中“非枢轴性”的结论。 * 目的:验证Proposition 3.4的理论预测。

🔎 结论是否比证明窄

  • 是。作者在Remark 2.4中明确指出,本文的证明严格依赖于固定格点设计,不能直接推广到随机设计。然而,在引言和讨论中,作者将本文定位为“首次建立固定格点设计下的极限分布”,这个结论是准确的,没有过度泛化。
  • 另一个潜在窄化点是导数 \(f_j^{*\prime}(x_{0,j}) > 0\) 的假设。如果导数为0,收敛速率和极限分布都会改变。作者在Assumption 1中明确假设了这一点,因此结论不适用于导数为0或不存在的情形。
  • 作者在Section 5中坦诚地列出了开放问题,包括随机设计、临界情形的推断等,这表明作者对结论的局限性有清晰的认识。

四、开放问题

  1. 随机设计下的渐近分布:本文结果严格依赖于固定格点设计。在随机设计下,分量LSE不再能干净解耦,且Mammen and Yu (2007)的Oracle性质证明存在缺口。建立随机设计下可加单调模型LSE的渐近分布理论是一个重要的开放问题。(扎根于:Remark 2.4, Section 5)

  2. 临界增长率 \(\beta_j = 1/3\) 下的枢轴置信区间:Proposition 3.4证明Deng et al. (2021)的块大小标准化在 \(\beta_j = 1/3\) 时失效。是否存在另一种基于LSE的、无需调参的标准化方法,能在该临界情形下构造出枢轴置信区间?(扎根于:Proposition 3.4, Section 5)

  3. 自适应于 \(\beta_j\) 的推断程序:Remark 3.5给出了一个在 \(\beta_j \le 1/3\) 时有效且率最优的边际条带平均法,但该方法在 \(\beta_j > 1/3\) 时效率低下。能否构造一个统一的推断程序,无需事先知道 \(\beta_j\) 所属的渐近机制,就能自动达到率最优且有效?(扎根于:Remark 3.5, Section 5)

  4. 高维情形:本文考虑固定维度 \(d\)。当 \(d\) 随 \(n\) 增长时,可加单调模型的LSE性质(如收敛速率、变量选择)如何?将本文的理论推广到高维稀疏可加单调模型是一个自然的方向。(扎根于:本文的设定是固定 \(d\),且引言中提到了Fang and Meinshausen (2012)的高维工作,但本文未涉及高维渐近理论。)


Maintained by 陈星宇 · Homepage · Source on GitHub

评论