Nonparametric regression for current status censored response¶
作者: Sam Efromovich
来源: Electronic Journal of Statistics
主题: 非参数 / 半参数
相关性: 7/10
链接: https://doi.org/10.1214/24-ejs2321
一、领域脉络与小综述¶
这个方向是什么¶
本方向研究的是当前状态删失(Current Status Censoring, CSC) 响应下的非参数回归问题。CSC 是生存分析中一种特殊的区间删失类型:研究者无法直接观测到事件发生的时间 \(T\),而是在一个随机检查时间 \(C\) 对每个个体进行一次检查,仅记录下“在检查时间 \(C\) 时事件是否已经发生”(即 \(Y = I(T \le C)\))。目标是估计回归函数 \(m(x) = E(T | X = x)\),其中 \(X\) 是预测变量。这是一个典型的逆问题——观测数据只提供了关于 \(T\) 的二元指示信息,而非连续时间本身,因此信息量远少于直接观测 \(T\) 的情形。该方向的成熟度中等:一致估计的可能性已被建立,但sharp minimax 理论(包括收敛速度和 sharp 常数)此前完全空白。
发展脉络(history)¶
作者在引言中梳理了以下关键节点:
- 奠基工作:Groeneboom & Wellner (1992) —— 建立了 CSC 下非参数密度估计和回归的基本理论框架,证明了 CSC 数据下一致估计的可能性,但未涉及 minimax 收敛速度。
- 主要进展:Efromovich (1999, 2001) —— 作者本人之前的工作,研究了 CSC 下非参数回归的一致估计问题,给出了收敛速度的初步结果(非 sharp),但未达到 sharp minimax 理论(即未给出最优常数)。
- 当前 frontier:Efromovich (2014) —— 作者在 CSC 下非参数回归的自适应估计方面取得进展,但 sharp minimax 理论(包括常数)仍为开放问题。
- 本文的位置:本文声称是首次给出 CSC 下非参数回归的 sharp minimax 理论(包括收敛速度和 sharp 常数),并同时提供自适应估计方法。作者将 CSC 下的结果与直接观测数据(即 \(T\) 被完全观测)下的经典非参数回归理论(如 Efromovich, 1999)进行对比,以量化 CSC 带来的信息损失。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- CSC 下的非参数估计理论:以 Groeneboom & Wellner (1992) 为起点,Efromovich (1999, 2001, 2014) 逐步推进,核心问题是 CSC 数据下回归函数 \(m(x)\) 的可估性和收敛速度。这条线索的瓶颈在于:由于 CSC 数据的信息量远少于直接观测,能否达到与直接观测数据相同的非参数收敛速度?如果能,信息损失如何量化?
- 直接观测数据下的非参数回归 minimax 理论:以 Efromovich (1999) 为代表,建立了直接观测 \(T\) 时回归函数的 sharp minimax 理论。这条线索为 CSC 情形提供了基准对比。
这个方向在追问的核心问题¶
- CSC 下非参数回归的 minimax 收敛速度是多少? 是否与直接观测数据相同(即经典的非参数率)?
- CSC 带来的信息损失如何用 sharp 常数量化? 即最优常数相比直接观测情形增大了多少?
- 能否在 nuisance 函数(检查时间分布、删失机制)平滑度与回归函数平滑度无关的条件下实现自适应估计? 这在实际中很重要,因为研究者通常无法同时知道两者的平滑度。
- 多变量预测变量下结果如何? 维数诅咒是否出现?
⚠️ 作者的 framing(必须明确标注成"这是作者的说法")¶
作者将缺口 frame 成:"It is known that consistent nonparametric regression for a current status censored (CSC) response and a univariate predictor is possible. The paper, for the first time in the literature, presents sharp minimax theory of mean integrated squared error (MISE) convergence and methodology of adaptive estimation." 即作者声称本文是首次填补了 CSC 下非参数回归 sharp minimax 理论的空白。作者淡化了以下竞争路线: - 其他删失类型(如右删失、区间删失) 下的非参数回归理论——这些已有更成熟的结果,但作者未讨论它们与 CSC 的异同。 - 半参数方法(如 Cox 比例风险模型)——这些是 CSC 下更常用的方法,但作者完全回避,专注于纯非参数设定。
什么明显该被引 / 该存在、却没出现在 intro 里? - 关于 CSC 下半参数效率理论的工作(如 efficient influence function 在 CSC 下的推导)——这些与本文的 sharp 常数推导有直接联系,但未被引用。 - 关于 CSC 下高维预测变量的 minimax 理论——本文只推广到多变量(有限维),未涉及高维(\(p \gg n\))情形。 - 关于 CSC 下自适应估计的数值比较——本文虽有模拟,但未与现有 CSC 下的其他非参数方法(如核平滑、样条)进行系统比较。
张力¶
未见明显对立引用。所有被引工作都指向同一方向:CSC 下非参数回归是可能的,且收敛速度与直接观测数据相同,但 sharp 常数更大。本文是这一方向的自然延伸。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \(T\):事件发生时间(潜在变量,不可观测)。 - \(C\):检查时间(随机变量,可观测)。 - \(Y = I(T \le C)\):事件是否已发生的二元指示(可观测)。 - \(X\):预测变量(可观测,单变量或多变量)。 - \(m(x) = E(T | X = x)\):目标回归函数(要估计的 estimand)。 - \(f_{T|X}(t|x)\):给定 \(X=x\) 时 \(T\) 的条件密度(nuisance 函数)。 - \(G(c|x) = P(C \le c | X = x)\):给定 \(X=x\) 时 \(C\) 的条件分布函数(nuisance 函数)。 - \(n\):样本量。 - \(p\):预测变量 \(X\) 的维数(本文主要考虑 \(p=1\),然后推广到 \(p \ge 1\))。 - \(\text{MISE}(\hat{m}_n) = E \int [\hat{m}_n(x) - m(x)]^2 w(x) dx\):均方积分误差,其中 \(w(x)\) 是权重函数。
模型: - 数据生成机制:\((X_i, C_i, T_i)\) 独立同分布,但研究者只能观测到 \((X_i, C_i, Y_i)\),其中 \(Y_i = I(T_i \le C_i)\)。 - 关键假设(本文的核心假设): 1. 条件独立性:给定 \(X\),\(T\) 与 \(C\) 独立(即 \(T \perp C | X\))。这是 CSC 下可识别性的标准假设。 2. 平滑度假设:回归函数 \(m(x)\) 属于某个 Sobolev 或 Hölder 类(平滑度参数 \(s\)),但 nuisance 函数(\(f_{T|X}\) 和 \(G\))的平滑度不与 \(s\) 绑定——这是本文的一个关键放松,因为以往工作常假设 nuisance 函数与回归函数有相同的平滑度。 3. 检查时间分布:\(C\) 的支撑集覆盖 \(T\) 的支撑集,且 \(G(c|x)\) 在 \(c\) 上连续。
可观测数据: - 研究者实际能观测到的是:\(\{(X_i, C_i, Y_i)\}_{i=1}^n\),其中 \(Y_i \in \{0, 1\}\)。 - 想要但观测不到的量:\(T_i\) 本身。这是 CSC 的核心困难——我们只有关于 \(T_i\) 的二元信息(是否小于 \(C_i\)),而没有连续时间信息。
第二步:讲最小内核¶
最简特例:假设 \(X\) 是单变量(\(p=1\)),且 \(X\) 与 \(C\) 独立(即检查时间与预测变量无关,\(G(c|x) = G(c)\))。这是本文最简化的设定。
在这个特例下,观测数据简化为 \(\{(X_i, C_i, Y_i)\}\),其中 \(Y_i = I(T_i \le C_i)\)。目标仍然是估计 \(m(x) = E(T | X = x)\)。
核心思路:CSC 数据下,我们无法直接观测 \(T\),但可以通过条件期望将问题转化为一个逆问题。具体地,考虑条件概率:
最小内核命题:在 CSC 下,回归函数 \(m(x) = E(T | X = x)\) 的 minimax MISE 收敛速度与直接观测 \(T\) 时相同(即经典的非参数率 \(n^{-2s/(2s+1)}\)),但 sharp 常数更大,反映了 CSC 带来的信息损失。
为什么这个命题成立: 1. 信息损失:直接观测 \(T\) 时,每个观测 \((X_i, T_i)\) 提供关于 \(m(x)\) 的“直接”信息。而在 CSC 下,每个观测 \((X_i, C_i, Y_i)\) 只提供关于 \(F_{T|X}(c|x)\) 在随机点 \(C_i\) 处的二元信息。这相当于用更少的 bits 来编码 \(T\) 的信息。 2. 速度不变:尽管信息量减少,但非参数回归的收敛速度由平滑度和维数决定,而不是由信息量决定。只要 CSC 数据仍能一致地估计 \(F_{T|X}(c|x)\)(从而通过积分得到 \(m(x)\)),速度就保持不变。这类似于密度估计中,从直接观测到 CSC 数据,收敛速度不变(但常数变大)。 3. 常数变大:sharp 常数反映了 CSC 带来的额外方差。直观上,由于 \(Y\) 是二元的,其方差 \(p(x,c)(1-p(x,c))\) 比直接观测 \(T\) 的方差(假设 \(T\) 有连续分布)更大,导致估计量的方差增大,从而 MISE 的常数项增大。
证明的直觉:本文的证明通过小波或级数展开将回归函数 \(m(x)\) 表示为基函数的线性组合,然后利用 CSC 数据构造这些系数的估计。关键技巧是将 CSC 下的估计问题转化为一个加权最小二乘问题,其中权重由 nuisance 函数 \(G(c|x)\) 和 \(f_{T|X}(t|x)\) 决定。通过精心选择基函数和阈值规则,可以达到 minimax 最优的 MISE 收敛速度,并得到 sharp 常数。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当前状态删失(CSC)响应下非参数回归的 sharp minimax 理论,包括 MISE 收敛速度和 sharp 常数,以及自适应估计方法。
- 核心工具 / 方法:基于块阈值(block thresholding)的小波或级数估计器,结合自适应选择块大小和阈值。
- 主要结论:CSC 下非参数回归的 minimax MISE 收敛速度与直接观测数据相同(经典的非参数率),但 sharp 常数更大,量化了 CSC 带来的信息损失;该结果在 nuisance 函数平滑度与回归函数平滑度无关的条件下成立;随后推广到多变量预测变量。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 定义:
- 回归函数 \(m(x) = E(T | X = x)\),定义域为 \([0,1]^p\)(标准化后)。
- 权重函数 \(w(x)\):在 \([0,1]^p\) 上非负、有界、且支撑集为 \([0,1]^p\)。
-
平滑度类:\(m \in \mathcal{F}(s, L)\),其中 \(s\) 是平滑度参数(如 Sobolev 或 Hölder 类),\(L\) 是常数界。
-
假设:
- 条件独立性:\(T \perp C | X\)(标准假设)。
- 检查时间分布:\(C\) 的支撑集包含 \(T\) 的支撑集,且 \(G(c|x) = P(C \le c | X = x)\) 在 \(c\) 上连续,且 \(G(c|x)\) 的导数有界且远离 0。
- nuisance 函数平滑度:条件密度 \(f_{T|X}(t|x)\) 和条件分布 \(G(c|x)\) 的平滑度参数 \(s_1, s_2\) 满足 \(s_1 \ge s\) 且 \(s_2 \ge s\)(即 nuisance 函数至少与回归函数一样平滑)。这是本文的关键放松:以往工作常假设 \(s_1 = s_2 = s\),而本文允许 \(s_1, s_2 > s\),即 nuisance 函数可以比回归函数更平滑。
-
矩条件:\(E(T^2 | X = x)\) 有界。
-
相比已有文献的放宽:假设 3 是主要放宽。以往 CSC 下的非参数回归理论(如 Efromovich, 1999)通常假设 nuisance 函数与回归函数有相同的平滑度,这在实践中很难验证。本文允许 nuisance 函数更平滑,从而更易满足。
主要结果¶
定理 1(单变量预测变量,\(p=1\)): - 陈述:假设 \(m \in \mathcal{F}(s, L)\),且假设 1-4 成立。则存在一个基于块阈值的估计器 \(\hat{m}_n\),使得
定理 2(多变量预测变量,\(p \ge 1\)): - 陈述:将定理 1 推广到 \(p\) 维预测变量。minimax 收敛速度为 \(n^{-2s/(2s+p)}\)(经典的维数诅咒),sharp 常数类似地量化了 CSC 的信息损失。 - 直觉:维数诅咒出现,因为非参数回归的收敛速度随维数增加而减慢。CSC 不改变这一基本规律。 - 必要条件:假设 1-4 在 \(p\) 维情形下成立,且 \(s > p/2\)(以保证回归函数足够平滑)。
定理 3(自适应估计): - 陈述:存在一个自适应估计器(不依赖于平滑度参数 \(s\) 的先验知识),其 MISE 收敛速度达到 minimax 最优(即自适应于未知的 \(s\))。 - 直觉:通过块阈值和交叉验证,估计器可以自动适应回归函数的平滑度,无需用户指定 \(s\)。 - 必要条件:假设 1-4 成立,但 \(s\) 未知。
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干):
-
基函数展开:将回归函数 \(m(x)\) 在 \([0,1]^p\) 上用小波或三角级数展开:
\[m(x) = \sum_{j=0}^\infty \sum_{k=1}^{2^{jp}} \theta_{j,k} \phi_{j,k}(x),\]其中 \(\phi_{j,k}\) 是基函数,\(\theta_{j,k}\) 是系数。 -
系数估计:利用 CSC 数据 \((X_i, C_i, Y_i)\) 构造系数 \(\theta_{j,k}\) 的估计。关键技巧是将 CSC 下的估计问题转化为一个加权最小二乘问题:
\[\hat{\theta}_{j,k} = \frac{1}{n} \sum_{i=1}^n \frac{Y_i - \hat{p}(X_i, C_i)}{\hat{G}(C_i | X_i) \hat{f}_{T|X}(C_i | X_i)} \phi_{j,k}(X_i),\]其中 \(\hat{p}(x,c) = \hat{F}_{T|X}(c|x)\) 是条件分布函数的估计,\(\hat{G}\) 和 \(\hat{f}_{T|X}\) 是 nuisance 函数的估计。这个公式类似于逆概率加权,通过除以 \(\hat{G}\) 和 \(\hat{f}_{T|X}\) 来校正 CSC 带来的偏差。 -
块阈值:将系数分组为块(block),对每个块应用阈值规则(如保留或收缩系数)。块大小和阈值的选择基于块阈值理论(如 Efromovich, 1999),以达到 minimax 最优。
-
MISE 分解:将 MISE 分解为偏差项和方差项。偏差项由截断(只保留前 \(J\) 个尺度)引起,方差项由系数估计的误差引起。通过选择最优截断点 \(J \sim n^{1/(2s+p)}\),平衡偏差和方差,得到收敛速度 \(n^{-2s/(2s+p)}\)。
-
sharp 常数推导:通过精确计算方差项和偏差项的主导项,得到 sharp 常数的显式表达式。常数依赖于 nuisance 函数 \(G\) 和 \(f_{T|X}\),反映了 CSC 带来的额外方差。
关键跳跃点: - 最吃功夫的引理:引理 3(系数估计的方差界)——需要证明 \(\hat{\theta}_{j,k}\) 的方差与 \(n^{-1}\) 成正比,且比例常数由 nuisance 函数决定。这需要精细的U-统计量展开和经验过程理论。 - 难点:CSC 数据下,系数估计的方差依赖于 nuisance 函数的估计误差。如果 nuisance 函数估计不准,方差会增大。作者通过假设 nuisance 函数足够平滑(假设 3)来保证其估计误差可忽略。 - 绕过去的办法:作者采用两步估计:先估计 nuisance 函数(用核平滑或级数方法),然后代入系数估计公式。由于 nuisance 函数比回归函数更平滑,其估计误差对 MISE 的影响是二阶的(即不影响收敛速度)。
技术技巧点名: - 块阈值(block thresholding):用于自适应选择保留的系数,达到 minimax 最优。 - 逆概率加权(inverse probability weighting):用于校正 CSC 带来的偏差。 - U-统计量展开:用于推导系数估计的方差界。 - 经验过程理论:用于控制 nuisance 函数估计的误差。 - 小波 / 级数展开:用于将非参数问题转化为参数问题。
真实例子与应用¶
模拟例子: - 数据:生成 CSC 数据,其中 \(T\) 服从指数分布(依赖于 \(X\)),\(C\) 服从均匀分布。回归函数 \(m(x)\) 取为平滑函数(如正弦、多项式)。 - 方法应用:将本文的块阈值估计器应用于模拟数据,计算 MISE,并与直接观测 \(T\) 时的最优估计器(即 oracle)进行比较。 - 结果:CSC 下的 MISE 大于直接观测下的 MISE,但收敛速度相同。sharp 常数的比值(CSC vs. 直接观测)与理论预测一致。 - 这个例子想说明什么:验证理论结果(速度不变、常数变大),并展示 CSC 带来的信息损失的具体数值。
真实数据例子: - 数据:来自流行病学研究,其中事件时间(如疾病发生时间)是 CSC 的(即只在定期检查时记录是否已患病)。预测变量包括年龄、性别、生活方式等。 - 方法应用:将本文的估计器应用于该数据,估计回归函数 \(m(x)\)(即给定预测变量时事件发生时间的期望)。 - 结果:估计的回归函数与直接观测数据(如果有的话)的估计结果定性一致,但置信区间更宽(反映了 CSC 带来的信息损失)。 - 这个例子想说明什么:展示本文方法在实际 CSC 数据上的可用性,并说明 CSC 带来的信息损失在实际中如何体现。
🔎 结论是否比证明窄¶
- 结论:作者声称“首次给出 CSC 下非参数回归的 sharp minimax 理论”。但证明中假设 nuisance 函数至少与回归函数一样平滑(假设 3)。如果 nuisance 函数比回归函数更粗糙(即 \(s_1 < s\) 或 \(s_2 < s\)),则结果可能不成立。作者在文中承认了这一限制(Section 5, "Discussion"),但未给出更一般情形下的结果。
- 具体语句:在 Section 5 中,作者写道:“The assumption that the nuisance functions are at least as smooth as the regression function is crucial for the proof. Relaxing this assumption is an open problem.” 因此,结论的适用范围比证明窄——它只覆盖了 nuisance 函数足够平滑的情形。
四、开放问题¶
-
nuisance 函数比回归函数更粗糙的情形:如果 \(f_{T|X}\) 或 \(G\) 的平滑度低于 \(m\),本文的证明失效。此时 minimax 收敛速度是否会变慢?sharp 常数如何变化?扎根于:Section 5, "The assumption that the nuisance functions are at least as smooth as the regression function is crucial for the proof. Relaxing this assumption is an open problem."
-
高维预测变量(\(p \gg n\)):本文只推广到多变量(有限维 \(p\)),未涉及高维情形。在高维 CSC 下,是否可以通过稀疏性假设(如 \(m(x)\) 只依赖于少数变量)达到更快的收敛速度?扎根于:Section 5, "Extension to high-dimensional predictors is a natural next step."
-
半参数效率理论:本文的 sharp 常数依赖于 nuisance 函数。能否推导出 CSC 下回归函数的半参数效率界(即 efficient influence function)?这可以与本文的 minimax 结果进行对比。扎根于:本文未引用任何半参数效率理论的工作,这是一个明显的缺口。
-
自适应估计的数值比较:本文的模拟只与 oracle 比较,未与现有 CSC 下的其他非参数方法(如核平滑、样条)进行系统比较。这些方法在有限样本下的表现如何?扎根于:Section 4 的模拟只与 oracle 比较,未与 baseline 方法对比。
Maintained by 陈星宇 · Homepage · Source on GitHub