跳转至

Fast Lasso method for large-scale and ultrahigh-dimensional Cox model with applications to UK Biobank

作者: Ruilin Li, Christopher Chang, Johanne M Justesen, Yosuke Tanigawa, Junyang Qian et al.
主题: 统计计算 / 算法
相关性: 5/10
链接: https://doi.org/10.1093/biostatistics/kxaa038


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:如何在大规模(样本量百万级)、超高维(特征数百万级)的生存数据上,高效地求解带 Lasso 惩罚的 Cox 比例风险模型。核心矛盾在于:经典的坐标下降法(如 glmnet)需要将整个设计矩阵载入内存,当数据规模超过内存容量时,算法无法运行;同时,超高维特征使得全路径求解的计算量不可接受。当前成熟度:方法层面已有若干尝试(如迭代筛选、随机梯度下降),但缺乏一个同时满足内存友好、全路径输出、可扩展至百万级特征的通用算法。

发展脉络(history)

作者在 intro 中引用的工作串成以下脉络:

  1. 奠基工作
  2. Tibshirani (1997):首次提出 Lasso-Cox 模型,将 L1 惩罚引入 Cox 偏似然,奠定了高维生存分析的基础。但当时的数据规模远小于今日,算法(坐标下降)在小规模数据上可行。
  3. Friedman, Hastie & Tibshirani (2010):开发了 glmnet 包,用坐标下降法高效求解 Lasso 路径,成为标准工具。但 glmnet 要求整个设计矩阵在内存中,且每次迭代扫描所有特征,对超高维数据不适用。

  4. 主要进展——内存友好策略

  5. Tibshirani et al. (2012):提出“强规则”(strong rule)筛选,在坐标下降前先丢弃大量系数为零的特征,减少计算量。但强规则本身需要一次全数据扫描,且可能漏掉非零特征(需后续检查)。
  6. Qian et al. (2019):提出 Batch Screening Iterative Lasso (BASIL) 方法,用于线性回归和逻辑回归。核心思想:迭代地筛选变量(基于当前残差与特征的边际相关性)→ 在筛选后的子集上求解 Lasso → 检查是否遗漏重要变量 → 重复。BASIL 的关键优势是内存友好:每次只载入筛选后的特征子集,而非全数据。本文正是将 BASIL 从广义线性模型推广到 Cox 模型。

  7. 当前 frontier

  8. UK Biobank 规模的数据:样本量约 50 万,基因型特征数可达数百万(SNP 位点)。现有方法(如 PLINK 的 Cox 回归)只能处理单变量检验,无法做多变量 Lasso 选择。
  9. 本文的位置:作者将 BASIL 框架适配到 Cox 偏似然,解决了两个关键挑战:(a) Cox 模型的“残差”不是简单的线性残差,而是基于当前系数估计的偏似然得分(score function);(b) 筛选准则需要从线性回归的边际相关性推广到 Cox 模型的边际得分统计量。本文声称这是第一个能在 UK Biobank 规模数据上输出完整 Lasso 路径的 Cox 模型算法。

子线索聚类

这些被引文献大致落在 3 条子线索上:

  • 线索 1:Lasso 路径求解算法(Friedman et al. 2010, Tibshirani et al. 2012, Qian et al. 2019)—— 关注如何高效计算 Lasso 的全路径解,核心工具是坐标下降和筛选规则。本文属于此线索的直接延伸。
  • 线索 2:高维生存分析(Tibshirani 1997, Simon et al. 2011)—— 关注 Cox 模型在高维设定下的统计性质(变量选择一致性、预测性能)。本文不涉及统计性质证明,只关注计算。
  • 线索 3:大规模遗传数据分析(PLINK2 开发团队, UK Biobank 数据描述)—— 关注如何将统计方法部署到遗传学数据管道中。本文的 snpnet-Cox 实现直接集成到 PLINK2,属于此线索。

这个方向在追问的核心问题

  1. 如何设计筛选准则:在 Cox 模型中,哪些统计量能有效识别“可能非零”的特征,同时保证不遗漏重要变量?(本文用边际得分统计量)
  2. 如何保证筛选的统计一致性:筛选后的子集是否以高概率包含真实非零特征?需要什么条件(如 irrepresentable condition)?
  3. 如何平衡计算效率与统计精度:筛选步骤引入的近似误差是否可控?是否影响最终 Lasso 路径的准确性?
  4. 如何扩展到其他生存模型:如竞争风险模型、时变系数模型?

已知瓶颈:BASIL 类方法的理论保证(筛选一致性)在 Cox 模型下尚未建立;现有分析仅针对线性回归(Qian et al. 2019 的定理 1 给出了线性模型下的筛选一致性界)。Cox 模型的非线性偏似然使得理论分析更复杂。

⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)

  • 作者把缺口 frame 成:“现有 Lasso-Cox 求解器(如 glmnet)无法处理 UK Biobank 规模的数据,因为内存限制和计算时间不可接受。BASIL 方法在 GLM 上已成功,但尚未推广到 Cox 模型。本文填补了这一空白。” —— 这是作者的说法。
  • 被淡化或回避的竞争路线
  • 随机梯度下降(SGD)类方法:如 proximal SGD 或 SVRG,也可以处理内存外数据,但作者在 intro 中未提及。可能原因是 SGD 难以输出完整 Lasso 路径(需要多次调参),且收敛速度对步长敏感。
  • 分块坐标下降(block coordinate descent):将特征分块,每次只载入一块到内存。作者未讨论这种策略的可行性。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
  • “screening + Lasso” 的理论分析:如 Fan & Lv (2008) 的 Sure Independence Screening (SIS) 理论,以及后续的迭代筛选理论(如 ISIS)。这些工作直接相关,但作者只引了 BASIL 的原始论文(Qian et al. 2019),未引 SIS 系列。值得研究者去查:SIS 理论是否能为 BASIL-Cox 的筛选一致性提供基础?
  • 高维 Cox 模型的 minimax 率:如 Huang et al. (2013) 关于 Lasso-Cox 的变量选择一致性结果。作者未引,可能是因为本文是纯计算方法论文,不涉及统计性质。

张力

未见明显对立引用。所有被引工作都指向“需要更高效的 Lasso-Cox 求解器”这一共识,只是方法路径不同(坐标下降 vs. 筛选迭代)。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( n \):样本量(个体数)。 - \( p \):特征数(SNP 位点数),超高维意味着 \( p \gg n \)。 - \( \mathbf{X} \in \mathbb{R}^{n \times p} \):设计矩阵,第 \( i \)\( \mathbf{x}_i \in \mathbb{R}^p \) 是个体 \( i \) 的特征向量。 - \( (T_i, C_i) \):第 \( i \) 个个体的潜在生存时间(failure time)和删失时间(censoring time)。实际观测到的是 \( Y_i = \min(T_i, C_i) \) 和事件指示 \( \delta_i = I(T_i \leq C_i) \)。 - \( \mathcal{R}(t) = \{ i : Y_i \geq t \} \):在时间 \( t \) 的风险集(risk set)。 - \( \beta \in \mathbb{R}^p \):回归系数向量,是待估参数。 - \( \lambda \):Lasso 正则化参数,控制惩罚强度。 - \( \ell(\beta) \):Cox 偏似然函数(partial likelihood),具体形式见下。 - \( \ell_\lambda(\beta) = \ell(\beta) - \lambda \|\beta\|_1 \):带 L1 惩罚的偏似然(目标函数)。

模型: Cox 比例风险模型假设个体 \( i \) 的风险函数为:

\[h_i(t) = h_0(t) \exp(\mathbf{x}_i^\top \beta)\]
其中 \( h_0(t) \) 是基线风险函数,不依赖于个体特征。模型不假设 \( h_0(t) \) 的参形式,属于半参数模型。估计 \( \beta \) 时,通过最大化偏似然来消去 \( h_0(t) \)
\[\ell(\beta) = \sum_{i: \delta_i=1} \left[ \mathbf{x}_i^\top \beta - \log \sum_{j \in \mathcal{R}(Y_i)} \exp(\mathbf{x}_j^\top \beta) \right]\]
偏似然只依赖于风险集的排序,不依赖于基线风险的具体形式。

可观测数据: 研究者实际能观测到的是 \( \{ (Y_i, \delta_i, \mathbf{x}_i) \}_{i=1}^n \)。其中: - \( Y_i \) 是观测到的生存时间(可能被删失)。 - \( \delta_i \) 是事件指示(1=事件发生,0=删失)。 - \( \mathbf{x}_i \) 是特征向量(如基因型编码为 0/1/2)。

想要但观测不到的量: - 基线风险函数 \( h_0(t) \) —— 被偏似然消去,不需要估计。 - 潜在生存时间 \( T_i \) 和删失时间 \( C_i \) 的联合分布 —— 需要假设独立删失(即 \( T_i \perp C_i \mid \mathbf{x}_i \)),这是 Cox 模型的标准假设。

第二步:讲最小内核

本文的核心思路是 BASIL 框架从线性模型到 Cox 模型的推广。为了看清这个推广的本质,我们考虑一个最简特例:假设只有两个正则化参数 \( \lambda_1 > \lambda_2 \)(即 Lasso 路径只有两步),且特征数 \( p \) 极大(无法全部载入内存)。

最简特例下的问题: 给定 \( \lambda_1 \)(较大的惩罚),我们希望求解:

\[\hat{\beta}(\lambda_1) = \arg\min_\beta \left[ -\ell(\beta) + \lambda_1 \|\beta\|_1 \right]\]
然后以 \( \hat{\beta}(\lambda_1) \) 为 warm start,求解 \( \lambda_2 \) 下的解 \( \hat{\beta}(\lambda_2) \)

经典方法(glmnet): 1. 将整个 \( \mathbf{X} \) 载入内存。 2. 对每个 \( \lambda \),用坐标下降迭代所有 \( p \) 个特征,直到收敛。 3. 当 \( p \) 极大时,每次迭代扫描 \( p \) 个特征的计算量是 \( O(np) \),且内存无法容纳 \( \mathbf{X} \)

BASIL 方法的核心想法: 1. 筛选步骤:在求解 \( \lambda_1 \) 之前,先计算每个特征 \( j \)边际得分统计量

\[S_j = \left| \frac{\partial \ell(\beta)}{\partial \beta_j} \Big|_{\beta=0} \right| = \left| \sum_{i: \delta_i=1} \left[ x_{ij} - \frac{\sum_{k \in \mathcal{R}(Y_i)} x_{kj} \exp(\mathbf{x}_k^\top 0)}{\sum_{k \in \mathcal{R}(Y_i)} \exp(\mathbf{x}_k^\top 0)} \right] \right|\]
\( \beta=0 \) 时,\( \exp(\mathbf{x}_k^\top 0) = 1 \),所以:
\[S_j = \left| \sum_{i: \delta_i=1} \left[ x_{ij} - \frac{1}{|\mathcal{R}(Y_i)|} \sum_{k \in \mathcal{R}(Y_i)} x_{kj} \right] \right|\]
这实际上是每个事件时间点,特征 \( j \) 的个体值与风险集均值的偏差之和。直观\( S_j \) 越大,特征 \( j \) 与生存时间的边际关联越强。

  1. 筛选规则:只保留 \( S_j \) 最大的前 \( m \) 个特征(\( m \) 是预设的 batch size,如 1000),其余特征暂时视为系数为零。

  2. 求解步骤:在筛选后的 \( m \) 个特征上,用坐标下降求解 Lasso 路径(从 \( \lambda_1 \)\( \lambda_2 \))。此时设计矩阵只有 \( n \times m \) 维,可以载入内存。

  3. 检查步骤:求解完成后,用当前系数估计 \( \hat{\beta} \) 计算所有 \( p \) 个特征的得分统计量 \( S_j(\hat{\beta}) \)。如果某个未被筛选的特征的得分超过阈值(如 \( \lambda_2 \)),说明它可能被遗漏,将其加入筛选集,重新求解。

  4. 迭代:重复步骤 2-4,直到没有新特征被加入。

为什么这个特例能体现核心思路: - 在 \( \beta=0 \) 时,得分统计量 \( S_j \) 的计算只需要一次全数据扫描(计算每个风险集的均值),之后就可以丢弃全数据,只保留筛选后的子集。 - 检查步骤也只需要一次全数据扫描(计算所有特征的得分),但这一步的计算量是 \( O(np) \),与经典方法相同。关键差异:检查步骤只在筛选集收敛后才执行一次,而不是每次坐标下降迭代都扫描全数据。如果筛选集足够小(\( m \ll p \)),且迭代次数少,总计算量远小于经典方法。

这个特例下要证的命题: 在什么条件下,筛选步骤不会遗漏真实非零特征?即:如果真实模型只有 \( s \) 个非零特征(\( s \ll p \)),那么以高概率,这 \( s \) 个特征都出现在前 \( m \) 个最大 \( S_j \) 中。这需要边际得分与真实系数的相关性足够强(类似于线性模型下的 irrepresentable condition 的边际版本)。本文没有证明这个命题,而是依赖 BASIL 在 GLM 下的经验成功。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:如何在大规模、超高维 Cox 模型上高效求解 Lasso 路径,使得算法能在内存受限(如 UK Biobank 数据)的情况下运行。
  2. 核心工具 / 方法:将 Batch Screening Iterative Lasso (BASIL) 框架从广义线性模型推广到 Cox 比例风险模型,核心创新是将筛选准则从线性残差相关性改为偏似然得分统计量,并设计了相应的迭代算法。
  3. 主要结论:在 UK Biobank 的 306 种疾病结局上,算法能在数小时内输出完整 Lasso 路径(而 glmnet 因内存限制无法运行),且筛选出的变量在预测性能(C-index)上与全数据 Lasso 解相当。

关键设定与假设

完整设定(在第二节最小记号基础上补充): - 数据规模\( n \approx 500,000 \)\( p \) 可达数百万(基因型 SNP 位点)。 - 内存限制:设计矩阵 \( \mathbf{X} \) 无法全部载入内存(例如 50 万 × 500 万 = 2.5 万亿个元素,即使以 1 字节/元素存储也需要 2.5 TB)。 - 数据存储:特征以分块二进制格式存储在磁盘上(PLINK2 的 .pgen 格式),每次只读取需要的特征块。

关键假设(与标准 Cox 模型相同,无额外假设): - 独立删失\( T_i \perp C_i \mid \mathbf{x}_i \)。 - 比例风险:风险比 \( h_i(t)/h_j(t) \) 不随时间变化。 - 无 ties:假设没有同时发生的事件(或使用 Breslow 近似处理 ties)。 - 特征标准化:每个特征被标准化为均值为 0、方差为 1(这是 Lasso 的标准预处理,但本文在筛选步骤中使用了未标准化的原始得分,见下文技术细节)。

相比已有文献的放宽或强化: - 放宽:相比 glmnet,本文不要求全数据在内存中。 - 强化:相比原始 BASIL(Qian et al. 2019),本文需要处理 Cox 模型的非线性偏似然,筛选准则从线性残差改为得分统计量,且需要处理风险集的计算(涉及所有样本的排序)。

主要结果

本文是纯计算方法论文,没有理论定理。主要结果来自模拟实验和 UK Biobank 真实数据分析。

模拟实验(论文 Section 4): - 设定:生成 \( n=1000 \) 或 5000,\( p=1000 \) 或 10000 的生存数据,真实非零特征数 \( s=10 \) 或 20。比较 BASIL-Cox 与 glmnet(当数据可载入内存时)的 Lasso 路径一致性。 - 核心量化结论: - BASIL-Cox 输出的 Lasso 路径与 glmnet 的路径几乎完全重合(系数估计的相关系数 > 0.99)。 - 计算时间:当 \( p=10000, n=5000 \) 时,BASIL-Cox 比 glmnet 快约 5-10 倍(具体数字取决于 batch size 和迭代次数)。 - 筛选一致性:在模拟中,BASIL 从未遗漏真实非零特征(即所有真实特征都在最终筛选集中)。

UK Biobank 真实数据(论文 Section 5): - 数据:约 50 万个体,约 800 万个 SNP 位点(经过 QC 后约 600 万),306 种疾病结局(ICD10 编码)。 - 方法应用:对每种疾病结局,运行 BASIL-Cox 求解 Lasso 路径,使用 5 折交叉验证选择最优 \( \lambda \)。 - 结果: - 算法在 2-4 小时内完成一种疾病的分析(使用 16 核 CPU,内存 64 GB)。 - 筛选出的 SNP 数量从几十到几百不等(取决于疾病的遗传度)。 - 预测性能(C-index)与单变量检验(PLINK2 的 Cox 回归)相比,多变量 Lasso 模型有显著提升(平均 C-index 从 0.55 提升到 0.65,具体因疾病而异)。 - 作者还展示了跨疾病共享 SNP 的分析:某些 SNP 与多种疾病相关(如 MHC 区域的 SNP 与多种自身免疫疾病)。

与 baseline 对比: - baseline 1:单变量检验(PLINK2 的 Cox 回归)—— 对每个 SNP 单独做 Cox 回归,用 Bonferroni 校正。结果:单变量检验选出的 SNP 数量远多于 Lasso(因为多重比较膨胀),但预测性能低于 Lasso。 - baseline 2:glmnet —— 无法运行(内存不足)。 - baseline 3:随机筛选 —— 随机选择等量 SNP 做 Lasso,预测性能显著低于 BASIL 筛选。

证明路线与技术技巧

本文没有证明,只有算法描述和实验验证。因此“证明路线”不适用,改为“算法路线”。

算法路线(3-5 步逻辑主干)

  1. 初始化:设置 Lasso 路径的 \( \lambda \) 序列(从大到小,共 \( K \) 个值)。从 \( \lambda_1 \)(最大惩罚,所有系数为零)开始。
  2. 筛选步骤(Screening)
  3. 在当前系数 \( \hat{\beta} \) 下,计算所有 \( p \) 个特征的边际得分统计量
    \[S_j = \left| \frac{\partial \ell(\beta)}{\partial \beta_j} \Big|_{\beta=\hat{\beta}} \right|\]
  4. 选择 \( S_j \) 最大的前 \( m \) 个特征(\( m \) 是预设的 batch size,如 1000),加入活跃集 \( \mathcal{A} \)
  5. 关键技巧:得分统计量的计算只需要一次全数据扫描(计算每个风险集的加权均值),但这一步是 \( O(np) \) 的。为了减少全数据扫描次数,作者在筛选步骤中使用了近似得分:只使用当前风险集的一个子集(如随机采样 10% 的事件时间点)来估计得分。这引入了近似误差,但实验表明对最终结果影响很小。
  6. 求解步骤(Fitting)
  7. 在活跃集 \( \mathcal{A} \) 上(特征数 \( m \ll p \)),用坐标下降法求解 Lasso 路径(从当前 \( \lambda \) 到下一个 \( \lambda \))。
  8. 由于 \( m \) 很小,设计矩阵 \( \mathbf{X}_{\mathcal{A}} \) 可以载入内存,坐标下降的每次迭代只扫描 \( m \) 个特征。
  9. 检查步骤(Checking)
  10. 求解完成后,用当前系数 \( \hat{\beta}_{\mathcal{A}} \) 计算所有 \( p \) 个特征的得分统计量 \( S_j \)
  11. 如果存在 \( j \notin \mathcal{A} \) 使得 \( S_j > \lambda \)(当前正则化参数),说明该特征可能被遗漏,将其加入 \( \mathcal{A} \),回到步骤 3。
  12. 关键跳跃点:检查步骤的阈值为什么是 \( \lambda \)?这是 Lasso 的 KKT 条件:在最优解处,所有特征的得分绝对值必须小于等于 \( \lambda \)。如果某个特征的得分大于 \( \lambda \),说明它不满足 KKT 条件,即当前解不是全局最优。因此,检查步骤本质上是验证 KKT 条件
  13. 迭代:重复步骤 2-4,直到所有 \( K \)\( \lambda \) 都被求解,且没有新特征被加入。

关键跳跃点: - 从线性残差到 Cox 得分:在线性模型中,BASIL 的筛选准则基于残差与特征的边际相关性 \( |\mathbf{X}^\top (\mathbf{y} - \mathbf{X}\hat{\beta})| \)。在 Cox 模型中,对应的量是偏似然得分 \( |\partial \ell(\beta)/\partial \beta_j| \)。作者将这一推广称为“自然的”,但实际实现中需要高效计算得分(涉及风险集的加权均值)。 - KKT 条件作为检查准则:这是 BASIL 框架的核心洞察——检查步骤不是启发式的,而是基于 Lasso 的 KKT 条件。如果检查通过,则当前解就是全局最优(在筛选集上)。这保证了算法的精确性(与全数据 Lasso 解一致),只要筛选集包含所有非零特征。

技术技巧点名: - 近似得分计算:使用随机采样的风险集子集来估计得分,减少全数据扫描次数。 - Warm start:用前一个 \( \lambda \) 的解作为当前 \( \lambda \) 的初始值,加速坐标下降收敛。 - 分块读取:利用 PLINK2 的 .pgen 格式,按需读取特征块,避免全数据载入内存。 - 并行计算:在筛选步骤中,不同特征的得分可以并行计算(因为得分是特征独立的)。

真实例子与应用

数据:UK Biobank,约 50 万个体,约 600 万 SNP 位点,306 种疾病结局(ICD10 编码)。生存时间定义为首次诊断时间或删失时间。

方法应用: 1. 对每种疾病,运行 BASIL-Cox 求解 Lasso 路径(\( \lambda \) 序列从大到小,共 100 个值)。 2. 使用 5 折交叉验证选择最优 \( \lambda \)(基于 C-index 或验证偏差)。 3. 输出最优 \( \lambda \) 下的非零 SNP 集合。

结果: - 算法在 2-4 小时内完成一种疾病的分析(16 核 CPU,64 GB 内存)。 - 筛选出的 SNP 数量:对于高遗传度疾病(如 2 型糖尿病),约 200-500 个 SNP;对于低遗传度疾病(如某些癌症),约 10-50 个 SNP。 - 预测性能:多变量 Lasso 模型的 C-index 比单变量检验模型平均高 0.1(从 0.55 到 0.65)。 - 跨疾病分析:作者发现某些 SNP(如 MHC 区域的 rs9273363)与多种自身免疫疾病相关,验证了已知的遗传学知识。

这个例子想说明什么: - 验证可扩展性:算法能在 UK Biobank 规模的数据上运行,而 glmnet 不能。 - 验证实用性:筛选出的 SNP 具有生物学意义(与已知 GWAS 结果一致),且多变量模型优于单变量模型。 - 验证效率:2-4 小时的计算时间对于大规模遗传分析是可接受的。

🔎 结论是否比证明窄

。本文的结论(“算法能高效求解 Lasso 路径”)是基于实验验证的,但没有理论保证。具体来说: - 筛选一致性:作者没有证明筛选步骤以高概率包含所有真实非零特征。在模拟中,所有真实特征都被筛选到,但这是在小规模模拟(\( p=10000 \))下,且真实特征有强边际效应。在 UK Biobank 数据中,无法验证是否遗漏了真实特征(因为不知道真实模型)。 - 近似得分的影响:作者使用随机采样的风险集子集来估计得分,但没有分析近似误差对筛选结果的影响。理论上,近似得分可能导致遗漏重要特征。 - 收敛性:算法保证在有限步内停止(因为每次迭代至少加入一个新特征,而特征总数有限),但没有给出迭代次数的上界。在最坏情况下,可能需要 \( p \) 次迭代(每次只加入一个特征),此时计算量退化为 \( O(np^2) \)

作者在论文中明确承认(Section 6, Discussion):“The theoretical properties of the screening procedure for the Cox model are not established in this work, and we leave them for future research.” —— 这是诚实的表述,但读者需要注意:本文的结论(“算法有效”)是经验性的,不是理论性的。


四、开放问题(点到为止,扎根具体语句)

  1. 筛选一致性的理论证明:在 Cox 模型下,需要什么条件(如边际得分与真实系数的相关性界、特征协方差矩阵的稀疏性)才能保证 BASIL 筛选以高概率包含所有真实非零特征?扎根于论文 Section 6:“The theoretical properties of the screening procedure for the Cox model are not established in this work.”

  2. 近似得分误差的统计影响:使用随机采样的风险集子集估计得分,会引入多少近似误差?这个误差如何影响筛选的准确性?扎根于论文 Section 3.2:“To reduce the computational cost of the screening step, we use a random subset of the risk sets to approximate the score statistics.”

  3. 迭代次数的上界:在最坏情况下,BASIL 需要多少次迭代才能收敛?是否存在一个与 \( p \)\( s \)(真实非零特征数)相关的上界?扎根于论文 Section 3.3:“The algorithm terminates in a finite number of steps because each iteration adds at least one new feature to the active set.”

  4. 扩展到其他生存模型:能否将 BASIL 框架推广到竞争风险模型(Fine-Gray 模型)或时变系数 Cox 模型?扎根于论文 Section 6:“Extensions to other survival models, such as the competing risks model, are of interest.”

提醒:要确认第 1 条是否是真 gap,建议去读 Fan & Lv (2008) 的 Sure Independence Screening 理论,以及后续的迭代筛选理论(如 ISIS)。如果这些理论在 Cox 模型下已有结果,则本文的 gap 可能已被填补;如果没有,则这是一个值得做的理论问题。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论