Semiparametric efficient estimation of the Cox regression coefficient when there can be ties¶
作者: Benjamin R Baer
主题: 效率理论 / Debiased ML
相关性: 8/10
链接: https://arxiv.org/abs/2608.11399
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是Cox比例风险模型中回归系数的半参数有效估计理论。其根本的统计问题是:在生存数据中,如何在不指定基线风险函数形式(即非参数)的前提下,对协变量的回归系数进行最优(即达到半参数效率界)的估计与推断。该方向的核心工具是半参数效率理论(efficient influence function, semiparametric efficiency bound)和计数过程鞅理论。当前成熟度:在连续失效时间(无结)设定下,理论已非常成熟(从1980年代起),但在存在结(ties) 的一般设定下,理论几乎空白——这正是本文要填补的缺口。
发展脉络(history)¶
- 奠基工作:Cox模型与部分似然的提出(1972-1975)
- Cox (1972):提出Cox比例风险模型,并针对有结情形给出了“精确”部分似然(式3),同时指出估计量的效率是一个“major outstanding problem”。
-
Cox (1975):提出部分似然(partial likelihood)的概念,为后续渐近理论奠定基础。
-
连续时间下的渐近理论(1981-1982)
- Tsiatis (1981):在失效和删失均绝对连续的假设下,严格证明了Cox估计量的相合性与渐近正态性。
-
Andersen & Gill (1982):允许基线累积风险连续但不要求绝对连续,但仍不允许有跳跃(即不允许结)。他们的计数过程框架成为后续标准工具。
-
连续时间下的效率理论(1977-2000)
- Oakes (1977) & Efron (1977):在绝对连续假设下,通过信息计算初步研究了Cox估计量的效率。
- Begun et al. (1983):使用Stein (1956)开创的半参数效率理论框架,首次严格证明了在失效和删失均绝对连续时,Cox估计量达到半参数效率界。这是该方向的里程碑。
- Murphy & van der Vaart (2000):使用剖面似然(profile likelihood)技术给出了效率的另一种证明,同样假设失效绝对连续。
-
Hirose (2011):在不要求删失分布连续性的条件下,给出了剖面似然的直接证明。
-
有结情形的探索(1972-2025)——但效率理论缺失
- Peto (1972), Breslow (1974), Efron (1977):提出了各种近似部分似然来处理结,但主要基于计算便利性,而非效率理论。
- Prentice & Kalbfleisch (2003):提出一个混合离散-连续Cox模型,并证明了Breslow估计量的相合性与渐近正态性,但未研究效率。
-
Cho et al. (2025):提出基于Poisson-二项分布的精确部分似然计算方法,在分组连续时间模型(分组宽度随样本量收缩)下证明了相合性与渐近正态性,但未研究效率界。
-
本文的位置(Baer, 2026)
- 本文是首次在失效分布可以是连续、离散或混合的一般设定下,推导Cox回归系数的半参数效率界,并证明Cox (1972)的“精确”估计量是渐近有效的。它填补了从Begun et al. (1983)至今四十余年的理论空白。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 线索A:连续时间Cox模型的渐近与效率理论(Tsiatis 1981, Andersen & Gill 1982, Begun et al. 1983, Murphy & van der Vaart 2000, Hirose 2011)。这一簇在绝对连续或连续失效假设下,建立了完整的相合性、渐近正态性与效率理论。
- 线索B:有结情形的模型与估计量(Cox 1972, Peto 1972, Breslow 1974, Efron 1977, Prentice & Kalbfleisch 2003, Cho et al. 2025)。这一簇提出了各种处理结的模型(如logistic odds模型、cloglog模型)和估计量(精确、近似、分组),但效率理论几乎完全缺失。
- 线索C:半参数效率理论与工具(Stein 1956, van der Vaart & Wellner 2021, Kennedy 2023, Baer & Strawderman 2024)。这一簇提供了推导效率界和构造有效估计量的通用框架与鞅工具。Baer & Strawderman (2024) 的“删失鞅”是本文的关键技术工具。
这个方向在追问的核心问题¶
- 在有结的一般设定下,Cox回归系数的半参数效率界是什么? 即,在失效分布可以是连续、离散或混合时,估计β的最优渐近方差是多少?
- Cox (1972)提出的“精确”部分似然估计量是否达到这个效率界? 即,它是否是渐近有效的?
- 能否构造一个计算上更高效、但渐近等价的估计量? 因为精确部分似然的计算复杂度随风险集大小呈二次增长(Howard-Gail递归)。
- 在分组Cox模型(grouped continuous-time model)下,效率理论是否不同? 即,当结是由分组人为产生且分组宽度随n→0时,忽略结的估计量(如Breslow近似)是否可能也是有效的?
当前主流方法与已知瓶颈:主流方法(Efron近似、Breslow近似)在结较少时表现良好,但缺乏效率理论支撑;精确Cox估计量有理论潜力但计算昂贵;所有现有理论工作要么假设绝对连续,要么假设完全离散,没有覆盖混合分布这一最一般情形。
⚠️ 作者的framing¶
作者把缺口frame成:尽管Cox模型在有结情形下被广泛使用,但“the lion’s share of theory is for the absolutely continuous case”(引言第2段),且“consistency, asymptotic normality, and semiparametric efficiency of the Cox estimator have not been established in the Cox model without assuming absolute continuity or assuming discreteness”(引言第3段)。因此,本文是“显然的下一步”:推导一般设定下的效率界,并证明Cox估计量的有效性。
被淡化或回避的竞争路线: - 分组Cox模型(grouped continuous-time model):作者在讨论中提及,但将其归为“if the observed data is believed to be from a grouped Cox model where the grouping intervals shrink as n→∞”,并指出此时“the estimator pretending there are no ties is efficient”。作者选择不沿着这条路线走,而是坚持Cox (1972)提出的原始模型(logistic odds at mass points)。 - Assumption-lean Cox回归(Vansteelandt et al., 2024):作者在讨论中提及,但将其定位为“a model specification that reduces to the usual Cox model when there are no discontinuities”,并指出这是“alternatively”的路线。作者没有将其作为主要竞争者。
什么明显该被引/该存在、却没出现在intro里? - 关于“分组Cox模型”下效率的正式工作:作者引用了Cho et al. (2025)和Scheike & Sun (2007),但这两篇都没有研究效率界。是否存在一篇直接推导分组Cox模型效率界的工作?从intro看,似乎没有——这本身就是一个值得研究者去查的gap。 - 关于“精确”部分似然计算复杂度的更深入分析:作者引用了Howard (1972)和Gail et al. (1981),但未提及是否有更近期的算法改进(如基于树结构或近似方法)。这可能是计算统计领域的一个开放问题。
张力¶
未见明显对立引用。所有被引工作基本沿着“连续→有结”的路径推进,彼此之间没有直接矛盾。唯一的潜在张力在于:Cox (1972)的logistic odds模型 vs. 分组Cox模型的cloglog模型——前者在质量点处假设比例优势,后者假设比例风险。作者明确选择了前者,并在讨论中承认“not universally applicable to all research questions”。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - 可观测数据:对于每个个体i,观测到三元组 \((L_i, X_i, \Delta_i)\)。 - \(L_i \in \mathbb{R}^p\):基线协变量(p维)。 - \(X_i > 0\):观测到的生存时间(可能是失效时间或删失时间的最小值)。 - \(\Delta_i \in \{0,1\}\):失效指示符(1=观测到失效,0=删失)。 - 衍生过程: - \(N_i^T(t) = I(\Delta_i = 1, X_i \le t)\):观测到的失效计数过程。 - \(N_i^C(t) = I(\Delta_i = 0, X_i \le t)\):观测到的删失计数过程。 - \(Y_i(u) = I(X_i \ge u)\):标准风险过程(at-risk process)。 - \(Y_i^\dagger(u) = I(N_i^C(u-) = 0, N_i^T(u) = 0)\):修正风险过程(在时间u之前既未失效也未删失)。 - 参数/estimand: - \(\beta \in \mathbb{R}^p\):Cox回归系数,是本文要估计的目标参数。 - 累积风险函数: - \(\Lambda_T^\sharp(t; \ell)\):给定L=ℓ时,失效的“识别出的”累积风险(通过可观测数据定义,见Lemma 1)。 - \(\Lambda_C^\dagger(t; \ell)\):给定L=ℓ时,删失的“识别出的”累积风险。 - \(\delta F(t) = F(t) - F(t-)\):函数F在t处的跳跃(增量)。 - 样本量与维数: - \(n\):样本量。 - \(p\):协变量维数(固定,不随n增长)。
模型:Cox模型\(\mathcal{M}\)(Definition 1)定义为:存在\(\beta \in \mathbb{R}^p\),使得对所有\(t>0\)和几乎所有\(\ell\),
可观测数据:研究者实际能观测到的是\((L_i, X_i, \Delta_i)\),即每个个体的协变量、观测时间和失效指示符。想要但观测不到的是潜在失效时间\(T^*\)和潜在删失时间\(C^*\)。本文采用“observed-data functional”视角,不依赖潜在变量假设(除了在Lemma 1中建立联系),因此所有理论直接基于可观测数据的分布P。
第二步:讲最小内核¶
本文的核心思路可以用离散时间情形(Example 2a/2b/2c)作为最简特例来理解。在这个特例下,所有失效时间都发生在有限个离散时间点\(t_1, \ldots, t_K\)上,且\(\delta\Lambda_T^\sharp(t; \ell) = P(X=t, \Delta=1 | L=\ell, X \ge t)\)是离散风险(即条件失效概率)。
最简特例:假设失效分布是完全离散的(即\(q=1\),所有失效都发生在质量点上),且删失也是离散的。那么Cox模型退化为:
核心思路:在这个离散设定下,Cox (1972)的“精确”部分似然(式3)正是条件logistic回归的似然。其得分函数(即估计方程)是:
为什么这是最小内核:整篇论文的一般设定(混合连续-离散分布)本质上就是把这个离散时间情形的logistic回归结构,与连续时间情形的比例风险结构,通过乘积积分(product integral)和鞅理论统一起来。在连续时间点,有效得分退化为熟悉的Cox得分(式1);在离散质量点,有效得分是条件logistic回归得分。本文的关键技术贡献是:证明了在混合分布下,Cox (1972)的“精确”部分似然估计量恰好对应这个统一的有效得分,因此是渐近有效的。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在失效分布可以是连续、离散或混合的一般设定下(即允许存在结),推导Cox回归系数\(\beta\)的半参数效率界,并证明Cox (1972)的“精确”部分似然估计量是渐近有效的。
- 核心工具/方法:使用计数过程鞅理论(特别是Baer & Strawderman (2024)的删失鞅)、乘积积分(product integral)和半参数效率理论(efficient influence function),推导出有效得分函数;并利用Arratia et al. (2005)的局部中心极限定理和rejective sampling结果来证明Cox估计量的渐近性质。
- 主要结论:在总体失效质量点属于一个未知有限集(Assumption 1)的技术条件下,(a) 有效得分函数由Theorem 2给出;(b) Cox估计量是相合且渐近有效的(Theorem 3);(c) 提出了一个计算复杂度更低的渐近等价估计量(Corollary 2)。
关键设定与假设¶
- Cox模型\(\mathcal{M}\)(Definition 1):见第二节。这是全文的基础模型。相比已有文献(如Andersen & Gill 1982),它放宽了对失效分布连续性的要求,允许任意混合分布。
- Assumption 1:\(J(P_0) = \{t \in (0, \tau] : P\{\delta N^T(t) > 0\} > 0\}\)是有限的。即,总体失效质量点(即结发生的时间点)属于一个未知但有限的集合。这是全文最关键的技术假设。作者论证了在此假设下,效率界不变(因为生成切空间的子模型仍然可用)。
- 条件独立删失(Lemma 1):\(T^* \perp\!\!\!\perp C^* | L\)(或更弱的“在\(C^* < T^*\)上”条件)。本文采用observed-data functional视角,因此这个假设不是必需的,但用于将结果与潜在变量解释联系起来。
- 正则条件(Section C.1):包括通常的紧致性、可微性、矩条件等,用于保证M-估计量的渐近理论。这些是标准技术条件,未在正文中详细列出。
- Assumption 2 & 3:关于基线累积风险估计量的相合性(一致相合)和收敛速率(\(n^{-1/4}\))。这些是用于构造“一般系数估计量”(Section 4.2)的,而非用于Cox估计量本身。
相比已有文献的放宽/强化: - 放宽:不要求失效分布绝对连续或完全离散,允许混合分布(即有结)。 - 强化:Assumption 1要求总体质量点有限。这比完全离散(质量点可数但可能无限)要强,但比连续分布(无质量点)要弱。作者在讨论中承认这是一个技术条件,并指出“Restricting the Cox model to distributions satisfying Assumption 1 does not change the efficiency bound at \(P_0\)”。
主要结果¶
Theorem 1(影响函数的正交补):刻画了所有影响函数(即所有渐近线性估计量的线性化)必须属于的空间。它由形如
Theorem 2(有效影响函数):在Theorem 1中取\(\alpha(u; L) = L\),得到有效得分\(S_{\text{eff}}\)。有效影响函数是\(\{E[S_{\text{eff}} S_{\text{eff}}^\top]\}^{-1} S_{\text{eff}}\)。直觉:在正交补中,使渐近方差最小的那个影响函数,恰好对应\(\alpha = L\)。在连续情形(Example 1c),它退化为熟悉的Cox得分;在离散情形(Example 2c),它退化为条件logistic回归得分。
Theorem 3(Cox估计量的有效性):在Assumption 1和正则条件下,Cox (1972)的“精确”部分似然估计量\(\hat{\beta}_{\text{Cox}}\)是相合的,且其影响函数就是有效影响函数,因此是渐近有效的。技术难点:证明的关键在于将“精确”部分似然得分与有效得分联系起来。作者使用了Arratia et al. (2005)关于rejective sampling的局部中心极限定理,来处理离散质量点处“从风险集中选择|T(i)|个个体”的组合复杂性。
Theorem 4 & Corollary 2(一般系数估计量与提议估计量):提出了一个基于有效得分方程(式6)的估计量\(\tilde{\beta}_n\),并证明了在Assumptions 1-3下它是局部有效的。其计算复杂度低于精确Cox得分(见Section 4.4)。
证明路线与技术技巧¶
整体路线(以Theorem 3为例): 1. 建立Cox估计量的渐近线性表示:证明\(\hat{\beta}_{\text{Cox}}\)满足\(\sqrt{n}(\hat{\beta}_{\text{Cox}} - \beta_0) = \frac{1}{\sqrt{n}} \sum_{i=1}^n \psi(O_i) + o_P(1)\),其中\(\psi\)是某个影响函数。 2. 识别影响函数:证明这个影响函数\(\psi\)恰好等于有效影响函数\(\{E[S_{\text{eff}} S_{\text{eff}}^\top]\}^{-1} S_{\text{eff}}\)。 3. 关键跳跃点:在离散质量点处,“精确”部分似然的得分不是通常的“协变量减去加权平均”形式,而是涉及一个复杂的组合和(式3的分母)。作者需要证明这个组合和渐近等价于有效得分中的加权条件期望项。 4. 使用Arratia et al. (2005):作者将每个离散质量点处的风险集视为一个有限总体,将“选择|T(i)|个个体作为失效”视为一个rejective sampling方案(Hájek, 1964)。Arratia et al. (2005)的局部中心极限定理给出了这种抽样方案下,logistic回归得分的高阶渐近展开,从而证明了组合和与条件期望的渐近等价性。
技术技巧点名: - 鞅理论(Martingale theory):全文的基础工具。使用Doob-Meyer分解将计数过程分解为补偿子(compensator)和鞅。特别是Baer & Strawderman (2024)的删失鞅\(M_C^\dagger\),用于处理删失过程。 - 乘积积分(Product integral):用于统一表达连续和离散情形的密度(Proposition 1, Corollary 1)。乘积积分在连续情形退化为指数函数,在离散情形退化为普通乘积。 - 半参数效率理论:使用Stein (1956)开创的框架,通过计算切空间(tangent space)和正交补来推导效率界。 - Rejective sampling & 局部中心极限定理(Arratia et al., 2005):用于处理离散质量点处“精确”部分似然的组合复杂性。这是证明Theorem 3的关键外部工具。 - Howard-Gail递归:用于计算“精确”部分似然得分(式9),其复杂度为\(O(|T(i)| (|R(i)| - |T(i)|))\)。 - 剖面估计方程(Profiled estimating equation):用于构造提议估计量(式7, 8),通过先估计基线累积风险(在离散质量点处解一个标量方程),再估计\(\beta\)。
真实例子与应用¶
数据:advanced GASTRIC meta-analysis(Paoletti et al., 2013),包含4069名来自20个随机化疗试验的晚期胃癌患者。终点是无进展生存期(PFS),其中疾病进展在预定临床评估时检测(产生离散失效时间),而死亡可连续发生。
方法应用:将提议估计量、Cox(精确)估计量和Efron近似估计量应用于该数据,协变量包括治疗指示符(化疗 vs. 对照)和试验编号的固定效应。
结果(Table 1): - 三个估计量给出的治疗效应估计几乎相同(约-0.224),标准误也相近(0.0327-0.0337)。 - 关键发现:尽管估计值相似,但计算时间差异巨大:Cox(精确)估计量比Efron近似慢410倍,且在模拟中当n=1000时因算术溢出而无法计算。
这个例子想说明什么:验证了提议估计量在实际数据中与Cox(精确)估计量给出几乎相同的结果,但计算上更可行(避免了精确部分似然的组合爆炸)。同时,它也展示了在结普遍存在(疾病进展在离散时间点检测)的真实场景中,本文的理论是相关的。
🔎 结论是否比证明窄¶
- Theorem 3的证明依赖于Assumption 1(有限质量点)。作者在讨论中承认,如果质量点无限(例如,完全离散分布有可数无穷多个质量点),该证明不直接适用。因此,结论的适用范围比“任意混合分布”要窄——它只覆盖了有限个质量点的情形。
- Theorem 4(一般系数估计量)同样依赖于Assumption 1,且额外需要Assumptions 2 & 3(基线累积风险估计量的相合性与\(n^{-1/4}\)速率)。这些假设在实际中是否容易满足?作者在Section 4.3中给出了一个具体的估计量(式7),并声称它满足这些假设,但没有给出正式的证明(Corollary 2的证明依赖于“assume the regularity conditions”)。
- 作者在讨论中承认:“The Cox model \(\mathcal{M}\)... is not universally applicable to all research questions.” 这表明作者对模型的局限性有清醒认识。
四、开放问题¶
-
放松Assumption 1(有限质量点):能否在质量点可数无限(甚至不可数,如奇异连续分布)的情形下,建立类似的效率理论?这需要更精细的鞅理论和泛函分析工具。扎根于:Assumption 1是Theorem 3和Corollary 2的核心条件,作者在讨论中未明确说明如何放松。
-
分组Cox模型下的效率理论:当结是由分组(grouping)人为产生,且分组宽度随\(n \to \infty\)收缩时,忽略结的估计量(如Breslow近似)是否也是有效的?作者在讨论中提及“an efficiency calculation with a triangular array of probability distributions may reveal that the estimator pretending there are no ties is efficient”,但没有给出正式结果。这是一个明确的开放问题。扎根于:Discussion第2段。
-
Assumption-lean Cox回归的效率:Vansteelandt et al. (2024)提出的assumption-lean Cox回归,在模型误设下仍可解释。能否推导其半参数效率界,并构造有效估计量?扎根于:Discussion第2段,作者提及该工作作为替代模型。
-
计算复杂度的进一步降低:提议估计量的计算复杂度是\(O(np + p \sum_{i \in \mathcal{I}: X_i \in \hat{J}} |R(i)|)\),在风险集很大时仍可能昂贵。能否利用随机抽样或近似方法(如基于树的最近邻搜索)进一步加速?扎根于:Section 4.4的计算复杂度分析,以及真实例子中Cox(精确)估计量因溢出而失败的事实。
Maintained by 陈星宇 · Homepage · Source on GitHub