Studying Competing Events with Federated Cumulative Incidence Curves¶
作者: Malcolm Risk (Serena), Shuang Yang (Serena), Jiang Bian (Serena), Yi Guo (Serena), Hyojung Jang (Serena), Jingchuan (Serena), Guo, Xu Shi, Lili Zhao
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2607.26287
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是:在联邦学习(FL)框架下,对多中心电子健康记录(EHR)数据中的竞争风险事件进行非参数因果推断。具体来说,它要解决的根本问题是:如何在不共享患者级数据的前提下,构建协变量调整后的累积发生率曲线(CIF),并基于受限平均时间损失(RMTL)进行组间因果比较。该方向当前处于早期应用阶段——已有联邦半参数(Fine-Gray模型)和联邦伪观察方法,但非参数工具(CIF、RMTL)的联邦化是空白。
发展脉络(history)¶
奠基工作(1975-1999): - Peterson (1975):提出了竞争风险设定下CIF的非参数估计量(公式2的基础),奠定了非参数框架。 - Lin (1997):给出了比较不同组别CIF的非参数检验统计量。 - Fine & Gray (1999):提出了半参数子分布风险模型(Fine-Gray模型),将Cox回归推广到竞争风险,成为应用最广的回归方法。
主要进展(2005-2021): - Xie & Liu (2005):提出了逆概率加权Kaplan-Meier(IPW-KM)方法,将IPW引入生存分析,为协变量调整提供了非参数工具。 - Young et al. (2020):用反事实框架严格定义了竞争风险设定下的经典统计量(CIF、RMTL),并给出了识别条件(交换性、正性、一致性)。本文引用它来论证加权估计量的因果识别。 - Conner & Trinquart (2021):提出了IPW加权的RMTL估计量及其方差估计,并指出当比例风险假设不成立时,RMTL优于Fine-Gray模型。本文引用它作为RMTL的基准方法。
当前Frontier(2023-2025): - Zhang et al. (2024):提出了ODACoR,一个单次通信的联邦Fine-Gray模型,实现了联邦半参数竞争风险分析。这是本文最直接的竞争路线。 - Rahman & Purushotham (2023):提出了基于伪观察的联邦机器学习方法,用于竞争风险预测,但需要共享局部风险表(存在隐私风险)。 - Risk et al. (2025):开发了基于影响函数的联邦Kaplan-Meier方法,是本文作者的前期工作,为本文的CIF联邦化提供了核心工具(生存函数和风险函数的联邦估计)。
本文的位置:本文是上述脉络的自然延伸——它填补了“联邦非参数竞争风险分析”这一空白,将Risk et al. (2025)的联邦KM方法扩展到竞争风险设定,并利用影响函数实现了CIF和RMTL的联邦估计。
子线索聚类¶
这些被引文献大致落在3条子线索上:
- 非参数方法(CIF / RMTL):Peterson (1975), Lin (1997), Xie & Liu (2005), Conner & Trinquart (2021), Austin & Fine (2025)。这一簇关注不依赖模型假设的CIF和RMTL估计,强调可视化与可解释性。本文属于此簇的联邦化。
- 半参数回归方法(Fine-Gray模型):Fine & Gray (1999), Hinchliffe & Lambert (2013), Zhang et al. (2024)。这一簇关注回归系数(子分布风险比)的估计,依赖比例风险假设。本文将其作为对比路线,强调自己避免了该假设。
- 伪观察方法:Binder et al. (2014), Rahman & Purushotham (2023)。这一簇将CIF转化为连续伪观察值,从而允许使用灵活的回归/机器学习模型。本文指出其存在隐私风险(需共享局部风险表)。
这个方向在追问的核心问题¶
- 如何在联邦框架下实现非参数竞争风险分析? 现有联邦方法(ODACoR、伪观察)都是半参数或参数化的,非参数工具(CIF、RMTL)的联邦化是空白。
- 如何在不共享患者级数据的前提下,进行协变量调整? IPW需要倾向性得分模型,其联邦化已有方法(Luo & Song 2020, Duan et al. 2020),但如何与CIF的联邦估计结合是挑战。
- 如何在联邦框架下进行统计推断(方差估计)? 非参数CIF的方差通常用bootstrap估计,这在联邦环境下通信成本过高。影响函数提供了一种替代方案。
- 如何平衡隐私保护与统计效率? 伪观察方法需要共享局部风险表(可能泄露个体生存时间),本文通过共享样条参数来降低隐私风险。
已知瓶颈:联邦环境下,非参数CIF的方差估计难以处理权重估计的不确定性(通常导致方差高估);比例风险假设在联邦环境下难以检验或放松。
⚠️ 作者的framing¶
作者把缺口frame成:“现有联邦竞争风险分析只覆盖了半参数和伪观察方法,非参数工具(CIF、RMTL)的联邦化是空白。我们的方法提供了有价值的替代方案:避免了比例风险假设、提供了直观的可视化、消除了伪观察方法的隐私风险。” 作者通过强调非参数方法的优势(无需比例风险假设、可视化、可解释性)和现有联邦方法的不足(半参数依赖假设、伪观察有隐私风险),将自己定位为“显然的下一步”。
被淡化或回避的竞争路线: - ODACoR (Zhang et al. 2024):作者承认其存在,但仅指出它依赖比例风险假设。作者没有讨论ODACoR在效率上可能优于非参数方法(当比例风险假设近似成立时),也没有讨论如何将ODACoR与IPW结合进行因果推断。 - 伪观察方法 (Rahman & Purushotham 2023):作者强调其隐私风险,但未讨论其灵活性优势(可结合任意机器学习模型),也未讨论是否可以通过差分隐私等技术缓解隐私风险。 - Meta-analysis:作者在模拟中将其作为baseline,但未在intro中讨论其作为替代方案的优缺点。
什么明显该被引 / 该存在、却没出现在intro里? - 更高效的联邦因果推断方法:如联邦双重机器学习(Federated DML)、联邦目标最大似然估计(Federated TMLE)。这些方法在非竞争风险设定下已有工作,但本文未引用或讨论其在竞争风险下的扩展可能性。这是一个值得研究者去查的问题。 - 差分隐私与联邦学习的结合:本文通过共享样条参数来保护隐私,但未讨论更严格的差分隐私保证。相关文献(如Abadi et al. 2016, DP-SGD)未被引用。 - 竞争风险下的因果中介分析:本文的RMTL只能估计总效应,无法区分直接效应和间接效应。Young et al. (2020) 讨论了这一区分,但本文未引用相关的中介分析方法。
张力¶
未见明显对立引用。各被引工作之间在方法论上互补而非矛盾:非参数方法强调灵活性与可视化,半参数方法强调效率与回归系数,伪观察方法强调灵活性。本文的framing是“填补空白”而非“解决矛盾”。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - 暴露:\(A_i \in \{0, 1\}\),表示个体\(i\)是否接受治疗(1=有预先存在的自身免疫性疾病AID,0=无)。 - 事件类型:\(\Omega_i \in \{1, 2\}\),表示个体\(i\)发生的事件类型(1=免疫相关不良事件irAE,2=死亡)。 - 事件时间:\(T_i\),表示从治疗开始到事件发生的时间。 - 删失时间:\(C_i\),表示个体\(i\)的失访时间。 - 观测数据:\(X_i = \min(T_i, C_i)\)(随访时间),\(\Delta_i = I(T_i < C_i) \Omega_i\)(事件状态:0=删失,1=irAE,2=死亡)。 - 协变量:\(Z_i\),表示混杂变量(如年龄、性别、药物类型、合并症指数)。 - 反事实量:\(T_i^{A_i=a}\) 和 \(\Omega_i^{A_i=a}\),表示如果个体\(i\)接受暴露水平\(a\)时的事件时间和事件类型。 - 目标量:反事实累积发生率函数 \(F_k^a(t) = P(T_i^{A_i=a} < t, \Omega_i^{A_i=a} = k)\),表示在暴露水平\(a\)下,在时间\(t\)之前因原因\(k\)发生事件的概率。 - 生存函数:\(S^a(t) = P(T_i^{A_i=a} > t)\),表示在暴露水平\(a\)下,在时间\(t\)之前未发生任何事件的概率。 - 风险函数:\(Y^a(t) = P(X_i^{A_i=a} > t)\),表示在暴露水平\(a\)下,在时间\(t\)仍处于风险中的概率。 - 权重:\(\hat{w}_i = \frac{A_i}{\hat{p}_i} + \frac{1-A_i}{1-\hat{p}_i}\),其中\(\hat{p}_i = P(A_i=1|Z_i)\)是估计的倾向性得分。 - 样本量:\(N\)(总样本量),\(N_s\)(站点\(s\)的样本量),\(K\)(站点数)。 - 时间点:\(t_j\)(唯一事件时间),\(t\)(感兴趣的时间点),\(\tau\)(RMTL的截断时间)。
模型: - 数据生成机制:观测数据 \((X_i, \Delta_i, A_i, Z_i)\) 来自一个潜在的反事实框架。对于每个个体,存在一对潜在结果 \((T_i^{A_i=1}, \Omega_i^{A_i=1})\) 和 \((T_i^{A_i=0}, \Omega_i^{A_i=0})\),但只能观测到与真实暴露\(A_i\)对应的那一对。删失时间\(C_i\)假设独立于潜在结果和暴露(条件于协变量\(Z_i\))。 - 识别假设(来自Young et al. 2020): - 交换性:\(T_i^a \perp A_i | Z_i\)(给定协变量,暴露与潜在结果独立)。 - 正性:\(0 < P(A_i=1|Z_i) < 1\)(每个个体都有非零概率接受任一暴露)。 - 一致性:如果\(A_i=a\),则\(T_i = T_i^a\)且\(\Omega_i = \Omega_i^a\)(观测结果等于潜在结果)。 - 估计模型:倾向性得分模型 \(g(P(A_i=1|Z_i)) = \alpha^T Z_i\),其中\(g(\cdot)\)是logit链接函数。
可观测数据: - 研究者实际能观测到:\((X_i, \Delta_i, A_i, Z_i)\),即每个个体的随访时间、事件状态(删失/irAE/死亡)、暴露状态和协变量。 - 想要但观测不到:反事实结果 \((T_i^{A_i=1-a}, \Omega_i^{A_i=1-a})\)(如果个体接受了与实际不同的暴露),以及潜在结果的全部分布。这些只能通过识别假设和IPW来估计。
第二步:讲最小内核¶
最简特例:假设没有协变量(\(Z_i\)为空),因此不需要IPW调整(\(\hat{w}_i=1\))。只有两个站点(\(K=2\)),站点1有\(N_1\)个观测,站点2有\(N_2\)个观测。我们只关注一个暴露水平(比如\(A_i=1\))和一个事件类型(比如\(k=1\),irAE)。目标是联邦估计CIF \(F_1^1(t)\)。
在这个特例下,核心问题退化成:如何在不共享个体数据的前提下,利用站点1和站点2的数据,得到与合并数据估计相同的CIF?
核心思路: 1. 站点1:用自己的数据计算CIF估计 \(\hat{F}_1^1(t; D_1)\)(公式2),并将其表示为样条函数(连续、单调非减)。将样条参数传递给站点2。 2. 站点2:收到样条参数后,可以重构 \(\hat{F}_1^1(t; D_1)\)。然后,站点2用自己的数据 \(D_2\) 来更新这个估计。更新公式(公式8)的核心是:
为什么这个更新公式有效? - 关键想法:合并数据的CIF估计 \(\hat{F}_1^1(t; D_1 \cup D_2)\) 满足得分方程 \(\sum_{i \in D_1} \psi(\hat{F}_1^1(t); o_i) + \sum_{i \in D_2} \psi(\hat{F}_1^1(t); o_i) = 0\)。站点2无法计算第一项(因为它没有\(D_1\)的数据),但可以用Von Mises展开来近似它:
数学困难:这个近似的有效性依赖于影响函数的性质(均值为0,导数趋近于-1)。附录A的引理证明了 \(\frac{1}{N} \sum_{i=1}^N \frac{\partial \psi(\hat{F}_k^a(t); o_i)}{\partial \hat{F}_k^a(t)} \xrightarrow{p} -1\),这保证了更新公式的分母 \(N_1 + N_2\) 是Newton法分母的渐近等价形式。
结论:在这个最简特例下,本文的核心想法是:用影响函数将历史数据的信息压缩成一个“差值”(当前估计与历史估计的差异),从而允许后续站点在不访问原始数据的情况下进行增量更新。这个想法直接推广到多个站点、多个暴露水平和多个事件类型。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在联邦学习框架下,如何在不共享患者级数据的前提下,对多中心EHR数据中的竞争风险事件进行非参数因果推断,具体包括构建协变量调整后的累积发生率曲线(CIF)和计算受限平均时间损失(RMTL)。
- 核心工具/方法:基于经验影响函数的增量更新算法,结合联邦倾向性得分模型(Luo & Song 2020, Duan et al. 2020)和联邦Kaplan-Meier方法(Risk et al. 2025),通过三轮顺序通信实现CIF和RMTL的联邦估计。
- 主要结论:模拟研究表明,所提方法在偏差和效率上与合并数据(金标准)几乎相同,而元分析(meta-analysis)效率远低。在OneFlorida+网络的10个站点、10,281名癌症患者中的应用显示,有预先存在非内分泌自身免疫性疾病的患者在ICI治疗后18个月内因内分泌irAE损失4.8个月的无事件生存时间,而无AID组为3.2个月。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 数据分布:观测数据 \((X_i, \Delta_i, A_i, Z_i)\) 独立同分布(i.i.d.)于某个未知分布。
- 删失机制:假设删失时间 \(C_i\) 独立于事件时间 \(T_i\) 和事件类型 \(\Omega_i\),条件于协变量 \(Z_i\) 和暴露 \(A_i\)(条件独立删失)。这是一个标准假设,但本文未明确讨论其合理性。
- 倾向性得分模型:假设倾向性得分模型 \(g(P(A_i=1|Z_i)) = \alpha^T Z_i\) 是正确设定的(即logit模型是真实的)。这是一个强假设,本文未讨论模型误设的稳健性。
- 权重已知假设:在推导CIF的影响函数和方差估计时,将估计的权重 \(\hat{w}_i\) 视为已知。这是一个关键的技术假设,作者承认这会导致方差高估(over-conservative inference),并引用Austin (2016)和Chen et al. (2025)来支持这一做法。
- 样条近似:CIF和生存函数在站点间传递时被表示为连续、单调非减的样条函数。这引入了近似误差,但作者通过模拟表明该误差可忽略。
- 第一站点样本量:要求第一站点在每组中至少有10个患者处于风险中,以确保初始估计的稳定性。
相比已有文献的放宽或强化: - 放宽:相比Fine-Gray模型(Zhang et al. 2024),本文不要求比例风险假设。 - 强化:相比伪观察方法(Rahman & Purushotham 2023),本文不共享局部风险表,从而降低了隐私风险。 - 相同:与Conner & Trinquart (2021)的非联邦IPW-RMTL方法相比,本文的识别假设和估计量本质相同,只是增加了联邦通信协议。
主要结果¶
理论结果(隐含在算法和附录中): - 定理1(隐含):所提联邦CIF估计量 \(\hat{F}_k^a(t)\) 是合并数据CIF估计量 \(\hat{F}_k^a(t; D_1 \cup \dots \cup D_S)\) 的渐近等价形式。附录A的推导表明,更新公式(8)的每一步都基于Von Mises展开和影响函数的性质,使得最终估计量满足与合并数据估计量相同的得分方程(渐近意义上)。 - 定理2(隐含):所提联邦CIF估计量的方差可由影响函数的平方和一致估计(公式11),且该估计量是渐近正态的(公式10)。 - 定理3(隐含):所提联邦RMTL估计量 \(\hat{\mu}_1 - \hat{\mu}_0\) 是渐近正态的,其方差可由RMTL的影响函数(公式13)的平方和一致估计(公式14)。
模拟结果: - 偏差:在三种模拟场景(指数/Weibull失效时间、不同删失率)下,所提方法的RMTL差异估计的偏差几乎为零,与合并数据估计量相同。元分析方法的偏差更大(尤其在删失率高时)。 - 效率:所提方法的相对效率(相对于合并数据)接近1,而元分析方法的效率远低(相对效率<0.5,在高删失场景下甚至更低)。 - 检验:所提方法的I类错误率控制在5%附近,与合并数据方法相同;元分析方法在高删失场景下I类错误率膨胀(>10%)。所提方法的检验功效与合并数据方法几乎相同,元分析方法功效更低。
应用结果: - 数据:OneFlorida+网络10个站点,10,281名接受ICI治疗的癌症患者,其中929人(9%)有预先存在的非内分泌AID。 - 方法:使用IPW调整药物类型、年龄、性别和Charlson合并症指数(CCI)。RMTL截断时间\(\tau=18\)个月(确保至少25%的患者处于风险中)。 - 结果: - 加权分析显示,有AID组因内分泌irAE损失的平均无事件生存时间为4.8个月(95% CI: [4.3, 5.2]),无AID组为3.2个月(95% CI: [3.1, 3.3])。差异为1.6个月。 - 加权分析显示,有AID组的18个月irAE-free生存RMST为10.8个月(95% CI: [10.2, 11.3]),无AID组为12.1个月(95% CI: [11.9, 12.2])。 - 未加权分析结果类似(有AID组RMTL=4.6个月,无AID组RMTL=3.2个月)。 - 例子想说明什么:该应用验证了方法的实用性——能够在真实多中心数据中产生有临床意义的因果比较结果,且与先前文献(Cappelli et al. 2022)一致。同时,它展示了方法在样本量分布极不均匀(站点样本量从1到3495)的情况下的可行性。
证明路线与技术技巧¶
整体路线(以CIF估计为例,3-5步逻辑主干):
- 第一步:估计权重和生存函数。使用联邦GLM(Luo & Song 2020, Duan et al. 2020)估计倾向性得分,计算IPW权重。使用联邦KM方法(Risk et al. 2025)估计生存函数 \(\hat{S}^a(t)\) 和风险函数 \(\hat{Y}^a(t)\)。这些是后续CIF估计的输入。
- 第二步:第一站点初始化。第一站点用自己的数据计算CIF估计 \(\hat{F}_k^a(t; D_1)\)(公式2),并将其拟合为样条函数。将样条参数传递给下一站点。
- 第三步:后续站点增量更新。对于每个后续站点\(s\),收到上一站点的样条参数后,重构 \(\hat{F}_k^a(t; \tilde{D}_{s-1})\)。然后,在\(Q\)个密集时间点上,用迭代更新公式(8)将本地数据\(D_s\)合并到估计中。更新公式的核心是用Von Mises展开近似历史数据的得分方程。
- 第四步:收敛判断与传递。检查收敛条件(公式9):累积影响函数和的绝对值是否小于阈值\(\epsilon\)。收敛后,将新的CIF估计拟合为样条,并传递到下一站点。
- 第五步:推断。在最终站点,用公式(11)计算CIF的方差(基于影响函数平方和的累积和),用公式(14)计算RMTL差异的方差。
关键跳跃点: - 如何用历史估计近似历史数据的得分方程? 这是整个算法的核心。附录A的推导使用了Von Mises展开(Gill 1989):
技术技巧点名: - 经验影响函数:用于度量每个观测对CIF估计的影响,是联邦更新的核心工具。其性质(均值为0,导数趋近于-1)保证了更新公式的有效性。 - Von Mises展开:用于近似历史数据的得分方程,是连接历史估计与历史数据的关键桥梁。 - Newton法:用于求解更新后的得分方程,但分母被简化为累积样本量(基于影响函数的导数性质)。 - 样条平滑:用于在站点间传递CIF和生存函数,避免泄露个体事件时间。样条参数(系数、自由度、节点位置)是唯一共享的信息。 - 顺序通信:站点按样本量从大到小排序,以最大化估计的收敛速度。
🔎 结论是否比证明窄¶
- “权重已知”假设的局限性:作者在2.5.1节明确承认,将权重视为已知会导致方差高估(over-conservative inference)。这是一个严格的证明结论(在权重已知假设下推导了方差公式),但作者在结论中将其泛化为“可接受的局限性”。实际上,当倾向性得分模型复杂(如包含高维协变量或非线性项)时,权重估计的不确定性可能很大,方差高估的程度可能不可忽略。作者没有给出方差高估的量化界。
- “直接效应”的缺失:作者在结论中承认,RMTL差异只能估计总效应,无法区分直接效应(暴露对事件k的直接影响)和间接效应(通过影响竞争事件而间接影响事件k)。这是一个证明结论的窄化——方法本身只能估计总效应,而作者在应用中将结果解释为“AID增加了irAE风险”,这实际上是总效应。要估计直接效应,需要更复杂的IPCW方法,作者将其列为未来工作。
- “样条近似”的误差:作者在算法中使用样条来传递CIF,但未在理论上证明样条近似误差对最终估计的影响。模拟中样条近似误差可忽略,但在极端情况下(如事件时间分布非常不规则),样条可能无法很好地逼近CIF。这是一个证明未覆盖的潜在问题。
- “第一站点样本量”要求:作者建议第一站点在每组中至少有10个患者处于风险中,但未给出理论证明。这是一个经验规则,而非严格定理。
四、开放问题(点到为止,扎根具体语句)¶
- 直接效应估计的联邦化:本文的RMTL只能估计总效应。作者在结论中写道:“Extending our previously developed federated methods for KM analysis ... to allow for IPCW is a potential future direction which would address this limitation and allow for a more fulsome treatment of competing risks data.” 这是一个明确的开放问题:如何将联邦KM方法与IPCW结合,以估计暴露对事件k的直接效应(控制竞争事件作为删失)?
- 方差调整以考虑权重估计的不确定性:作者承认将权重视为已知会导致方差高估(2.5.1节:“treating the weights as known typically leads to over-estimation of variance”)。开放问题是:如何推导一个包含权重估计不确定性的调整后影响函数,从而得到更精确的方差估计?这可能需要用到M-estimation理论或delta方法。
- 扩展到更复杂的因果框架:本文的识别假设(交换性、正性、一致性)是标准的,但未讨论未测量混杂或工具变量等更复杂的情况。开放问题是:如何将联邦CIF方法扩展到近端因果推断(Proximal Causal Inference) 或工具变量设定下,以处理未测量混杂?这需要开发新的识别策略和联邦估计算法。
- 扩展到连续时间或高维协变量:本文的CIF估计基于离散事件时间(唯一事件时间点)。开放问题是:如何将方法扩展到连续时间(如使用核平滑)或高维协变量(如使用正则化回归估计倾向性得分)?这可能需要引入更复杂的非参数或半参数技术。
Maintained by 陈星宇 · Homepage · Source on GitHub