跳转至

Transporting Randomized Trial Effects to Real-World Populations via Riesz-Calibrated Optimal Transport

作者: Anik Burman, Margaret Gamalo, Promit Ghosal, Prosenjit Kundu
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.23453


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:如何将随机对照试验(RCT)中估计的因果效应,可靠地外推到一个与试验人群在协变量分布上存在差异的真实世界目标人群。其核心统计挑战在于,目标人群中的平均处理效应(ATE)是一个依赖于目标协变量分布的泛函,而试验数据只能提供在试验协变量分布下的条件结果信息。因此,估计的关键在于准确估计目标-试验协变量密度比 \( r^\dagger = dQ_X / dP_X \),这个密度比既是重加权估计的核心权重,也是半参数有效影响函数中的Riesz表示子。该方向的成熟度较高,已有大量关于识别、估计和推断的工作,但如何应对模型误设和弱重叠问题仍是活跃的研究前沿。

发展脉络

  • 奠基工作:Stuart et al. (2011) 和 Cole & Stuart (2010) 系统性地提出了使用倾向评分(sampling propensity score)来评估和调整RCT结果的可推广性。他们将试验参与倾向性建模为协变量的函数,通过逆概率加权(IPW)来对齐试验与目标人群。这一框架奠定了该领域的基础,但其性能高度依赖于倾向评分模型的正确设定。

  • 主要进展:为了克服倾向评分模型误设的风险,研究者发展了多种替代方法。平衡加权方法(Hainmueller, 2012; Imai & Ratkovic, 2014; Zubizarreta, 2015; Chan et al., 2016)直接求解权重,使得加权后的试验样本在预设的协变量函数上与目标样本匹配,从而避免了显式建模倾向评分。双重稳健方法(Bang & Robins, 2005; Dahabreh et al., 2020)结合了结果回归和加权,只要其中之一正确,估计量就一致。校准方法(Josey et al., 2021; Lee et al., 2023; Chen et al., 2023)被专门用于可推广性分析,通过矩条件来估计权重。这些工作极大地丰富了工具箱,但平衡加权仅能保证有限个矩条件的平衡,而校准方法通常依赖于一个预设的、可能误设的权重模型。

  • 当前前沿:最优传输(OT)方法(Dunipace, 2021; Gunsilius & Xu, 2022; Yan et al., 2024)提供了一个新的视角,它直接在协变量空间中对齐两个分布,而不是通过一个标量的倾向评分。Dunipace (2021) 的“因果最优传输”工作与本论文最为接近,它通过最小化Sinkhorn散度来构造权重,并可施加平衡约束。然而,这些工作并未系统性地分析正则化OT权重与目标密度比 \( r^\dagger \) 之间的偏差,也未提供消除该偏差的通用校准框架。

  • 本文的位置:本文(Burman et al., 2026)定位在“OT + 校准”的交汇点。它首先诊断出固定正则化参数下,未校准的OT权重与 \( r^\dagger \) 之间存在一个不随样本量衰减的人口层面偏差(Theorem 4.2)。然后,它提出Riesz校准(RiCOT),通过在OT优化问题中直接施加校准方程(即Riesz矩条件)来消除这一偏差。这使得校准后的权重在正则化参数固定为正的情况下,仍能一致估计 \( r^\dagger \)(Theorem 4.5)。最后,它将校准后的权重与结果回归结合,构建了一个达到半参数效率界的双重稳健估计量(Theorem 5.2)。本文的贡献不在于单独提出OT或校准,而在于刻画了正则化OT的推断偏差,并提供了一个不依赖正则化参数衰减的校准修复机制。

子线索聚类

  1. 倾向评分与加权方法:以 Stuart et al. (2011), Cole & Stuart (2010), Westreich et al. (2017) 为代表。核心是建模试验参与概率,通过IPW或逆几率加权进行外推。优点是直观,但易受模型误设和弱重叠影响。
  2. 平衡与校准方法:以 Hainmueller (2012), Imai & Ratkovic (2014), Zubizarreta (2015), Chan et al. (2016), Josey et al. (2021), Lee et al. (2023), Chen et al. (2023) 为代表。核心是直接求解权重以匹配协变量矩,避免显式建模倾向评分。优点是更稳健,但通常只保证有限个矩条件的平衡,且校准方法本身也可能依赖于一个预设的权重模型。
  3. 因果最优传输方法:以 Dunipace (2021), Gunsilius & Xu (2022), Yan et al. (2024) 为代表。核心是利用OT在协变量空间进行全局对齐,构造权重。优点是几何直观,能处理复杂的分布偏移。但本文指出,直接使用正则化OT权重会引入偏差,且现有工作未系统解决此问题。
  4. Riesz表示子直接估计:以 Chernozhukov et al. (2021, 2026) 为代表。核心是通过回归或对抗性方法直接估计目标泛函的Riesz表示子。本文的不同之处在于,它从一个正则化OT权重出发,然后通过校准将其修正为Riesz表示子,从而结合了OT的几何结构与推断所需的矩表示。

核心问题与瓶颈

  • 核心问题1:如何稳健地估计目标-试验密度比 \( r^\dagger \)?这是所有外推方法的核心。倾向评分方法依赖于一个未知的、可能高度非线性的模型。平衡方法只能保证有限个矩的平衡。OT方法提供了一个几何对齐,但正则化引入了偏差。
  • 核心问题2:如何应对弱重叠(weak overlap)?当目标与试验的协变量分布重叠很小时,倾向评分权重会变得不稳定,方差极大。OT的源松弛(source-relaxation)机制可以自动为对齐不良的试验单元分配较小的权重,从而提供一种自然的稳定性。
  • 核心问题3:如何实现半参数有效推断?一个理想的估计量应该具有双重稳健性,并且其方差能够达到半参数效率界,从而可以构建有效的置信区间。这要求权重估计量 \( \hat{r} \) 和结果回归估计量 \( \hat{\mu}_0 \) 的乘积误差满足 \( o_p(N^{-1/2}) \) 的条件。

⚠️ 作者的 framing

作者将缺口 frame 为:“正则化OT权重存在一个不随样本量衰减的偏差,这个偏差源于其与目标密度比 \( r^\dagger \)(即Riesz表示子)之间的系统性差异。” 因此,本文的“显然的下一步”就是通过施加Riesz矩条件来校准OT权重,从而消除这个偏差。

  • 被淡化或回避的竞争路线:作者将本文定位为“参数化倾向评分加权的稳健替代方案”,并明确指出“当采样倾向性模型正确设定时,传统的AIPW可以有效地利用该参数结构”。这暗示了在模型正确时,传统方法可能更优。作者也回避了与直接估计Riesz表示子的方法(如Chernozhukov et al., 2021)进行深入的比较,只是说明本文的起点不同(从OT权重出发)。
  • 什么明显该被引/该存在、却没出现在intro里:作者在“Related Work”中提到了直接估计Riesz表示子的工作,但并未在intro中将其作为一条主要的竞争路线进行讨论。对于一位熟悉半参数理论的读者来说,一个自然的问题是:“为什么不直接用Chernozhukov et al. (2021)的Riesz回归来估计 \( r^\dagger \),而是要用一个复杂的OT+校准两步法?” 作者在intro中并未正面回答这个问题,而是强调了OT的“几何结构”和“全局对齐”优势。这是一个值得研究者去查的问题:在什么条件下,OT+校准比直接Riesz回归更好?是有限样本性能、对弱重叠的鲁棒性,还是计算上的优势?

张力

未见明显对立引用。所有被引工作基本都认同“模型误设和弱重叠是主要挑战”,并各自提出解决方案。本文的诊断(正则化OT有偏差)和解决方案(校准)与现有文献是互补而非矛盾的。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型与可观测数据

  • 符号:
  • \( P \):试验数据的联合分布。
  • \( Q \):目标人群数据的联合分布。
  • \( X \in \mathbb{R}^d \):基线协变量。
  • \( T \in \{0, 1\} \):处理指示变量(在试验中随机分配)。
  • \( Y \):观测到的结局。
  • \( Y(a) \):潜在结局(在 \( T=a \) 下的结局)。
  • \( \tau_Q := E_Q[Y(1) - Y(0)] \):目标 estimand,即目标人群中的平均处理效应(ATE)。
  • \( \mu_0(x) := E_P[Y | X=x, T=0] \):控制组响应曲面,是试验数据中可识别的条件期望。
  • \( r^\dagger(x) := dQ_X(x) / dP_X(x) \):目标-试验密度比,是核心的待估参数。
  • \( e_0(x) := P(T=0 | X=x) \):随机化概率,在试验中已知。
  • \( A := (1-T) / e_0(X) \):逆随机化权重,用于将控制组条件期望转化为无条件期望。
  • \( \Psi(\mu, r) \):估计泛函,是构建估计量的基础。

  • 模型:

  • 数据生成机制:存在两个独立样本。试验样本 \( O^R_i = (X_i, T_i, Y_i) \sim P \),其中 \( T_i \) 是随机分配的。目标样本 \( O^Q_j = (X^Q_j, Y^Q_j) \sim Q \),所有目标个体都接受处理(\( Y^Q_j = Y^Q_j(1) \))。
  • 识别假设:
    1. 一致性:在试验中,\( Y = T Y(1) + (1-T) Y(0) \);在目标中,\( Y^Q = Y^Q(1) \)。
    2. 正定性:\( 0 < e \le e_0(x) \le \bar{e} < 1 \)。
    3. 控制响应可传输性:\( E_Q[Y^Q(0) | X^Q=x] = \mu_0(x) \)。
    4. 重叠:\( Q_X \ll P_X \),且 \( r^\dagger \) 有界。
  • 待估对象:\( r^\dagger \) 和 \( \mu_0 \)。\( \mu_0 \) 由试验数据直接识别。\( r^\dagger \) 是本文通过校准OT来估计的核心对象。

  • 可观测数据:

  • 试验数据:\( \{ (X_i, T_i, Y_i) \}_{i=1}^n \)。我们可以观测到协变量、随机分配的处理和结局。
  • 目标数据:\( \{ (X^Q_j, Y^Q_j) \}_{j=1}^m \)。我们可以观测到协变量和在接受处理下的结局。
  • 不可观测:目标个体在控制组下的潜在结局 \( Y^Q_j(0) \)。这是需要通过外推来估计的。识别假设 (iii) 将 \( E_Q[Y^Q(0) | X^Q] \) 与可观测的 \( \mu_0(X^Q) \) 联系起来。

第二步:最小内核

本文的核心数学问题是:如何从正则化最优传输中获得的权重 \( r_{\epsilon, \rho} \),得到一个对目标-试验密度比 \( r^\dagger \) 的一致估计?

最简特例:考虑一个极端简化的情形,其中协变量是单维的(\( d=1 \)),且 \( P_X \) 和 \( Q_X \) 都是已知的连续分布。我们使用平衡的、无熵正则化的OT(即 \( \rho=0, \epsilon=0 \))。在这种情况下,最优传输计划是一个确定性的映射,它将每个试验点 \( x \) 映射到目标点 \( z \),使得累积分布函数相等:\( F_P(x) = F_Q(z) \)。由此产生的试验侧权重 \( r(x) \) 是 \( x \) 处的密度比 \( q(x)/p(x) \),这正是 \( r^\dagger(x) \)。在这个特例下,OT完美地恢复了密度比。

现在,引入熵正则化(\( \epsilon > 0 \))。如论文中 Proposition 4.1 所示,当 \( \rho=0 \) 时,权重变为 \( r_{\epsilon,0}(x) = S_\epsilon[ q / (S_\epsilon p) ](x) \),其中 \( S_\epsilon \) 是高斯平滑算子。这意味着 \( r_{\epsilon,0} \) 是 \( r^\dagger \) 的一个平滑版本,而不是 \( r^\dagger \) 本身。例如,如果 \( p \) 和 \( q \) 都是高斯分布,那么 \( r^\dagger \) 是一个指数二次型,而 \( r_{\epsilon,0} \) 会是一个更“模糊”的版本。这个偏差是人口层面的,不随样本量增加而消失。

本文的关键想法是:不试图让 \( \epsilon \to 0 \) 来消除这个偏差(这会导致计算和统计上的困难),而是通过施加额外的约束来修正这个偏差。这个约束就是Riesz矩条件:\( E_P[ r(X) h(X) ] = E_Q[ h(X) ] \)。在有限维空间 \( H_J \) 上施加这个约束,就得到了校准后的权重 \( \hat{r} \)。校准的作用是“纠正”由正则化OT产生的权重,使其在 \( H_J \) 上满足正确的矩条件,从而逼近 \( r^\dagger \)。随着 \( J \) 的增长,校准空间 \( H_J \) 越来越丰富,\( \hat{r} \) 对 \( r^\dagger \) 的逼近也越来越好。

因此,这篇论文在数学上干了一件什么事?它证明了:通过在一个不断增长的有限维空间上施加Riesz矩条件,可以消除由固定正则化参数(\( \epsilon, \rho \))引起的、不随样本量衰减的OT权重偏差,从而使得校准后的权重成为目标-试验密度比 \( r^\dagger \) 的一致估计。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:如何将随机对照试验(RCT)的平均处理效应(ATE)稳健且有效地外推到接受相同处理的真实世界目标人群,特别是在倾向评分模型可能误设且协变量分布重叠较弱的情况下。
  2. 核心工具/方法:提出了RiCOT(Riesz-Calibrated Optimal Transport)方法,该方法在带熵正则化和源松弛的半非平衡最优传输问题中,直接嵌入Riesz矩条件作为校准方程,从而修正正则化OT权重与目标密度比 \( r^\dagger \) 之间的系统性偏差。
  3. 主要结论:校准后的权重 \( \hat{r} \) 在正则化参数固定为正时,仍能一致估计 \( r^\dagger \)(Theorem 4.5)。结合交叉拟合的结果回归 \( \hat{\mu}_0 \),所得的双重稳健估计量 \( \hat{\tau} \) 在乘积率条件下达到半参数效率界(Theorem 5.2),且其方差可通过影响函数直接估计,无需重抽样(Theorem 5.2)。

关键设定与假设

  • 设定:两样本设定。一个RCT样本 \( (X, T, Y) \sim P \),一个真实世界目标样本 \( (X^Q, Y^Q) \sim Q \)。目标 estimand 是目标人群中的ATE,\( \tau_Q = E_Q[Y(1) - Y(0)] \)。由于目标人群均接受处理,\( Y^Q = Y^Q(1) \) 可直接观测,核心挑战是估计 \( E_Q[Y(0)] \)。
  • 关键假设:
  • Assumption 1 (Causal Identification):包含一致性、正定性、控制响应可传输性(\( E_Q[Y^Q(0)|X^Q=x] = \mu_0(x) \))和重叠(\( Q_X \ll P_X \), \( r^\dagger \) 有界)。这是识别的基础。
  • Assumption S2 (Transport program and calibration design):这是技术性假设,用于保证校准OT的统计性质。包括:基函数 \( b_J \) 的Gram矩阵特征值一致有界(S2(i));对数密度比与偏移量的差 \( \log r^\dagger - \gamma L \) 可以被基函数以 \( J^{-s/d} \) 的速率逼近(S2(ii)),其中 \( s > d/2 \) 是光滑性参数;以及传输计划的数值稳定性(S2(iii))。相比已有文献,这些假设明确地将校准空间视为一个筛子(sieve),其维度 \( J \) 随样本量增长,这是本文理论的核心。
  • Assumption S3 (Cross-fitting and outcome regression):结果回归 \( \hat{\mu}_0 \) 通过交叉拟合估计,且其 \( L^2(P) \) 误差以 \( N^{-\beta} \) 速率收敛。这是标准假设。
  • Assumption S4 (Two-sided overlap):\( r^\dagger \) 有界且远离0。这个假设比识别所需的单侧重叠更强,主要用于校准权重的率理论(Theorem 4.5),以确保对数尺度上的操作是良定义的。

主要结果

  • Theorem 4.2 (Regularization bias at fixed \( (\epsilon, \rho) \)):推导了未校准OT权重 \( r_{\epsilon, \rho} \) 与真实密度比 \( r^\dagger \) 之间的人口层面偏差的显式展开。偏差由两部分组成:源松弛项 \( (\rho/\epsilon) B_\epsilon \) 和熵平滑项 \( (\epsilon/4)[\Delta r^\dagger - r^\dagger \Delta p / p] \)。这个偏差是 \( O(\rho/\epsilon + \epsilon) \) 量级,且不随样本量衰减。这个定理是诊断性的,它揭示了为什么需要校准。
  • Theorem 4.5 (Calibration rate):这是校准权重的核心收敛定理。它证明了,在合适的筛子维度 \( J_N \) 增长条件下,校准后的权重 \( \hat{r} \) 在 \( L^2(P_X) \) 范数下以 \( O_p(J_N^{-s/d} + \sqrt{J_N \log J_N / N} + a_{L,N}) \) 的速率收敛到 \( r^\dagger \)。关键点是,这个收敛速率中不包含与 \( \epsilon \) 或 \( \rho \) 相关的偏差项,因为校准已经将其消除。正则化参数只通过影响偏移量 \( L \) 的估计误差 \( a_{L,N} \) 来间接影响速率。
  • Theorem 5.2 (Efficient limit distribution and plug-in variance):这是推断的核心定理。它证明了,在乘积率条件 \( \|\hat{r} - r^\dagger\|_{L^2} \|\hat{\mu}_0 - \mu_0\|_{L^2} = o_p(N^{-1/2}) \) 下,RiCOT估计量 \( \hat{\tau} \) 是渐近线性的,其影响函数就是Theorem 3.1中的有效影响函数,因此 \( \sqrt{m}(\hat{\tau} - \tau_Q) \xrightarrow{d} N(0, V_{eff}) \)。更重要的是,它证明了通过简单代入估计量得到的方差估计量 \( \hat{V} \) 是 \( V_{eff} \) 的一致估计,从而可以直接构建Wald置信区间,无需重抽样或重复求解OT问题。

证明路线与技术技巧

  • 整体路线:

    1. 识别与有效影响函数:首先,通过标准因果推断假设识别出 \( \tau_Q \)(Proposition 2.1)。然后,推导出 \( \tau_Q \) 在非参数模型下的有效影响函数(Theorem 3.1),其中目标-试验密度比 \( r^\dagger \) 作为Riesz表示子出现。最后,得到一个精确的二阶余项表达式(Proposition 3.2),将估计误差与 \( \hat{r} - r^\dagger \) 和 \( \hat{\mu}_0 - \mu_0 \) 的乘积联系起来。
    2. 刻画未校准OT的偏差:通过分析半非平衡熵正则化OT的对偶问题,得到未校准权重 \( r_{\epsilon, \rho} \) 的核表示(Proposition 4.1)。然后,利用热核展开(Lemma ST3)和扰动分析,推导出 \( r_{\epsilon, \rho} \) 与 \( r^\dagger \) 之间的人口层面偏差(Theorem 4.2)。
    3. 校准OT权重的构造与收敛性:在OT问题中直接嵌入Riesz矩条件作为约束(Definition 2)。通过求解KKT条件,发现校准效应表现为一个乘性指数倾斜(Proposition 4.3)。进一步,通过变量替换 \( \theta = -\lambda/(\epsilon+\rho) \),将校准问题转化为一个关于 \( \theta \) 的有限维凸M-估计问题(Proposition 4.4)。最后,利用筛子M-估计的标准技巧,证明校准权重 \( \hat{r} \) 的 \( L^2 \) 收敛速率(Theorem 4.5)。
    4. 双重稳健估计与有效推断:将校准权重与交叉拟合的结果回归结合,构建一步估计量 \( \hat{\tau} \)(Definition S2)。通过精确的随机分解(Theorem ST1),将估计误差分解为有效影响函数的样本平均加上三个余项。利用交叉拟合和校准权重的熵控制(Lemma ST2),证明余项均为 \( o_p(N^{-1/2}) \)。从而得到渐近正态性和方差估计的一致性(Theorem 5.2)。
  • 关键跳跃点:

    • 从OT权重到校准权重的跳跃:最关键的跳跃在于认识到,校准约束在KL散度惩罚下会自然地产生一个乘性指数倾斜(Proposition 4.3),而不是一个加性修正。这使得校准后的权重能够保持OT权重的几何结构(例如,对弱重叠单元的自动降权),同时满足推断所需的矩条件。
    • 从无限维校准到有限维凸优化的跳跃:将校准问题转化为一个关于 \( \theta \) 的凸优化问题(Proposition 4.4)是技术上的关键。这使得我们可以利用成熟的M-估计理论来分析校准权重的收敛性,而无需处理无限维的约束优化问题。
  • 技术技巧点名:

    • Gibbs平滑算子 \( S_\epsilon \):用于简洁地表示熵正则化OT权重的解析形式,并利用热核展开进行偏差分析。
    • 热核展开(Heat kernel expansion):用于推导未校准OT权重的偏差展开式(Theorem 4.2),将平滑效应与密度比联系起来。
    • 指数倾斜(Exponential tilt):校准约束在KL散度下自然产生的形式,保证了权重的正性和几何结构的保持。
    • 筛子M-估计(Sieve M-estimation):用于分析校准权重 \( \hat{r} \) 的收敛速率(Theorem 4.5),通过控制得分函数、证明局部强凸性等标准步骤。
    • 交叉拟合(Cross-fitting):用于处理结果回归 \( \hat{\mu}_0 \) 的估计误差,避免Donsker类条件,使得余项分析更简洁。
    • 经验过程理论(Empirical process theory):用于控制涉及校准权重 \( \hat{r} \) 的余项(Lemma ST2),因为 \( \hat{r} \) 没有被交叉拟合,需要利用其所属函数类的熵来控制其经验过程。

真实例子与应用

  • 数据/场景:转甲状腺素蛋白淀粉样心肌病(transthyretin amyloid cardiomyopathy)的30个月全因死亡率。目标人群来自一个真实世界注册研究(THAOS),所有患者均接受研究药物治疗。试验数据来自一个比较研究药物与安慰剂的RCT(Maurer et al., 2018)。
  • 方法应用:将RiCOT与五种对比方法(Naive, G-comp, IPW-PS, IPW-OT, AIPW-PS)应用于该数据。基线协变量包括年龄、性别、种族/民族、BMI、NYHA分级、TTR基因型和暴露时间。校准筛子维度设为 \( J=11 \)。
  • 结果:
    • 所有调整后的估计量都给出了比未调整估计量(-0.334)更大的绝对风险差,这与目标人群基线风险更高的事实一致。
    • G-comp, AIPW-PS 和 RiCOT 的估计值非常接近(分别为 -0.534, -0.540, -0.556),表明结果回归在此应用中捕捉了大部分安慰剂风险变异。
    • IPW-PS 的估计值(-0.476)有所衰减,而 IPW-OT 的估计值(-0.578)更接近双重稳健估计量。这表明校准OT权重比参数化采样倾向性模型更好地逼近了密度比。
    • RiCOT 的95%置信区间为 (-0.617, -0.494),且对 \( J \) 的选择不敏感(Figure 7)。
  • 这个例子想说明什么:该例子旨在展示RiCOT在实际应用中的可行性,并验证其在真实数据上的表现与模拟结果一致。它表明,当结果回归模型表现良好时,RiCOT能提供与其他双重稳健方法相似的估计;而当权重估计是关键时,校准OT权重可能优于参数化倾向评分权重。

🔎 结论是否比证明窄

论文的结论是严谨的,但有一个重要的细微之处需要指出。Theorem 5.2 的渐近正态性和效率要求乘积率条件 \( \|\hat{r} - r^\dagger\|_{L^2} \|\hat{\mu}_0 - \mu_0\|_{L^2} = o_p(N^{-1/2}) \)。虽然论文在Corollary ST10中给出了保证该条件成立的充分条件(如 \( \beta + s/(2s+d) > 1/2 \)),但这个条件本身是一个关于两个估计量收敛速率的联合条件,而不是一个关于单个估计量的简单条件。在实际应用中,很难验证这个条件是否满足。论文在模拟中展示了在特定设定下该条件成立,但并未声称在所有情况下都成立。因此,结论“达到半参数效率界”是在一个特定的、可验证的乘积率条件下成立的,而非无条件成立。论文在Discussion中也坦诚地讨论了这一点,指出“tradeoff is the slower rate and potentially greater finite-sample variability associated with nonparametric estimation”。

四、开放问题

  1. 对可传输性假设的敏感性分析:论文明确指出“identification rests throughout on conditional transportability, an assumption that cannot be checked from the observed data. A formal sensitivity analysis for departures from this assumption is therefore the most important robustness gap”。这是一个明确的、由作者自己提出的开放问题。扎根于论文 Section 10 的讨论。
  2. 扩展到时间-事件结局:论文在Section 9中处理了复发事件率,但明确指出“extending the Riesz-calibration argument to time-to-event outcomes is the immediate methodological direction”。这是一个具体的、由作者指出的下一步方向。扎根于论文 Section 10 的讨论。
  3. 使用真实世界数据增强随机对照臂:论文提到“Designs that use real-world controls to augment a randomized control arm are a second [substantive next step]”。这改变了 estimand 和传输结构,提出了新的识别问题。扎根于论文 Section 10 的讨论。
  4. 非相同协变量集与高维表示子估计:论文在Section 10的末尾简要提到了“nonidentical covariate sets across trial and real-world data, high-dimensional representer estimation”。这是一个更广泛的开放领域,论文本身并未深入探讨。扎根于论文 Section 10 的讨论。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论