跳转至

Randomization inference for treatment effects on survival outcomes

作者: Lucy D'Agostino McGowan, Joseph Rigdon, Xinran Li, Dylan Small
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.16529


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在随机化临床试验中,当主要终点是删失的生存时间(time-to-event)时,如何在不依赖参数模型(如 Cox 比例风险模型或加速失效时间模型)的前提下,给出一个标量效应大小(scalar effect-size summary)的置信区间。当前成熟度:log-rank 检验和 Kaplan-Meier 曲线是标准工具,但它们不直接量化效应幅度;Cox 模型和 AFT 模型填补了这个缺口,但引入了超出随机化本身所需的分布假设。本文的工作是填补“非参数效应大小推断”这个缺口——它试图让效应大小的置信区间与 log-rank 检验一样,仅依赖随机化分配分布即可保证有效性。

发展脉络(history)

  1. 奠基工作:log-rank 检验与 Cox 模型
  2. Peto et al. (1977):提出了 log-rank 检验的实用框架,并给出了一个基于 log-rank 统计量的风险比估计量。但 Lin et al. (2016) 指出 Peto 的估计量不一致,其置信区间覆盖概率不正确。
  3. Cox (1972):提出了比例风险模型,使得风险比成为最常用的效应大小度量。但比例风险假设在实践中可能被违反,且该假设并非 Kaplan-Meier 估计或 log-rank 检验有效性的必要条件。

  4. 主要进展:随机化推断框架的建立

  5. Li and Small (2023):建立了 log-rank 检验的有限总体随机化推断基础。他们证明,在 Bernoulli 随机化实验和非信息性 i.i.d. 删失下,log-rank 统计量在无处理效应的 sharp null 下是渐近标准正态的。这是本文的直接基础——本文将其结果从“无效应”的 sharp null 推广到“常数效应”的 sharp null 族。

  6. 当前 frontier:非参数效应大小推断

  7. Lin et al. (2016):通过反转 Cox 模型下的得分检验来构造风险比的置信区间。他们的区间具有“若 log-rank 检验显著则区间排除零”的性质,且比 Wald 区间更窄更准确。但该区间仍依赖比例风险假设。
  8. 本文 (McGowan et al., 2026):将 Li and Small (2023) 的随机化推断框架扩展到常数处理效应(加法移位 c 和乘法因子 ρ),通过反转 log-rank 检验构造置信区间。其核心创新在于:不仅转换潜在事件时间,还转换潜在删失时间,以确保在 sharp null 下观测到的风险时间和事件指示符完全确定。

子线索聚类

这些被引文献大致落在两条子线索上:

  1. 基于模型的效应大小推断(Cox 模型、AFT 模型):
  2. 代表工作:Cox (1972), Wei (1992), Lin et al. (2016)。
  3. 核心思路:假设一个参数或半参数模型(比例风险、加速失效时间),通过似然或部分似然进行推断。
  4. 优点:效率高,区间窄。
  5. 缺点:有效性依赖模型假设,当假设被违反时覆盖可能退化。

  6. 随机化推断(有限总体推断):

  7. 代表工作:Li and Small (2023), 本文。
  8. 核心思路:仅依赖随机化分配分布,不对事件时间分布做任何假设。
  9. 优点:稳健,无需模型假设。
  10. 缺点:效率低于正确指定的参数模型;需要非信息性 i.i.d. 删失假设(Assumption 2),这比经典 log-rank 检验的渐近理论(允许更一般的删失模式,Gill 1980)更严格。

这个方向在追问的核心问题

  1. 如何在不依赖模型假设的前提下,给出一个标量效应大小的置信区间?
  2. 当前主流方法:Cox 模型的风险比、AFT 模型的加速因子。
  3. 已知瓶颈:这些方法引入的假设(比例风险、参数分布)并非随机化本身所要求的。

  4. 如何将随机化推断框架从“无效应”的 sharp null 推广到“常数效应”的 sharp null?

  5. 难点:在常数效应下,潜在事件时间和潜在删失时间都需要转换,以确保观测数据在 null 下完全确定。
  6. 本文的解法:同时转换潜在事件时间和潜在删失时间。

  7. 非参数效应大小推断的效率损失有多大?

  8. 已知:log-rank 统计量是秩基的,丢弃了时间幅度的信息。
  9. 本文的模拟表明:相对于正确指定的 Weibull AFT 模型,效率损失是“适度的”(modest),但未给出量化界。

⚠️ 作者的 framing

作者把缺口 frame 成什么?
作者将缺口 frame 为:“log-rank 检验和 Kaplan-Meier 曲线不提供效应大小度量,而 Cox 模型和 AFT 模型引入了超出随机化所需的假设”。因此,本文成为“显然的下一步”:既然 log-rank 检验在随机化下有效,那么通过反转它来构造效应大小的置信区间,自然继承了同样的随机化有效性。

哪些竞争路线被他淡化或回避了?
- Lin et al. (2016) 的方法:作者承认其区间更窄更准确,但强调它依赖比例风险假设。然而,Lin et al. 的得分检验反转方法在 Cox 模型下是半参数有效的,且对比例风险假设的偏离有一定的稳健性(通过稳健方差估计)。作者没有讨论这种稳健性。
- 限制平均生存时间(RMST):作者在讨论中提及“在存在处理效应异质性时,Kaplan-Meier 曲线本身和 RMST 等度量可能更有信息量”,但没有将 RMST 作为竞争方法进行系统比较。RMST 也是一个非参数效应大小度量,且已有成熟的推断方法(如基于 Kaplan-Meier 的积分)。
- 经典 log-rank 检验的渐近理论:作者在讨论中承认,经典渐近理论允许比 i.i.d. 删失更一般的删失模式(Gill 1980),而本文的随机化框架需要 i.i.d. 删失假设。这意味着本文的框架在某些删失模式下可能比经典方法更受限。

什么明显该被引 / 该存在、却没出现在 intro 里?
- RMST 的推断方法:RMST 是生存分析中一个广泛使用的非参数效应大小度量,已有大量关于其置信区间构造的工作(如基于 delta 方法、bootstrap、伪观测值)。本文没有引用或比较这些方法。
- 基于 Kaplan-Meier 的分位数推断:中位生存时间差也是一个常见的非参数效应大小度量,其置信区间可通过 bootstrap 或 Brookmeyer-Crowley 方法构造。本文没有提及。
- 更一般的随机化推断框架:Rosenbaum (2020) 的随机化推断教科书被引用,但仅用于“转换潜在结果”这一通用思想。Rosenbaum 的框架中关于“无效应”的 sharp null 与“常数效应”的 sharp null 之间的转换,在更一般的设定(如配对设计、分层设计)下已有讨论,本文没有引用这些工作。

张力

未见明显对立引用。所有被引工作基本是互补的:Li and Small (2023) 提供了随机化推断基础,Lin et al. (2016) 提供了基于模型的替代方案,本文则填补了非参数效应大小推断的缺口。唯一的张力在于:Li and Small (2023) 的随机化框架需要 i.i.d. 删失假设,而经典 log-rank 检验的渐近理论(Gill 1980)允许更一般的删失模式。作者在讨论中承认了这一点,但未深入探讨。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( n \):样本量(单位数)。 - \( Z_i \in \{0,1\} \):单位 \( i \) 的处理分配,\( Z_i = 1 \) 表示接受处理,\( Z_i = 0 \) 表示对照。在 Bernoulli 随机化下,\( Z_i \) 独立同分布,\( P(Z_i = 1) = p_1 \in (0,1) \)。 - \( T_i(1), T_i(0) \):单位 \( i \) 在处理和对照下的潜在事件时间(potential event times)。这是潜在量,不可同时观测。 - \( C_i(1), C_i(0) \):单位 \( i \) 在处理和对照下的潜在删失时间(potential censoring times)。这也是潜在量。 - \( W_i \):单位 \( i \) 的观测到的风险时间(observed time at risk):

\[W_i = \begin{cases} \min\{T_i(1), C_i(1)\}, & \text{if } Z_i = 1, \\ \min\{T_i(0), C_i(0)\}, & \text{if } Z_i = 0. \end{cases}\]
- \( \Delta_i \):单位 \( i \) 的观测到的事件指示符(event indicator):
\[\Delta_i = \begin{cases} 1\{T_i(1) \le C_i(1)\}, & \text{if } Z_i = 1, \\ 1\{T_i(0) \le C_i(0)\}, & \text{if } Z_i = 0. \end{cases}\]
- \( c \):加法移位参数(additive shift),\( c \ge 0 \)。 - \( \rho \):乘法因子(multiplicative factor),\( \rho > 0 \)。 - \( \text{LR}_c, \text{LR}_\rho \):基于转换后数据计算的 log-rank 统计量。

模型: - 数据生成机制:潜在事件时间 \( (T_i(1), T_i(0)) \) 和潜在删失时间 \( (C_i(1), C_i(0)) \) 是固定的(有限总体)或随机的(超总体),但本文的推断仅依赖随机化分配分布,不对它们的分布做任何假设。 - 已知量:处理分配概率 \( p_1 \)(通常为 0.5)。 - 要估的对象:常数处理效应——加法移位 \( c^* \)(使得 \( T_i(1) = T_i(0) + c^* \) 对所有 \( i \) 成立)或乘法因子 \( \rho^* \)(使得 \( T_i(1) = T_i(0) \rho^* \) 对所有 \( i \) 成立)。

可观测数据: - 研究者实际能观测到的是:\( \{(Z_i, W_i, \Delta_i) : i = 1, \ldots, n\} \)。即每个单位的处理分配、风险时间、事件指示符。 - 想要但观测不到的是:潜在事件时间 \( T_i(1), T_i(0) \) 和潜在删失时间 \( C_i(1), C_i(0) \)。这些只能通过假设(如常数效应)和转换来“反事实地”构造。

关键假设: - Assumption 1(随机化):\( Z_i \mid T(1), T(0), C(1), C(0) \overset{\text{i.i.d.}}{\sim} \text{Bern}(p_1) \)。即处理分配独立于所有潜在结果和潜在删失时间。 - Assumption 2(非信息性 i.i.d. 删失):\( (C(1), C(0)) \perp\!\!\!\perp (T(1), T(0)) \),且 \( (C_i(1), C_i(0)) \) 是 i.i.d. 的二维随机向量。即删失时间独立于事件时间,且所有单位的潜在删失时间联合分布相同。

第二步:讲最小内核

最简特例:考虑一个没有删失(\( C_i(1) = C_i(0) = \infty \) 对所有 \( i \))的随机化试验,且我们只关心乘法因子 \( \rho \)。在这个特例下,观测数据简化为 \( \{(Z_i, T_i^{\text{obs}})\} \),其中 \( T_i^{\text{obs}} = T_i(Z_i) \) 是观测到的事件时间(无删失,所以 \( W_i = T_i^{\text{obs}} \),\( \Delta_i = 1 \))。

核心思路:在 sharp null \( H_\rho: T_i(1) = T_i(0) \rho \) 下,我们可以“反事实地”构造一个转换后的事件时间:

\[\tilde{T}_i = \begin{cases} T_i^{\text{obs}}, & \text{if } Z_i = 1, \\ T_i^{\text{obs}} \rho, & \text{if } Z_i = 0. \end{cases}\]
如果 \( H_\rho \) 为真,那么 \( \tilde{T}_i = T_i(1) \) 对所有 \( i \) 成立(因为当 \( Z_i = 0 \) 时,\( T_i^{\text{obs}} = T_i(0) \),乘以 \( \rho \) 后得到 \( T_i(1) \))。因此,在 \( H_\rho \) 下,所有单位的转换后事件时间都等于它们的潜在处理事件时间 \( T_i(1) \),这意味着处理分配 \( Z_i \) 与转换后事件时间 \( \tilde{T}_i \) 无关(因为 \( T_i(1) \) 是固定的,与 \( Z_i \) 独立)。

最小内核的数学表述:在无删失的特例下,检验 \( H_\rho \) 等价于检验“\( Z_i \) 与 \( \tilde{T}_i \) 独立”。由于 \( Z_i \) 是随机化分配的,我们可以使用任何两样本检验。log-rank 检验是其中一种(在无删失时,它退化为 Wilcoxon 秩和检验的一种变体)。因此,本文的核心想法是:通过转换观测数据,将“常数效应”的 sharp null 转化为“无效应”的 sharp null,然后应用 Li and Small (2023) 的随机化推断结果。

为什么需要转换删失时间?
当存在删失时,事情变得复杂。在 \( H_\rho \) 下,观测到的风险时间是:

\[W_i = \begin{cases} \min\{T_i(1), C_i(1)\}, & \text{if } Z_i = 1, \\ \min\{T_i(0), C_i(0)\}, & \text{if } Z_i = 0. \end{cases}\]
如果我们只转换事件时间(即 \( \tilde{T}_i = T_i^{\text{obs}} \rho \) 当 \( Z_i = 0 \)),那么转换后的风险时间 \( W_{i,\rho} \) 是:
\[W_{i,\rho} = \begin{cases} \min\{T_i(1), C_i(1)\}, & \text{if } Z_i = 1, \\ \min\{T_i(0), C_i(0)\} \cdot \rho, & \text{if } Z_i = 0. \end{cases}\]
在 \( H_\rho \) 下,\( T_i(0) \rho = T_i(1) \),但 \( C_i(0) \rho \neq C_i(1) \)(除非 \( C_i(0) = C_i(1) \) 或 \( \rho = 1 \))。因此,即使 \( H_\rho \) 为真,转换后的风险时间 \( W_{i,\rho} \) 在两组之间可能仍有系统差异,因为删失时间的转换不匹配。这就是为什么本文同时转换潜在删失时间:定义 \( \tilde{C}_i(1) = C_i(1) \),\( \tilde{C}_i(0) = C_i(0) \rho \),这样在 \( H_\rho \) 下,\( \tilde{C}_i(1) = \tilde{C}_i(0) \) 不成立,但 Assumption 2(非信息性 i.i.d. 删失)在转换后仍然成立,且 \( W_{i,\rho} = \min\{\tilde{T}_i(Z_i), \tilde{C}_i(Z_i)\} \) 在 \( H_\rho \) 下与 \( Z_i \) 独立(因为 \( \tilde{T}_i(1) = \tilde{T}_i(0) \) 且 \( (\tilde{C}(1), \tilde{C}(0)) \perp\!\!\!\perp (\tilde{T}(1), \tilde{T}(0)) \))。

一句话总结:本文的核心数学操作是同时转换潜在事件时间和潜在删失时间,使得在常数效应的 sharp null 下,转换后的数据满足“无效应”的 sharp null,从而 Li and Small (2023) 的随机化推断结果可以直接应用。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在随机化临床试验中,针对生存数据,如何构造加法移位 \( c \) 和乘法因子 \( \rho \) 这两个标量效应大小的非参数置信区间,使其仅依赖随机化分配分布即可保证有效性。
  2. 核心工具 / 方法:将 Li and Small (2023) 的随机化推断框架从“无效应”的 sharp null 推广到“常数效应”的 sharp null,通过同时转换潜在事件时间和潜在删失时间,将常数效应检验转化为无效应检验,然后反转 log-rank 检验构造置信区间。
  3. 主要结论:所提出的置信区间在模拟中维持名义覆盖,即使数据生成过程违背参数 AFT 模型假设;相对于正确指定的参数 AFT 推断,效率损失是适度的。

关键设定与假设

完整设定(在第二节最小记号的基础上补充): - 有限总体 vs 超总体:本文采用有限总体框架(finite population),即潜在事件时间和潜在删失时间被视为固定的(或条件于它们的随机性),推断仅来自随机化分配分布。这与经典的超总体框架(假设事件时间来自某个分布)不同。 - Bernoulli 随机化:处理分配是独立的 Bernoulli 试验,概率 \( p_1 \in (0,1) \)。这比完全随机化(固定组大小)更灵活,但 Li and Small (2023) 的结果也适用于完全随机化。 - 非信息性 i.i.d. 删失:Assumption 2 要求删失时间独立于事件时间,且所有单位的潜在删失时间联合分布相同。这比经典 log-rank 检验的渐近理论(允许更一般的删失模式,如独立但不同分布、或条件独立于协变量)更严格。

相比已有文献的放宽或强化: - 放宽:相比 Cox 模型(需要比例风险假设)和 AFT 模型(需要参数分布假设),本文不对事件时间分布做任何假设。 - 强化:相比经典 log-rank 检验的渐近理论(允许更一般的删失模式),本文的随机化框架需要 i.i.d. 删失假设(Assumption 2)。作者在讨论中承认了这一点,并指出在 Assumption 2 不成立时,该过程可能仍可通过经典超总体渐近理论得到验证。

主要结果

定理 1(加法移位): - 陈述:在 \( H_c: T_i(1) = T_i(0) + c \) 下,如果 Assumptions 1 和 2 成立,且 Li and Small (2023) 的正则条件对转换后的潜在事件时间和潜在删失时间成立,则 \( \text{LR}_c \mid T(1), T(0) \xrightarrow{d} N(0,1) \)。 - 直觉:通过将对照组的观测时间加上 \( c \),并同时将对照组的潜在删失时间加上 \( c \),在 \( H_c \) 下,转换后的数据满足“无效应”的 sharp null,因此 Li and Small (2023) 的结果直接适用。 - 必要条件:\( c \ge 0 \)(对于 \( c < 0 \),通过交换处理组和对照组标签来处理)。 - 解决的技术难点:确保在转换后,观测到的风险时间和事件指示符在 null 下完全确定。这要求同时转换潜在事件时间和潜在删失时间。

定理 2(乘法因子): - 陈述:在 \( H_\rho: T_i(1) = T_i(0) \rho \) 下,如果 Assumptions 1 和 2 成立,且 Li and Small (2023) 的正则条件对转换后的潜在事件时间和潜在删失时间成立,则 \( \text{LR}_\rho \mid T(1), T(0) \xrightarrow{d} N(0,1) \)。 - 直觉:与定理 1 类似,通过将对照组的观测时间乘以 \( \rho \),并同时将对照组的潜在删失时间乘以 \( \rho \),在 \( H_\rho \) 下,转换后的数据满足“无效应”的 sharp null。 - 必要条件:\( \rho > 0 \)。 - 解决的技术难点:与定理 1 相同。

推论 1(置信区间覆盖): - 陈述:在定理 1 和 2 的假设下,置信集 \( C_{\text{add}} \) 和 \( C_{\text{mult}} \) 的渐近覆盖至少为 \( 1 - \alpha \)。 - 直觉:这是检验反转的标准结果:如果检验的渐近第一类错误率是 \( \alpha \),那么反转得到的置信集的渐近覆盖至少为 \( 1 - \alpha \)。

模拟结果: - Type I error(\( \rho = 1 \)):随机化区间在两种数据生成过程(Weibull 和 log-logistic)、三种删失率(20%, 50%, 80%)和两种样本量(50, 200)下,Type I error 接近名义 5% 水平。Weibull AFT 区间在正确指定时也控制良好,但在 log-logistic 下膨胀。 - Coverage(\( \rho = 1.25 \)):在 Weibull 下,两种方法覆盖相当;在 log-logistic 下,随机化区间保持接近 95%,而 Weibull AFT 区间覆盖退化。 - 区间宽度:在 Weibull 下,参数区间略窄;在 log-logistic 下,随机化区间宽度与参数区间相当或更窄(因为参数区间覆盖退化,其宽度可能不再有意义)。

证明路线与技术技巧

整体路线(以定理 2 为例,3-5 步逻辑主干):

  1. 转换潜在变量:定义转换后的潜在事件时间 \( \tilde{T}_i(1) = T_i(1) \),\( \tilde{T}_i(0) = T_i(0) \rho \);转换后的潜在删失时间 \( \tilde{C}_i(1) = C_i(1) \),\( \tilde{C}_i(0) = C_i(0) \rho \)。

  2. 验证假设在转换后仍然成立:

  3. Assumption 1(随机化):\( Z_i \) 的分布不依赖于任何潜在变量,因此转换后仍然成立。
  4. Assumption 2(非信息性 i.i.d. 删失):由于 \( (C(1), C(0)) \perp\!\!\!\perp (T(1), T(0)) \),且 \( \rho \) 是常数,所以 \( (\tilde{C}(1), \tilde{C}(0)) \perp\!\!\!\perp (\tilde{T}(1), \tilde{T}(0)) \) 仍然成立。i.i.d. 性质也保持,因为每个单位的转换是相同的确定性函数。

  5. 验证在 \( H_\rho \) 下,转换后的数据满足“无效应”的 sharp null:

  6. 在 \( H_\rho \) 下,\( T_i(1) = T_i(0) \rho \),所以 \( \tilde{T}_i(1) = T_i(1) = T_i(0) \rho = \tilde{T}_i(0) \)。因此,对所有 \( i \),\( \tilde{T}_i(1) = \tilde{T}_i(0) \),即 Fisher 的“无处理效应” null 对转换后的事件时间成立。

  7. 验证转换后的观测数据与 Li and Small (2023) 的设定一致:

  8. 对于单位 \( i \),转换后的观测风险时间是 \( W_{i,\rho} = \min\{\tilde{T}_i(Z_i), \tilde{C}_i(Z_i)\} \),观测事件指示符是 \( \Delta_i = 1\{\tilde{T}_i(Z_i) \le \tilde{C}_i(Z_i)\} \)。这与 Li and Small (2023) 中观测数据的定义形式完全相同(只是潜在变量被替换为转换后的版本)。

  9. 应用 Li and Small (2023) 的定理:

  10. 由步骤 2-4,转换后的数据满足 Li and Small (2023) 的所有假设和正则条件。因此,由他们的定理 4 和 5,log-rank 统计量 \( \text{LR}_\rho \) 在给定转换后的潜在事件时间(即 \( T(1) \))下,渐近服从标准正态分布。

关键跳跃点: - 最吃功夫的引理:实际上,本文没有引入新的引理。整个证明依赖于 Li and Small (2023) 的定理 4 和 5。真正的“跳跃”在于认识到:同时转换潜在事件时间和潜在删失时间是必要的,且转换后 Assumption 2 仍然成立。这个跳跃在 Remark 2 中被明确点出:“Standard randomization inference transforms potential outcomes under a sharp null. We extend this by also transforming potential censoring times.”

技术技巧点名: - 随机化推断(randomization inference):整个框架的基础。不依赖事件时间的分布,仅依赖随机化分配分布。 - 检验反转(test inversion):构造置信区间的标准技巧。通过在一组候选参数值上计算 log-rank p 值,保留那些 p 值大于 \( \alpha \) 的值。 - log-rank 统计量:秩基的两样本检验统计量,对生存数据具有稳健性。

真实例子与应用

数据:rhDNase 治疗囊性纤维化的随机试验(Therneau and Hamilton, 1997),\( n = 641 \) 名受试者(排除 6 名入组时已感染的受试者),323 人接受安慰剂,318 人接受 rhDNase。主要终点是首次肺部恶化的时间。

方法应用: - 加法移位:在 \( c \in [-80, 80] \) 天的网格上搜索,点估计 \( \hat{c} = 50.1 \) 天,95% CI [17.1, 73.0] 天。 - 乘法因子:在 \( \rho \in [e^{-3}, e^3] \) 的对数网格上搜索,点估计 \( \hat{\rho} = 1.55 \),95% CI [1.14, 1.89]。

结果: - 加法移位:rhDNase 将首次恶化时间推迟了约 50 天(95% CI: 17 到 73 天)。 - 乘法因子:rhDNase 将首次恶化时间延长了约 55%(95% CI: 14% 到 89%)。

这个例子想说明什么: - 验证方法:展示了如何在实际数据上应用该方法,并给出了可解释的临床结论。 - 展示相对优势:通过将转换后的对照 Kaplan-Meier 曲线与处理组曲线叠加(Figure 4),作者论证了乘法因子比加法移位更适合该数据(乘法转换后的曲线与处理组曲线更接近)。这提供了一个视觉诊断工具,用于检查常数效应假设是否合理。 - 可复现性:提供了 R 代码和 Shiny 应用,降低了使用门槛。

🔎 结论是否比证明窄

  • 窄结论 1:定理 1 和 2 的证明依赖于 Li and Small (2023) 的正则条件(Condition 1 或 2)。这些条件涉及潜在事件时间和潜在删失时间的联合分布,包括对 log-rank 统计量方差的一致估计等。作者没有在本文中明确陈述这些条件,而是直接引用。这意味着本文结论的有效性完全取决于 Li and Small (2023) 的条件是否成立,而这些条件在本文中未被验证或讨论。
  • 窄结论 2:定理 1 和 2 要求 \( c \ge 0 \) 和 \( \rho > 0 \)。对于 \( c < 0 \),作者通过交换处理组和对照组标签来处理,但这意味着置信区间对于负的 \( c \) 可能不对称(因为搜索网格从 \( c_{\min} \) 到 \( c_{\max} \),且 \( c_{\min} < 0 \) 时标签被交换)。这在 Remark 1 中被提及,但未在模拟或例子中展示。
  • 窄结论 3:模拟仅评估了乘法因子 \( \rho \) 的置信区间,没有评估加法移位 \( c \) 的置信区间。作者在模拟部分明确说“We conducted a simulation study to evaluate the finite-sample operating characteristics of the proposed randomization-based confidence intervals for the multiplicative effect parameter \( \rho \)”。加法移位区间的有限样本表现未被评估。
  • 泛化 claim:作者在摘要和结论中声称区间“valid under the randomization distribution alone, requiring no assumptions for the event-time distribution”。这是正确的,但需要 Assumption 2(非信息性 i.i.d. 删失)。作者在讨论中承认了这一点,并指出在 Assumption 2 不成立时,该过程可能仍可通过经典超总体渐近理论得到验证。这是一个未证明的 claim——作者没有给出在 Assumption 2 不成立时该过程仍然有效的理论保证。

四、开放问题

  1. 加法移位区间的有限样本表现:本文的模拟仅评估了乘法因子 \( \rho \) 的置信区间。加法移位 \( c \) 的置信区间在有限样本下的覆盖和宽度表现如何?是否对删失率、样本量和效应大小敏感?——扎根于 Section 5 第一句:“We conducted a simulation study to evaluate the finite-sample operating characteristics of the proposed randomization-based confidence intervals for the multiplicative effect parameter \( \rho \)”。

  2. 非 i.i.d. 删失下的有效性:本文的随机化框架需要 Assumption 2(非信息性 i.i.d. 删失),但经典 log-rank 检验的渐近理论允许更一般的删失模式。在 Assumption 2 被违反(如删失时间依赖于处理分配、或删失时间与事件时间相关)时,本文的区间是否仍然有效?作者在讨论中推测“the proposed procedure may still admit a valid classical large-sample justification”,但未给出证明。——扎根于 Section 7 倒数第二段:“Although our randomization-based justification requires assumptions on the censoring mechanism... it places no stochastic assumptions on the potential event times. In contrast, the classical asymptotic theory for the log-rank test treats the event times as stochastic and requires independent/noninformative censoring, while allowing more general censoring schemes than i.i.d. censoring.”

  3. 常数效应假设的检验:本文的区间在常数效应下有效,但当效应随时间变化时,区间可能误导。如何检验常数效应假设?作者建议通过视觉检查(Figure 4),但缺乏正式的检验统计量。——扎根于 Section 7 第三段:“Both parameters summarize the treatment effect by a single scalar and therefore are most meaningful when the effect is constant across time.”

  4. 扩展到更复杂的设定:本文的方法能否扩展到分层随机化、非依从性(noncompliance)、或工具变量设定?例如,在 IV 设定下,能否通过类似的转换构造局部平均处理效应(LATE)的置信区间?——扎根于 Section 7 的讨论,作者提到“subgroup analyses”作为常数效应假设的放松,但未提及 IV 或非依从性。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论