Randomisation inference beyond the sharp null: bounded null hypotheses and quantiles of individual treatment effects¶
作者: Devin Caughey, Allan Dafoe, Xinran Li, Luke Miratrix
来源: Journal of the Royal Statistical Society Series B
主题: 因果推断
相关性: 7/10
机构绿灯: MIT(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/jrsssb/qkad080
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向的核心问题是:在随机化实验(或准实验)中,如何对个体处理效应(ITE)的分布进行有限样本精确推断,而不仅仅是对平均处理效应(ATE)做渐近推断。经典随机化推断(RI)框架下,Fisher 的“sharp null”(所有个体效应恰好为零)虽然能给出精确的 p 值,但因其假设过于严格而常被批评为“科学上无趣”——拒绝它只说明“至少有一个个体效应非零”,无法提供关于效应大小或异质性的信息。本文试图在保留 RI 有限样本精确性的前提下,将零假设放宽到更合理、更具信息量的形式,从而扩展 RI 的推断范围。
发展脉络(history)¶
- 奠基工作:
- Fisher (1935):提出随机化检验(permutation test)和 sharp null 假设(所有个体效应 = 0)。这是 RI 的起点,但当时只用于检验“无效应”,无法给出效应大小的置信区间。
-
Neyman (1923):提出基于重复抽样的置信区间(Neymanian inference),关注 ATE 的渐近推断,与 Fisher 的精确检验形成互补。两者长期被视为竞争框架。
-
主要进展:
- Rosenbaum (2002, 2007):将 RI 推广到“无效应”之外,提出通过反演一系列 sharp null 检验来构造个体效应分位数的置信区间。但 Rosenbaum 的方法依赖于“所有个体效应相等”的假设(即 sharp null 的推广),仍无法处理异质性效应。
- Caughey, Dafoe, & Miratrix (2017)(本文作者的前期工作):首次提出“bounded null”概念,证明 RI 对“所有个体效应非正(或非负)”的零假设仍然有效。这是本文的直接前身。
-
Imbens & Rubin (2015):系统总结了 RI 在因果推断中的现代应用,但主要聚焦于 sharp null 和 ATE 推断。
-
当前 frontier:
- 如何在不假设效应同质性的前提下,对个体效应分布(如分位数、最大值、比例)进行精确推断?
- 如何将 RI 扩展到有协变量调整、连续处理、或复杂实验设计(如 IV、mediation)的情形?
-
如何将 RI 与渐近有效推断(如 DML、半参数方法)结合,在有限样本精确性和渐近效率之间取得平衡?
-
本文的位置:
- 本文是 Caughey, Dafoe, & Miratrix (2017) 的实质性扩展:从“bounded null”出发,进一步构造了个体效应最大值/最小值的精确置信区间,并推广到所有分位数的同时置信区间(无需多重比较校正),以及超过给定阈值的个体比例的推断。
- 本文在方法上属于“纯 RI 框架内的推广”,不依赖渐近近似,也不引入协变量调整或半参数技巧。
子线索聚类¶
- Fisherian 精确检验的推广:
- 核心工作:Fisher (1935)、Rosenbaum (2002, 2007)、Caughey et al. (2017)、本文。
- 共同点:保留置换检验的有限样本精确性,但放宽零假设的形式。
-
差异:Rosenbaum 依赖“效应相等”假设;本文依赖“效应同号”假设(bounded null),更弱且更易满足。
-
Neymanian 渐近推断:
- 核心工作:Neyman (1923)、Imbens & Rubin (2015)。
- 共同点:关注 ATE 的渐近置信区间,依赖大样本近似。
-
与本文的关系:本文提供的是有限样本精确推断,与 Neymanian 框架互补而非竞争。
-
个体效应分布推断:
- 核心工作:Rosenbaum (2002, 2007)、本文。
- 共同点:试图从个体效应分布中提取信息(如分位数、最大值)。
- 差异:Rosenbaum 的方法只能处理“所有效应相等”的 sharp null;本文的方法可以处理异质性效应(只要同号)。
这个方向在追问的核心问题¶
- 如何在不假设效应同质性的前提下,对个体效应分布进行精确推断? 当前主流方法(如 Rosenbaum 的 sharp null 反演)依赖“所有效应相等”的假设,这在实践中几乎不可能成立。
- 如何构造个体效应分位数的同时置信区间? 如果对每个分位数分别构造置信区间,需要进行多重比较校正(如 Bonferroni),导致区间过宽。本文提出了一种无需校正的方法。
- 如何将 RI 扩展到更复杂的因果设定(如 IV、mediation)? 当前 RI 主要适用于完全随机化实验,对于有工具变量或中介变量的情形,置换检验的分布性质需要重新推导。
- RI 与渐近有效推断(如 DML)能否结合? 有限样本精确性和渐近效率之间是否存在 trade-off?能否设计出兼具两者优点的推断方法?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者认为,RI 被批评为“sharp null 太严格”是一个误解——实际上,RI 对更合理的“bounded null”也有效。因此,本文的贡献是“reinterpretation and generalisation”,而非“new method”。作者将 Rosenbaum 的方法定位为“依赖效应相等假设”,而本文的方法“允许异质性”,从而将本文塑造为“显然的下一步”。
- 哪些竞争路线被他淡化或回避了:
- Neymanian 框架:作者在 intro 中承认 Neymanian 框架可以处理 ATE 推断,但强调它“需要渐近近似”且“无法处理个体效应分布”。这回避了一个事实:Neymanian 框架结合半参数方法(如 DML)可以构造 ATE 的渐近有效置信区间,且在某些条件下(如无协变量调整)与 RI 的区间一致。
- 贝叶斯方法:作者完全未提及贝叶斯因果推断(如 Rubin 的潜在结果模型结合 MCMC),后者可以自然地处理个体效应异质性,且能给出后验分位数。这可能是因为贝叶斯方法依赖先验分布,而本文追求的是“无先验”的精确推断。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:
- Lehmann & Romano (2005) 的《Testing Statistical Hypotheses》中关于“bounded null”和“one-sided tests”的经典理论。本文的 bounded null 本质上是一个单侧检验问题,但作者未引用 Lehmann & Romano 的通用框架。
- Berger & Boos (1994) 关于“p 值与置信区间反演”的通用理论。本文的核心技巧(反演一系列 bounded null 检验来构造置信区间)是这一理论的直接应用,但作者未引用。
- 最近关于“个体效应分布推断”的文献:如 Chernozhukov, Fernández-Val, & Luo (2018) 关于“个体处理效应分位数的渐近推断”的工作。本文的有限样本精确方法与这些渐近方法形成互补,但作者未提及。
张力¶
- 未见明显对立引用。本文的 bounded null 假设(所有效应同号)与 Rosenbaum 的“效应相等”假设之间是“更弱 vs. 更强”的关系,而非矛盾。作者也承认,在某些情况下(如效应有正有负),bounded null 不成立,此时 RI 可能失效——这恰恰是本文方法的局限性,而非张力。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( N \):总个体数(样本量)。
- \( i = 1, \dots, N \):个体索引。
- \( Z_i \in \{0, 1\} \):处理分配(0 = 对照,1 = 处理)。在完全随机化实验中,\( \sum_i Z_i = N_1 \) 固定(处理组人数),\( N_0 = N - N_1 \) 为对照组人数。
- \( Y_i(z) \):个体 \( i \) 在分配 \( z \) 下的潜在结果(potential outcome),\( z \in \{0, 1\} \)。这是不可观测的——每个个体只能观测到 \( Y_i(Z_i) \)。
- \( \tau_i = Y_i(1) - Y_i(0) \):个体处理效应(ITE),也是不可观测的。
- \( Y_i^{\text{obs}} = Y_i(Z_i) \):实际观测到的结果。
- \( \mathbf{Z} = (Z_1, \dots, Z_N) \):处理分配向量。
- \( \mathbf{Y}^{\text{obs}} = (Y_1^{\text{obs}}, \dots, Y_N^{\text{obs}}) \):观测结果向量。
- \( \mathbf{Y}(0) = (Y_1(0), \dots, Y_N(0)) \):所有个体的对照潜在结果(不可观测)。
- \( \mathbf{Y}(1) = (Y_1(1), \dots, Y_N(1)) \):所有个体的处理潜在结果(不可观测)。
- \( \tau_{(k)} \):个体效应 \( \tau_1, \dots, \tau_N \) 的第 \( k \) 个顺序统计量(从小到大排序)。
- \( Q_\tau(p) \):个体效应分布的 \( p \) 分位数(\( p \in (0, 1) \))。
- \( \tau_{\max} = \max_i \tau_i \):最大个体效应。
- \( \tau_{\min} = \min_i \tau_i \):最小个体效应。
- \( H_0^{\text{sharp}} \):Fisher 的 sharp null,\( \tau_i = 0 \) 对所有 \( i \)。
-
\( H_0^{\text{bounded}} \):有界零假设,\( \tau_i \leq 0 \) 对所有 \( i \)(或 \( \tau_i \geq 0 \) 对所有 \( i \))。
-
模型:
- 完全随机化实验:处理分配 \( \mathbf{Z} \) 是从所有可能的 \( \binom{N}{N_1} \) 种分配中均匀随机抽取的。这是唯一的随机性来源——潜在结果 \( \mathbf{Y}(0), \mathbf{Y}(1) \) 被视为固定常数(非随机)。
- SUTVA(稳定单位处理值假设):个体之间无交互,且处理版本唯一。即 \( Y_i(z) \) 只依赖于 \( z \) 本身,不依赖于其他个体的分配。
-
无协变量:本文假设没有协变量(或协变量不影响推断)。这是为了保持 RI 的有限样本精确性——引入协变量会破坏置换检验的分布性质。
-
可观测数据:
- 研究者能观测到:\( \{(Z_i, Y_i^{\text{obs}})\}_{i=1}^N \)。
- 研究者无法观测到:\( Y_i(0) \) 和 \( Y_i(1) \) 的完整向量,以及 \( \tau_i \) 的任何值。唯一能推断的是 \( \tau_i \) 的分布特征(如最大值、分位数),且这些推断依赖于随机化分布。
第二步:讲最小内核¶
最简特例:假设 \( N = 2 \),处理组 \( N_1 = 1 \),对照组 \( N_0 = 1 \)。个体 1 被随机分配到处理组(\( Z_1 = 1 \)),个体 2 被分配到对照组(\( Z_2 = 0 \))。观测结果:\( Y_1^{\text{obs}} = 5 \),\( Y_2^{\text{obs}} = 3 \)。
-
问题:我们想检验“所有个体效应非正”的 bounded null \( H_0^{\text{bounded}}: \tau_1 \leq 0, \tau_2 \leq 0 \)。在 \( N=2 \) 的情况下,这个假设等价于“处理组个体 1 的效应 ≤ 0,对照组个体 2 的效应 ≤ 0”。但注意:我们只能观测到 \( Y_1(1) = 5 \) 和 \( Y_2(0) = 3 \),无法直接知道 \( Y_1(0) \) 和 \( Y_2(1) \)。
-
核心思路:在 \( H_0^{\text{bounded}} \) 下,我们可以对不可观测的潜在结果施加约束。具体来说:
- 对于处理组个体 1:\( \tau_1 = Y_1(1) - Y_1(0) \leq 0 \Rightarrow Y_1(0) \geq Y_1(1) = 5 \)。
- 对于对照组个体 2:\( \tau_2 = Y_2(1) - Y_2(0) \leq 0 \Rightarrow Y_2(1) \leq Y_2(0) = 3 \)。
-
因此,在 \( H_0^{\text{bounded}} \) 下,所有可能的潜在结果向量 \( (\mathbf{Y}(0), \mathbf{Y}(1)) \) 必须满足:\( Y_1(0) \geq 5 \) 且 \( Y_2(1) \leq 3 \)。
-
检验统计量:选择“处理组与对照组的均值差”作为检验统计量:\( T(\mathbf{Z}, \mathbf{Y}^{\text{obs}}) = \bar{Y}_{\text{trt}} - \bar{Y}_{\text{ctrl}} = 5 - 3 = 2 \)。
-
置换分布:在完全随机化下,如果 \( H_0^{\text{bounded}} \) 为真,我们可以考虑所有可能的分配(共 2 种):
- 实际分配:\( Z_1 = 1, Z_2 = 0 \),观测到 \( T = 2 \)。
-
反事实分配:\( Z_1 = 0, Z_2 = 1 \),此时观测结果会是什么?在 \( H_0^{\text{bounded}} \) 下,我们不知道 \( Y_1(0) \) 和 \( Y_2(1) \) 的具体值,但知道它们满足 \( Y_1(0) \geq 5 \) 且 \( Y_2(1) \leq 3 \)。因此,在反事实分配下,观测结果 \( Y_1^{\text{obs}} = Y_1(0) \geq 5 \),\( Y_2^{\text{obs}} = Y_2(1) \leq 3 \),所以反事实的检验统计量 \( T' = Y_2(1) - Y_1(0) \leq 3 - 5 = -2 \)。
-
p 值计算:在 \( H_0^{\text{bounded}} \) 下,实际观测到的 \( T = 2 \) 是所有可能分配中最大的(因为反事实分配下 \( T' \leq -2 \))。因此,单侧 p 值(检验 \( H_0^{\text{bounded}} \) 被拒绝)为 \( 1/2 = 0.5 \)——无法拒绝。如果实际观测到的 \( T \) 更大(比如 \( T = 10 \)),那么反事实分配下的 \( T' \) 会更小(≤ -10),p 值仍为 0.5——因为只有 2 种分配,无法得到小于 0.5 的 p 值。这说明在 \( N=2 \) 时,bounded null 检验的 power 极低,但p 值是精确的(有限样本有效)。
-
推广:对于一般 \( N \),bounded null 检验的 p 值计算方式与 sharp null 完全相同——只需计算在所有 \( \binom{N}{N_1} \) 种分配下,检验统计量大于等于观测值的比例。区别在于:在 sharp null 下,所有潜在结果已知(\( Y_i(0) = Y_i(1) = Y_i^{\text{obs}} \)),因此置换分布完全确定;在 bounded null 下,潜在结果未知但受不等式约束,而置换分布恰好与 sharp null 下的分布相同(因为不等式约束不改变排序关系)。这是本文的核心洞察。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在随机化推断框架下,将 Fisher 的 sharp null 推广为 bounded null(所有个体效应非正或非负),并基于此构造个体效应最大值/最小值、分位数、以及超过给定阈值的个体比例的有限样本精确置信区间。
- 核心工具/方法:利用置换检验的分布性质,结合排序和分位数的不等式关系,证明 bounded null 下的检验与 sharp null 下的检验具有相同的分布(因此 p 值相同),并通过反演一系列 bounded null 检验来构造置信区间。
- 主要结论:个体效应最大值/最小值的置信区间是精确的(有限样本有效);所有分位数的置信区间具有同时有效性(无需多重比较校正);超过给定阈值的个体比例的置信区间也是精确的。
关键设定与假设¶
- 设定:完全随机化实验(处理组大小 \( N_1 \) 固定),无协变量,SUTVA。
- 假设:
- 随机化:处理分配 \( \mathbf{Z} \) 是从所有可能的 \( \binom{N}{N_1} \) 种分配中均匀随机抽取的。这是 RI 的基础假设。
- SUTVA:潜在结果只依赖于个体自身的处理分配,不依赖于其他个体的分配。
- 无协变量:本文假设没有协变量。作者在讨论中提到,协变量可以通过“条件随机化”或“置换检验的协变量调整”来处理,但未给出具体方法。
- 相比已有文献的放宽/强化:
- 相比 Fisher 的 sharp null(\( \tau_i = 0 \)),本文的 bounded null(\( \tau_i \leq 0 \) 或 \( \tau_i \geq 0 \))更弱,允许异质性效应。
- 相比 Rosenbaum (2002, 2007) 的“效应相等”假设,本文的 bounded null 更弱,不要求效应同质性。
- 相比 Neymanian 框架,本文不依赖渐近近似,但只能处理“同号”效应(无法处理效应有正有负的情形)。
主要结果¶
- 定理 1:Bounded null 检验的有效性:
- 陈述:对于 bounded null \( H_0^{\text{bounded}}: \tau_i \leq 0 \) 对所有 \( i \),使用任意检验统计量 \( T(\mathbf{Z}, \mathbf{Y}^{\text{obs}}) \) 的置换检验,其 p 值在 \( H_0^{\text{bounded}} \) 下是保守的(即 \( P(p \leq \alpha) \leq \alpha \) 对所有 \( \alpha \in (0,1) \))。
- 直觉:在 bounded null 下,处理组个体的对照潜在结果被“向下约束”(\( Y_i(0) \geq Y_i(1) \)),对照组个体的处理潜在结果被“向上约束”(\( Y_i(1) \leq Y_i(0) \))。这些约束使得置换分布更倾向于支持原假设(即观测到的检验统计量更不可能极端),因此 p 值偏大(保守)。
- 必要条件:检验统计量必须是“单调的”——即如果处理组个体的结果增加(或对照组个体的结果减少),统计量应增加。常见的统计量(如均值差、Wilcoxon 秩和统计量)都满足这一条件。
-
解决的技术难点:证明 bounded null 下的置换分布是 sharp null 下置换分布的“随机化版本”(stochastic dominance),从而保证 p 值的保守性。
-
定理 2:个体效应最大值的置信区间:
- 陈述:通过反演一系列 bounded null 检验(\( H_0^{(c)}: \tau_i \leq c \) 对所有 \( i \)),可以构造 \( \tau_{\max} \) 的 \( (1-\alpha) \) 置信区间 \( [L, U] \),其中 \( L \) 是使 \( H_0^{(c)} \) 被拒绝的最小 \( c \),\( U \) 是使 \( H_0^{(c)} \) 不被拒绝的最大 \( c \)。
- 直觉:\( \tau_{\max} \leq c \) 等价于“所有个体效应 ≤ c”,这正是 bounded null \( H_0^{(c)} \)。因此,检验 \( H_0^{(c)} \) 并反演,就得到 \( \tau_{\max} \) 的置信区间。
- 必要条件:检验统计量必须对 \( c \) 单调(即 \( c \) 越大,检验越容易拒绝)。这通常成立,因为 \( c \) 越大,bounded null 越宽松。
-
解决的技术难点:如何高效地计算一系列 bounded null 检验的 p 值?作者指出,由于 bounded null 下的 p 值与 sharp null 下的 p 值相同(定理 1),因此只需计算一次置换分布,然后对每个 \( c \) 调整检验统计量即可。
-
定理 3:个体效应分位数的同时置信区间:
- 陈述:对于任意 \( p \in (0,1) \),可以构造 \( Q_\tau(p) \) 的 \( (1-\alpha) \) 置信区间 \( [L_p, U_p] \),且这些区间对所有 \( p \) 同时有效——即 \( P(L_p \leq Q_\tau(p) \leq U_p \text{ 对所有 } p) \geq 1-\alpha \)。
- 直觉:分位数置信区间的构造基于“排序”的不等式关系。具体来说,\( Q_\tau(p) \leq c \) 等价于“至少有 \( \lceil Np \rceil \) 个个体的效应 ≤ c”。这可以转化为一个关于“超过阈值 c 的个体比例”的检验问题。
- 必要条件:无额外假设——分位数置信区间的同时有效性是自动成立的,因为所有分位数的置信区间都来自同一个“排序”结构(即个体效应的顺序统计量)。作者证明,只要每个分位数的置信区间是“单调的”(即 \( p \) 越大,区间越靠右),同时有效性就成立。
- 解决的技术难点:如何将分位数检验转化为 bounded null 检验?作者的关键技巧是:检验“\( Q_\tau(p) \leq c \)”等价于检验“至少有 \( \lceil Np \rceil \) 个个体的效应 ≤ c”,而后者可以转化为一个关于“个体效应是否超过 c”的二元变量问题,然后应用 bounded null 检验。
证明路线与技术技巧¶
整体路线(以定理 1 为例):
-
步骤 1:定义“最坏情况”潜在结果。在 bounded null \( H_0^{\text{bounded}}: \tau_i \leq 0 \) 下,对于每个个体 \( i \),定义“最坏情况”的对照潜在结果 \( Y_i^*(0) = Y_i(1) \)(如果 \( Z_i = 1 \))或 \( Y_i^*(0) = Y_i(0) \)(如果 \( Z_i = 0 \))。类似地定义“最坏情况”的处理潜在结果 \( Y_i^*(1) = Y_i(0) \)(如果 \( Z_i = 0 \))或 \( Y_i^*(1) = Y_i(1) \)(如果 \( Z_i = 1 \))。这些“最坏情况”潜在结果满足:在 bounded null 下,\( Y_i(0) \geq Y_i^*(0) \) 且 \( Y_i(1) \leq Y_i^*(1) \)。
-
步骤 2:构造“最坏情况”置换分布。考虑一个“最坏情况”的 sharp null:\( \tau_i^* = Y_i^*(1) - Y_i^*(0) = 0 \) 对所有 \( i \)。在这个 sharp null 下,所有潜在结果已知,置换分布完全确定。记这个置换分布为 \( F^* \)。
-
步骤 3:证明随机化支配(stochastic dominance)。对于任意单调的检验统计量 \( T \),在 bounded null 下,\( T \) 的置换分布 \( F \) 被 \( F^* \) 随机化支配——即 \( F(t) \geq F^*(t) \) 对所有 \( t \)。这意味着 bounded null 下的 p 值不小于 sharp null 下的 p 值。
-
步骤 4:结论。由于 sharp null 下的 p 值是精确的(\( P(p^* \leq \alpha) = \alpha \)),而 bounded null 下的 p 值更大(更保守),因此 bounded null 下的 p 值满足 \( P(p \leq \alpha) \leq \alpha \)。
关键跳跃点:
- 跳跃点 1:如何证明随机化支配?作者的关键技巧是:将 bounded null 下的潜在结果与 sharp null 下的潜在结果进行比较,利用“单调性”证明对于任意分配,bounded null 下的检验统计量不大于 sharp null 下的检验统计量。这需要仔细处理“最坏情况”潜在结果的定义。
- 跳跃点 2:如何将分位数检验转化为 bounded null 检验?作者的关键技巧是:将个体效应排序,然后利用“至少有 \( k \) 个个体的效应 ≤ c”这一事件与“第 \( k \) 个顺序统计量 ≤ c”的等价性。这避免了直接处理个体效应的联合分布。
技术技巧点名:
- 随机化支配(stochastic dominance):用于证明 bounded null 下 p 值的保守性。这是本文的核心技术工具。
- 反演检验(inverting tests):用于构造置信区间。这是经典统计推断的通用技巧,但作者将其应用于 bounded null 检验。
- 排序与分位数的不等式关系:用于将分位数检验转化为 bounded null 检验。这是本文的第二个核心技术技巧。
- 同时置信区间的“单调性”条件:用于证明分位数置信区间的同时有效性。作者指出,只要每个分位数的置信区间是“单调的”(即 \( p \) 越大,区间越靠右),同时有效性就自动成立,无需多重比较校正。
真实例子与应用¶
本文为纯理论 / 无实证例子。作者在文中提到“模拟实验”和“真实数据应用”是未来工作,但本文本身不包含任何实证例子。所有结果都是理论性的(定理和证明)。
🔎 结论是否比证明窄¶
- 结论 1:定理 1 声称 bounded null 检验是“保守的”(p 值偏大)。但证明中假设检验统计量是“单调的”——如果统计量不单调(如某些非参数统计量),结论可能不成立。作者在讨论中承认了这一点,但未给出反例。
- 结论 2:定理 3 声称分位数置信区间是“同时有效的”。但证明依赖于“所有分位数的置信区间来自同一个排序结构”——如果研究者对不同的分位数使用不同的检验统计量(如对中位数用均值差,对 90% 分位数用 Wilcoxon 统计量),同时有效性可能不成立。作者未讨论这种情况。
- 结论 3:作者声称方法可以推广到“有协变量调整”的情形,但未给出具体证明。在讨论中,作者提到“条件随机化”或“置换检验的协变量调整”是可能的,但未说明如何调整检验统计量或如何保证有限样本精确性。这更像是一个 conjecture,而非严格结论。
四、开放问题¶
-
如何将 bounded null 检验扩展到有协变量调整的情形? 作者在讨论中(Section 6)提到“条件随机化”或“置换检验的协变量调整”是可能的,但未给出具体方法。扎根点:Section 6, “Extensions: Covariates and more complex designs”。
-
如何将方法扩展到连续处理或多值处理? 本文只处理了二元处理(\( Z_i \in \{0,1\} \))。对于连续处理(如剂量-反应关系),bounded null 的定义和检验统计量的选择都需要重新考虑。扎根点:Section 6, “Extensions: ... continuous treatments”。
-
如何将方法扩展到工具变量(IV)或中介分析(mediation)设定? 在这些设定中,个体效应(如 complier average causal effect)的定义更复杂,bounded null 的检验需要处理“非依从性”或“中介变量”的随机化分布。扎根点:Section 6, “Extensions: ... more complex designs”。
-
bounded null 检验的 power 如何? 作者只证明了 p 值的保守性(type I error 控制),但未讨论 power(type II error)。在有限样本下,bounded null 检验的 power 可能很低(如 \( N=2 \) 的例子所示)。如何设计检验统计量以最大化 power?扎根点:Section 5, “Power considerations” (作者仅简短提及,未深入分析)。
Maintained by 陈星宇 · Homepage · Source on GitHub