跳转至

Randomization Tests in Randomized Saturation Designs

作者: Jizhou Liu, Azeem M. Shaikh, Liang Zhong
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2607.04257


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是在存在干扰(interference)的集群随机实验中,如何对溢出效应(spillover effects)进行有效的假设检验。具体来说,当实验采用“随机饱和设计”(randomized saturation designs)——即先随机分配集群到不同的处理饱和度水平,再在集群内按该饱和度随机分配个体——时,研究者关心的核心问题是:一个集群内未接受处理的个体,其潜在结果是否会因该集群被分配到的处理饱和度水平不同而不同。这个方向当前的核心挑战在于:集群数量通常很少(见论文 Table 3 中许多实证研究的集群数在 20-50 之间),无法依赖大样本渐近近似;同时,关于溢出效应的零假设通常不是“尖锐的”(sharp),即它们无法为所有个体的所有潜在结果赋值,因此传统的 Fisher 随机化检验不能直接应用。

发展脉络

奠基工作:Hudgens and Halloran (2008) 建立了在部分干扰(partial interference)假设下识别和估计直接效应与溢出效应的框架,并提出了基于集群的方差估计。这是该领域的基石,但它主要关注点估计和基于渐近的推断,而非有限样本的精确检验。

主要进展(两条线索)

  1. 随机化推断(Randomization Inference):Fisher (1953) 的随机化检验思想被 Imbens and Rubin (2015) 系统性地引入因果推断。Aronow (2012) 提出了一个检测干扰存在的一般性方法。Athey, Eckles, and Imbens (2018) 提出了“焦点单元”(focal units)的概念,通过条件化于焦点单元来构造网络干扰下的精确 p 值。Basse, Feller, and Toulis (2019) 将这一思想形式化为一个通用的条件随机化检验框架,并应用于一个两阶段设计(第一阶段是二值处理,每个处理集群中恰好有一个处理单元)。Puelz et al. (2021) 用图论方法推广了条件随机化检验。Zhong (2024) 提出了“成对插补随机化检验”(PIRT),用于在一般干扰下检验非尖锐零假设,这是本文在单调性检验上的直接前驱。

  2. 饱和设计下的估计与推断:Basse and Feller (2018) 系统性地分析了随机饱和设计,提出了估计直接效应和溢出效应的 Horvitz-Thompson 型估计量。Imai, Jiang, and Malani (2021) 研究了存在不依从(noncompliance)的两阶段随机实验。Cruces, Tortarolo, and Vázquez-Bare (2025) 和 Liu (2026) 进一步推进了估计和推断方法。这些工作主要依赖大样本渐近理论。

当前 Frontier 与本文位置:当前的前沿是将随机化推断的有限样本优势与饱和设计的实际复杂性结合起来。Basse et al. (2019) 是这一结合的先驱,但其设计限制在二值饱和水平且每个处理集群只有一个处理单元。本文(Liu, Shaikh, Zhong, 2026)将其推广到多饱和水平、每个集群有多个处理单元的通用设定,并系统性地处理了三类零假设:部分尖锐零假设、有界零假设和弱平均零假设,以及全局单调性零假设。它填补了“有限样本精确检验”与“多饱和水平实际设计”之间的空白。

子线索聚类

  1. 条件随机化检验(Conditional Randomization Tests):核心思想是通过条件化于焦点单元和受限的分配空间,将非尖锐零假设转化为一个可计算的置换检验问题。代表工作:Athey et al. (2018), Basse et al. (2019), Puelz et al. (2021), Liu et al. (2026), Liu and Zhong (2026)。本文的 Section 3 和 4 属于此线索。

  2. 成对插补随机化检验(Pairwise-Imputation Randomization Tests, PIRT):核心思想是通过比较实际分配与每个可能的参考分配,利用“成对可插补性”来构造一个无条件有效的检验。代表工作:Zhong (2024)。本文的 Section 5 属于此线索。

  3. 饱和设计下的估计与渐近推断:核心思想是利用设计权重和渐近正态性进行推断。代表工作:Hudgens and Halloran (2008), Basse and Feller (2018), Imai et al. (2021), Cruces et al. (2025), Liu (2026)。本文的 Section 4(弱平均零假设)与此线索有交集,但采用了随机化检验的视角。

  4. 弱零假设下的随机化检验:核心思想是当零假设只约束平均效应时,如何通过学生化(studentization)或其它方法获得渐近有效的随机化检验。代表工作:Chung and Romano (2013), DiCiccio and Romano (2017), Zhao and Ding (2021), Wu and Ding (2021), Toulis (2025)。本文的 Section 4 直接建立在此线索之上。

这个方向在追问的核心问题

  1. 如何为部分尖锐的溢出效应零假设构造有限样本精确的检验? 这是本文 Section 3 解决的核心问题。已知瓶颈:非尖锐零假设无法为所有潜在结果赋值,导致传统 Fisher 检验失效。
  2. 如何为只约束平均效应的弱零假设构造有效的随机化检验? 这是本文 Section 4 解决的核心问题。已知瓶颈:有限样本精确性通常不可得,需要渐近理论支撑。
  3. 如何检验溢出效应在多个有序饱和度水平上的全局单调性? 这是本文 Section 5 解决的核心问题。已知瓶颈:多重比较校正会损失功效,且缺乏一个直接针对全局零假设的单一检验。
  4. 如何将随机化推断推广到更一般的暴露映射(如网络暴露)和连续剂量反应设计? 这是本文在结论中提出的未来方向。

⚠️ 作者的 framing

作者将缺口 frame 成:现有工作要么只处理了二值饱和水平(Basse et al., 2019),要么主要关注估计和渐近推断(Hudgens and Halloran, 2008; Basse and Feller, 2018; Imai et al., 2021),而本文提供了一个在多饱和水平、多处理单元设定下,针对多种溢出效应零假设的统一随机化推断框架。 作者淡化了以下竞争路线: - 基于渐近的推断方法:作者承认其在大样本下的有效性,但强调在集群数少时不可靠,从而突出了自己方法的有限样本优势。 - 基于多重比较的方法:对于单调性检验,作者提到“将相邻对比的 p 值通过 Bonferroni 校正组合”是一种可行方法,但认为自己的 PIRT 方法更直接、更有效(在模拟中,当饱和度水平增多时,PIRT 功效更高)。

什么明显该被引 / 该存在、却没出现在 intro 里? - 论文引用了 Basse et al. (2024) 关于群体形成实验中的随机化检验,但未引用更早的关于“暴露映射”(exposure mapping)的文献,如 Aronow and Samii (2017) 的 Estimating average causal effects under general interference。这可能是作者认为其 Assumption 2.1(同质部分干扰)已经足够,但更一般的暴露映射框架可能提供更丰富的视角。 - 论文引用了 Caughey et al. (2023) 关于有界零假设的随机化推断,但未引用更早的关于“部分识别”(partial identification)的文献,如 Manski (1990) 的 Nonparametric bounds on treatment effects。有界零假设本质上是一个部分识别问题,将其与随机化检验结合是一个有趣的方向,但作者没有深入讨论这一联系。

张力

未见明显对立引用。所有被引工作都在各自的设定下推进,没有出现彼此矛盾或在略不同条件下得相反结论的情况。这是一个相对成熟且内部一致的子领域。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - 集群与个体K 个集群,索引 j = 1, ..., K。集群 j 包含 n_j 个个体。总个体数 N = Σ n_j[i] 表示个体 i 所属的集群。 - 处理饱和度S = {s_0, s_1, ..., s_L} 是集群级处理饱和度标签的集合,s_0 = 0 表示零饱和度。K_ℓ 是设计固定的、被分配到饱和度 s_ℓ 的集群数量。 - 第一层随机化A_j ∈ S 是集群 j 被分配到的饱和度。A = (A_1, ..., A_K) 是集群级分配向量。A 通过完全随机化产生,使得恰好有 K_ℓ 个集群被分配到 s_ℓ。 - 第二层随机化D_i ∈ {0, 1} 是个体 i 的处理指示变量。D = (D_1, ..., D_N) 是个体级处理向量。给定 A = a,在每个集群 j 内,从 n_j 个个体中均匀无放回地随机选择 m_j(a_j) 个个体接受处理(D_i = 1)。 - 潜在结果Y_i(z) 是个体 i 在分配 z = (a, d) 下的潜在结果。可观测数据Y_i^{obs} = Y_i(Z^{obs}),其中 Z^{obs} = (A^{obs}, D^{obs}) 是实际实现的分配。 - 暴露映射:Assumption 2.1(同质部分干扰)规定,Y_i(z) 只依赖于个体 i 自身的处理状态 d_i 和其所在集群 [i] 中接受处理的总人数 Σ_{k∈[i]} d_k。由于设计固定了集群 j 在饱和度 s 下的处理人数为 m_j(s),因此潜在结果可以简写为 Y_i(r, s),其中 r ∈ {0, 1} 是个体处理状态,s 是集群饱和度。这个简写只在 (r, s) 是可行暴露(feasible exposure)时才有定义。 - 可行暴露集E_j = {(0, s): m_j(s) < n_j} ∪ {(1, s): m_j(s) > 0}。对于未处理个体,我们只关心 s ∈ S_0 = {s ∈ S: m_j(s) < n_j for every j},即对所有集群都可行的未处理饱和度。 - 目标参数:对于两个饱和度 s, s' ∈ S_0,我们关心的是未处理个体的溢出效应对比 Y_i(0, s) - Y_i(0, s')

模型: - 有限总体框架:潜在结果 {Y_i(z)} 被视为固定的常数。所有随机性仅来自已知的分配机制(两层随机化)。 - 同质部分干扰假设(Assumption 2.1):这是核心的识别假设。它排除了跨集群的干扰,并将集群内的干扰简化为只依赖于处理人数。这是一个实质性假设,而非随机化的结果。

可观测数据: - 研究者观测到:(A^{obs}, D^{obs}, Y^{obs})。 - 对于每个个体 i,我们观测到其所在集群的饱和度 A^{obs}_{[i]}、其自身的处理状态 D^{obs}_i,以及在该分配下的结果 Y_i^{obs} = Y_i(D^{obs}_i, A^{obs}_{[i]})。 - 关键不可观测量:对于任何其他分配 z ≠ Z^{obs},其对应的潜在结果 Y_i(z) 是缺失的。这正是因果推断的核心问题。

第二步:讲最小内核

本文的最小内核是一个两集群、两饱和度、每个集群只有一个未处理焦点单元的特例。这个特例剥离了所有为一般性服务的复杂假设,直接展示了核心思路。

特例设定: - 只有两个集群:K = 2,集群 1 和集群 2。 - 只有两个饱和度水平:S = {s, s'},且 s ≠ s'。 - 设计固定:一个集群被分配到 s,另一个被分配到 s'。所以 K_s = K_{s'} = 1。 - 每个集群只有一个个体:n_1 = n_2 = 1。因此 m_j(s) = 01。我们考虑 ss' 都使得 m_j(s) < 1,即 m_j(s) = 0 对所有 j 成立。这意味着两个集群都是纯控制集群,没有个体接受处理。 - 因此,D_i^{obs} = 0 对所有 i 成立。所有个体都是未处理的。 - 焦点单元选择:每个集群选择 k_j = 1 个未处理个体作为焦点单元。由于每个集群只有一个个体,所以焦点单元就是该个体本身。

核心问题:我们想检验部分尖锐零假设 H^{s,s'}_{0,PS}: Y_1(0, s) = Y_1(0, s') 且 Y_2(0, s) = Y_2(0, s')。即,对于每个个体,其在饱和度 ss' 下的未处理潜在结果相同。

核心思路: 1. 条件化:我们条件化于观测到的焦点单元集合 U = {1, 2}(即所有个体)和它们的观测结果 Y_1^{obs}, Y_2^{obs}。 2. 重标号空间:我们考虑一个“重标号”空间,即交换两个集群的饱和度标签。由于设计固定了 K_s = K_{s'} = 1,所以重标号空间只有两个元素: - a_J^{(1)} = (s, s'):集群 1 为 s,集群 2 为 s'(这是观测到的分配)。 - a_J^{(2)} = (s', s):集群 1 为 s',集群 2 为 s。 3. 统计量:我们使用焦点集群均值之差。在观测到的重标号 a_J^{(1)} 下,统计量为 τ̂_U(a_J^{(1)}) = Y_1^{obs} - Y_2^{obs}。在重标号 a_J^{(2)} 下,统计量为 τ̂_U(a_J^{(2)}) = Y_2^{obs} - Y_1^{obs}。 4. 零假设下的可插补性:在 H^{s,s'}_{0,PS} 下,对于任何个体 iY_i(0, s) = Y_i(0, s')。这意味着,无论集群被重标号为 s 还是 s',该个体的潜在结果都等于其观测结果。因此,在重标号 a_J^{(2)} 下,集群 1 的“潜在”结果 Y_1(0, s') 等于其观测结果 Y_1^{obs},集群 2 的“潜在”结果 Y_2(0, s) 等于其观测结果 Y_2^{obs}。所以,τ̂_U(a_J^{(2)}) 可以直接用观测数据计算出来。 5. 检验:在零假设下,重标号分布是均匀的(每个重标号概率为 1/2)。我们计算 p 值:p = (1/2) * [1{τ̂_U(a_J^{(1)}) ≥ τ̂_U(a_J^{(1)})} + 1{τ̂_U(a_J^{(2)}) ≥ τ̂_U(a_J^{(1)})}]。如果 Y_1^{obs} > Y_2^{obs},则 τ̂_U(a_J^{(1)}) > 0τ̂_U(a_J^{(2)}) < 0,所以 p = 1/2。如果 Y_1^{obs} < Y_2^{obs},则 p = 1/2。如果 Y_1^{obs} = Y_2^{obs},则 p = 1。这个检验永远不会拒绝,这正是有限样本有效性的体现:在零假设下,p 值在 [0, 1] 上随机分布,且 P(p ≤ α) ≤ α

这个特例说明了什么:它清晰地展示了条件随机化检验的核心机制:通过条件化于焦点单元,将非尖锐的零假设转化为一个关于集群标签的置换问题。在零假设下,焦点单元的潜在结果在置换下是可插补的,从而使得置换分布成为一个有效的参考分布。论文的一般情形只是将这个特例推广到多个集群、多个焦点单元和更复杂的统计量。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在随机饱和设计中,针对多种关于溢出效应的零假设(部分尖锐零假设、有界零假设、弱平均零假设、全局单调性零假设),开发了基于随机化推断的假设检验方法。
  2. 核心工具 / 方法:条件随机化检验(CRT)框架(结合焦点单元选择和集群级重标号分布)和成对插补随机化检验(PIRT)框架。
  3. 主要结论:对于部分尖锐和有界零假设,CRT 提供有限样本精确的条件检验;对于弱平均零假设,学生化的 CRT 提供渐近有效的无条件检验;对于全局单调性零假设,PIRT 提供有限样本有效的无条件检验。

关键设定与假设

  • Assumption 2.1 (同质部分干扰):这是贯穿全文的核心假设。它比一般的“部分干扰”更强,因为它不仅假设干扰只发生在集群内部,还假设集群内的干扰完全由处理人数决定,而与具体是哪些人接受处理无关。相比 Basse et al. (2019) 的设定,本文允许每个集群有多个处理单元,因此这个假设是必要的,否则潜在结果空间会过于复杂。
  • 有限总体框架:潜在结果固定,随机性仅来自分配机制。这是 Fisher 随机化检验的标准框架。
  • 设计假设:第一层(集群级)是完全随机化,第二层(个体级)是集群内的完全随机化。这是已知的分配机制。
  • 焦点单元选择条件 (4)1 ≤ k_j ≤ min{n_j - m_j(s), n_j - m_j(s')}。这个条件保证了无论集群被分配到 s 还是 s',都有足够的未处理个体可供选择为焦点单元。这是确保重标号分布有效性的关键。
  • Assumption C.1 (弱零假设的正则条件):用于弱平均零假设的渐近理论。包括稳定的设计分数、变换后的四阶矩有界、非退化的极限方差、最大可忽略性。这些条件是标准的,用于保证学生化统计量的渐近正态性和置换分布的收敛性。

主要结果

Theorem 3.1 (有限样本条件有效性): - 陈述:对于部分尖锐零假设 H^{s,s'}_{0,PS} 和有界零假设 H^{s,s'}_{δ,B},Procedure 3.1 给出的条件随机化检验是有限样本有效的,即 P{p_T ≤ α | U} ≤ α。 - 直觉:对于部分尖锐零假设,零假设本身保证了焦点单元的结果在重标号下不变,因此任何基于焦点结果的统计量都是可插补的。对于有界零假设,等式边界 H^{s,s'}_{δ,E} 是最不利的(least favorable)配置,因此基于该边界构造的检验是保守的。 - 必要条件:焦点单元选择条件 (4) 必须满足。 - 解决的技术难点:如何将非尖锐的零假设转化为一个可计算的置换问题。解决方案是条件化于焦点单元,将问题简化为集群级标签的置换。

Theorem 4.1 (无条件渐近有效性): - 陈述:对于加权弱平均零假设 H^{s,s'}_{0,W}(λ),在 Assumption C.1 下,基于学生化统计量 T^{Ney}_{U,λ} 的 relabeling p-value 满足 lim sup_{K→∞} P{p_{T,λ} ≤ α} ≤ α。 - 直觉:弱零假设不提供个体水平的可插补性,因此条件重标号分布不是精确的零分布。但是,通过学生化,可以校正重标号分布与真实零分布之间的差异,使得检验在渐近意义下有效。 - 必要条件:Assumption C.1 必须成立,特别是非退化的极限方差和最大可忽略性。 - 解决的技术难点:证明学生化统计量的观测值与其在置换分布下的分位数之间的渐近关系。证明路线(见下文)通过将观测统计量分解为三个渐近独立的部分,并证明置换分布收敛到标准正态,从而得到结论。

Theorem 5.1 (有限样本有效性): - 陈述:对于全局单调性零假设 H_{0,M}(S_M),Procedure 5.1 给出的 PIRT 是有限样本有效的,即 E_P[1{p^{PIRT}_M(Z^{obs}) ≤ α/2}] ≤ α。 - 直觉:PIRT 的核心是 Proposition 5.1,它表明在单调性零假设下,对于任何一对分配 (z, z')T{Y(z), z, z'} ≥ T{Y(z'), z, z'}。这个成对排序性质保证了检验的有限样本有效性。 - 必要条件:统计量 T 必须是“成对可插补的溢出单调统计量”(Definition 5.1),即它只依赖于在两个分配下都未处理且暴露水平都在 S_M 中的个体,并且其单调性方向与零假设一致。 - 解决的技术难点:如何构造一个直接检验全局单调性零假设的单一检验,而不是依赖多重比较。解决方案是 Zhong (2024) 提出的 PIRT 框架,它通过比较实际分配与所有可能的参考分配来构造一个无条件有效的检验。

证明路线与技术技巧

Theorem 3.1 的证明路线: 1. 引理 B.2:证明在条件化事件 C = (U, Z_{s,s'}(U, Z^{obs})) 下,对比集群的饱和度标签 A_J 服从均匀分布 Unif(A^{obs}_J)。这是通过计算条件概率并证明其与重标号无关得到的。关键技巧:利用分配机制的乘积结构和焦点采样的对称性,证明 Pr(C | A = a)a_J 无关。 2. 部分尖锐零假设 (a):证明在 H^{s,s'}_{0,PS} 下,焦点单元的结果在 Z_{s,s'}(U, Z^{obs}) 中的所有分配下都是可插补的(即等于观测值)。因此,任何基于焦点结果的统计量 T_U 都是可插补的。然后,应用引理 B.1(随机化 p 值的超均匀性)即得结论。 3. 有界零假设 (b):证明等式边界 H^{s,s'}_{δ,E} 是最不利的。具体地,证明在 H^{s,s'}_{δ,B} 下,基于 s' 锚定的统计量 T^B_{U,δ} 的 p 值 p_T 总是大于或等于在 H^{s,s'}_{δ,E} 下的 p 值 p_*关键技巧:通过代数变换,证明对于任何重标号 w1{t(w, y^{imp}) ≥ t(W, y^{imp})} ≥ 1{t(w, y^0) ≥ t(W, y^0)},其中 y^{imp} 是基于有界零假设的插补值,y^0 是基于等式边界的插补值。由于 p_* 在等式边界下是有效的,因此 p_T 在原始有界零假设下也是有效的(且更保守)。

Theorem 4.1 的证明路线: 1. 引理 C.1:证明对比集群、焦点单元和饱和度标签的联合分布可以等价地表示为:先随机抽取 M_K 个集群作为对比集,再独立抽取焦点单元,最后在对比集内进行完全随机化分配。这个顺序表示是后续分解的基础。 2. 三部分分解 (26):将学生化统计量的分子 τ̂_{X,U}(A_J) 分解为三个部分: - R^{(1)}_K:对比集抽样误差(来自第一步)。 - R^{(2)}_K:焦点抽样误差(来自第二步)。 - R^{(3)}_K:标签随机化误差(来自第三步)。 3. 渐近正态性:分别证明三个部分(经过适当缩放)是渐近正态的,并且它们渐近独立。 - R^{(1)}_K:来自无放回抽样的 CLT。 - R^{(2)}_K:来自独立(但不同分布)的焦点抽样的 Lyapunov CLT。 - R^{(3)}_K:来自完全随机化设计的 Hajék CLT。 4. 方差计算:计算三个部分方差之和,并证明其极限 σ² = 1 - κV_{X,μ}/D_X ≤ 1。 5. 置换分布收敛性:证明在条件于 (J, U, Y^{obs}) 下,学生化 relabeling 统计量的分布收敛到标准正态分布 N(0, 1)关键技巧:学生化是必要的,因为它使得置换分布的分位数收敛到 z_{1-α},而观测统计量的极限方差 σ² ≤ 1,从而保证了检验的渐近保守性。

Theorem 5.1 的证明路线: 1. Proposition 5.1:证明在单调性零假设下,对于任何一对分配 (z, z'),成对排序性质 T{Y(z), z, z'} ≥ T{Y(z'), z, z'} 成立。证明直接依赖于 Assumption 2.1 和单调性零假设的定义。 2. p 值定义:定义 p(z) = Σ_{z̃} 1[T{Y(z), z, z̃} ≥ T{Y(z), z̃, z}] π(z̃)。当 Z^{obs} = z 时,p^{PIRT}_M(Z^{obs}) = p(z)。 3. 不等式链:利用 Proposition 5.1,证明 p(z) ≥ Σ_{z̃} H(z, z̃) π(z̃),其中 H(z, z̃) = 1[T{Y(z), z, z̃} ≥ T{Y(z̃), z̃, z}]。 4. 双重求和技巧:定义 w_α = P(p^{PIRT}_M(Z^{obs}) ≤ α/2)。通过双重求和 Σ = Σ_{z∈Z_α} Σ_{z̃} H(z, z̃) π(z) π(z̃),得到两个不等式: - Σ ≤ (α/2) w_α(由 p 值的定义)。 - Σ > w_α² / 2(由 H(z, z̃) + H(z̃, z) ≥ 1H(z, z) = 1)。 5. 结论:由 w_α² / 2 < (α/2) w_α 推出 w_α < α,即检验的有限样本有效性。

真实例子与应用

Zomba 现金转移实验 (Malawi): - 数据 / 场景:Baird et al. (2011, 2018) 的马拉维 Zomba 现金转移项目。本文使用其公开数据的一个子集(UCT-plus-zero 样本),包含 42 个枚举区(EAs),分配到四个学校女孩补助政策标签:ℓ_0(无补助)、ℓ_{0.33}(33% 的 UCT)、ℓ_{0.66}(66% 的 UCT)、ℓ_1(100% 的 UCT)。关注四个结果:当前入学率、英语读写能力、是否已婚、是否怀孕。 - 方法应用: - 成对有界零假设检验:对三对对比 (ℓ_{0.33}, ℓ_0)(ℓ_{0.66}, ℓ_{0.33})(ℓ_{0.66}, ℓ_0),使用焦点集条件 CRT 检验 H^{s,s'}_{0,B}: Y_i(0, ℓ_s) ≤ Y_i(0, ℓ_{s'})。 - 全局单调性零假设检验:对有序标签 {ℓ_0, ℓ_{0.33}, ℓ_{0.66}},使用 PIRT 检验 H_{0,M}: Y_i(0, ℓ_0) ≤ Y_i(0, ℓ_{0.33}) ≤ Y_i(0, ℓ_{0.66})。 - 结果:所有检验的 p 值均大于 0.05,未拒绝任何零假设。例如,ℓ_{0.33} vs ℓ_0 在“是否已婚”上的 p 值为 0.064,是最大的证据,但仍不显著。 - 这个例子想说明什么: 1. 实际可行性:展示了所提出的方法可以在一个真实的、具有多饱和度水平和异质性集群大小的实验中实现。 2. 有限样本价值:该实验每个饱和度水平只有 9-15 个集群,集群大小差异大(见 Table 1),这正是大样本渐近方法可能失效的场景,凸显了有限样本随机化检验的价值。 3. 校准模拟:论文还进行了校准模拟(semi-synthetic),将所提出的 CRT 和 PIRT 与线性概率模型回归(带集群稳健标准误)和 Bonferroni 校正的相邻 CRT 进行比较。模拟结果显示,CRT 的尺寸控制优于回归,而 PIRT 在饱和度水平较多时功效更高。这为方法选择提供了实证依据。

🔎 结论是否比证明窄

  • Theorem 4.1 的结论是渐近的,但证明中隐含了更强的条件。定理陈述的是 lim sup P(p ≤ α) ≤ α,但证明中依赖于 Assumption C.1 中的一系列矩条件和收敛性假设。这些假设在实际中可能难以验证。作者在 Remark C.1 中承认了权重的作用,但并未给出一个简单的充分条件。因此,该定理的适用范围可能比其陈述的“渐近有效”要窄,因为它依赖于一个非平凡的、关于变换后的集群级数组的正则条件。
  • Theorem 5.1 的结论是有限样本有效的,但 p 值的计算需要枚举整个分配空间 Z。作者在文中提到“当 |Z| 太大而无法枚举时,可以用 Monte Carlo 近似”,但明确指出“只有精确枚举,或保守的有限 Monte Carlo 实现,才能被描述为有限样本有效”。因此,在实际应用中,如果分配空间巨大,Monte Carlo 近似会丧失有限样本有效性的保证,这比定理的陈述要窄。
  • Section 3 的 CRT 对焦点单元的选择是条件化的。Theorem 3.1 的结论是 P(p_T ≤ α | U) ≤ α,即条件于焦点单元 U 的有效性。这意味着,如果研究者选择了一个“不幸”的焦点单元集(例如,恰好选到了异常值),检验的 size 可能仍然被控制,但 power 可能很低。作者在 Remark 3.1 中讨论了焦点单元大小的选择,但未讨论焦点单元本身的选择对 power 的影响。这是一个在实践中很重要但未被理论覆盖的问题。

四、开放问题

  1. 更一般的暴露映射:本文的 Assumption 2.1(同质部分干扰)将干扰简化为集群内的处理人数。如何将本文的随机化推断框架推广到更一般的暴露映射,例如网络暴露映射(每个个体的暴露取决于其邻居的处理状态)或连续剂量反应设计?作者在结论中提到了这一点,但未给出具体路线。扎根点:Section 7 结论:“the monotone PIRT framework can be adapted to more general exposure mappings, including network exposure mappings and continuous dose-response designs.”

  2. 弱零假设的有限样本理论:本文的弱平均零假设检验(Theorem 4.1)是渐近有效的。是否存在一个有限样本有效的检验(可能通过某种形式的“最不利”构造)?或者,是否存在一个有限样本的界,可以量化渐近近似的误差?扎根点:Section 4 开头:“These nulls are scientifically less restrictive but do not determine the missing focal potential outcomes. Consequently, the conditional relabeling distribution is no longer an exact finite-sample null distribution.”

  3. 焦点单元选择对功效的影响:本文的 CRT 条件化于焦点单元 U。焦点单元的大小 k_j 和选择方式(目前是均匀随机抽样)如何影响检验的功效?是否存在一个最优的选择策略?扎根点:Remark 3.1 讨论了 k_j 的选择,但只提到了对称性和计算成本,未讨论功效。

  4. PIRT 在巨大分配空间下的计算与近似:Theorem 5.1 的 PIRT 需要枚举整个分配空间 Z。当 Z 巨大时,Monte Carlo 近似会丧失有限样本有效性。是否存在一种计算上可行且仍能保持有限样本有效性的近似方法?例如,利用分配空间的对称性或图结构进行重要性采样?扎根点:Section 5.3:“When |Z| is too large for enumeration, the sum in (18) can be approximated by Monte Carlo draws from the known design distribution P. Only exact enumeration, or a conservative finite-Monte-Carlo implementation, should be described as finite-sample valid without numerical qualification.”


Maintained by 陈星宇 · Homepage · Source on GitHub

评论