跳转至

Analyzing Within-Subject Experiments: Identification, Testing, and Sensitivity

作者: Shiyao Liu, Junni L. Zhang
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.26606


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是两期组内实验(within-subject experiment)的因果推断。根本问题是:当每个受试者在两个时期依次接受两种不同的处理条件(如先处理再对照,或先对照再处理),且第一期的处理可能影响第二期的反应(即存在结转效应,carryover effect)时,如何从观测数据中识别、估计和推断平均处理效应(ATE)。该方向的核心张力在于:组内设计通过重复测量有望提高效率,但结转效应可能使pooled estimator产生偏差,而常用的结转检验(carryover test)和基于该检验的两步法(先检验再决定是否pooling)在统计上存在严重缺陷。当前该子方向的成熟度处于“问题已被广泛认识但缺乏严格形式化分析”的阶段——大量应用研究在使用组内设计,但其识别条件和推断方法尚未被系统审视。

发展脉络(history)

  • 奠基工作:Willan and Pater (1986) 在临床试验的交叉设计(crossover trial)背景下,系统讨论了结转效应和两阶段分析(Grizzle's procedure)的问题,指出两步法可能导致覆盖不足。这是该问题的经典起点,但局限于临床试验的特定设定(正态、同方差、等分配)。
  • 主要进展:Freeman (1989) 在Willan and Pater的基础上,通过数值计算进一步揭示了两步法覆盖不足的严重性,并得出结论“两步分析太误导以至于没有实用价值”。Freeman的工作是本文最直接的前身,但同样局限于加性正态模型和等分配。
  • 当前frontier:Clifford, Sheagley, and Piston (2021a) 在政治科学领域大力推荐重复测量设计(包括组内设计),声称可以提高精度而不改变处理效应。这篇论文引发了大量应用跟进——Jordan, Ollerenshaw, and Trexler (2026a) 发现83篇论文引用了它来证明组内设计的合理性。然而,这些应用工作没有形式化组内设计的识别条件,也没有严格评估结转检验的统计性质。
  • 本文的位置:Liu and Zhang (2026) 在潜在结果框架下形式化了两期组内设计的识别与推断问题,允许非均衡分配和异质性处理/结转效应。它系统揭示了:①pooled estimator的识别条件(平均结转效应之差为零);②结转检验的势低于后测ATE检验;③两步法覆盖不足的精确条件(当pooling更有效时恰好覆盖不足);④提供了敏感性分析方法。本文是对Clifford等人推荐的一个方法论上的纠偏和补充——它支持组内设计,但反对用结转检验来决定是否pooling。

子线索聚类

这些被引文献大致落在两条子线索上:

  1. 识别与估计线索:关注pooled estimator在什么条件下识别ATE,以及如何正确实现。代表工作:Shi and Ye (2024) 在生物统计学的交叉试验背景下推导了相同的识别条件(平均结转效应之差为零),但未涉及设计-based推断和回归实现。本文在此基础上扩展了设计-based分析,并研究了回归规范与设计-based估计量的关系。
  2. 检验与推断线索:关注结转检验的统计性质和两步法的覆盖问题。代表工作:Willan and Pater (1986) 和 Freeman (1989) 在临床试验背景下揭示了问题。本文将其扩展到更一般的设定(非正态、异方差、非均衡分配),并给出了覆盖不足的精确条件(Proposition 10)。

这个方向在追问的核心问题

  1. 识别问题:在组内设计中,pooled estimator在什么条件下识别ATE?这个条件是否比“无结转效应”更弱?
  2. 检验问题:结转检验的势如何?它能否可靠地检测出有实际影响的结转效应?
  3. 推断问题:基于结转检验的两步法产生的置信区间是否具有名义覆盖?在什么条件下覆盖不足?
  4. 敏感性分析:当结转效应可能存在时,如何评估pooled estimator结论的稳健性?

当前主流方法与已知瓶颈:主流做法是使用结转检验(通常检验交互项是否为零),若不显著则pooling,否则使用后测数据。已知瓶颈包括:①结转检验势低;②两步法覆盖不足;③pooled estimator在结转差非零时存在偏差。

⚠️ 作者的framing

这是作者的说法:作者把缺口frame成“现有文献推荐组内设计以提高精度,但对其识别条件和推断问题缺乏严格的形式化分析”。具体来说,作者认为Clifford等人(2021a)和Jordan等人(2026a)虽然推荐了组内设计,但: - 没有形式化pooled estimator的识别条件(只要求“无结转效应”,但实际需要的是更弱的“平均结转效应之差为零”); - 没有评估结转检验的势和两步法的覆盖问题; - 没有提供敏感性分析方法。

被淡化或回避的竞争路线: - 作者明确回避了预处理协变量的讨论(Section 6:“we study unadjusted estimators and do not consider the inclusion of pretreatment covariates”)。协变量调整可能改变效率比较和敏感性计算,这是作者主动划定的边界。 - 作者也回避了多期或多条件设计的一般化(Section 6:“our formal results concern within-subject designs reducible to the same two-sequence structure”),只处理可简化为两序列结构的设计。

什么明显该被引/该存在、却没出现在intro里? - 作者引用了Shi and Ye (2024) 在生物统计学的交叉试验背景下推导了相同的识别条件,但未引用更早的交叉试验文献(如Senn (2002) 的经典教材)。这可能是因为作者聚焦于社会科学应用,但交叉试验文献中的许多结果(如两步法的问题)是直接相关的。 - 作者没有引用关于双稳健估计或半参数效率理论在组内设计中的应用工作。这可能是作者有意为之,因为本文聚焦于设计-based推断而非模型-based推断。 - 作者没有引用Hainmueller, Hopkins, and Yamamoto (2014) 关于联合实验(conjoint experiment)中稳定性假设的讨论,尽管在concluding remarks中提到了这一点。这可能是一个值得研究者去查的问题:联合实验中的“无任务间结转效应”假设与本文的假设有何异同?

张力

未见明显对立引用。被引工作之间没有彼此矛盾或在略不同条件下得相反结论的情况。Willan and Pater (1986) 和 Freeman (1989) 的结论与本文一致(两步法有问题),Clifford等人(2021a)的推荐与本文的结论也不矛盾——本文支持组内设计,只是反对用结转检验来决定是否pooling。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( i = 1, \dots, n \):受试者(单元)索引。 - \( t = 1, 2 \):时期索引。 - \( D_{it} \in \{0, 1\} \):单元 \( i \) 在时期 \( t \) 的处理状态。\( D=1 \) 为处理,\( D=0 \) 为对照。 - 只有两种可能的处理序列:\( (D_{i1}, D_{i2}) = (1, 0) \)(先处理再对照)或 \( (0, 1) \)(先对照再处理)。 - \( n_1 \):分配到序列 \( (1,0) \) 的单元数;\( n_2 \):分配到序列 \( (0,1) \) 的单元数;\( n = n_1 + n_2 \)。 - \( Y_{it}(d_1, d_2) \):单元 \( i \) 在时期 \( t \) 的潜在结果,给定第一时期接受 \( d_1 \)、第二时期接受 \( d_2 \)。 - \( Y_{it} = Y_{it}(D_{i1}, D_{i2}) \):观测结果。 - \( \tau_i \):单元 \( i \) 的处理效应(相对于对照条件)。 - \( \delta_{i, d_1} \):单元 \( i \) 在第二时期的结转效应,取决于第一时期的处理 \( d_1 \)。 - \( \tau = \mathbb{E}[\tau_i] \):平均处理效应(ATE),是本文的主要estimand。 - \( \delta = \mathbb{E}[\delta_{i,0}] - \mathbb{E}[\delta_{i,1}] \):两个序列的平均结转效应之差(carryover gap)。 - \( \mu_1 = \mathbb{E}[Y_{i1} | (1,0)] - \mathbb{E}[Y_{i1} | (0,1)] \):第一时期(后测)的总体对比,识别 \( \tau \)。 - \( \mu_2 = \mathbb{E}[Y_{i2} | (0,1)] - \mathbb{E}[Y_{i2} | (1,0)] \):第二时期的总体对比,识别 \( \tau + \delta \)。 - \( \mu_{\text{co}} = \frac{1}{2}(\mu_1 + \mu_2) = \tau + \delta/2 \):pooled总体对比。 - \( \hat{\mu}_1, \hat{\mu}_2, \hat{\mu}_{\text{co}} \):对应的样本估计量。 - \( \sigma_1^2, \sigma_2^2, \sigma_{\text{co}}^2, \sigma_\delta^2 \):各估计量的方差尺度(定义见论文Section 2)。 - \( \sigma_{12} \):跨时期协方差的加权和(定义见论文Section 2)。

模型: - 潜在结果模型(饱和模型,Equation 1):

\[Y_{it}(d_1, d_2) = \pi_{it} + d_t \tau_i + (t-1) \delta_{i, d_1}\]
其中 \( \pi_{it} \) 是基线结果(可随单元和时期变化),\( \tau_i \) 是单元处理效应,\( \delta_{i, d_1} \) 是结转效应(仅出现在第二时期)。 - 关键假设: - SUTVA(Assumption 1):无干扰,潜在结果只取决于单元自身的处理序列。 - 随机分配(Assumption 2):处理序列独立于潜在结果,且 \( n_1/n \to r \in (0,1) \)。 - 正则条件(Assumption 3):单元间独立同分布,各分量方差有限且正。

可观测数据: - 研究者实际能观测到的是:每个单元 \( i \) 的处理序列 \( (D_{i1}, D_{i2}) \) 和两个时期的结果 \( (Y_{i1}, Y_{i2}) \)。 - 研究者观测不到的是:每个单元在另一种处理序列下的潜在结果(反事实),以及结转效应 \( \delta_{i, d_1} \) 本身。 - 关键识别挑战:\( \delta \) 是不可直接观测的,只能通过 \( \mu_2 - \mu_1 \) 来识别,但这需要假设 \( \mu_1 = \tau \)(由随机分配保证)。

第二步:讲最小内核

最简特例:两期、两种序列、无协变量、等分配(\( n_1 = n_2 = n/2 \))、同方差、正态结果。

在这个特例下,论文的核心问题退化为:

问题:给定观测数据 \( \{(Y_{i1}, Y_{i2}, D_{i1}, D_{i2})\}_{i=1}^n \),其中 \( (D_{i1}, D_{i2}) \) 随机等概率地取 \( (1,0) \) 或 \( (0,1) \),我们想估计平均处理效应 \( \tau \)。一个自然的估计量是 pooled estimator:

\[\hat{\mu}_{\text{co}} = \frac{1}{2} \left( \bar{Y}_{1,(1,0)} - \bar{Y}_{1,(0,1)} + \bar{Y}_{2,(0,1)} - \bar{Y}_{2,(1,0)} \right)\]
其中 \( \bar{Y}_{t,(d_1,d_2)} \) 是序列 \( (d_1,d_2) \) 中时期 \( t \) 的样本均值。

核心思路: 1. 识别:在总体水平上,\( \mu_{\text{co}} = \tau + \delta/2 \)。因此,\( \hat{\mu}_{\text{co}} \) 识别 \( \tau \) 当且仅当 \( \delta = 0 \),即两个序列的平均结转效应相等。注意,这不要求每个单元的结转效应为零,也不要求任一序列的平均结转效应为零——只要求它们相等。 2. 检验:为了判断 \( \delta = 0 \) 是否成立,研究者通常使用结转检验 \( H_0: \delta = 0 \),基于 \( \hat{\delta} = \hat{\mu}_2 - \hat{\mu}_1 \)。在等分配和同方差下,\( \hat{\delta} \) 的方差为 \( \sigma_\delta^2/n \),其中 \( \sigma_\delta^2 = \sigma_1^2 + \sigma_2^2 + 2\sigma_{12} \)。而 \( \hat{\mu}_1 \) 的方差为 \( \sigma_1^2/n \)。 3. 势比较:如果跨时期协方差非负(\( \sigma_{12} \ge 0 \)),则 \( \sigma_\delta^2 \ge \sigma_1^2 \)。如果进一步假设 \( |\delta| \le |\tau| \)(结转效应通常小于处理效应),则结转检验的非中心参数 \( \sqrt{n}|\delta|/\sigma_\delta \) 严格小于 ATE检验的非中心参数 \( \sqrt{n}|\tau|/\sigma_1 \)。因此,结转检验的势严格低于 ATE检验的势。 4. 两步法覆盖:两步法先检验 \( H_0: \delta = 0 \),若不拒绝则使用 \( \hat{\mu}_{\text{co}} \) 及其置信区间,若拒绝则使用 \( \hat{\mu}_1 \) 及其置信区间。当 \( \delta = 0 \) 时,两步法的覆盖概率为:

\[\text{ACP} = \Pr(|\hat{\delta}| \le z \cdot \text{se}(\hat{\delta}), |\hat{\mu}_{\text{co}} - \tau| \le z \cdot \text{se}(\hat{\mu}_{\text{co}})) + \Pr(|\hat{\delta}| > z \cdot \text{se}(\hat{\delta}), |\hat{\mu}_1 - \tau| \le z \cdot \text{se}(\hat{\mu}_1))\]
利用联合渐近正态性和Plackett公式,可以证明:当且仅当 pooling 比后测分析更有效时(即 \( \sigma_{\text{co}}^2 < 4\sigma_1^2 \)),两步法的覆盖概率低于名义水平。这正是组内设计最有价值的场景。

为什么这个特例抓住了核心:论文的一般情形(非均衡分配、异方差、非正态)只是这个特例的“加壳”——识别条件不变,势比较的结论在更弱的条件下成立(Proposition 9),覆盖不足的条件在一般参数化下仍然成立(Proposition 10)。这个特例清晰地展示了组内设计的核心困境:当它最有价值时(pooling更有效),两步法恰好覆盖不足。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在两期组内实验的潜在结果框架下,形式化了pooled estimator的识别条件,评估了结转检验的势和两步法的覆盖性质,并推导了敏感性分析方法。
  2. 核心工具/方法:设计-based推断(design-based inference)、潜在结果框架、联合渐近正态性、Plackett公式、敏感性参数化。
  3. 主要结论:①pooled estimator识别ATE当且仅当两个序列的平均结转效应之差为零;②在温和条件下,结转检验的势严格低于后测ATE检验的势;③两步法产生的置信区间通常覆盖不足——当结转差为零时,覆盖不足恰发生在pooling比后测分析更有效时;④已发表结论在合理的结转差范围内是稳健的。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 潜在结果模型(Equation 1):\( Y_{it}(d_1, d_2) = \pi_{it} + d_t \tau_i + (t-1) \delta_{i, d_1} \)。这是一个饱和模型,允许基线、处理效应和结转效应在单元间异质。
  • SUTVA(Assumption 1):无干扰,潜在结果只取决于单元自身的处理序列。这是因果推断的标准假设。
  • 随机分配(Assumption 2):处理序列独立于潜在结果,且分配比例 \( n_1/n \to r \in (0,1) \)。这保证了第一时期对比识别ATE。
  • 正则条件(Assumption 3):单元间i.i.d.,各分量方差有限且正。这是CLT所需的标准条件。
  • 相比已有文献的放宽/强化:
  • 相比Freeman (1989):放宽了正态性、同方差、等分配假设。
  • 相比Shi and Ye (2024):扩展了设计-based分析,研究了回归实现与设计-based估计量的关系。
  • 相比Clifford等人(2021a):形式化了识别条件,揭示了结转检验和两步法的问题。

主要结果

结果1:识别条件(Proposition 1-3) - \( \mu_1 = \tau \)(第一时期对比识别ATE)。 - \( \mu_2 = \tau + \delta \)(第二时期对比识别ATE加结转差)。 - \( \mu_{\text{co}} = \tau + \delta/2 \)(pooled对比识别ATE加一半结转差)。 - 因此,pooling识别ATE当且仅当 \( \delta = 0 \)。

结果2:渐近分布(Proposition 4-6) - \( \sqrt{n}(\hat{\mu}_1 - \mu_1)/\sigma_1 \xrightarrow{d} N(0,1) \) - \( \sqrt{n}(\hat{\mu}_2 - \mu_2)/\sigma_2 \xrightarrow{d} N(0,1) \) - \( 2\sqrt{n}(\hat{\mu}_{\text{co}} - \mu_{\text{co}})/\sigma_{\text{co}} \xrightarrow{d} N(0,1) \) - 设计-based标准误由样本方差的一致估计给出。

结果3:势比较(Proposition 9) - 如果 \( |\delta| \le |\tau| \) 且 \( \sigma_\delta \ge \sigma_1 \)(后者在跨时期协方差非负时成立),则结转检验的势严格低于后测ATE检验的势。 - 直觉:结转检验需要更大的样本或更大的效应才能达到与ATE检验相同的势。

结果4:两步法覆盖(Proposition 10) - 当 \( \delta = 0 \) 时,两步法覆盖低于名义水平当且仅当 pooling比后测分析更有效(\( \sigma_{\text{co}}^2 < 4\sigma_1^2 \))。 - 当 \( \delta \neq 0 \) 时,覆盖通常低于名义水平,除非 \( |\delta| \) 或 \( n \) 很大(此时结转检验可靠地拒绝 \( H_0 \),两步法退化为后测分析)。 - 这个结果精确刻画了组内设计的困境:当它最有价值时(pooling更有效),两步法恰好覆盖不足。

结果5:敏感性分析 - 定义 \( \delta_{\min,\text{std}}^* = 2(1 - z_{1-\alpha/2}/|t_{\text{co}}|) \),其中 \( t_{\text{co}} = \hat{\mu}_{\text{co}}/\text{se}(\hat{\mu}_{\text{co}}) \)。 - 这是使偏调整估计量 \( \hat{\tau}(\delta^*) = \hat{\mu}_{\text{co}} - \delta^*/2 \) 不再显著的最小标准化结转差。 - 对已发表研究的回顾发现,\( \delta_{\min,\text{std}}^* \) 的平均值约为1.168,而实际 \( |\hat{\delta}/\hat{\mu}_{\text{co}}| \) 的平均值约为0.352,说明结论在合理的结转差范围内是稳健的。

证明路线与技术技巧

整体路线(以两步法覆盖的证明为例):

  1. 步骤1:将两步法转化为已知方差下的渐近等价程序。由于方差估计量是一致的,可以忽略方差估计的不确定性,将问题简化为已知方差下的程序。
  2. 步骤2:标准化。定义标准化统计量 \( Z_\delta = \sqrt{n}\hat{\delta}/\sigma_\delta - \eta \),\( Z_1 = \sqrt{n}(\hat{\mu}_1 - \mu_1)/\sigma_1 \),\( Z_{\text{co}} = 2\sqrt{n}(\hat{\mu}_{\text{co}} - \mu_1)/\sigma_{\text{co}} - b_{\text{co}} \),其中 \( \eta = \sqrt{n}\delta/\sigma_\delta \),\( b_{\text{co}} = \sqrt{n}\delta/\sigma_{\text{co}} \)。
  3. 步骤3:推导联合渐近分布。利用Proposition 8,\( (Z_\delta, Z_1) \) 和 \( (Z_\delta, Z_{\text{co}}) \) 是渐近标准二元正态的,相关系数分别为 \( \rho_{\delta,1} \) 和 \( \rho_{\delta,\text{co}} \)。
  4. 步骤4:写出渐近覆盖概率。ACP = \( \Pr(|Z_\delta + \eta| \le z, |Z_{\text{co}} + b_{\text{co}}| \le z) + \Pr(|Z_\delta + \eta| > z, |Z_1| \le z) \)。
  5. 步骤5:在 \( \delta = 0 \) 下简化。此时 \( \eta = b_{\text{co}} = 0 \),ACP = \( R(\rho_{\delta,\text{co}}) + (1-\alpha) - R(\rho_{\delta,1}) \),其中 \( R(\rho) = \Pr(|X| \le z, |Y| \le z) \) 是标准二元正态在矩形 \( [-z, z]^2 \) 上的概率。
  6. 步骤6:利用Plackett公式分析 \( R(\rho) \)。Lemma 1证明 \( R(\rho) \) 是 \( |\rho| \) 的严格增函数。因此,ACP与 \( 1-\alpha \) 的大小关系取决于 \( |\rho_{\delta,\text{co}}| \) 与 \( |\rho_{\delta,1}| \) 的大小关系。
  7. 步骤7:参数化并比较相关系数。引入 \( r = \sigma_2^2/\sigma_1^2 \) 和 \( g = \sigma_{12}/\sigma_1^2 \),计算 \( \rho_{\delta,\text{co}}^2 - \rho_{\delta,1}^2 \) 的符号,最终得到 \( \text{ACP} < 1-\alpha \iff g > (r-3)/2 \iff \sigma_{\text{co}}^2 < 4\sigma_1^2 \)。

关键跳跃点: - 从两步法到渐近等价程序:需要证明方差估计量的一致性,使得用估计方差代替真实方差不影响渐近覆盖。这一步依赖于Assumption 3的正则条件。 - Plackett公式的应用:Lemma 1的证明使用了Plackett公式 \( \partial_\rho \Phi_2(a,b;\rho) = \phi_2(a,b;\rho) \),这是分析二元正态矩形概率的关键工具。 - 相关系数比较的代数化简:将 \( \rho_{\delta,\text{co}}^2 - \rho_{\delta,1}^2 \) 分解为 \( (2g+3-r)(g^2-r) \) 除以正分母,利用可行性条件 \( g^2 < r \) 确定符号。

技术技巧点名: - 设计-based推断:使用样本方差的一致估计作为标准误,不依赖模型假设。 - CLT:对独立序列组的样本均值应用CLT。 - 联合渐近正态性:通过线性组合论证证明 \( (\hat{\delta}, \hat{\mu}_1) \) 和 \( (\hat{\delta}, \hat{\mu}_{\text{co}}) \) 的联合渐近正态性。 - Plackett公式:用于分析二元正态矩形概率对相关系数的依赖性。 - 参数化技巧:引入 \( r \) 和 \( g \) 将问题简化为两个参数的代数比较。

真实例子与应用

数据:Clifford, Sheagley, and Piston (2021a) 的Study 1。这是一个关于“福利”vs“对穷人援助”措辞效应的调查实验,采用组内设计。受试者被随机分配到序列 \( (1,0) \)(先“福利”再“援助”)或 \( (0,1) \)(先“援助”再“福利”),每次暴露后测量对政府支出的支持度(三点量表)。

如何应用本文方法: - 识别条件验证:作者计算了 \( \hat{\delta} = \hat{\mu}_2 - \hat{\mu}_1 \),发现 \( \hat{\delta} = 0.021 \)(标准误0.033),不显著。但作者指出,这不意味着 \( \delta = 0 \) 被证实——结转检验可能势低。 - 两步法覆盖评估:作者用该研究的方差分量(\( \sigma_1^2 = 2.226, \sigma_2^2 = 1.995, \sigma_{12} = 1.145 \))校准了覆盖曲线(Figure 4)。在 \( \delta = 0 \) 时,两步法覆盖为0.924(低于名义95%);在 \( \delta = 0.188 \) 时,覆盖降至最低0.433。 - 敏感性分析:作者计算了 \( \delta_{\min,\text{std}}^* = 1.539 \),意味着结转差需要达到pooled估计的1.539倍才能推翻显著性。而实际 \( |\hat{\delta}/\hat{\mu}_{\text{co}}| = 0.074 \),远低于该阈值。

结果: - 该研究的pooled估计 \( \hat{\mu}_{\text{co}} = -0.278 \)(标准误0.033),后测估计 \( \hat{\mu}_1 = -0.289 \)(标准误0.070)。pooling使标准误减少了约53%。 - 敏感性分析表明,该结论对合理的结转差是稳健的。

这个例子想说明什么: - 验证了pooling的效率增益(标准误减少53%)。 - 展示了结转检验的势低问题(\( \hat{\delta} \) 不显著,但两步法覆盖已低于名义水平)。 - 展示了敏感性分析的实际应用——即使结转检验不显著,敏感性分析也能提供更透明的证据。

🔎 结论是否比证明窄

  • Proposition 10(两步法覆盖) 的证明严格依赖于 \( \delta = 0 \) 的假设。作者在Remark 2中声称当 \( \delta \neq 0 \) 时,渐近覆盖趋于 \( 1-\alpha \)(因为 \( \eta \to \infty \) 或 \( -\infty \) 导致 \( T_{\text{pool}} \to 0 \) 和 \( T_1 \to 0 \))。但这是渐近结果,有限样本下覆盖可能远低于名义水平(如Figure 5所示,在中等样本量下覆盖可低至0.37)。作者在正文中明确指出了这一点,没有过度claim。
  • Proposition 9(势比较) 的证明依赖于两个条件:\( |\delta| \le |\tau| \) 和 \( \sigma_\delta \ge \sigma_1 \)。作者在正文中论证了这两个条件在社会科学应用中通常是合理的,但没有严格证明它们总是成立。特别是 \( |\delta| \le |\tau| \) 是一个实质性假设,不是统计假设。
  • 敏感性分析 中的 \( \delta_{\min,\text{std}}^* \) 只考虑了同方向的结转差(即与pooled估计同号的 \( \delta \))。作者在正文中明确说明了这一点(“the smallest same-direction carryover gap”),没有声称它覆盖了所有可能的 \( \delta \) 方向。

四、开放问题

  1. 多期或多条件设计的推广:本文的结果严格限于可简化为两序列结构的设计。作者在concluding remarks中提到了联合实验(conjoint experiment)作为重要推广方向,但“our present results do not establish the exact sensitivity mapping for conjoint estimands”。扎根点:Section 6, “Extending them to conjoint and other repeated-treatment designs is an important direction for future research.”

  2. 预处理协变量的纳入:作者明确排除了协变量调整,但协变量可能改变效率比较和敏感性计算。扎根点:Section 6, “First, we study unadjusted estimators and do not consider the inclusion of pretreatment covariates, which may alter the efficiency comparison and the corresponding sensitivity calculations.”

  3. 与半参数效率理论的结合:本文使用设计-based推断,但半参数效率理论(如efficient influence function)可能为pooled estimator提供更紧的效率界和双稳健估计量。扎根点:本文没有引用任何半参数效率理论的工作,这是一个明显的理论空白——设计-based标准误是否是最优的?能否通过协变量调整达到半参数效率界?

  4. 更一般的敏感性分析方法:本文的敏感性分析只考虑了同方向的结转差,且只关注了显著性(sign)而非点估计的幅度。能否发展出更一般的敏感性分析方法,如基于E-value或部分识别的方法?扎根点:Section 5的敏感性分析只回答了“sign是否稳健”,没有回答“点估计的幅度对结转差有多敏感”。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论