跳转至

Analyzing Within-Subject Experiments: Identification, Testing, and Sensitivity

作者: Shiyao Liu, Junni L. Zhang
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.26606


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是被试内设计(within-subject design)的因果推断,具体指两期(two-period)交叉设计:每个被试先后接受两种处理条件(如先处理再对照,或先对照再处理),每期后测量一次结果。根本的统计问题是:在存在携带效应(carryover effect)——第一期处理影响第二期结果——的情况下,如何从两期合并数据中识别、估计和检验平均处理效应(ATE)。该方向当前成熟度中等:大量实证工作已在使用,但识别假设的充分性、检验程序的统计性质、以及敏感性分析的框架尚未被系统形式化。

发展脉络(history)

  • 奠基工作:Willan and Pater (1986) 在临床交叉试验(crossover trial)背景下,系统研究了携带效应对两期设计的影响,并指出“Grizzle’s procedure”(先检验携带效应,再决定是否合并两期数据)的缺陷。这是本文的核心技术起点。
  • 主要进展:Freeman (1989) 在加法正态模型、等分配、同方差假设下,通过数值计算展示了Grizzle两步法的置信区间覆盖不足问题,并得出结论“该两步分析太具误导性,无实际用途”。本文将其推广到非正态、异方差、不等分配的一般设定。
  • 当前frontier:Clifford, Sheagley, and Piston (2021a) 在政治学领域大力推荐被试内设计以提高精度,并建议用携带效应检验来决定是否合并。Jordan, Ollerenshaw, and Trexler (2026a) 的元分析发现,重复测量设计的估计值相对于仅后测设计有约20%的衰减(attenuation),暗示携带效应可能系统性地存在。Shi and Ye (2024) 在生物统计学的交叉试验背景下,独立推导了与本文相同的识别条件(携带效应差为零),但未涉及检验势和敏感性分析。
  • 本文的位置:本文在潜在结果框架下形式化了两期被试内设计,首次系统分析了:(1) 合并估计量的识别条件与设计-based方差;(2) 携带效应检验的势相对于ATE检验的严格劣势;(3) 两步法置信区间覆盖不足的解析条件(当且仅当合并更有效时覆盖不足);(4) 基于敏感性参数δ的敏感性分析方法,并应用于已发表研究。

子线索聚类

  • 设计建议与实证困惑:Clifford, Sheagley, and Piston (2021a) 推荐被试内设计;Jordan, Ollerenshaw, and Trexler (2026a) 发现衰减现象;Diaz and Rossiter (2026) 指出后测设计仍是学科默认。这一簇在追问“被试内设计是否真的有效”。
  • 识别与估计理论:Shi and Ye (2024) 推导了识别条件;本文进一步给出了设计-based方差、回归实现(period-interacted OLS/RE)与设计-based估计的等价性。这一簇在追问“合并估计量到底识别什么”。
  • 检验与两步法问题:Willan and Pater (1986) 和 Freeman (1989) 在临床背景下揭示了两步法的问题;本文在更一般的潜在结果框架下严格证明了覆盖不足的条件。这一簇在追问“携带效应检验能否作为合并的决策依据”。
  • 敏感性分析:本文首次为被试内设计提出了基于δ的敏感性分析方法,并应用于实证文献。这一簇在追问“如果携带效应差非零,结论是否稳健”。

核心问题与已知瓶颈

  • 核心问题1:合并估计量在什么条件下识别ATE?已知瓶颈:携带效应差δ=0是充要条件,但该条件无法被数据检验(因为δ本身不可识别,只能检验δ=0)。
  • 核心问题2:携带效应检验的势如何?已知瓶颈:本文证明在温和条件下(跨期协方差非负、|δ|≤|τ|),携带效应检验的势严格低于ATE检验。这意味着“通过检验来确认合并是否合理”在逻辑上自相矛盾——检验本身需要比ATE检验更大的样本才能可靠。
  • 核心问题3:两步法(先检验再合并)的置信区间覆盖性质如何?已知瓶颈:当δ=0时,覆盖不足恰好发生在合并比后测更有效时(即被试内设计有价值时);当δ≠0时,覆盖不足是常态,除非δ或样本量很大。
  • 核心问题4:如何对携带效应进行敏感性分析?已知瓶颈:本文给出了δ*_min,std的解析表达式,并发现已发表结论对合理的δ值通常是稳健的。

⚠️ 作者的framing

作者把缺口frame成:“研究者不应依赖事后携带效应检验来决定是否合并,而应实质性地论证携带效应差为零的合理性,并报告对偏离的敏感性分析。” 作者淡化了以下竞争路线: - 使用预处理协变量:作者明确声明“我们研究未调整的估计量,不考虑预处理协变量”(Section 6),但协变量调整可能改变效率比较和敏感性计算。 - 多期或连续时间设计:作者将结果限定于“可归约为两序列结构的被试内设计”(Section 6),但携带效应问题在联合实验(conjoint experiments)等更广泛设定中同样存在。 - 贝叶斯方法:作者未讨论贝叶斯方法在携带效应建模中的潜在优势。

什么明显该被引/该存在、却没出现在intro里? - 关于“统计-计算权衡”或“计算复杂性”的文献——本文不涉及计算问题,但研究者(陈星宇)的兴趣中包含这一方向。本文的敏感性分析δ*_min,std是一个解析公式,计算上无挑战。 - 关于“高阶影响函数”(HOIF)或“高阶U统计量”的文献——本文的合并估计量本质上是两个独立组均值的平均,不涉及高阶统计量。 - 关于“随机矩阵理论”或“高维统计”的文献——本文的设定是低维的(两期、两个处理序列),不涉及高维问题。

张力

未见明显对立引用。所有被引工作(Willan & Pater 1986; Freeman 1989; Shi & Ye 2024)在识别条件和两步法问题上结论一致。Clifford, Sheagley, and Piston (2021a) 和 Jordan, Ollerenshaw, and Trexler (2026a) 的实证发现(衰减)与本文的理论预测(携带效应差导致合并估计量有偏)一致。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(n\):总被试数。 - \(n_1, n_2\):分别被分配到序列(1,0)和(0,1)的被试数,\(n = n_1 + n_2\)。 - \(D_{it} \in \{0,1\}\):被试\(i\)在第\(t\)期的处理状态(\(t=1,2\))。只有两种可能的序列:(1,0)和(0,1)。 - \(Y_{it}(d_1, d_2)\):潜在结果——被试\(i\)在第\(t\)期、给定第一期处理\(d_1\)和第二期处理\(d_2\)时的结果。 - \(Y_{it} = Y_{it}(D_{i1}, D_{i2})\):观测结果。 - \(\tau_i\):被试\(i\)的处理效应(相对于对照条件)。 - \(\delta_{i, d_1}\):被试\(i\)在第二期的携带效应,取决于第一期处理\(d_1\)。 - \(\tau = \mathbb{E}[\tau_i]\):平均处理效应(ATE)。 - \(\delta = \mathbb{E}[\delta_{i,0}] - \mathbb{E}[\delta_{i,1}]\):两个序列的平均携带效应之差(简称“携带效应差”)。 - \(\mu_1 = \mathbb{E}[Y_{i1} | D_{i1}=1] - \mathbb{E}[Y_{i1} | D_{i1}=0]\):第一期对比。 - \(\mu_2 = \mathbb{E}[Y_{i2} | D_{i2}=1] - \mathbb{E}[Y_{i2} | D_{i2}=0]\):第二期对比。 - \(\mu_{co} = (\mu_1 + \mu_2)/2\):合并对比。 - \(\hat{\mu}_1, \hat{\mu}_2, \hat{\mu}_{co}\):对应的样本估计量。 - \(\sigma_1^2, \sigma_2^2, \sigma_{co}^2\):方差尺度(定义见论文Section 2)。 - \(\sigma_{12}\):跨期协方差组合(定义见论文Section 2)。

模型: 潜在结果模型(论文Equation 1):

\[Y_{it}(d_1, d_2) = \pi_{it} + d_t \tau_i + (t-1) \delta_{i, d_1}.\]
其中\(\pi_{it}\)是基线结果(可随被试和时期变化),\(\tau_i\)是单位处理效应,\(\delta_{i, d_1}\)是第二期携带效应(仅当\(t=2\)时出现)。处理效应和携带效应均可异质。

可观测数据: 研究者实际能观测到的是: - 每个被试\(i\)的处理序列分配\((D_{i1}, D_{i2})\)(要么是(1,0),要么是(0,1))。 - 每个被试在两期的观测结果\(Y_{i1}, Y_{i2}\)。 - 样本量\(n\)和序列组大小\(n_1, n_2\)。

想要但观测不到的量: - 每个被试的潜在结果\(Y_{it}(1,0)\)和\(Y_{it}(0,1)\)——每个被试只观测到其被分配序列下的结果,反事实结果缺失。 - 单位处理效应\(\tau_i\)——不可观测,因为每个被试只接受一种处理序列。 - 单位携带效应\(\delta_{i,0}\)和\(\delta_{i,1}\)——不可观测,因为每个被试只经历一种序列。 - 携带效应差\(\delta\)——不可直接观测,只能通过\(\mu_2 - \mu_1\)识别。

第二步:最小内核

最简特例:两期、两个处理序列、随机分配、无协变量、无时期效应(\(\pi_{it}\)的均值不随时间变化)、等分配(\(n_1 = n_2\))、且处理效应和携带效应均质(\(\tau_i = \tau\),\(\delta_{i,0} = \delta_0\),\(\delta_{i,1} = \delta_1\))。

在这个特例下,潜在结果退化为: - 序列(1,0):\(Y_{i1} = \pi + \tau\),\(Y_{i2} = \pi + \delta_1\)。 - 序列(0,1):\(Y_{i1} = \pi\),\(Y_{i2} = \pi + \tau + \delta_0\)。

第一期对比:\(\mu_1 = (\pi + \tau) - \pi = \tau\)。 第二期对比:\(\mu_2 = (\pi + \tau + \delta_0) - (\pi + \delta_1) = \tau + (\delta_0 - \delta_1) = \tau + \delta\)。 合并对比:\(\mu_{co} = (\mu_1 + \mu_2)/2 = \tau + \delta/2\)。

要证的命题:合并估计量\(\hat{\mu}_{co}\)识别ATE(即\(\mu_{co} = \tau\))当且仅当\(\delta = 0\)。

证明思路:从\(\mu_{co} = \tau + \delta/2\)直接可得。\(\delta = 0\)等价于\(\mu_1 = \mu_2\),即两期对比相等。

为什么这个特例是核心:论文的一般设定(异质效应、不等分配、时期效应)只是在这个特例上“加壳”——识别条件不变(\(\delta=0\)),但方差公式和回归实现需要调整。论文的核心数学困难不在于识别,而在于:(1) 推导设计-based方差与回归方差的关系;(2) 比较检验势;(3) 推导两步法覆盖不足的解析条件。这些都在这个特例的记号下可以讲清。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在两期被试内设计中,合并估计量在什么条件下识别ATE?携带效应检验的势如何?两步法(先检验再合并)的置信区间覆盖性质如何?如何对携带效应进行敏感性分析?
  2. 核心工具/方法:潜在结果框架、设计-based推断、联合渐近分布、敏感性参数\(\delta\)。
  3. 主要结论:(1) 合并估计量识别ATE当且仅当携带效应差\(\delta=0\);(2) 在温和条件下,携带效应检验的势严格低于ATE检验;(3) 两步法置信区间在\(\delta=0\)时恰好当合并更有效时覆盖不足,在\(\delta \neq 0\)时通常覆盖不足;(4) 敏感性分析表明已发表结论对合理\(\delta\)值稳健。

关键设定与假设

  • Assumption 1 (SUTVA):无干扰、潜在结果仅取决于自身处理序列。
  • Assumption 2 (随机分配):处理序列分配独立于潜在结果;\(n_1 \to rn\),\(n_2 \to (1-r)n\),\(0<r<1\)。
  • Assumption 3 (独立同分布与正则条件):每个被试的潜在结果向量独立同分布;各分量方差有限且正。
  • 相比已有文献:相比Freeman (1989)的加法正态模型、等分配、同方差假设,本文放宽到非正态、异方差、不等分配。相比Shi and Ye (2024),本文增加了检验势分析和敏感性分析。

主要结果

  • Proposition 1-3 (识别):\(\mu_1 = \tau\),\(\mu_2 = \tau + \delta\),\(\mu_{co} = \tau + \delta/2\)。因此\(\mu_{co} = \tau\)当且仅当\(\delta=0\)。
  • Proposition 4-6 (渐近分布):\(\hat{\mu}_1, \hat{\mu}_2, \hat{\mu}_{co}\)的渐近正态性,方差公式见论文。
  • Proposition 7 (效率条件):\(\sigma_2^2 < \sigma_1^2\)是合并比后测更有效的充分条件(无论\(\sigma_{12}\)如何)。
  • Proposition 9 (势比较):若\(|\delta| \leq |\tau|\)且跨期协方差非负,则携带效应检验的势严格低于ATE检验。
  • Proposition 10 (覆盖不足条件):当\(\delta=0\)时,两步法置信区间覆盖不足当且仅当合并比后测更有效(即\(\sigma_{co}^2 < 4\sigma_1^2\))。
  • 敏感性分析:\(\delta^*_{\min, \text{std}} = 2(1 - z_{1-\alpha/2}/|t_{co}|)\),即需要多大(相对于\(\hat{\mu}_{co}\))的携带效应差才能推翻显著性。

证明路线与技术技巧

整体路线(以两步法覆盖不足为例): 1. 标准化:将两步法决策(是否合并)和区间覆盖事件转化为标准化正态变量\(Z_\delta, Z_1, Z_{co}\)的函数。 2. 联合渐近分布:推导\((Z_\delta, Z_1)\)和\((Z_\delta, Z_{co})\)的渐近联合正态分布,相关系数\(\rho_{\delta,1}\)和\(\rho_{\delta,co}\)。 3. 覆盖概率表达式:写出渐近覆盖概率ACP = Pr(不拒绝且合并区间覆盖) + Pr(拒绝且后测区间覆盖)。 4. 参数化:归一化\(\sigma_1^2=1\),引入\(r = \sigma_2^2/\sigma_1^2\)和\(g = \sigma_{12}/\sigma_1^2\)。 5. 关键引理:标准二元正态在正方形\(|X|\leq z, |Y|\leq z\)上的概率\(R(\rho)\)是\(|\rho|\)的严格增函数。 6. 符号判断:在\(\delta=0\)时,ACP - (1-\(\alpha\))的符号等于\(|\rho_{\delta,co}| - |\rho_{\delta,1}|\)的符号,进一步等于\(-(2g+3-r)\)的符号(因为\(g^2 < r\))。因此ACP < 1-\(\alpha\)当且仅当\(g > (r-3)/2\),即\(\sigma_{co}^2 < 4\sigma_1^2\)。

关键跳跃点: - 从ACP表达式到符号判断:需要将ACP分解为\((1-\alpha) + T_{pool} - T_1\),其中\(T_{pool} = R(\rho_{\delta,co})\),\(T_1 = R(\rho_{\delta,1})\)。然后利用\(R(\rho)\)的单调性将比较转化为相关系数比较。 - 相关系数比较的代数化简:将\(\rho_{\delta,co}^2 - \rho_{\delta,1}^2\)分解为\((2g+3-r)(g^2 - r)\),并利用可行性条件\(g^2 < r\)确定符号。

技术技巧点名: - 潜在结果框架:用于形式化识别条件,区分可观测与不可观测量。 - 设计-based推断:直接基于随机分配推导方差,不依赖模型假设。 - 联合渐近分布:用于分析两步法,需要推导\(\hat{\delta}\)与\(\hat{\mu}_1\)、\(\hat{\mu}_{co}\)的协方差。 - Plackett's formula:用于证明\(R(\rho)\)的单调性(∂Φ₂/∂ρ = ϕ₂)。 - 敏感性分析:基于偏倚调整估计量\(\hat{\tau}(\delta^*) = \hat{\mu}_{co} - \delta^*/2\),推导\(\delta^*_{\min, \text{std}}\)的解析表达式。

真实例子与应用

  • 数据:Clifford, Sheagley, and Piston (2021a)的Study 1(“welfare” vs “assistance to the poor”问题措辞实验),以及Jordan, Ollerenshaw, and Trexler (2026a)的Studies 4-6。
  • 如何应用:作者从这些研究的复制数据中重构了两序列结构,计算了\(\hat{\mu}_1, \hat{\mu}_2, \hat{\mu}_{co}\)及其标准误,并与设计-based估计量比较。
  • 结果:
  • Table 2:在原始数据(等分配)下,period-interacted OLS/RE精确匹配设计-based估计;在合成数据(2:1分配)下,treatment-only回归有3.27%的偏差,而period-interacted回归仍精确匹配。
  • Figure 3:在Study 1校准下,携带效应检验的势曲线始终低于ATE检验曲线。
  • Figure 4:两步法覆盖概率在\(\delta=0\)时为0.924,在\(\delta=0.19\)时降至0.433。
  • Figure 5:在Study 4校准下,两步法覆盖概率随样本量增加呈U形,在中等样本量时降至约0.37。
  • Table 4:对8篇论文的敏感性分析显示,平均\(\delta^*_{\min, \text{std}} = 1.168\),远大于平均\(|\hat{\delta}/\hat{\mu}_{co}| = 0.352\),表明结论对合理携带效应差稳健。
  • 例子想说明什么:验证理论预测(回归等价性、势比较、覆盖不足),展示敏感性分析的实际应用,说明已发表结论的稳健性。

🔎 结论是否比证明窄

  • 窄结论1:Proposition 9(势比较)依赖于两个条件:\(|\delta| \leq |\tau|\)和跨期协方差非负。作者在Section 4中声称“在温和条件下”成立,但这两个条件并非总是成立(例如,若携带效应差大于处理效应,或跨期协方差为负,则势比较可能反转)。作者在实证部分(Table 4)发现\(|\hat{\delta}/\hat{\mu}_{co}|\)平均为0.352,支持\(|\delta| \leq |\tau|\)的合理性,但未提供正式检验。
  • 窄结论2:Proposition 10(覆盖不足条件)是渐近结果,依赖于方差已知的近似。作者在Appendix 2.3中通过模拟验证了有限样本下(n=100, 500)的偏差很小(±0.011以内),但未给出有限样本的精确界。
  • 泛化claim:作者在Section 6中建议“将敏感性分析扩展到联合实验”,但明确声明“当前结果未建立联合估计量的精确敏感性映射”。这是一个诚实的限制,而非过度泛化。

四、开放问题

  1. 预处理协变量的影响:作者声明“未考虑预处理协变量”(Section 6)。协变量调整可能改变效率比较(\(\sigma_{co}^2 < 4\sigma_1^2\)的条件)和敏感性分析(\(\delta^*_{\min, \text{std}}\)的表达式)。扎根于论文Section 6:“we study unadjusted estimators and do not consider the inclusion of pretreatment covariates, which may alter the efficiency comparison and the corresponding sensitivity calculations.”

  2. 多期或连续时间推广:作者将结果限定于“可归约为两序列结构的被试内设计”(Section 6)。但携带效应问题在联合实验、多期交叉设计、连续时间设计中同样存在。扎根于论文Section 6:“Extending them to conjoint and other repeated-treatment designs is an important direction for future research.”

  3. 非参数识别与检验:本文的识别条件\(\delta=0\)是参数化的(平均携带效应差为零)。能否在非参数或半参数框架下放松该条件?例如,是否可以在仅假设单调性或符号约束下进行部分识别?扎根于论文Section 2的识别条件:“Pooling identifies the average treatment effect if and only if δ = 0.”

  4. 计算复杂性视角:本文的敏感性分析\(\delta^*_{\min, \text{std}}\)是解析公式,计算上无挑战。但若考虑更复杂的设定(如多期、高维协变量、非线性模型),敏感性分析的计算成本可能成为瓶颈。是否存在“统计-计算权衡”——即更精确的敏感性分析需要更高的计算成本?扎根于论文Section 5的敏感性分析公式:“δ^*{\min, \text{std}} ≡ 2(1 - z{1-\alpha/2}/|t_{co}|).”


Maintained by 陈星宇 · Homepage · Source on GitHub

评论