Analyzing Within-Subject Experiments: Identification, Testing, and Sensitivity¶
作者: Shiyao Liu, Junni L. Zhang
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.26606
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是实验设计中的被试内设计(within-subject design)的因果推断。根本的统计问题是:在两期被试内实验中,当第一期的处理可能遗留到第二期(carryover effect)时,如何从重复测量数据中识别和估计平均处理效应(ATE),以及如何评估推断的稳健性。当前成熟度:这是一个经典但近期在社会科学(尤其是政治学)中重新活跃的方向,已有大量应用,但对其识别条件和推断方法的形式化分析仍不完整。
发展脉络(history)¶
- 奠基工作:Willan and Pater (1986) 在临床交叉试验(crossover trial)中系统讨论了遗留效应问题,指出两步法(先检验遗留效应,再根据检验结果选择估计量)的缺陷。Freeman (1989) 进一步在加法正态模型下证明了两步法置信区间覆盖不足。这些工作奠定了该问题的理论基础,但局限于正态、等分配等强假设。
- 主要进展:Clifford, Sheagley, and Piston (2021a) 将重复测量设计引入政治学调查实验,声称能提高精度而不改变处理效应。这篇论文引发了大量应用(Jordan, Ollerenshaw, and Trexler 2026a 识别了83篇引用它的论文),但作者未形式化遗留效应问题。Jordan, Ollerenshaw, and Trexler (2026a) 的元分析发现重复测量估计值相对于后测估计值有约20%的衰减,暗示遗留效应可能普遍存在。
- 当前frontier:Shi and Ye (2024) 在非均衡分配和异质性遗留效应下推导了与本文相同的识别条件。本文在此基础上进一步:① 将设计-based分析与回归实现联系起来;② 系统评估了遗留效应检验的势和两步法的覆盖性能;③ 提出了敏感性分析方法。
- 本文的位置:本文是对上述工作的综合与深化——它形式化了识别条件,证明了检验势的排序,揭示了两步法覆盖不足的精确条件(当且仅当pooling更有效时),并提供了可操作的敏感性分析工具。
子线索聚类¶
这些被引文献大致落在三条子线索上: 1. 临床交叉试验中的遗留效应问题(Willan and Pater 1986; Freeman 1989; Brown Jr 1980):在正态模型下讨论两步法,结论是两步法不可靠。本文将其推广到非正态、异方差、非均衡分配。 2. 政治学中的重复测量设计推广(Clifford, Sheagley, and Piston 2021a; Jordan, Ollerenshaw, and Trexler 2026a):强调精度增益,但未充分处理遗留效应。本文指出其方法论缺口。 3. 识别条件的形式化(Shi and Ye 2024):在非均衡分配和异质性遗留效应下推导了pooling识别ATE的条件(遗留效应差为零)。本文与之独立但一致,并扩展了设计-based分析和回归实现。
这个方向在追问的核心问题¶
- 识别:pooled estimator在什么条件下识别ATE?——答案:当两个处理序列的平均遗留效应之差为零时(δ=0)。
- 检验:遗留效应检验的势如何?能否作为pooling的正当性依据?——答案:在温和条件下,其势严格低于后测ATE检验,因此不能。
- 推断:两步法(先检验后pooling)的置信区间覆盖性能如何?——答案:当δ=0时,覆盖不足恰发生在pooling更有效时;当δ≠0时,除非δ或样本量很大,否则覆盖不足是常态。
- 稳健性:如何评估pooled估计对遗留效应的敏感性?——答案:通过δ*_min,std,即能推翻显著性的最小同向遗留效应差(以pooled估计的倍数表示)。
⚠️ 作者的framing¶
作者把缺口frame成:遗留效应检验不能解决pooling的正当性问题,研究者应改用敏感性分析。具体来说: - 作者强调“post hoc carryover test should not determine whether to pool”(Section 6),并证明其势不足和两步法覆盖不足。 - 竞争路线(如使用预处理协变量提高精度或调整遗留效应)被淡化:作者在Section 6的limitations中承认“we study unadjusted estimators and do not consider the inclusion of pretreatment covariates”,但未深入讨论。 - 什么明显该被引/该存在、却没出现在intro里?:① 关于交叉试验中遗留效应的贝叶斯方法(如Grieve 1985, Biometrics)未被引用;② 关于多期/非平衡设计的更一般识别理论(如Robins 1986的g-computation公式)未被提及;③ 关于敏感性分析的更一般框架(如Rosenbaum 2002的灵敏度分析)未被引用。这些可能是值得研究者去查的缺口。
张力¶
未见明显对立引用。所有被引工作基本一致认为遗留效应是主要障碍,且两步法不可靠。Freeman (1989) 和本文的结论一致,只是本文在更一般的设定下推广了。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \(n\):总样本量(respondent数)。 - \(n_1, n_2\):分配到处理序列(1,0)和(0,1)的样本量,\(n = n_1 + n_2\)。 - \(D_{it} \in \{0,1\}\):单元\(i\)在时期\(t\)的处理状态。只有两种序列:(1,0)和(0,1)。 - \(Y_{it}\):单元\(i\)在时期\(t\)的观测结果。 - \(Y_{it}(d_1, d_2)\):单元\(i\)在时期\(t\)的潜在结果,给定第一期处理\(d_1\)、第二期处理\(d_2\)。 - \(\tau_i\):单元\(i\)的处理效应(相对于控制条件)。 - \(\delta_{i, d_1}\):单元\(i\)在第二期的遗留效应,取决于第一期处理\(d_1\)。 - \(\tau \equiv E[\tau_i]\):平均处理效应(ATE)。 - \(\delta \equiv E[\delta_{i,0}] - E[\delta_{i,1}]\):两个序列的平均遗留效应之差(carryover gap)。 - \(\mu_1 \equiv E[Y_{i1} | (D_{i1}, D_{i2}) = (1,0)] - E[Y_{i1} | (D_{i1}, D_{i2}) = (0,1)]\):第一期对比的总体均值差。 - \(\mu_2 \equiv E[Y_{i2} | (D_{i1}, D_{i2}) = (0,1)] - E[Y_{i2} | (D_{i1}, D_{i2}) = (1,0)]\):第二期对比的总体均值差。 - \(\mu_{co} \equiv \frac{1}{2}(\mu_1 + \mu_2)\):pooled对比的总体均值。 - \(\sigma_1^2, \sigma_2^2, \sigma_{co}^2, \sigma_\delta^2\):各估计量的方差尺度(定义见论文Section 2)。 - \(\sigma_{12}\):跨时期协方差的加权和(定义见论文Section 2)。
模型:潜在结果模型(Equation 1):
可观测数据:研究者实际能观测到的是每个单元\(i\)的: - 处理序列\((D_{i1}, D_{i2})\)(即属于(1,0)还是(0,1))。 - 两期结果\(Y_{i1}, Y_{i2}\)。 - 样本量\(n, n_1, n_2\)。
想要但观测不到的量: - 每个单元的潜在结果\(Y_{it}(d_1, d_2)\)(只能观测到其分配序列对应的那个)。 - 单元处理效应\(\tau_i\)和遗留效应\(\delta_{i, d_1}\)。 - 平均遗留效应差\(\delta\)(只能通过\(\mu_2 - \mu_1\)识别,但\(\mu_2\)本身包含\(\tau + \delta\))。
第二步:讲最小内核¶
最简特例:两期、两个处理序列、随机分配、无协变量、无时期效应(即\(\pi_{it} = \pi_i\)不随时间变化)、处理效应和遗留效应可异质但均值有限。
在这个特例下,论文的核心命题退化成: - 识别:pooled estimator \(\hat{\mu}_{co} = \frac{1}{2}(\hat{\mu}_1 + \hat{\mu}_2)\) 的总体极限是 \(\mu_{co} = \tau + \delta/2\)。因此,\(\hat{\mu}_{co}\) 识别ATE当且仅当 \(\delta = 0\)(即两个序列的平均遗留效应相等)。注意:这不要求每个单元的遗留效应为零,甚至不要求任一序列的平均遗留效应为零,只要求它们相等。 - 检验势:遗留效应检验(\(H_0: \delta = 0\))的势低于后测ATE检验(\(H_0: \tau = 0\))的势,当且仅当 \(|\delta| \leq |\tau|\) 且 \(\sigma_\delta > \sigma_1\)(后者在跨时期协方差非负时成立,这在社会科学中很常见)。 - 两步法覆盖:当 \(\delta = 0\) 时,两步法置信区间的渐近覆盖概率 \(< 1-\alpha\) 当且仅当 pooling 比后测更有效(即 \(\sigma_{co}^2 < 4\sigma_1^2\))。这正是被试内设计有价值的情形。
为什么这个特例是内核:论文的一般设定(允许时期效应、非均衡分配、异方差)只是在这个特例上“加壳”——识别条件不变,检验势的排序在更一般的条件下仍成立(Proposition 9),两步法覆盖的精确条件(Proposition 10)在一般参数化下仍成立。论文的技术贡献在于:① 在一般设定下推导了设计-based方差与回归标准误的等价性;② 将两步法覆盖的结论从Freeman (1989)的正态等分配推广到非正态、异方差、非均衡分配;③ 提出了敏感性分析公式。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在两期被试内实验中,pooled estimator何时识别ATE?遗留效应检验的势如何?两步法(先检验后pooling)的置信区间覆盖性能如何?如何对遗留效应进行敏感性分析?
- 核心工具/方法:潜在结果框架、设计-based推断、渐近正态性、联合渐近分布、敏感性参数化。
- 主要结论:① pooling识别ATE当且仅当两个序列的平均遗留效应之差为零(\(\delta=0\));② 在温和条件下,遗留效应检验的势严格低于后测ATE检验;③ 两步法置信区间通常覆盖不足——当\(\delta=0\)时,覆盖不足恰发生在pooling更有效时;当\(\delta \neq 0\)时,除非\(\delta\)或样本量很大,否则覆盖不足是常态;④ 敏感性分析表明,已发表结论在合理的遗留效应差范围内稳健。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定: - 潜在结果模型(Equation 1):\(Y_{it}(d_1, d_2) = \pi_{it} + d_t \tau_i + (t-1) \delta_{i, d_1}\)。允许\(\pi_{it}\)随时期变化(时期效应),\(\tau_i\)和\(\delta_{i, d_1}\)异质。 - 假设: - SUTVA(Assumption 1):无干扰。 - 随机分配(Assumption 2):处理序列独立于潜在结果,且\(n_1/n \to r \in (0,1)\)。 - i.i.d. + 正则条件(Assumption 3):各单元的潜在结果向量独立同分布,方差有限。 - 相比已有文献的放宽/强化: - 相比Freeman (1989):放宽了正态性、同方差、等分配假设。 - 相比Shi and Ye (2024):独立推导了相同的识别条件,但扩展了设计-based分析和回归实现。 - 相比Clifford et al. (2021a)和Jordan et al. (2026a):形式化了遗留效应问题,指出了其方法论缺口。
主要结果¶
理论型结果(挑2-3个最关键定理):
- 识别定理(Proposition 1-3):
- \(\mu_1 = \tau\)(第一期对比识别ATE)。
- \(\mu_2 = \tau + \delta\)(第二期对比识别ATE加遗留效应差)。
- \(\mu_{co} = \tau + \delta/2\)(pooled对比识别ATE加一半遗留效应差)。
- 必要条件:\(\mu_{co} = \tau\) 当且仅当 \(\delta = 0\)。
- 直觉:pooling不能消除遗留效应,只能将其减半。
-
解决的技术难点:在异质性处理效应和遗留效应下,仍能得到简洁的识别条件。
-
检验势比较(Proposition 9):
- 在 \(|\delta| \leq |\tau|\) 且 \(\sigma_\delta \geq \sigma_1\)(后者在跨时期协方差非负时成立)的条件下,遗留效应检验的渐近势严格低于后测ATE检验的势。
- 直觉:遗留效应检验需要更大的样本量才能达到与ATE检验相同的势,因此不能作为pooling的正当性依据。
-
解决的技术难点:将势比较转化为非中心性参数的比较,利用正态分布势函数的单调性。
-
两步法覆盖定理(Proposition 10):
- 当 \(\delta = 0\) 时,两步法置信区间的渐近覆盖概率 \(< 1-\alpha\) 当且仅当 pooling 比后测更有效(\(\sigma_{co}^2 < 4\sigma_1^2\))。
- 直觉:两步法在pooling最有价值时覆盖不足,因此不能依赖。
- 解决的技术难点:将覆盖概率表示为二元正态分布概率的差,利用Plackett公式分析其符号。
证明路线与技术技巧¶
整体路线(以两步法覆盖定理为例): 1. 标准化:将估计量标准化为标准正态变量,定义\(Z_\delta, Z_1, Z_{co}\)。 2. 联合分布:利用Proposition 8得到\((Z_\delta, Z_1)\)和\((Z_\delta, Z_{co})\)的联合渐近正态分布,相关系数为\(\rho_{\delta,1}\)和\(\rho_{\delta,co}\)。 3. 覆盖概率表达式:将两步法覆盖概率分解为两个互斥事件的概率之和(见Appendix 1.7的Equation A.14-A.15)。 4. 符号分析:在\(\delta=0\)时,覆盖概率与\(1-\alpha\)的差取决于\(|\rho_{\delta,co}|\)与\(|\rho_{\delta,1}|\)的大小比较。 5. 参数化:将相关系数用\(r = \sigma_2^2/\sigma_1^2\)和\(g = \sigma_{12}/\sigma_1^2\)表示,证明\(|\rho_{\delta,co}| > |\rho_{\delta,1}|\)当且仅当\(g > (r-3)/2\),即pooling更有效。
关键跳跃点: - Lemma 1:证明二元正态概率\(R(\rho) = \Pr(|X| \leq z, |Y| \leq z)\)在\(|\rho|\)上严格递增。这是将覆盖比较转化为相关系数比较的关键。 - 符号因式分解:在证明Proposition 10时,将\(\rho_{\delta,co}^2 - \rho_{\delta,1}^2\)的分子因式分解为\((2g+3-r)(g^2 - r)\),利用\(g^2 < r\)(正定性条件)确定符号。
技术技巧点名: - 设计-based方差:直接基于样本方差构造标准误,不依赖模型假设。 - CR0等价性:证明period-interacted回归的单元聚类标准误等于设计-based标准误(Appendix 1.5)。 - Plackett公式:用于分析二元正态概率对相关系数的导数(Lemma 1的证明)。 - 因式分解:将复杂的符号判断转化为简单因式的符号判断(Proposition 10的证明)。
真实例子与应用¶
数据/场景:Clifford, Sheagley, and Piston (2021a)的Study 1(Smith 1987的措辞研究:比较“welfare” vs “assistance to the poor”对政府支出支持度的影响)。这是一个两期被试内设计,\(n_1=227, n_2=226\),结果变量为三点量表。
方法应用: - 设计-based估计:\(\hat{\mu}_{co} = -0.278\),标准误0.033。 - 回归实现:period-interacted OLS和随机效应模型均精确复现设计-based估计和标准误(Table 2)。 - 遗留效应检验:\(\hat{\delta} = 0.021\),不显著(\(t=0.11\))。 - 两步法覆盖:在\(\delta=0\)时覆盖概率0.924(低于名义95%),最差覆盖0.433(在\(\delta=0.188\)时)。 - 敏感性分析:\(\delta^*_{min,std} = 1.539\),即遗留效应差需要达到pooled估计的1.539倍才能推翻显著性。
结果说明: - 验证了理论:pooling更有效(\(\sigma_{co}^2/(4\sigma_1^2) = 0.217 < 1\)),但两步法覆盖不足。 - 展示了相对baseline的优势:pooled标准误(0.033)远小于后测标准误(0.070),精度提升约53%。 - 敏感性分析表明结论稳健:即使遗留效应差达到pooled估计的1.54倍,仍不能推翻显著性。
本文为纯理论/无实证例子?:本文有实证例子——使用了Clifford et al. (2021a)和Jordan et al. (2026a)的真实数据,并进行了大规模的文献回顾(33篇论文,30个可恢复的study-outcome)。
🔎 结论是否比证明窄¶
- 窄的地方:敏感性分析(Section 5)的结论“published conclusions robust to plausible carryover gaps”是基于对8篇论文的回顾,但作者明确说“This does not restore point identification or guarantee correct coverage: the sensitivity analysis only shows how large the carryover gap would need to be before the estimated effect is no longer distinguishable from zero in its original direction”(Section 5末尾)。因此,敏感性分析不恢复点识别或保证覆盖,只回答定性问题(效应的符号是否稳健)。
- 泛泛claim的地方:作者在Section 6的concluding remarks中说“Within-subject designs remain valuable”,但这一结论依赖于敏感性分析的结果,而敏感性分析本身不解决识别问题。作者也承认了这一点。
- conjecture:作者在Section 6提到“Extending them to conjoint and other repeated-treatment designs is an important direction for future research”,这是一个明确的conjecture,未在本文中证明。
四、开放问题¶
-
扩展到多期/非平衡设计:本文只研究了两期、两个处理序列的设计。对于多期(>2)或非平衡(不同单元有不同期数)的被试内设计,pooled estimator的识别条件和两步法的覆盖性能如何?扎根于Section 6的limitations:“our formal results concern within-subject designs reducible to the same two-sequence structure”。
-
预处理协变量的纳入:本文只研究了无调整的估计量。纳入预处理协变量可能改变效率比较和敏感性计算。扎根于Section 6的limitations:“we study unadjusted estimators and do not consider the inclusion of pretreatment covariates”。
-
conjoint实验的推广:本文的敏感性分析框架能否推广到conjoint实验?conjoint实验中的“稳定性与无遗留效应假设”与本文的\(\delta=0\)条件类似,但估计量(AMCE)和设计结构不同。扎根于Section 6的concluding remarks:“Extending them to conjoint and other repeated-treatment designs is an important direction for future research”。
-
遗留效应的高维/非参数建模:本文假设遗留效应是常数(在均值意义上)。如果遗留效应是协变量的函数(如高维或非参数),识别条件和敏感性分析如何变化?这是一个潜在的统计-计算权衡问题——高维遗留效应可能带来更丰富的模型,但也需要更强的假设或计算工具。扎根于本文的潜在结果模型(Equation 1)中遗留效应\(\delta_{i, d_1}\)的异质性设定,但未进一步建模。
Maintained by 陈星宇 · Homepage · Source on GitHub