跳转至

Sharp Minimax Theory for Randomized Experiments

作者: Timothy Sudijono, Edgar Dobriban, Eric Tchetgen Tchetgen
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.13822


一、领域脉络与小综述

这个方向是什么
本文研究的是有限总体随机实验中,样本平均处理效应(SATE)的极小极大估计问题,其中设计(treatment assignment 的随机化方案)和估计量可以联合优化。核心统计问题是:在潜在结果取值有界(本文先处理二元情形)且无干扰(SUTVA)的设定下,极小极大均方误差(MSE)的精确值是多少?最优过程(设计+估计量)是什么?该方向试图为实验设计提供理论基准,区分常见过程(如完全随机化+差分均值)与最优过程之间的差距。

发展脉络
- 奠基工作:Neyman (1923) 提出有限总体因果推断框架,Fisher (1935) 强调随机化。早期工作分别优化设计(如 Elfving 1952, Kiefer 1974)或估计量(如 Horvitz-Thompson 1952),但联合优化直到近年才被系统研究。
- 主要进展:
- Kallus (2018, 2021) 在固定估计量为差分均值的条件下,求解了极小极大最优设计。他证明:当潜在结果矩阵满足有界范数假设时,完全随机化是极小极大最优;若引入协变量结构,其他设计更优。本文引用语境:“These works have a slightly richer model of nature than the present paper, allowing for covariates... Thus, these works are complementary to our paper.”
- Bai (2023) 在超总体框架下,假设潜在结果分布具有某种置换不变性,证明 (CRE, DIM) 在线性估计量类中是极小极大最优的。本文引用语境:“Bai proves a general design minimaxity theorem for estimating arbitrary contrasts... (CRE, DIM) is found to be the minimax optimal procedure restricted to estimators which are linear in the observed data Y.”
- Kandiros et al. (2026) 首次在网络干扰下研究联合优化,给出 GATE 的极小极大率 Θ(1/n),但常数和二阶项未刻画。本文引用语境:“Specializing to the SUTVA case gives a minimax rate of Θ(1/n). The present paper sharpens the SUTVA analysis, precisely characterizing the constant as well as the second-order term.”
- Survey sampling 分支:Rinott (2009) 的综述给出有限总体均值估计的极小极大过程(简单随机抽样 + 仿射收缩),其二阶项为 O(N^{-3/2})。本文引用语境:“The second-order term decays faster than in the randomized experiment setting, and affine shrinkage is optimal instead of nonlinear shrinkage.”
- Aronow & Lopatto (2026) 在无偏估计量类中证明中心化 Horvitz-Thompson 是极小极大最优的。本文引用语境:“It appears in essentially the same form in the survey sampling literature [AL26], where their form of ˆτ_cHT is shown minimax optimal over design-unbiased estimators under independent sampling.”
- 当前 frontier:联合优化下极小极大风险的精确常数和二阶项尚未被刻画。本文填补了这一空白。

子线索聚类
1. 设计优化(固定估计量):Kallus (2018, 2021), Bai (2023), Basse et al. (2023) —— 在给定估计量(如 DIM)下寻找最优设计,通常得到完全随机化或匹配设计。
2. 网络干扰下的联合优化:Kandiros et al. (2026) —— 给出率阶,但常数未定。
3. Survey sampling 中的极小极大理论:Rinott (2009), Aronow & Lopatto (2026), Cheng & Li (1983) —— 有限总体均值估计,得到仿射收缩和 O(N^{-3/2}) 二阶项。
4. 标准过程的风险分析:Aronow et al. (2014), Lin (2013), Imbens & Rubin (2015) —— 分析 (CRE, DIM) 等过程的方差和置信区间,但未从极小极大角度刻画。

核心问题与瓶颈
- 核心问题:
1. 极小极大风险能否精确到常数和二阶项?
2. 最优过程是什么?是否由 Bernoulli 随机化 + 非线性收缩达到?
3. 标准过程(如 CRE+DIM)与最优过程的差距有多大?
- 已知瓶颈:联合优化空间巨大(设计空间为所有随机化方案,估计量空间为所有函数),直接求解不可行。已有工作要么限制估计量类(线性),要么限制设计类(固定形式)。

⚠️ 作者的 framing
作者将缺口 frame 为:“a fundamental understanding of optimal joint selection over the space of feasible estimators and designs remains incomplete.” 他们声称自己的贡献是“precise characterization of this minimax risk under no interference”,包括“sharp constant and second-order term”。
- 被淡化或回避的竞争路线:
- Kallus 和 Bai 的工作被定位为“complementary”,因为他们的模型更丰富(含协变量或超总体),但本文强调自己“sharpens the SUTVA analysis”。作者未讨论协变量如何影响二阶项,也未讨论超总体框架下的极小极大风险是否与有限总体不同。
- Survey sampling 文献中的仿射收缩被指出“second-order term decays faster”,但作者未解释为什么实验设定下二阶项更慢(n^{-4/3} vs N^{-3/2})。
- 明显该被引但未出现的工作:
- 关于二阶极小极大展开的经典工作:Levit (1981, 1983, 1986) 和 Bickel (1981) 已被引用,但更近期的如 Korányi & MacGibbon (2002) 也被引用。未见明显缺失。
- 关于 Airy 函数在统计中应用的文献(如随机矩阵理论中的 Tracy-Widom 分布)未被引用,但本文的 Airy 函数来自变分问题,与随机矩阵无关,所以合理。

张力
未见明显对立引用。各工作在不同设定下结论一致:完全随机化在一阶意义下最优,但二阶项需要非线性收缩。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \(Y_i(1), Y_i(0) \in \{0,1\}\):单元 \(i\) 的二元潜在结果(固定值,非随机)。
  • \(\tau = \frac{1}{n}\sum_{i=1}^n (Y_i(1)-Y_i(0))\):样本平均处理效应(SATE),是待估参数。
  • \(A_i \in \{0,1\}\):处理指示变量,其联合分布称为设计 \(\mathcal{A}\)。
  • 观测数据:\(Y_i = A_i Y_i(1) + (1-A_i)Y_i(0)\)。
  • 过程:\((\mathcal{A}, \hat{\tau})\),其中 \(\hat{\tau}\) 是估计量(可依赖 \(A\) 和 \(Y\))。
  • 风险:\(R_n(\mathcal{A}, \hat{\tau}) = \mathbb{E}[(\hat{\tau} - \tau)^2]\),期望对设计随机性取。
  • 极小极大风险:\(\inf_{\mathcal{A}, \hat{\tau}} \sup_{P \in \{0,1\}^{2n}} R_n(\mathcal{A}, \hat{\tau})\),其中 \(P\) 是潜在结果配置。

  • 模型

  • 有限总体,无干扰(SUTVA)。潜在结果固定,随机性仅来自设计。
  • 二元结果:\(Y_i(a) \in \{0,1\}\)。
  • 无协变量,无超总体假设。

  • 可观测数据

  • 可观测:\((A_i, Y_i)\) 对,\(i=1,\dots,n\)。
  • 不可观测:每个单元的另一个潜在结果 \(Y_i(1-A_i)\)。
  • 关键变换:\(S_i = A_i Y_i + (1-A_i)(1-Y_i)\)。在 Bernoulli(1/2) 设计下,\(S_i\) 的分布仅依赖于个体处理效应 \(\Delta_i = Y_i(1)-Y_i(0) \in \{-1,0,1\}\),且与设计独立(见 Theorem 2.2 证明)。

第二步:最小内核

论文的核心约化是:极小极大风险等价于一个仅含两个未知参数 \((p,q,r)\) 的估计问题,其中 \(p = \#\{i: \Delta_i=1\}\), \(q = \#\{i: \Delta_i=-1\}\), \(r = n-p-q\)。观测数据 \(X \sim p + \text{Bin}(r, 1/2)\),估计 \(\theta = (p-q)/n\)。这个约化通过对称化论证(Theorem 2.1)和构造先验(Theorem 2.2 下界)得到。

最简特例:取 \(n=2\)。所有可能的 \((p,q,r)\) 组合为:
- \((2,0,0)\):\(\theta=1\),\(X=2\) 确定。
- \((0,2,0)\):\(\theta=-1\),\(X=0\) 确定。
- \((1,0,1)\):\(\theta=1\),\(X \sim 1 + \text{Bin}(1,1/2)\),即 \(X=1\) 或 \(2\) 等概率。
- \((0,1,1)\):\(\theta=-1\),\(X \sim 0 + \text{Bin}(1,1/2)\),即 \(X=0\) 或 \(1\) 等概率。
- \((1,1,0)\):\(\theta=0\),\(X=1\) 确定。
- \((0,0,2)\):\(\theta=0\),\(X \sim \text{Bin}(2,1/2)\)。

极小极大风险 \(\rho_2^*\) 可通过求解一个 3×3 的凸优化问题得到(见附录 A)。数值上,\(\rho_2^* \approx 0.25\)(而 \(1/n=0.5\),所以二阶项为负)。最优估计量 \(f_2^*(x)\) 是后验均值,非线性收缩。

核心数学困难:当 \(n\) 大时,参数空间 \(\Theta_n = \{(\theta, r): 0 \le r \le n, |\theta|+r \le n, \theta+r \equiv n \mod 2\}\) 的边界 \(r = n - |\theta|\) 是最难估计的区域。在该边界上,方差 \(\text{Var}(X/n) = (n-|\theta|)/n^2 = 1/n - |\theta|/n^2\) 随 \(|\theta|\) 线性衰减,导致二阶项比常数方差问题(如正态均值)更慢(\(n^{-4/3}\) vs \(n^{-1}\))。论文的关键想法是:通过变分问题找到最优的收缩函数 \(h\),使得风险展开中的二阶项最小化,而该变分问题的解由 Airy 函数给出。


三、这篇论文做了什么

三句话
1. 研究了有限总体二元潜在结果下 SATE 的极小极大风险,允许设计-估计量联合优化。
2. 核心工具是将原问题约化为一个二参数二项观测模型,并利用变分法和 Airy 函数构造二阶最优估计量。
3. 主要结论:极小极大风险 \(\rho_n^* = 1/n - C_A / n^{4/3} + o(n^{-4/3})\),其中 \(C_A \approx 1.617\),由 Bernoulli(1/2) 随机化加非线性收缩估计量达到;标准过程 (CRE, DIM) 仅一阶最优。

关键设定与假设
- 设定:有限总体,\(n\) 个单元,二元潜在结果 \(Y_i(a) \in \{0,1\}\),无干扰(SUTVA)。
- 假设:无协变量,无超总体假设。设计 \(\mathcal{A}\) 可以是任意联合分布,估计量 \(\hat{\tau}\) 可以是任意函数。
- 记号:\(\Delta_i = Y_i(1)-Y_i(0) \in \{-1,0,1\}\);\(p,q,r\) 为 \(\Delta_i=1,-1,0\) 的个数。
- 相比已有文献:
- 放宽了 Kallus (2018) 和 Bai (2023) 对估计量类的限制(线性或固定形式)。
- 强化了 Kandiros et al. (2026) 的 SUTVA 特例,从率阶 \(\Theta(1/n)\) 精确到常数和二阶项。
- 与 survey sampling 文献不同:实验设定下二阶项更慢(\(n^{-4/3}\) vs \(N^{-3/2}\)),且最优收缩是非线性的而非仿射。

主要结果
1. Theorem 2.1(约化等价):原问题的极小极大风险等于约化模型 \(\rho_n^* = \inf_f \sup_{(p,q,r)} \mathbb{E}[f(p+\text{Bin}(r,1/2)) - (p-q)/n]^2\)。最优估计量唯一,是后验均值。
2. Theorem 2.2(最优过程):\(\inf_{\mathcal{A},\hat{\tau}} \sup_P R_n = \rho_n^*\),且由 Bernoulli(1/2) 设计加估计量 \(\hat{\tau}_{\text{Opt}} = f_n^*(\sum S_i)\) 达到。该过程是可容许的。
3. Theorem 2.3(有界结果推广):若 \(Y_i(a) \in [L,U]\),则极小极大风险为 \((U-L)^2 \rho_n^*\),最优过程为 BRE(1/2) 加随机化后的收缩估计量。
4. Theorem 3.1(二阶展开):\(\rho_n^* = 1/n - C_A / n^{4/3} + o(n^{-4/3})\),其中 \(C_A = -4^{1/3} a_1' \approx 1.617\),\(a_1'\) 是 Airy 函数导数的最大负零点。
5. Proposition 4.1(标准过程风险):
- (CRE, DIM):最大风险 \(1/(n-1)\)。
- (BRE, DIM):\(1/n + 2/n^2 + O(n^{-3})\)。
- (BRE, HT):\(4/n\)。
- (BRE, cHT):\(1/n\)。
6. Theorem 4.1(可容许性):(CRE, DIM) 和 (BRE, cHT) 是可容许的;(BRE, DIM) 和 (BRE, HT) 被 (CRE, DIM) 支配。

证明路线与技术技巧

  • 整体路线(Theorem 3.1 上界):
  • 将约化模型重参数化为 \((\theta, r)\),观测 \(X = \theta + \sum_{i=1}^r \epsilon_i\),\(\epsilon_i\) i.i.d. Rademacher。
  • 考虑候选估计量 \(\hat{\tau}_n^A(X) = X/n - n^{-2/3} h_A(X/n^{2/3})\),其中 \(h_A\) 待定。
  • 利用 Stein 引理(Lemma E.1)展开风险,得到主导项 \(r/n^2\) 和二阶项 \(n^{-4/3}[h_A(\tilde{\theta})^2 - 2r h_A'(\tilde{\theta})/n]\)。
  • 最坏情形出现在边界 \(r = n - |\theta|\),代入后风险近似为 \(1/n + n^{-4/3}[h_A(x)^2 - 2h_A'(x) - |x|]\)。
  • 变分问题:\(\inf_h \sup_x \{h(x)^2 - 2h'(x) - |x|\}\)。通过积分变换和 Rayleigh 商,该问题等价于微分算子 \(-4 d^2/dx^2 + |x|\) 的最小特征值,其本征函数为 Airy 函数(式 (15)),特征值 \(C_A\)。
  • 取 \(h_A = -2\phi_A'/\phi_A\),其中 \(\phi_A\) 为归一化本征函数,则风险上界为 \(1/n - C_A/n^{4/3} + o(n^{-4/3})\)。

  • 整体路线(Theorem 3.1 下界):

  • 构造离散先验 \(\Pi_n\),其概率质量正比于 \(\phi_A(k/n^{2/3})^2\)。
  • 应用离散 Van Trees 不等式(Lemma C.1)得到 Bayes 风险下界。
  • 计算先验的信息量 \(I_n(\rho)\),展开得 \(I_n = 1/n + C_A/n^{4/3} + o(n^{-4/3})\)。
  • 由 Van Trees 不等式,Bayes 风险 \(\ge (1-\rho_0)^2/(n^2 I_n) = 1/n - C_A/n^{4/3} + o(n^{-4/3})\)。

  • 关键跳跃点:

  • 从风险展开到变分问题的过渡:需要证明二阶项中 \(r\) 可替换为 \(n-|\theta|\) 且误差可忽略,这依赖于 \(h_A\) 的 Lipschitz 性和尾部衰减(Proposition C.2)。
  • 变分问题的解与 Airy 函数的联系:通过 Rayleigh 商和 Sturm-Liouville 理论,最小特征值对应 Airy 函数。
  • 离散 Van Trees 不等式的推导:需要处理二项似然和对称先验,得到信息量的显式表达式(式 (37))。

  • 技术技巧点名:

  • Stein 引理(Rademacher 和):Lemma E.1,用于展开风险中的交叉项 \(\mathbb{E}[U_r h(X/n^{2/3})]\)。
  • Van Trees 不等式(离散版):Lemma C.1,用于下界,处理离散参数空间和二项观测。
  • Airy 函数和 Sturm-Liouville 理论:用于求解变分问题,得到常数 \(C_A\) 和最优收缩函数。
  • Riemann 和逼近:用于将离散先验的信息量展开为积分,得到 \(C_A\) 项。

真实例子与应用
本文为纯理论,无真实数据例子。但包含数值模拟(Figure 1, 4, 5):
- Figure 1:比较 (CRE, DIM)、(BRE, DIM)、(BRE, cHT) 和 (BRE, Opt) 的最大风险(乘以 \(n\)),显示 (BRE, Opt) 在 \(n=100\) 时比 (CRE, DIM) 降低约 40% 的风险。
- Figure 4:在均匀超立方体先验下,(BRE, Opt) 在大多数配置上风险最小;在等计数向量先验下,(CRE, DIM) 表现更好。
- Figure 5:固定 SATE \(\tau\) 后,(BRE, Opt) 在 \(|\tau|\) 较小时优势明显,\(|\tau|\) 大时不如 (CRE, DIM)。
这些模拟旨在说明 (BRE, Opt) 并非只在最坏配置上有效,而是在小效应量下普遍有用。

🔎 结论是否比证明窄
- Theorem 3.1 的证明严格针对二元潜在结果。Theorem 2.3 将结果推广到有界结果,但二阶展开的具体形式(常数 \(C_A\) 和指数 \(n^{-4/3}\))仅对二元情形证明。对于连续有界结果,Theorem 2.3 的证明通过随机化将问题归约到二元情形,因此二阶展开仍然成立(乘以 \((U-L)^2\))。但论文未讨论连续结果下是否可能得到更快的二阶项。
- 论文在 Discussion 中声称“Our results are intended to be a theoretical benchmark”,并建议 (BRE, Opt) 可能用于小样本 RCT,但未提供实际数据分析。结论的实用性尚需进一步研究。


四、开放问题(点到为止,扎根具体语句)

  1. 推断问题:如何为 (BRE, Opt) 构造置信区间?论文提到“a randomization test might be well-suited for (BRE, Opt). The test may be inverted to give confidence intervals by considering weak null hypotheses as in [WD21].”(Section 5)。但未给出具体方法或理论保证。
  2. 协变量纳入:论文未考虑基线协变量。作者在 Related Work 中提及 Kallus 和 Bai 的工作允许协变量,但本文的框架如何扩展?Section 5 提到“the potential to incorporate measured baseline covariates to further enhance efficiency and power”。
  3. 连续潜在结果:Theorem 2.3 将二元结果推广到有界结果,但二阶展开是否对任意有界分布成立?证明依赖于随机化将连续结果转化为二元,但该随机化可能不是最优的。论文未讨论连续结果下是否可能达到更快的二阶项(如 survey sampling 中的 \(n^{-3/2}\))。
  4. 网络干扰:Kandiros et al. (2026) 给出了网络实验的率阶,本文的精确刻画能否推广到网络设定?Section 1.2 提到“The present paper sharpens the SUTVA analysis”,暗示网络情形是开放问题。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论