Designing Spatial Treatments¶
作者: Stefan Faridani, Michael P. Leung
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2609.08335
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是空间因果推断中的实验设计。根本的科学问题是:当干预(treatment)被施加于空间中的某些位置(如警察巡逻点、新超市、生态保护区),而响应单元(如犯罪率、人流量、物种多样性)位于其他位置,且响应随与干预点的距离增加而衰减时,如何设计干预点的空间布局(即“在哪里放置干预”),使得我们能以最优的统计精度估计一个“干净”的因果效应——即单个干预点对所有可能位置的平均影响。这个方向当前处于从识别框架向最优设计过渡的阶段:Pollmann (2026) 和 Wang et al. (2025) 建立了空间处理的因果识别框架,但他们的 estimand 是“污染”的(受多个干预点共同影响),且设计是给定的而非优化的。本文首次将实验设计(而非仅估计)引入空间处理设定,并给出了 minimax 最优的设计。
发展脉络¶
-
奠基工作:空间处理的因果框架。Pollmann (2026) 和 Wang et al. (2025) 是本文的直接前驱。Pollmann (2026) 提出了空间处理的潜在结果框架,定义了“污染”效应(比较
E[Y_x(S ∪ {s}) - Y_x(S \ {s})]),并假设处理效应在固定距离 d₀ 外终止。Wang et al. (2025) 在类似设定下定义了“平均边际化效应”(AME),并证明了随机化足以非参数识别 AME。留下的口子:两者的 estimand 都依赖于处理位置的分布(设计依赖),因此无法研究最优设计;且假设效应在固定距离外完全消失(c·1{s ≤ d₀}),比本文的幂律衰减(c·s^{-γ})更强。 -
主要进展:空间干扰(spatial interference)下的最优设计。Faridani and Niehaus (2026) 和 Leung (2022, 2025) 研究的是空间干扰(干预分配给单元本身,而非空间位置)下的最优设计。Leung (2022) 提出了簇随机化设计,用 Horvitz-Thompson 估计量,并推导了估计量的收敛速率与设计参数的关系,证明了近最优速率。Faridani and Niehaus (2026) 在此基础上建立了 minimax 率最优性。留下的口子:这些工作处理的是“单元级干预+单元间干扰”,而非“位置级干预+单元响应”。本文的设定不同:干预是空间位置,响应单元是另一个集合,因此依赖结构是局部依赖(local dependence)而非簇依赖或近邻依赖(near-epoch dependence),中心极限定理完全不同。
-
当前 frontier:二分图干扰(bipartite interference)。Lu et al. (2025)、Zigler and Papadogeorgou (2021)、Zigler et al. (2025) 研究了干预单元与响应单元不同的二分图设定。这可以视为连续空间处理的离散类比。留下的口子:这些工作通常假设二分图结构已知(如大气传输模型),而本文的设定是连续的、基于距离的衰减,没有预设的图结构。
-
本文的位置:本文是空间处理最优设计的首篇工作。它填补了从“识别”到“设计”的缺口,将 minimax 率最优性从空间干扰推广到空间处理,并处理了因连续衰减导致的偏差-方差权衡。作者在引言中明确说:“We build on their contributions by studying optimal design”(第2页)。
子线索聚类¶
- 线索 A:空间处理的因果识别(Pollmann 2026, Wang et al. 2025)。核心问题:在观测或实验数据下,如何识别空间处理的因果效应?方法:潜在结果框架 + 基于距离的假设(固定截断或衰减)。瓶颈:estimand 设计依赖,无法优化设计。
- 线索 B:空间干扰下的最优设计(Faridani and Niehaus 2026, Leung 2022, 2025)。核心问题:当干预分配给单元且存在单元间干扰时,如何设计实验(如簇随机化)以最优估计全局平均处理效应?方法:簇随机化 + Horvitz-Thompson 估计 + minimax 率分析。瓶颈:设定不同(单元级 vs. 位置级),依赖结构不同。
- 线索 C:二分图干扰(Lu et al. 2025, Zigler and Papadogeorgou 2021, Zigler et al. 2025)。核心问题:当干预单元与响应单元不同且由二分图连接时,如何估计因果效应?方法:逆概率加权、倾向得分调整。瓶颈:图结构已知,连续空间设定是更一般的推广。
这个方向在追问的核心问题¶
- 如何定义“干净”的因果效应? 当多个干预点同时存在时,如何分离单个干预点的贡献?本文用“无污染”效应(
Y_x({s}) - Y_x(∅))来定义,而 Pollmann/Wang 用“污染”效应(E[Y_x(S ∪ {s}) - Y_x(S \ {s})])。 - 如何平衡偏差与方差? 干预点越分散,偏差越小(更接近无污染效应),但有效样本量越小,方差越大。最优设计需要找到最佳分离距离 r。
- 最优收敛速率是多少? 它取决于区域大小(Vol(R))、衰减速率 γ,以及设计参数。本文给出 minimax 速率
λ_n^{-d/(2 + d/γ)}。 - 如何做推断? 在局部依赖结构下,如何建立中心极限定理并构造有效的方差估计?本文用更紧的 Wasserstein 界来获得最优速率。
⚠️ 作者的 framing¶
作者把缺口 frame 成:“现有工作(Pollmann, Wang)的 estimand 是设计依赖的,因此无法研究最优设计;我们定义了一个设计独立的 estimand(无污染效应),从而可以研究最优设计。” 同时,作者淡化了以下竞争路线: - 空间干扰文献(Faridani & Niehaus, Leung):作者承认这些工作研究的是不同设定(单元级干预),但强调“central limit theory is substantially different”(第3页),从而将本文定位为独立贡献。 - 二分图干扰文献:作者将其定位为“discrete analog”(第3页),暗示本文的连续设定更一般。 - 什么明显该被引/该存在、却没出现在 intro 里? 作者没有引用任何关于空间点过程设计(如泊松点过程、Matérn 过程本身)的统计文献(如 Moller & Waagepetersen 的专著)。虽然本文使用了 Matérn 点过程,但引用的是其作为“thinning”机制,而非作为空间统计的设计工具。这可能是作者有意为之(因为本文的 Matérn 设计是作为实验设计工具,而非空间统计模型),但值得研究者去查:空间统计中是否有更优的点过程设计(如 Strauss 过程、惩罚似然)可用于本文的设定?
张力¶
未见明显对立引用。所有被引工作基本在各自设定下自洽,没有在相同设定下得出相反结论的。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
R ⊆ ℝ^d:紧致空间区域,干预点只能放在这里。S:实际被处理的干预点集合(随机变量),是R的有限子集。x ∈ ℝ^d:响应单元的位置。η:响应单元的空间分布(测度),可观测。Y_x(S):位置x处的潜在结果,如果干预点集合是S。不可观测(反事实)。θ₀:目标 estimand,即“无污染”平均因果效应。τ(s) = μ(s, {s}) - μ(s, ∅):位置s处的“无污染”效应。μ(s, S):在s周围环形区域Δ内,响应单元在干预集S下的平均结果。F:分析者指定的、在R上的连续分布,用于加权τ(s)得到θ₀。n:proto-site(候选干预点)的数量。X_i:第i个 proto-site 的位置,i.i.d. 来自F。U_i:第i个 proto-site 的标记(mark),i.i.d. Uniform(0,1)。r:Matérn thinning 的半径(设计参数)。M_r:经过 thinning 后保留的“潜在站点”(potential sites)的索引集。D_i:第i个潜在站点的处理分配(0/1),i.i.d. Bernoulli(p)。ρ_i = P(i ∈ M_r | X_n):第i个 proto-site 成为潜在站点的概率。γ:衰减速率(Assumption 1 中的指数)。λ_n:区域R的尺度参数(R = λ_n · R₀,Vol(R) = O(λ_n^d))。β_n = r_n / λ_n:归一化的 Matérn 半径。Δ:定义μ(s, S)的环形区域(区间)。c:Assumption 1 中的常数。-
d:空间维度。 -
模型:
- 数据生成机制:
- 生成
n个 proto-siteX_ii.i.d. ~F(连续分布,支撑在R内)。 - 生成标记
U_ii.i.d. ~ Uniform(0,1)。 - Matérn thinning:保留那些在其
r-球内标记最小的 proto-site,得到潜在站点集M_r。 - 对每个潜在站点,独立分配处理
D_i~ Bernoulli(p)。 - 实际处理集
S = {X_i : i ∈ M_r, D_i = 1}。 - 响应单元的位置由测度
η生成(可观测)。 - 每个响应单元
x的潜在结果Y_x(S)由非随机的函数决定,满足 Assumption 1(幂律衰减)。
- 生成
- 已知:
F、η、p、r、Δ、n由分析者选择或已知。γ未知但假设存在一个下界。 -
要估的对象:
θ₀ = ∫ τ(x) dF(x)。 -
可观测数据:
- 可观测:所有 proto-site 的位置
{X_i}、它们的标记{U_i}、处理分配{D_i}、响应单元的位置(由η给出)、每个响应单元在S下的实际结果Y_x(S)。 - 不可观测:任何反事实结果(如
Y_x(∅)、Y_x({s})当s不是实际处理点时)。所有Y_x(S')对于S' ≠ S都是反事实。 - 关键识别假设:Assumption 1(幂律衰减)将不可观测的反事实与实际观测联系起来。
第二步:最小内核¶
本文的核心思路可以用一个一维、线性衰减、两个 proto-site 的特例来理解。
- 最简特例:
- 设
d = 1(一维空间),R = [0, L]是一个线段。 - 设
F是[0, L]上的均匀分布。 - 设
n = 2,只有两个 proto-site:X₁和X₂,i.i.d. ~ Uniform[0, L]。 - 设
Δ = [0, δ]是一个很小的区间(即我们只关心离处理点很近的单元)。 - 设响应单元均匀分布在
[0, L]上(η是 Lebesgue 测度)。 - 设衰减是线性的:
Y_x({s}) - Y_x(∅) = c · max(0, 1 - |x - s| / γ),即效应在距离γ内线性衰减到 0(这满足 Assumption 1,但更简单)。 -
设
r是 Matérn 半径。 -
在这个特例下,核心问题是什么?
- 我们想估计
θ₀ = (1/L) ∫₀^L τ(s) ds,其中τ(s) = (1/(2δ)) ∫_{s-δ}^{s+δ} [Y_x({s}) - Y_x(∅)] dx(近似为c,如果δ很小且s离边界够远)。 - Matérn thinning:如果
|X₁ - X₂| < r,则标记较小的那个被保留为潜在站点,另一个被丢弃。如果|X₁ - X₂| ≥ r,则两者都被保留。 - 假设
|X₁ - X₂| ≥ r,两者都被保留。然后随机分配处理:D₁, D₂ ~ Bernoulli(p)。 - 假设
D₁ = 1, D₂ = 0。则S = {X₁}。 - 我们观测到
Y_x({X₁})对所有x。 - Horvitz-Thompson 估计量:
其中
θ̂ = (1/2) * [ μ(X₁, {X₁}) * (1/ρ₁) * (1/p - 0/(1-p)) + μ(X₂, {X₁}) * (1/ρ₂) * (0/p - 1/(1-p)) ]ρ₁ = 1/|B(X₁, r) ∩ {X₁, X₂}|。如果|X₁ - X₂| ≥ r,则ρ₁ = ρ₂ = 1。如果|X₁ - X₂| < r,则只有一个被保留,ρ会调整。 - 偏差:
μ(X₂, {X₁})不是μ(X₂, {X₂})。因为X₁是唯一的处理点,X₂处的“无污染”效应应该是τ(X₂) = μ(X₂, {X₂}) - μ(X₂, ∅),但我们观测到的是μ(X₂, {X₁})。偏差来自|μ(X₂, {X₁}) - μ(X₂, {X₂})|。如果|X₁ - X₂|很大(远大于γ),则Y_x({X₁}) ≈ Y_x(∅)对x靠近X₂,所以μ(X₂, {X₁}) ≈ μ(X₂, ∅),偏差 ≈τ(X₂)(很大!)。如果|X₁ - X₂|很小,则Y_x({X₁}) ≈ Y_x({X₂})对x靠近X₂,偏差 ≈ 0。所以,处理点越分散(r 越大),偏差越小。 - 方差:有效样本量是潜在站点的数量。如果
r很大,两个 proto-site 很可能被 thinning 成一个,有效样本量 ≈ 1,方差很大。如果r很小,两个都被保留,有效样本量 ≈ 2,方差较小。所以,r 越大,方差越大。 -
最优 r:平衡偏差(
O(r^{-γ}),这里γ=1)和方差(O(1/(n r)),因为有效样本量 ≈n r / L)。令r^{-1} ≈ 1/(n r),解得r ≈ n^{-1/2}。此时收敛速率 ≈n^{-1/2}。在一维、线性衰减下,这就是 minimax 速率。 -
这个特例揭示了论文的核心数学困难:偏差和方差都依赖于
r,且r的选择必须同时控制两者。一般情形(d 维、幂律衰减)只是这个一维例子的“加壳”:偏差阶r^{-γ},方差阶(n r^d)^{-1}(因为有效样本量 ≈n r^d),平衡得r ∝ n^{-1/(d+2γ)},速率n^{-γ/(d+2γ)}。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在空间处理设定下,当响应随与处理点的距离幂律衰减时,如何设计处理点的空间布局(Matérn thinning 设计)以最优估计“无污染”平均因果效应
θ₀。 - 核心工具/方法:提出基于 Matérn type II 点过程的设计,通过半径
r控制处理点间的分离距离;采用 Horvitz-Thompson 估计量;利用局部依赖中心极限定理(用更紧的 Wasserstein 界)建立渐近正态性;通过构造最坏情形的潜在结果证明 minimax 率最优性。 - 主要结论:存在一个率最优的
r选择(r ∝ λ_n^{1/(1 + 0.5d/γ)}),使得θ̂的收敛速率λ_n^{-d/(2 + d/γ)}是 minimax 最优的;该速率不依赖于 proto-site 数量n(只要n足够大);在弱条件下θ̂渐近正态,且方差估计量是渐近保守的。
关键设定与假设¶
- Assumption 1 (Spillovers):
|Y_x(S) - Y_x(S')| ≤ c · s^{-γ},如果S和S'在B(x, s)内相同。含义:处理效应随距离幂律衰减,γ控制衰减速度。相比已有文献:比 Pollmann (2026) 和 Wang et al. (2025) 的固定截断假设(c·1{s ≤ d₀})更一般,允许长程衰减。 - Assumption 2 (Bounded Response):
μ(s, S)有界,且环形区域Δ内总有足够多的响应单元。含义:技术性假设,保证矩存在。 - Assumption 3 (Density):
f(F的密度)连续、有界、有正下界,支撑有 Lipschitz 边界。含义:保证局部体积的渐近行为良好(如 Lemma B.1)。 - Assumption 4 (Non-degeneracy):
liminf β_n^{-d} σ_n^2 > 0a.s. 含义:方差不会退化到零,保证中心极限定理非平凡。 - Assumption 5 (Scale-invariance):
μ(X₁, {X₁})和μ(X₁, ∅)只依赖于归一化位置X̃₁ = X₁/λ_n。含义:用于推导极限方差的闭式表达式。例子包括平移不变性或尺度归一化。
主要结果¶
- Theorem 1 (偏差界与渐近正态性):
- 陈述:
|θ̂ - θ̂*| = O_p(r_n^{-γ})(偏差阶),且(θ̂* - θ₀)/σ_n → N(0,1)(渐近正态)。 - 直觉:
θ̂*是一个不可实现的“无偏”版本(用真实的反事实Y_x({X_i})和Y_x(∅)代替观测的Y_x(S))。偏差来自用Y_x(S)近似Y_x({X_i}),由 Assumption 1 控制。θ̂*的渐近正态性由局部依赖 CLT 保证。 - 必要条件:
β_n → 0(r_n → ∞但慢于λ_n),Assumption 4(非退化方差)。 -
解决的技术难点:标准局部依赖 CLT(如 Ross 2011, Theorem 3.6)要求
Ψ^2/(nσ_n)^3 · Σ E|Z_i^*|^3 → 0,其中Ψ = O(nβ_n^d)是依赖图的最大度。这会导致次优的速率条件(如γ > 2d)。本文使用 Lemma B.5 中更紧的 Wasserstein 界,只要求β_n → 0,从而允许任意γ > 0。 -
Theorem 2 (Minimax 率最优性):
- 陈述:对任何线性估计量
θ̂_ω和任何设计,存在满足 Assumptions 1-2 的潜在结果,使得limsup P(b_n λ_n^{d/(2+d/γ)} |θ̂_ω - θ₀| > δ) > 0对任何b_n → ∞。 - 直觉:构造两类“坏”的潜在结果,一类使估计量有偏(Step 1),另一类使估计量有方差(Steps 2-3),从而证明任何线性估计量都不能比
λ_n^{-d/(2+d/γ)}更快收敛。 - 必要条件:
λ_n → ∞(区域扩大),γ > 0。 -
解决的技术难点:Step 1 需要将连续空间离散化(用 packing number),并构造一个依赖于处理点位置的潜在结果(
Y_x(S) = a_n^{-1} D_{k(x)}),使得估计量退化为一个加权和。这比 Faridani and Niehaus (2026) 的类似步骤更复杂,因为处理点是连续的而非离散的单元。 -
Theorem 3 (极限方差):
- 陈述:在 Assumption 5 和
nβ_n^d / log n → c下,β_n^{-d} σ_n^2几乎必然收敛到一个由μ₁, μ₀, f和几何量v_d(·)表达的极限。 - 直觉:方差由两部分组成:来自单个潜在站点的方差(第一项积分)和来自距离在
(r, 2r]内的潜在站点对的协方差(第二项积分)。 -
必要条件:
nβ_n^d不能太小(对数阶),以保证 U-统计量的 Borel-Cantelli 收敛。 -
Theorem 4 (方差估计):
- 陈述:
(σ̂² - B_n)/σ_n² → 1,其中B_n是协方差项的和。在额外条件下,B_n收敛到一个正极限(Vol(B(0,2)) ∫ (τ₈(x) - τ̄₈)² f(x)² dx),因此σ̂²是渐近保守的(倾向于高估方差)。 - 直觉:
σ̂²包含了所有距离 ≤ 2r 的站点对的交叉项,而B_n正是这些交叉项的期望。由于B_n的极限是正的,σ̂²的期望大于σ_n²,导致保守的置信区间。
证明路线与技术技巧¶
- 整体路线(Theorem 1 的证明):
- 偏差控制:用 Assumption 1 将
θ̂ - θ̂*的绝对值 bound 为c r_n^{-γ} · (1/n) Σ (1/ρ_i) · (D_i/p + (1-D_i)/(1-p))。然后证明(1/n) Σ 1/ρ_i的方差是o(1)(因为β_n → 0),从而θ̂ - θ̂* = O_p(r_n^{-γ})。 - 分解:
θ̂* - θ₀ = (θ̂* - E[θ̂*|X_n]) + (E[θ̂*|X_n] - θ₀)。第二项是O_p(n^{-1/2}),相对于第一项(O_p(β_n^{d/2}))可忽略,因为nβ_n^d → ∞。 - 局部依赖 CLT:对
Z_i^*(θ̂*的去均值版本)应用 Lemma B.5。关键是要 bound (B.7) 中的两个项。- 第一项(三阶矩项):
(1/σ³) Σ_{i,j,k} E[|Z_i^* Z_j^* Z_k^*|] A_{ij} A_{ik}。通过 case analysis(i=j=k,i=j≠k,i≠j≠k)和 Lemma B.3(矩 bound),证明该项是O(β_n^{d/2}) = o(1)。 - 第二项(四阶协方差项):
(√2/(πσ⁴)) Var(Σ_{i,j} Z_i^* Z_j^* A_{ij})^{1/2}。同样通过 case analysis 和 Lemma B.3,证明该项是o(1)。
- 第一项(三阶矩项):
-
关键跳跃点:标准局部依赖 CLT 要求 bound
Ψ²/(nσ)³ Σ E[|Z_i^*|³],其中Ψ = O(nβ_n^d)是最大度。这会导致O(n²β_n^{5d/2})的 bound,需要β_n = o(n^{-4/(5d)})才能趋于 0。而 Lemma B.5 的 bound 只要求O(β_n^{d/2}),允许β_n → 0任意慢。作者绕过的办法是:不使用现成的、但保守的 CLT 版本,而是回到 Stein's method 的中间步骤,直接 bound Wasserstein 距离,从而获得更紧的界。 -
技术技巧点名:
- Stein's method / Wasserstein 距离:用于证明局部依赖 CLT(Lemma B.5)。
- 局部依赖图:
A_{ij} = 1{||X_i - X_j|| ≤ 2r_n},用于刻画Z_i^*的条件独立性。 - 高阶矩 bound:Lemma B.3 给出了
N_i · E[M_i | X_n]等量的 bound,用于控制 CLT 证明中的矩。 - U-统计量 + Borel-Cantelli:用于证明 Theorem 3 中
T₃的几乎必然收敛(因为nβ_n^d / log n → ∞保证指数型不等式可求和)。 - Packing number + 最坏情形构造:用于 Theorem 2 的 minimax 下界证明。Step 1 用 packing 将连续空间离散化,构造依赖于处理的潜在结果;Step 2-3 用 Rademacher 随机化和 Paley-Zygmund 不等式构造依赖于设计的潜在结果。
- Lebesgue 微分定理:用于 Lemma B.1 中局部体积的渐近近似。
真实例子与应用¶
本文包含一个模拟实验(Section 5),没有真实数据例子。
- 数据/场景:
R = λ_n [-1,1]²(二维正方形),η是强度为 1 的齐次泊松点过程。Δ = [0, 0.5],F是[-1,1]²上的均匀分布。潜在结果:Y_x(S) = I_x(S) Σ_{s∈S} w_{xs} α_x + ε_x,其中w_{xs} = min(||x-s||^{-4}, 1)(满足 Assumption 1 对任何γ ∈ (0,3)),α_x = 1 + x₁/λ_n(空间趋势),ε_x ~ N(0,1)。 - 如何应用方法:选择
β_n按 (6) 式(undersmoothed design),γ̃ ∈ {1,2}。对不同的n(500, 1k, 2k)和λ_n(20, 30, 40, 80, 120, 160)进行 5000 次模拟。计算θ̂、σ̂、覆盖率等。 - 结果:
σ̂(SE)总是大于σ_n(SE)和σ̄_n(SE*),支持 Theorem 4 的保守性结论。- 当
γ̃=1(更保守,r更大)时,n*(有效样本量)更小,SE 更大,但偏差更小(θ̂接近θ₀)。 - 当
γ̃=2(r较小)时,n*更大,SE 更小,但偏差可能更大(最后三行,当r被人为减半时,θ̂明显偏离θ₀,覆盖率下降)。 - 覆盖率在
γ̃=1和γ̃=2下都接近 95%,但最后三行(高偏差)的“oracle”覆盖率(CI 和 CI*)显著下降,而σ̂的覆盖率(CI)下降较少,说明σ̂的保守性部分补偿了偏差。 - 这个例子想说明什么:
- 验证了理论结果(偏差-方差权衡、保守方差估计)。
- 展示了 undersmoothed design 在实际中的表现(覆盖率接近名义水平)。
- 说明了当偏差不可忽略时,保守的方差估计可以提供更稳健的推断。
🔎 结论是否比证明窄¶
- Theorem 1 的渐近正态性:证明中假设
β_n → 0且nβ_n^d → ∞。但结论中写的是“under weak conditions”。实际上,β_n → 0是必要的(否则偏差不消失),nβ_n^d → ∞也是必要的(否则方差不趋于 0)。这两个条件在论文中明确给出(第8页)。没有过度 claim。 - Theorem 2 的 minimax 性:结论是“for any design and linear estimator”。证明中确实只考虑了线性估计量(形式为
∫ ω_x(S) Y_x(S) dη)。作者没有 claim 这对非线性估计量(如基于机器学习的估计量)也成立。这是一个窄结论:minimax 下界只对线性估计量类成立。非线性估计量可能达到更快的速率吗?作者没有讨论,这是一个开放问题。 - Theorem 4 的方差估计:结论是
σ̂²是渐近保守的。证明中假设nβ_n^d / log n → c足够大。如果nβ_n^d增长太慢(如对数阶),则B_n的收敛性可能不成立。作者在 Theorem 3 的陈述中明确了这个条件。
四、开放问题¶
-
非线性估计量的 minimax 率:Theorem 2 的 minimax 下界只对线性估计量(形式为
∫ ω_x(S) Y_x(S) dη)成立。是否存在非线性估计量(如基于核平滑、神经网络或双机器学习的方法)能突破这个速率?这扎根于 Theorem 2 的陈述本身(“Let θ̂_ω be any estimator of the form (4)”)。研究者可以尝试构造一个非线性估计量,并证明其速率优于λ_n^{-d/(2+d/γ)},或者证明这个速率对所有估计量都是 minimax 的(即证明一个无假设的下界)。 -
未知衰减速率 γ 的自适应设计:本文的设计依赖于已知的(或保守估计的)衰减速率 γ。如果 γ 完全未知,能否构造一个自适应设计,在不事先指定 γ 的情况下达到最优速率?这扎根于 Section 4 的校准方法(“we propose to calibrate as follows... it is easier in practice to form a worst-case prior over P rather than γ directly”)。研究者可以探索用数据驱动的方法(如交叉验证)选择 r,或使用更复杂的点过程(如 Strauss 过程)来适应未知的 γ。
-
“污染”效应的最优设计:本文只研究了“无污染”效应 θ₀。对于 Pollmann (2026) 和 Wang et al. (2025) 研究的“污染”效应(如
E[Y_x(S ∪ {s}) - Y_x(S \ {s})]),是否存在类似的最优设计?这扎根于引言中的对比(“Their primary estimand... is design-dependent, which precludes a study of optimal design”)。研究者可以尝试重新定义“污染”效应的 estimand,使其设计独立,然后研究其最优设计。 -
更一般的衰减模型:Assumption 1 假设幂律衰减(
c s^{-γ})。如果衰减是其他形式(如指数衰减c e^{-γ s}、或具有未知函数形式),本文的设计和理论如何推广?这扎根于 Assumption 1 本身。研究者可以探索在更一般的衰减模型下,minimax 速率是否仍然由某个“有效衰减指数”决定,以及 Matérn 设计是否仍然最优。
Maintained by 陈星宇 · Homepage · Source on GitHub