跳转至

Outcome Modeling in Design-Based Inference for Spatial Settings

作者: Arisa Sadeghpour, Erin Hartman
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2608.15439


一、领域脉络与小综述

这个方向是什么

本子方向关注的是空间干扰下的因果推断。当干预单元(如警察巡逻的热点街道)随机或准随机地分配处理,但研究者关心的结果(如犯罪事件)发生在与干预单元不同且有一定距离的地理位置时,标准SUTVA假设(一个单元的结果不受其他单元处理分配的影响)不再成立,因为处理效应会“溢出”到邻近空间。该方向的核心问题是:在存在空间溢出效应的情况下,如何识别和估计在特定空间点或特定距离上的处理效应。

当前该方向的成熟度处于方法框架已建立,但关键实践细节(尤其是数据测量与结果建模)尚未被充分审视的阶段。

发展脉络(history)

  1. 奠基工作:干扰下的因果推断框架

    • Hudgens & Halloran (2008):首次在存在干扰(interference)的实验中系统定义了平均直接效应和平均间接效应,为后续工作提供了基础概念框架。
    • Sävje et al. (2021):将平均处理效应的概念扩展到存在未知干扰的设定下,提出了“期望平均处理效应”(expected average treatment effect),并证明了在伯努利随机化下,Horvitz-Thompson估计量的设计无偏性。
  2. 主要进展:空间干扰下的设计基于推断框架

    • Wang et al. (2025):将上述工作扩展到空间设定,定义了“平均边际效应”(Average Marginalized Effect, AME)。AME是一个随距离索引的因果量,用于估计在给定距离上,边际化所有干预节点处理分配后的效应。该框架是设计基于的,即其识别和估计依赖于随机化设计,而非对结果生成过程(outcome model)的假设。作者提出了Horvitz-Thompson和Hájek估计量,并证明了其设计无偏性或一致性。
    • Pollmann (2023):研究了类似的estimand,但工作在准实验(observational)设定下,需要依赖可忽略性(ignorability)假设来识别一个可交换的控制组。
  3. 当前Frontier与本文位置

    • 本文(Sadeghpour & Hartman, 2026):作者指出,上述设计基于框架虽然声称是“设计无偏”的,但其estimand(AME)依赖于不可直接观测的“圆平均”(circle average)。在实际应用中,研究者只能观测到离散空间点上的结果(如网格数据),因此必须引入结果建模(outcome modeling)来估计这些圆平均。本文的核心贡献是揭示了这一被忽视的张力:即使使用设计无偏的Horvitz-Thompson估计量,结果建模误差也会引入偏差。本文系统分析了这种偏差的性质(随结果密度衰减,但不随干预节点数衰减),并通过模拟和实际数据重分析给出了实践建议。

子线索聚类

这些被引文献大致落在以下两条子线索上:

  • 线索一:设计基于的框架(Design-based frameworks):以Wang et al. (2025)和Pollmann (2023)为代表。核心思路是利用随机化设计(或准实验设计中的可交换性)来识别因果效应,避免对结果生成过程做出强假设。其优势在于推断的稳健性,但本文指出其代价是忽略了结果测量本身带来的建模需求。
  • 线索二:模型基于的框架(Model-based frameworks):以Papadogeorgou et al. (2022)和Leung (2022)为代表。这些工作直接对空间干扰过程进行建模(如点过程、空间回归模型)。其优势在于可以更灵活地处理复杂的干扰模式,但推断结果对模型假设的依赖性更强。本文在讨论部分提及了这些工作,但将其定位为不同的技术路线。

这个方向在追问的核心问题

  1. 如何定义和识别空间干扰下的因果效应? 当前主流方法是定义随距离变化的效应(如AME),但识别依赖于局部干扰假设(local interference)和干预节点间距假设。
  2. 如何估计这些效应? 设计基于框架提供了Horvitz-Thompson等估计量,但本文揭示了一个关键瓶颈:这些估计量需要“圆平均”作为输入,而圆平均本身需要估计。
  3. 结果建模误差如何影响因果推断? 这是本文的核心追问。已知瓶颈是:误差不是经典的(classical measurement error),而是与处理状态相关(non-differential),因此会引入偏差。
  4. 如何选择结果模型? 本文提出了使用交叉验证和滞后结果(lagged outcomes)的实用建议,但承认这并非完美方案。

⚠️ 作者的framing

  • 作者的缺口frame:作者将缺口frame为“现有设计基于框架声称是设计无偏的,但忽略了结果建模的必要性”。这使得本文的贡献成为“揭示一个被忽视的实践陷阱”,而非提出全新的理论框架。作者将自己定位为“填补理论与实践之间鸿沟”的工作。
  • 被淡化或回避的竞争路线:作者明确将本文定位在“设计基于”框架内,并指出模型基于的方法(如Papadogeorgou et al. (2022))是“不同的”。作者没有深入比较两种路线的优劣,而是专注于揭示设计基于路线内部的一个固有矛盾。作者也回避了与更系统的测量误差模型(如Gordon et al. (2023)的对抗性去偏算法)的深度整合,仅在讨论中提及。
  • 明显该被引/该存在、却没出现在intro里的:作者在讨论中引用了Gordon et al. (2023)关于遥感数据中机器学习测量误差的工作,但并未在intro中将其作为核心相关文献。这暗示作者可能认为其工作与Gordon et al. (2023)有平行关系,但并非直接继承或竞争。一个值得研究者去查的问题是:是否存在更早的、关于“设计基于推断中结果建模必要性”的讨论? 例如,在调查抽样(survey sampling)文献中,当使用模型辅助估计时,是否已有类似的分析?作者引用了Särndal et al. (2003)关于测量误差的经典教材,但未深入展开。

张力

未见明显对立引用。被引工作之间在方法论上互补多于冲突。Wang et al. (2025)和Pollmann (2023)分别处理实验和准实验设定,而本文则是对它们共同依赖的“圆平均可观测”假设的挑战。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号:

    • N:干预节点(intervention nodes)的总数,例如被选为“热点”的街道数量。
    • i:干预节点的索引,i = 1, ..., N。
    • x ∈ X:二维空间中的一个点,例如经纬度坐标。
    • Z_i ∈ {0, 1}:干预节点i的二元处理分配。Z_i = 1表示处理(如增加巡逻),Z_i = 0表示对照。
    • Z = (Z_1, ..., Z_N):所有干预节点的处理分配向量。
    • z:Z的一个具体实现。
    • Y_x(z):潜在结果(potential outcome)。在给定处理分配向量z下,空间点x上的结果(如犯罪风险)。这是不可观测的,因为对于同一个点x,我们只能观测到其实际分配z下的结果。
    • d_i(x):点x到干预节点i的距离。
    • Ω_d:距离集合,定义了“形状”。例如,Ω_d = {d}表示一个半径为d的圆。
    • µ_i(Y(z), Ω_d):圆平均(circle average)。在给定处理分配z下,所有与干预节点i距离在Ω_d内的点x上,潜在结果Y_x(z)的平均值。这是本文的核心estimand,但也是不可直接观测的。
    • τ_i(d) = µ_i(1, d) - µ_i(0, d):干预节点i的个体化边际效应。这是不可识别的。
    • AME(d) = (1/N) Σ_i τ_i(d):平均边际效应。这是本文要估计的目标因果量。
    • π_i:干预节点i被分配到处理的概率。
    • L:网格(raster)的边长,用于衡量结果密度。L越小,密度越高。
    • δ:一个点p到其所在网格中心g_k的偏移量。
  • 模型:

    • 数据生成机制:本文采用设计基于(design-based)的框架。这意味着潜在结果Y_x(z)被视为固定的、非随机的属性。唯一的随机性来源是处理分配Z。因此,不存在一个显式的“结果生成模型”。然而,为了分析结果建模误差,作者引入了一个辅助性的“效应数据生成过程”(effect DGP):Y_x = f(x) + ϵ_x,其中f(x)是一个平滑、有界的函数(仅依赖于到节点的距离),ϵ_x是固定的、均值为零的、空间不相关的误差项。注意:这个DGP仅用于分析,并非推断所依赖的模型。
    • 已知量:处理分配概率π_i(由实验设计决定)。
    • 待估对象:AME(d)。
  • 可观测数据:

    • 可观测:研究者能观测到的是离散空间点x ∈ X_o ⊂ X上的结果Y_x(例如,每个街道段上的犯罪指数),以及每个干预节点i的处理分配Z_i。
    • 不可观测/潜在:
      1. 所有空间点x上的潜在结果Y_x(z)(除了实际分配z下的那个)。
      2. 圆平均µ_i(Y(z), Ω_d)。因为要计算它,需要知道圆上所有(无穷多个)点的结果,而研究者只能观测到离散的点。
      3. 个体化边际效应τ_i(d)。

第二步:讲最小内核

本文的核心数学问题可以归结为:即使处理分配是随机的(设计无偏),但当我们用一个离散的、有误差的模型去估计“圆平均”这个中间量时,为什么Horvitz-Thompson估计量会变得有偏?

最简特例:假设只有一个干预节点(N=1),且我们只关心一个特定距离d上的圆平均。处理分配Z是伯努利随机化,P(Z=1) = 0.5。我们想估计AME(d) = τ_1(d) = µ_1(1, d) - µ_1(0, d)。

  1. Oracle情况:如果我们能直接观测到圆平均µ_1(1, d)和µ_1(0, d),那么Horvitz-Thompson估计量是: ˆτ_HT = (Z/0.5) * µ_1(1, d) - ((1-Z)/0.5) * µ_1(0, d) 由于Z是随机的,E[ˆτ_HT] = µ_1(1, d) - µ_1(0, d) = AME(d)。这是设计无偏的。

  2. 现实情况:我们无法直接观测到µ_1(1, d)和µ_1(0, d)。我们只能观测到离散网格点上的结果Y_x。我们用一个离散化模型来估计圆平均:对于圆上的任意一点p,我们用其所在网格的中心点g_k的值Y_{g_k}来近似。这样我们得到估计的圆平均ˆµ_1(Z, d)。

  3. 误差来源:估计误差˜ϵ_1(Z, d) = ˆµ_1(Z, d) - µ_1(Z, d)。这个误差取决于f(x)的梯度、网格大小L以及节点位置。关键:这个误差˜ϵ通常不是均值为零的,并且它依赖于处理状态Z。例如,如果处理效应是空间衰减的(f(x)在处理节点附近更高),那么对于处理节点(Z=1),f(x)的梯度更大,导致˜ϵ更大;而对于对照节点(Z=0),梯度可能为零,˜ϵ也接近零。

  4. 偏差的产生:现在,我们使用估计的圆平均来计算Horvitz-Thompson估计量: ˆτ_HT_est = (Z/0.5) * ˆµ_1(1, d) - ((1-Z)/0.5) * ˆµ_1(0, d) 其期望为: E[ˆτ_HT_est] = E[ (Z/0.5) * (µ_1(1, d) + ˜ϵ_1(1, d)) - ((1-Z)/0.5) * (µ_1(0, d) + ˜ϵ_1(0, d)) ] = AME(d) + E[ (Z/0.5) * ˜ϵ_1(1, d) - ((1-Z)/0.5) * ˜ϵ_1(0, d) ] 由于˜ϵ_1(1, d)和˜ϵ_1(0, d)是固定的(在潜在结果框架下),且Z是随机的,第二项变为: = AME(d) + (1/0.5) * 0.5 * ˜ϵ_1(1, d) - (1/0.5) * 0.5 * ˜ϵ_1(0, d) = AME(d) + ˜ϵ_1(1, d) - ˜ϵ_1(0, d) 只要˜ϵ_1(1, d) ≠ ˜ϵ_1(0, d),这个估计量就是有偏的。偏差来源于不同处理状态下结果建模误差的差异。

核心思路:本文的核心思路就是通过一个简单的泰勒展开,证明了在离散化模型下,这个误差差异˜ϵ_1(1, d) - ˜ϵ_1(0, d)是O(L)(系统节点)或O(L^2)(随机节点)量级的,并且它不随干预节点数N的增加而衰减,只随结果密度(即L变小)而衰减。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在空间干扰下的设计基于推断框架中,当estimand(平均边际效应AME)依赖于不可直接观测的“圆平均”时,结果建模(outcome modeling)的必要性及其对估计量偏差和标准误的影响。
  2. 核心工具/方法:通过理论分析(泰勒展开)和模拟研究,系统分析了在离散化模型(discretized model)下,结果建模误差如何传播到Horvitz-Thompson和Hájek估计量中,并比较了不同结果模型(离散化、反距离加权IDW、克里金Kriging)的表现。
  3. 主要结论:即使使用设计无偏的Horvitz-Thompson估计量,结果建模也会引入偏差。该偏差随结果密度(resolution)增加而衰减(O(L)或O(L^2)),但不随干预节点数N增加而衰减。标准误在密度增加时会收敛到oracle标准误。随机放置干预节点比系统放置能获得更快的偏差衰减率。

关键设定与假设

  • 设定:N个干预节点,二元处理Z_i,伯努利随机化(概率π_i)。结果Y_x是空间点x的属性。目标estimand是AME(d),定义为所有干预节点在距离d上的个体化边际效应的平均值。
  • 关键假设:
    1. 局部干扰(Local Interference):存在一个距离h(d),使得距离大于h(d)的两个干预节点i和j,它们的圆平均不受同一个其他节点l的处理分配影响。这是Wang et al. (2025)提出的,用于限制干扰的复杂程度,使得估计量的渐近性质成立。
    2. 干预节点间距(Intervention Node Spacing):随着N增长,相互靠近的节点数量一致有界。这保证了空间不会过度拥挤,是局部干扰假设的配套条件。
    3. 结果模型假设(用于理论分析):在理论分析中,作者假设结果Y_x = f(x) + ϵ_x,其中f(x)是平滑、有界的,且仅依赖于到节点的径向距离。误差ϵ_x是固定的、均值为零、空间不相关。这些假设是为了进行泰勒展开分析,并非推断所必需。
  • 与已有文献的对比:本文放宽了Wang et al. (2025)和Pollmann (2023)中隐含的“圆平均可直接观测”的假设。本文强化了对结果建模误差的量化分析,这是现有设计基于框架所缺失的。

主要结果

  • 理论结果(第4节及附录B):
    • 定理1(偏差率):在离散化模型下,对于单个圆平均的估计误差˜ϵ,当节点系统放置时,最坏情况下的偏差为O(L);当节点随机放置时,期望偏差为O(L^2)。这里L是网格边长,衡量结果密度的倒数。
    • 定理2(偏差与距离):对于系统放置的节点,当距离d增大时,偏差会衰减至零。这是因为大半径的圆会穿过更多网格,使得偏移量δ在平均意义上相互抵消(通过广义Riemann-Lebesgue引理证明)。
    • 推论(偏差与N):AME估计量的偏差不随干预节点数N的增加而衰减(见附录B.7.2)。偏差仅取决于结果密度L和距离d。
  • 模拟结果(第6-7节):
    • 偏差:使用估计结果的Horvitz-Thompson和Hájek估计量在小距离处偏差最大。偏差随结果密度增加(L减小)而减小,但随N增加不减小(见图6)。
    • 标准误:随着结果密度增加,使用估计结果的标准误收敛到使用oracle结果的标准误(见图6)。
    • 节点放置:随机放置节点比系统放置节点产生的偏差更小,且偏差衰减更快(对比图6和图7)。
    • 模型比较:IDW和Kriging通常优于离散化模型,尤其是在系统放置节点时。离散化模型在系统放置节点时,偏差可能不随密度单调递减。

证明路线与技术技巧

  • 整体路线:
    1. 定义误差:将估计的圆平均ˆµ表示为真实圆平均µ加上误差˜ϵ。
    2. 分析单个点误差:对于圆上的一个点p,离散化模型的预测误差e(p) = D(p) - Y(p)。通过泰勒展开,将e(p)分解为∇f(p)·δ(一阶项)、(1/2)δ^T H(p)δ(二阶项)和噪声项ϵ(g_k) - ϵ(p)。
    3. 积分得到圆平均误差:将e(p)沿圆积分,得到˜ϵ。
    4. 计算期望:对节点位置c(随机或系统)取期望,得到偏差。对于随机节点,由于δ的均值为零,一阶项∇f(p)·δ的期望为零,因此偏差由二阶项主导,为O(L^2)。对于系统节点,一阶项不消失,偏差为O(L)。
    5. 传播到AME:将˜ϵ代入Horvitz-Thompson估计量的偏差公式,证明偏差不随N衰减。
  • 关键跳跃点:
    • 从点误差到圆平均误差:将沿圆的积分与对节点位置的期望互换(Fubini定理),将问题简化为分析单个角度θ上的期望误差。
    • 随机节点下的一阶项消失:关键在于证明E_c[∇f(p)·δ] = 0。这依赖于δ在[-L/2, L/2]^2上均匀分布,且∇f(p)在给定θ和d下是常数(因为f仅依赖于径向距离)。
    • 系统节点下的大距离偏差衰减:证明平均偏移量δ(c, d)随d→∞趋于零。这使用了广义Riemann-Lebesgue引理,表明一个周期函数的平均在频率趋于无穷时趋于其周期平均(此处为0)。
  • 技术技巧点名:
    • 泰勒展开:用于近似离散化模型在单个点上的预测误差,将误差分解为梯度项和Hessian项。
    • Fubini定理:交换积分和期望的顺序,简化偏差分析。
    • 广义Riemann-Lebesgue引理:用于证明系统节点下,大距离时平均偏移量趋于零。
    • 设计基于推断的期望计算:对处理分配Z取期望,推导出偏差表达式,并证明其与N无关。

真实例子与应用

  • 数据/场景:重分析了Collazos et al. (2021)关于哥伦比亚麦德林市热点警务(hot spots policing)对犯罪影响的实验。数据包括967个热点街道(干预节点),其中384个被随机分配接受增加巡逻。结果变量是街道级别的犯罪指数。
  • 方法应用:
    1. 结果建模:使用交叉验证在离散化、Kriging和IDW三个模型中选择。由于空间自相关性低,IDW被选为最优模型(MSE最低)。
    2. 估计AME:使用Hájek估计量(考虑了不等的处理概率)和IDW模型估计的圆平均,计算从50米到1000米范围内每隔50米的AME。
    3. 推断:报告了基于Conley空间HAC标准误和基于置换检验(inverting permutation tests)的95%置信区间。
  • 结果:
    • 主要发现:在所有距离上,AME估计值都很小且统计上不显著(见图8)。这与Collazos et al. (2021)的原始结论一致,即热点警务没有显著的犯罪转移(displacement)或扩散(diffusion)效应。
    • 稳健性分析:使用滞后结果(lagged outcomes)进行安慰剂检验,AME曲线同样不显著(见图9a)。对一阶差分结果的分析也得到类似结论(见图9b)。对四种犯罪类型分别分析,结果均为空(见图10)。
    • 例子想说明什么:这个例子旨在展示本文提出的方法框架(AME + 结果建模 + 模型选择)在实际应用中的完整流程,并验证了其结论与现有文献的一致性。同时,它也展示了AME框架相比传统粗粒度分析(如Collazos et al. (2021)的短程/长程分类)能提供更精细的、随距离变化的效应估计。

🔎 结论是否比证明窄

  • 是。作者在理论分析中严格证明了离散化模型下偏差的O(L)和O(L^2)率。然而,在结论和讨论中,作者将这一发现推广到“结果建模”的必要性,并声称“即使Horvitz-Thompson估计量也会因结果建模而产生偏差”。这个更广泛的结论在模拟中得到了支持(对IDW和Kriging也观察到了偏差),但缺乏对IDW和Kriging模型下偏差率的严格理论证明。作者在5.2节明确承认“Convergence rates under infill asymptotics may differ under each model and are beyond the scope of this paper”。因此,关于IDW和Kriging的偏差行为,目前更多是模拟证据,而非严格理论。

四、开放问题

  1. 其他结果模型的偏差率:对于IDW、Kriging等更复杂的空间插值模型,在infill渐近下的偏差率是多少?是否也能得到类似O(L^p)的收敛结果?这个问题的具体扎根点在第5.2节:“Convergence rates under infill asymptotics may differ under each model and are beyond the scope of this paper”。

  2. 不确定性量化:如何构建同时考虑结果建模不确定性和处理分配随机性的有效标准误或置信区间?本文使用的Conley HAC和置换检验均未纳入结果建模的不确定性。这个问题的具体扎根点在第10节讨论:“neither Conley spatial HAC estimators or these permutation tests account for uncertainty from modeling of the outcomes”。

  3. 模型选择的更优策略:本文提出的基于滞后结果的交叉验证方法,在模拟中发现“many outcome models may perform well on null effect processes but poorly on spatial additive decay effect processes”。是否存在更直接针对圆平均估计误差的模型选择准则?或者,是否存在一个类似于“honest inference”的样本分割框架,可以用于空间干扰下的模型选择?这个问题的具体扎根点在第10节讨论:“Model performance on observed point outcomes can be used as a proxy, but it does not directly target model performance when estimating circle averages”。

  4. 与更广泛测量误差文献的整合:本文的结果建模误差本质上是一种非经典的测量误差。Gordon et al. (2023)提出的对抗性去偏算法是否可以直接应用于此?或者,是否存在一个更通用的、适用于空间干扰设定的去偏框架?这个问题的具体扎根点在第10节讨论:“Gordon et al. (2023) show how machine learning measurement errors can bias causal inference estimates... They propose the use of an adversarial debiasing algorithm for bias correction”。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论