Weighted Extensions of the Kolmogorov-Smirnov, Cramer-von Mises, and Anderson-Darling Tests for Assessing Covariate Balance¶
作者: Ariel Linden
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.21782
一、领域脉络与小综述¶
这个方向是什么¶
本方向解决的根本问题是:在因果推断中,如何诊断经加权调整(如倾向得分加权、熵平衡、匹配权重)后,处理组与对照组在观测协变量上的分布是否已充分平衡。平衡诊断是支持因果解释的必要步骤(Rubin, 2008),但常用汇总统计量(标准化均值差、方差比)只捕捉分布的一个点,可能遗漏整体分布差异。分布拟合优度检验(KS、AD、CVM)能比较整个经验累积分布函数(ECDF),但此前仅适用于无权重数据。本文首次将这三类检验推广到带权数据,使用统一的标签置换推断程序,不依赖权重生成机制。
发展脉络(history)¶
奠基工作(1930s–1950s):Kolmogorov (1933) 和 Smirnov (1948) 提出 KS 统计量,取两个 ECDF 的最大绝对垂直距离;Cramér (1928) 和 von Mises (1931) 提出 CVM 统计量,求和平方差异;Anderson & Darling (1952) 提出 AD 统计量,加入方差标准化项以增强尾部敏感性。这三者构成经典的两样本分布检验框架,其渐近性质在 Stephens (1974) 和 D'Agostino & Stephens (1986) 中被系统整理。
在因果推断中的引入(2000s–2010s):Rubin (2008) 强调“设计优于分析”,将协变量平衡视为支持因果解释的必要步骤。Stuart (2010) 综述匹配方法,指出平衡诊断常用标准化均值差和方差比。Austin (2009, 2015) 系统讨论了 IPTW 后的平衡诊断实践,但仅推荐汇总统计量。这些工作为分布检验的应用提供了动机,但未直接处理加权数据。
当前 frontier 与本文位置:加权因果推断方法(IPTW、熵平衡、分类树权重等)日益普及,但平衡诊断工具仍停留在无权重设定。本文首次将 KS、AD、CVM 扩展到带权数据,并采用置换推断(而非渐近分布),使方法适用于任何权重来源。这是该子方向的一个直接且实用的推进。
子线索聚类¶
- 协变量平衡诊断方法:包括标准化均值差、方差比(Austin, 2009; Stuart, 2010)、Somer's D(Newson & Falcaro, 2023)、最优判别分析切点(Linden & Yarnold, 2016),以及本文推广的分布检验。这些方法的目标相同,但检测能力不同。
- 加权因果推断方法:包括 IPTW(Robins et al., 2000)、熵平衡(Hainmueller, 2012)、边际均值加权分层(Linden, 2014)、分类树权重(Linden & Yarnold, 2017, 2018)。这些方法产生权重,需要相应的平衡诊断工具。
- 置换检验在因果推断中的应用:本文使用标签置换推断,将权重视为固定属性,不依赖权重生成机制。这一思路与经典置换检验一致,但应用于加权统计量。
这个方向在追问的核心问题¶
- 问题1:如何检测加权后协变量分布的整体差异,而非仅均值或方差?现有汇总统计量可能遗漏尾部或弥散差异。
- 问题2:不同分布检验(KS、AD、CVM)在加权设定下是否保留其已知的敏感性差异(中心、尾部、弥散)?
- 问题3:如何校准加权检验统计量的零分布?渐近分布复杂,置换推断是否可行且有效?
- 问题4:权重变异程度如何影响检验的 Type I error 和 power?
当前主流方法与瓶颈:主流方法仍是标准化均值差和方差比,因为它们简单、可报告。但瓶颈在于它们只能检测一阶或二阶矩差异。分布检验虽更全面,但缺乏加权版本,且其渐近分布推导困难。本文用置换推断绕过渐近分布,但代价是计算成本(O(RN log N))和无法提供解析的 p 值公式。
⚠️ 作者的 framing¶
作者将缺口 frame 为:“现有分布检验只适用于无权重数据,而加权分析中需要它们”。他通过以下方式使本文成为“显然的下一步”: - 直接推广三种检验的统计量定义(加权 ECDF、Kish 有效样本量替代 N)。 - 采用统一的置换推断,不依赖权重生成机制,声称“适用于任何加权方案”。 - 模拟研究验证 Type I error 控制和 power 优势的保持。
被淡化或回避的竞争路线: - 作者没有考虑渐近分布理论。对于加权 KS 或 AD,可能存在基于加权经验过程的渐近零分布(如通过 Brownian bridge 的加权版本),但作者完全依赖置换。这避免了理论推导,但也意味着方法在样本量极大时可能不如渐近检验高效(置换检验的计算成本随 R 线性增长)。 - 作者没有讨论多重比较问题:当同时检验多个协变量时,未做任何调整(如 Bonferroni、FDR)。这在应用中是常见问题,但作者仅在讨论中提及“报告多个检验”作为建议,未提供校正方法。 - 作者没有与基于核的最大均值差异(MMD) 或 Wasserstein 距离 等现代分布检验进行比较。他在未来工作中提到了 Kuiper 检验和 Wasserstein 距离,但未在模拟中纳入。这可能是为了保持焦点在经典检验上,但也回避了“是否有更好的替代”这一问题。
什么明显该被引 / 该存在、却没出现在 intro 里? - 关于加权经验过程的文献(如 van der Vaart & Wellner, 1996 中关于加权经验分布函数的收敛性)未被引用。这些理论结果可以支撑加权 KS 统计量的渐近性质,但作者选择置换,可能认为不需要。 - 关于置换检验在加权数据中的有效性的文献(如 Janssen, 1997 关于置换检验在异方差下的性质)未被引用。作者假设置换在权重变异下仍有效,但模拟显示在极端权重变异(r_e=0.2)时 Type I error 略有膨胀,这或许与置换检验的有限样本性质有关。 - 关于协变量平衡诊断的综述(如 Imbens & Rubin, 2015 的教科书)未被引用,但可能因为本文是方法论文而非综述。
张力¶
未见明显对立引用。所有被引工作均支持“平衡诊断重要”和“分布检验优于汇总统计量”的共识。唯一潜在的张力是:一些研究者可能认为标准化均值差已足够(如 Austin, 2009 的实践建议),但本文通过模拟和例子展示了分布检验能检测到汇总统计量遗漏的差异,从而挑战了这一观点。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \( g \in \{1, 0\} \):组别指示,1 为处理组,0 为对照组。 - \( n_g \):第 \( g \) 组的样本量;总样本量 \( N = n_1 + n_0 \)。 - \( x_{gi} \):第 \( g \) 组第 \( i \) 个观测的协变量值(连续型随机变量)。 - \( w_{gi} > 0 \):第 \( g \) 组第 \( i \) 个观测的权重(固定已知,非随机)。 - \( F_g(x) \):第 \( g \) 组的真实累积分布函数(CDF)。 - \( \hat{F}_g^w(x) \):第 \( g \) 组的加权经验 CDF,定义见下文。 - \( \hat{D}^w(x) \):合并样本的加权经验 CDF。 - \( m \):合并样本中不同取值的个数(考虑 ties)。 - \( x_{(k)} \):合并样本中第 \( k \) 个有序的不同取值。 - \( \tau_k \):取值 \( x_{(k)} \) 的原始观测个数(未加权计数)。 - \( n_e \):Kish 有效样本量,\( n_e = n_{e,1} + n_{e,0} \),其中 \( n_{e,g} = (\sum_i w_{gi})^2 / \sum_i w_{gi}^2 \)。 - \( r_e = n_e / N \):有效样本量比率,衡量权重变异程度。
模型: - 数据生成机制:两组独立样本,分别来自连续分布 \( F_1 \) 和 \( F_0 \)。原假设 \( H_0: F_1 = F_0 \)(协变量平衡)。权重 \( w_{gi} \) 是外生给定的(例如来自倾向得分估计),与 \( x_{gi} \) 和组别独立(在模拟中独立生成,在应用中可能依赖协变量,但本文的置换推断不依赖此假设)。 - 统计模型:非参数,无分布假设(除了连续性用于 ECDF 定义)。
可观测数据: - 可观测:每个观测的组别 \( g \)、协变量值 \( x \)、权重 \( w \)。研究者能直接计算加权 ECDF。 - 不可观测:真实分布 \( F_g \)、潜在结果、权重生成机制(本文不依赖)。想要但观测不到的是“如果两组来自同一分布,加权 ECDF 的差异应仅由抽样误差引起”——这正是检验要判断的。
第二步:最小内核¶
本文的最小内核是:在加权数据下,如何构造一个检验统计量来比较两个加权 ECDF,并通过置换得到 p 值。最简特例是:两组样本量相等(\( n_1 = n_0 = n \)),所有权重都等于 1(即无权重情形)。此时,加权检验退化为经典检验,置换检验退化为经典置换检验。但本文的核心推广在于权重不为 1 时。
最简特例(权重变异但样本量小): 设 \( n_1 = n_0 = 2 \),处理组观测:\( (x_{11}=1, w_{11}=2), (x_{12}=3, w_{12}=1) \);对照组观测:\( (x_{01}=2, w_{01}=1), (x_{02}=4, w_{02}=3) \)。总样本 \( N=4 \),不同取值 \( m=4 \)(无 ties)。加权 ECDF: - 处理组:\( \hat{F}_1^w(x) \) 在 \( x<1 \) 为 0,\( 1 \le x < 3 \) 为 \( 2/(2+1)=2/3 \),\( x \ge 3 \) 为 1。 - 对照组:\( \hat{F}_0^w(x) \) 在 \( x<2 \) 为 0,\( 2 \le x < 4 \) 为 \( 1/(1+3)=1/4 \),\( x \ge 4 \) 为 1。 计算加权 KS 统计量 \( D^w = \max_x |\hat{F}_1^w(x) - \hat{F}_0^w(x)| \)。在 \( x=1 \) 处:\( |2/3 - 0| = 2/3 \);在 \( x=2 \) 处:\( |2/3 - 1/4| = 5/12 \);在 \( x=3 \) 处:\( |1 - 1/4| = 3/4 \);在 \( x=4 \) 处:\( |1 - 1| = 0 \)。所以 \( D^w = 3/4 \)。
置换检验:将 4 个观测的组别标签随机置换(保持 \( n_1=n_0=2 \)),每个观测的 \( (x, w) 对固定不变。例如一次置换后,处理组可能得到 \( (x=2, w=1) \) 和 \( (x=4, w=3) \),对照组得到 \( (x=1, w=2) \) 和 \( (x=3, w=1) \),重新计算 \( D^w \)。重复 R 次,得到零分布。p 值为 \( (1 + \#\{D^{w*} \ge D^w\})/(R+1) \)。
这个例子展示了核心思路:权重作为观测的固定属性,置换只改变组别标签,不改变权重和协变量值。统计量定义直接使用加权 ECDF,无需额外假设。AD 和 CVM 的推广类似,只是统计量形式更复杂(AD 需要 Kish 有效样本量)。
三、这篇论文做了什么¶
三句话¶
- 研究问题:将 Kolmogorov-Smirnov、Cramér–von Mises 和 Anderson–Darling 三种分布拟合优度检验推广到带权数据,用于因果推断中加权后的协变量平衡诊断。
- 核心工具/方法:对每个检验,用加权 ECDF 替换无权重 ECDF;对 AD 检验,用 Kish 有效样本量替换原始样本量 N 进行方差标准化;所有检验的 p 值通过统一的标签置换推断程序获得,不依赖权重生成机制。
- 主要结论:模拟显示三种加权检验在权重变异较大时仍能控制 Type I error 接近名义水平;各检验的已知比较优势(KS 对中心差异最敏感,AD 对尾部差异压倒性最优,AD 与 CVM 对弥散差异表现相当)在加权设定下得以保持;建议将 AD 作为常规默认选择。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - 两组独立样本,连续分布(允许 ties,但 AD 的 tie 乘子保留原始计数)。 - 权重严格正,可任意缩放(统计量只依赖权重比)。 - 原假设 \( H_0: F_1 = F_0 \)(加权后协变量分布相同)。 - 置换推断假设:在 \( H_0 \) 下,组别标签可交换(即观测的协变量值和权重与组别独立)。这一假设在权重外生生成时成立,但若权重依赖于协变量(如倾向得分),则置换可能不保持联合分布。作者通过模拟验证了 Type I error 控制,但未从理论上证明。
相比已有文献的放宽或强化: - 放宽:经典 KS/AD/CVM 仅适用于无权重数据;本文允许任意正权重。 - 强化:本文不要求权重来自特定模型(如倾向得分),适用于任何加权方案。 - 限制:本文仅考虑两样本检验,未推广到多样本;仅使用置换推断,未提供渐近分布。
主要假设列表: 1. 两组样本独立。 2. 协变量为连续型(允许 ties,但 AD 的 tie 乘子可能放大点质量的影响)。 3. 权重严格正(零权重观测应排除)。 4. 在 \( H_0 \) 下,组别标签与 \( (x, w) \) 独立(可交换性)。 5. 权重外生给定,不依赖于组别标签(否则置换无效)。
主要结果¶
理论型结果:本文无新定理,所有结果来自模拟。核心量化结论如下:
- Type I error(表2):在 \( n=1000-4000 \),\( r_e=0.6 \) 下,三种检验的拒绝率在 0.042-0.057 之间,接近名义 0.05。在极端权重变异 \( r_e=0.2 \) 时,拒绝率升至 0.064-0.067(表5),略有膨胀。
- Power:中心差异(表3):KS 始终最优(\( n=1000 \) 时 0.449,\( n=4000 \) 时 0.996),AD 次之(0.193→0.912),CVM 最弱(0.146→0.828)。所有配对差异显著(表4,p<0.001)。
- Power:尾部差异(表3):AD 压倒性最优(0.114→0.914),KS 和 CVM 接近名义水平(KS: 0.045→0.137, CVM: 0.051→0.072)。AD 与两者的差异显著(p<0.001)。
- Power:弥散差异(表3):AD 和 CVM 表现相当(AD: 0.215→0.648, CVM: 0.205→0.618),均优于 KS(0.183→0.536)。AD 在 \( n\ge2000 \) 时略优于 CVM(p<0.05),但差异很小。
- 权重变异敏感性(表5):比较优势在 \( r_e=0.2-0.9 \) 下保持。Type I error 在 \( r_e=0.2 \) 时略有膨胀(~0.065),其他水平接近名义。
解决的技术难点:如何定义加权 AD 的方差标准化项。作者选择 Kish 有效样本量 \( n_e \) 而非原始 N,因为 N 会高估加权样本的信息量。这一选择是合理的,但作者也承认,若权重来自特定模型,设计方差公式可能更精确,但会破坏方法的通用性。
证明路线与技术技巧¶
本文为应用型,无严格数学证明。但统计量的构造和置换推断的合理性可视为一种“概念证明”。技术技巧如下:
- 加权 ECDF 的定义:直接替换权重比,保持右连续阶梯函数性质。
- Kish 有效样本量:用于 AD 的方差标准化,是调查抽样中的标准调整。作者将其从调查抽样移植到因果推断的平衡诊断中。
- 标签置换推断:将权重视为固定属性,只置换组别标签。这是经典置换检验的直接应用,但作者强调其“不依赖权重生成机制”的通用性。
- 模拟设计:通过构造三种特定类型的分布差异(中心、尾部、弥散)来隔离各检验的敏感性。差异通过分位数上的分段线性函数实现,确保差异仅出现在目标区域。
- 配对比较:使用每对检验在同一数据集上的拒绝结果之差,计算配对 z 检验,正确考虑了相关性。
真实例子与应用¶
数据:来自 Linden et al. (2010) 的准实验评估,比较接受动机性访谈健康教练的慢性病患者(Coached, n=106)与未参与者(Controls, n=230)。使用逆概率治疗权重(IPTW),基于 60 个协变量通过广义提升回归估计倾向得分。
方法应用:对加权后的 BMI 变量,计算三种加权检验的 p 值(基于 2000 次置换)。结果:AD p=0.018(显著),CVM p=0.079(边缘),KS p=0.123(不显著)。图1显示加权 ECDF 差异是弥散的(而非集中在单点),这与 AD 和 CVM 优于 KS 的模拟结果一致。
这个例子想说明:若仅依赖 KS,研究者可能错误地认为 BMI 已平衡,而 AD 检测到了残留差异。这验证了模拟中发现的比较优势,并展示了实际应用中的重要性。
🔎 结论是否比证明窄¶
本文的结论完全基于模拟,且作者明确承认局限性(如正态基分布、单一效应大小、未考虑多重比较)。因此,结论的适用范围被严格限制在模拟条件下。例如,作者在讨论中写道:“whether the comparative ordering documented here extends to non-normal base distributions was not assessed”(是否扩展到非正态基分布未评估)。这表明结论比证明窄:证明(模拟)仅覆盖正态分布,但结论被表述为“AD 是合理的通用默认选择”,这隐含了外推。作者在讨论中已指出这一限制,因此不算过度 claim。
另一个窄点:Type I error 控制仅在 \( r_e \ge 0.4 \) 时良好,在 \( r_e=0.2 \) 时略有膨胀。作者报告了这一结果,但未在结论中强调这一边界条件。读者需注意。
四、开放问题¶
-
非正态基分布下的比较优势是否保持? 本文模拟仅使用正态分布。若基分布偏斜、双峰或重尾,各检验的敏感性排序可能改变。扎根于论文 Discussion 第一段:“Whether the comparative ordering documented here extends to non-normal base distributions was not assessed and is a natural direction for follow-up work.”
-
加权 AD 的 tie 乘子是否应调整为加权计数? 当前 AD 的 tie 乘子 \( \tau_k \) 保留原始未加权计数,这在权重变异大且存在大量 ties 时可能扭曲统计量。作者在 Discussion 中提及此问题,但未解决。扎根于 Section 2.4.2:“The tie multiplier \( \tau_k \) is retained as the raw count of observations sharing value \( x_{(k)} \), unadjusted for weight; this is a direct, unmodified port of the original discrete formulation and its implications for heavily tied data are addressed in the Discussion.”
-
置换推断在权重依赖于协变量时的有效性? 本文假设权重外生,但实际中权重常通过倾向得分估计得到,与协变量相关。此时置换可能不保持联合分布,Type I error 可能偏离。作者未讨论此问题。扎根于 Section 2.5:“Because weight is treated as a fixed attribute of the observation rather than a quantity tied to how it was generated, this scheme applies without modification to any weighting method”——但这一声称未在权重内生时验证。
-
多重比较校正:当同时检验多个协变量时,如何控制族系错误率?本文未提供任何校正方法。扎根于 Discussion 中仅建议“reporting more than one test”,未涉及多重协变量问题。这是一个明显的 gap,可结合研究者熟悉的假设检验理论(如 Bonferroni、FDR)进行扩展。
-
渐近分布理论:能否推导加权 KS/AD/CVM 在 \( H_0 \) 下的渐近分布(如加权 Brownian bridge)?这可以避免置换的计算成本,并提供解析 p 值。扎根于论文未涉及渐近理论,仅使用置换。研究者若熟悉经验过程理论,可尝试推导。
Maintained by 陈星宇 · Homepage · Source on GitHub