Cohen's f or Mean Standardized Differences? Assessing Covariate Balance with Multivalued Treatments¶
作者: Ariel Linden
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2608.10266
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是多值处理(k>2组)下的协变量平衡评估。在因果推断的观察性研究中,调整(如倾向得分加权)后需要检查处理组间协变量分布是否足够相似,以支持因果解释。对于二值处理,标准化均值差(SMD)是标准工具;但对于多值处理,尚无公认的“综合”平衡度量。现有实践是将所有成对SMD取均值或最大值(McCaffrey et al. 2013),或使用结果加权平衡度量(Zhao & Yang 2022)。本文引入Cohen's f——Cohen's d到k组的经典推广(原用于ANOVA效应量)——作为替代,并系统比较它与现有聚合SMD实践在追踪下游估计偏差上的表现。
发展脉络(从introduction与参考文献构建)¶
-
奠基工作:Cohen (1988) 在《Statistical Power Analysis for the Behavioral Sciences》中定义了Cohen's d(两组标准化均值差)和Cohen's f(多组标准化效应量,定义为各组标准化偏离的加权均方根)。Austin (2009) 系统推广了SMD用于倾向得分匹配后的平衡诊断,建立了“SMD<0.1视为可忽略不平衡”的经验规则。这两篇奠定了二值处理下平衡评估的效应量框架。
-
主要进展:McCaffrey et al. (2013) 针对多值处理,提出用广义提升模型(GBM)估计倾向得分,并建议“计算每对处理组的SMD,然后报告均值或最大值”作为模型选择的平衡诊断。这成为多值处理下的主流实践。Zhao & Yang (2022) 进一步提出“结果加权平衡度量”,在模型选择中利用结果变量信息来加权协变量,以选择最优的广义倾向得分模型。这两篇工作将平衡诊断从二值扩展到多值,但作者指出:“neither is derived from, or shown to reduce to, Cohen's d itself”(引言),即它们缺乏与已有效应量框架的直接联系。
-
当前frontier:Linden (2026) 将Kolmogorov-Smirnov、Cramér-von Mises、Anderson-Darling检验推广到k个加权组,用于平衡诊断,但同样面临“综合统计量可能掩盖单个严重不平衡对”的问题。本文的位置是:填补“多值处理下无公认综合平衡度量”的缺口,将Cohen's f引入平衡诊断,并首次将其与现有聚合SMD实践进行形式化比较和模拟验证。
-
本文的位置:作者明确说“This paper takes up that gap as an open, comparative question rather than assuming either existing candidate is correct”(引言)。本文的贡献分为三类:数学贡献(f与成对SMD的精确关系及最小比值证明)、计算贡献(通过Stata命令esizereg扩展到加权和协变量调整模型)、实证贡献(模拟和实例显示f与|d|追踪偏差能力相当,但尺度不同)。
子线索聚类¶
- 基于SMD的聚合实践:McCaffrey et al. (2013) 的均值/最大绝对SMD,Zhao & Yang (2022) 的结果加权平衡度量。这些方法直接计算成对SMD然后聚合,但缺乏与d的解析联系。
- 基于效应量的方法:Cohen's d/f框架(Cohen, 1988),本文将其从ANOVA效应量语境移植到平衡诊断,并给出与成对SMD的精确关系。
- 分布检验方法:Linden (2026) 的k样本加权分布检验,与本文的f共享“综合统计量可能掩盖单个不平衡对”的关切。
核心问题与瓶颈¶
- 核心问题:多值处理下,如何定义一个综合平衡度量,使其(a)与二值处理下的SMD有可追溯的联系,(b)能有效预测下游估计偏差,(c)有可解释的阈值?
- 已知瓶颈:现有聚合SMD实践(|d|, |d|_max)没有与d的尺度对齐,且未经验证与偏差的相关性。Cohen's f有理论联系,但阈值未知,且其组大小加权特性可能掩盖小处理组的不平衡。
⚠️ 作者的framing¶
作者将缺口frame成“没有公认的综合标准”,而f是“grounded in an established effect-size framework”(摘要)且“carries an exact, derivable relationship to d itself”(引言)。竞争路线(McCaffrey的聚合实践)被描述为“useful for what they are built to do, but neither is derived from, or shown to reduce to, Cohen's d itself”(引言),暗示它们缺乏理论根基。但作者在结果中承认f与|d|表现相当(r≈0.93),所以f并非明显更优,而是提供了不同的尺度与分解。
明显该被引但没出现:本文未引用任何关于多值处理下平衡度量的理论性质(如识别性、效率)的工作,也未引用更现代的基于核或距离协方差的平衡度量。这可能是因为本文是应用导向的模拟比较,而非理论推导。研究者可自行检查:是否有其他多值平衡度量(如基于最大均值差异MMD)的文献被遗漏。
张力¶
未见明显对立引用。所有被引工作基本一致认为平衡诊断应基于标准化差异而非假设检验,且多值处理下需要聚合。唯一的张力在于聚合方式:f是二次加权,|d|是线性平均,|d|_max是最大值,三者尺度不同,但作者通过模拟表明它们在追踪偏差上表现相似。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(k\):处理组数(≥2)。 - \(n_j\):第j组的样本量,\(N = \sum_{j=1}^k n_j\)。 - \(w_j = n_j / N\):组j的样本权重。 - \(X\):一个连续协变量(本文考虑单个协变量,但方法可扩展到多个,每个协变量单独评估)。 - \(T \in \{1,\dots,k\}\):处理组指示变量。 - \(M_j\):第j组的调整后均值(来自回归模型的预测边际,而非原始样本均值)。它反映了模型中任何协变量调整、交互项和权重的效果。 - \(\bar{M} = \sum_j w_j M_j\):加权总均值。 - \(SD_p\):标准化标准差,来自拟合模型(通过模型整体预测边际的delta方法标准误乘以\(\sqrt{N}\)得到,对于OLS等于残差标准差)。 - \(d = (M_1 - M_0)/SD_p\):二值处理下的Cohen's d。 - \(d_j = (M_j - \bar{M})/SD_p\):组j的标准化偏离。 - \(d_{jj'} = (M_j - M_{j'})/SD_p\):组j与j'的成对标准化均值差。 - \(f = \sqrt{\sum_j w_j d_j^2}\):Cohen's f。 - \(|\bar{d}| = \binom{k}{2}^{-1} \sum_{j<j'} |d_{jj'}|\):平均绝对成对SMD。 - \(|\bar{d}|_{\max} = \max_{j<j'} |d_{jj'}|\):最大绝对成对SMD。
模型:本文的统计模型是一个回归模型,以协变量X为因变量,处理组指示变量T为自变量(可含其他协变量、交互项、权重)。模型可以是OLS、logistic等,但本文主要考虑连续协变量,所以是线性回归。关键点是:\(M_j\)和\(SD_p\)都来自这个拟合模型,而不是原始数据。这使得方法适用于加权(如倾向得分权重)和协变量调整。
可观测数据:每个观测i有\((X_i, T_i)\),以及可能的权重\(w_i\)(如倾向得分权重的倒数)。研究者可以观测到协变量值、处理组标签、权重。想要但观测不到的是:潜在结果(用于因果推断)和未测量混杂。平衡诊断只检查可观测协变量,不能直接证明未测量混杂的平衡(Rubin, 2008)。
第二步:最小内核——等组权重、k=3、无协变量调整的线性模型¶
剥去所有一般性设定,考虑最简单情形:\(k=3\),等组权重(\(w_1=w_2=w_3=1/3\)),无其他协变量,无权重(即原始数据),线性模型(等价于直接计算组均值和合并标准差)。此时: - \(M_j\)就是第j组的样本均值\(\bar{X}_j\)。 - \(\bar{M} = (\bar{X}_1+\bar{X}_2+\bar{X}_3)/3\)。 - \(SD_p\)是合并标准差(假设同方差),即\(\sqrt{\frac{1}{N-3}\sum_j \sum_{i:T_i=j} (X_{ij} - \bar{X}_j)^2}\)。 - \(d_j = (\bar{X}_j - \bar{M})/SD_p\)。 - \(f = \sqrt{\frac{1}{3}(d_1^2+d_2^2+d_3^2)}\)。 - 成对SMD:\(d_{12}=(\bar{X}_1-\bar{X}_2)/SD_p\),等等。 - \(|\bar{d}| = \frac{1}{3}(|d_{12}|+|d_{13}|+|d_{23}|)\)。 - \(|\bar{d}|_{\max} = \max(|d_{12}|,|d_{13}|,|d_{23}|)\)。
核心命题:在这个最小设定下,f与\(|\bar{d}|\)的关系是什么?作者证明(Proposition 1):在等组权重下,f/\(|\bar{d}|\)的最小值在组均值等间距时达到,值为\(\sqrt{3(k-1)/(4(k+1))}\)。对于k=3,该值为\(\sqrt{3\cdot2/(4\cdot4)} = \sqrt{6/16} \approx 0.612\)。这意味着f总是小于\(|\bar{d}|\),且比值有下界。例如,若三个组均值等间距(如-1,0,1),则f=0.816,\(|\bar{d}|=1.333\),比值0.612。若两个组均值相等、第三个远离,则f更接近最大偏离,比值可能更大。
为什么这个最小内核重要:它揭示了f与\(|\bar{d}|\)的根本差异——f是二次加权(对大方差更敏感),\(|\bar{d}|\)是线性平均。因此,常规SMD阈值(如0.1)不能直接用于f。这个最小例子是整篇论文数学贡献的核心:Proposition 1的证明(Section 2.6)直接基于这个设定,然后推广到一般权重和k。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在多值处理(k≥3)的协变量平衡评估中,比较Cohen's f与现有聚合SMD实践(平均绝对SMD \(|\bar{d}|\)和最大绝对SMD \(|\bar{d}|_{\max}\))在追踪下游估计偏差上的表现,并推导f与成对SMD的精确数学关系。
- 核心工具/方法:将Cohen's f从ANOVA效应量框架扩展到加权和协变量调整模型(通过预测边际和模型基标准差),并实现为Stata命令esizereg;通过模拟研究(k=3,4,6,正确/误设GPS加权)和真实数据实例进行验证。
- 主要结论:f与\(|\bar{d}|\)在追踪偏差上表现相当(pooled r=0.93,加权组内r≈0.79),\(|\bar{d}|_{\max}\)最弱;f与\(|\bar{d}|\)尺度不同,其比值有解析下界(等组权重下最小为\(\sqrt{3(k-1)/(4(k+1))}\)),因此常规SMD阈值不能直接用于f;非线性/交互作用结果模型下排名不变。
关键设定与假设¶
完整设定(在最小内核基础上补充): - 处理组数:k∈{3,4,6},但方法适用于任意k≥2。 - 协变量:三个协变量(X1~N(0,1), X2~lognormal(0,0.5), X3~Bernoulli(0.4)),但方法可处理任意多个连续/分类协变量(每个协变量单独评估平衡)。 - 处理分配机制:多项logit模型,包含X1,X2,X3及X1×X3交互项,由混淆强度参数γ∈{0,0.25,0.5,1}缩放。γ=0对应随机分配。 - 广义倾向得分(GPS)加权:通过多项logistic回归估计,两种设定:正确(包含交互项)和误设(遗漏交互项)。 - 结果模型:线性Y = μ_T + 1.5(X1+X2+X3) + ε,ε~N(0,1),真实组均值μ_j间距1.5。非线性稳健性场景:增加X1^2和X1X3项。 - 偏差目标:未调整结果回归估计的组均值与真实均值的平均绝对偏差和最大绝对偏差(经协变量样本均值校正)。
关键假设(本文未明确列出,但隐含): - SUTVA:潜在结果与处理分配无关(标准因果推断假设)。 - 无未测量混杂(给定GPS后):这是因果解释的前提,但本文只检查可观测协变量平衡,不验证此假设。 - GPS模型正确设定(在正确设定臂中):多项logit形式正确,且包含所有相关交互项。 - 线性结果模型(主模拟):结果模型是线性的,与平衡诊断(只检查一阶矩)对齐。非线性场景测试了偏离。
相比已有文献的放宽/强化: - 相比McCaffrey et al. (2013) 的聚合SMD实践,本文提供了f与d的精确关系(k=2时f=d/2),这是理论强化。 - 相比Zhao & Yang (2022) 的结果加权平衡度量,本文不利用结果信息,而是直接比较平衡统计量与偏差的相关性,这是不同的验证策略。 - 相比Cohen (1988) 的原始f定义(基于ANOVA的SSbetween/SSwithin),本文使用模型基SD_p而非残差平方和,使得f适用于加权和协变量调整模型,但导致f与经典ANOVA f^2不完全相等(仅渐近相等)。
主要结果¶
理论结果(Section 2.6): - f与成对SMD的精确关系:\(f^2 = \sum_{j<j'} w_j w_{j'} d_{jj'}^2\)。即f是成对SMD平方的加权和,权重为组大小乘积。 - Proposition 1:在等组权重下,f/\(|\bar{d}|\)的最小值在组均值等间距时达到,值为\(\sqrt{3(k-1)/(4(k+1))}\)。证明通过Cauchy-Schwarz不等式,将最大化\(|\bar{d}|\)(给定f固定)转化为线性形式,得到等间距序列为最优。 - 数值例子:k=3时最小比值0.612,k=4时0.671,k=6时0.732。模拟中观测到的比值(Table 3)接近这些下界,但随γ和组大小平衡变化。
模拟结果(Section 3): - f随混淆强度单调上升:未加权时f从0.062(γ=0)到0.209(γ=1);正确GPS加权后f降至0.010-0.031;误设GPS加权后f略高(0.010-0.034),但偏差差异很小(Table 2)。 - 偏差相关性:f与平均绝对偏差的pooled相关系数0.933,\(|\bar{d}|\)为0.936,\(|\bar{d}|_{\max}\)为0.919。加权组内(正确GPS)分别为0.791、0.788、0.776。\(|\bar{d}|_{\max}\)始终最弱。 - 非线性稳健性:排名不变,但绝对相关系数下降(正确GPS从0.728降至0.688),因为加权后非线性结构占偏差更大比例(Table 4)。 - f/\(|\bar{d}|\)比值:随k增大而增大(k=3时约0.63,k=6时约0.77),与理论下界一致;组大小不平衡时比值变化(Table 3)。
真实例子(Section 4): - 数据:心力衰竭疾病管理项目,3组(控制组5141人,电话组459人,远程监测组307人),协变量为基于药房数据的预测成本评分。 - 方法:通过广义倾向得分构建边际均值分层权重(MMWS),计算加权前后的f和\(|\bar{d}|\)。 - 结果:加权前f=0.065(η²=0.004),\(|\bar{d}|=0.134\),\(|\bar{d}|_{\max}=0.201\),成对SMD显示控制组与两干预组不平衡(d≈-0.2)。加权后f=0.010,\(|\bar{d}|=0.038\),所有成对CI包含0。两个统计量得出相同实质结论:加权消除了可检测的不平衡。 - 说明:该例子展示了f与\(|\bar{d}|\)尺度不同但结论一致,且当最大不平衡涉及大组时(控制组占87%),f/\(|\bar{d}|\)比值(0.49)低于理论下界,因为组大小权重放大了大组的影响。
证明路线与技术技巧(理论部分)¶
整体路线(Section 2.6的推导与Proposition 1的证明): 1. 建立f与成对SMD的关系:从f的定义\(f^2 = \sum_j w_j d_j^2\)出发,利用\(d_j = \sum_{j'} w_{j'} (M_j - M_{j'})/SD_p\)(因为\(\bar{M} = \sum w_{j'} M_{j'}\)),展开平方并重新排列,得到\(f^2 = \sum_{j<j'} w_j w_{j'} d_{jj'}^2\)。这一步是代数恒等式,不依赖任何分布假设。 2. 将f与\(|\bar{d}|\)联系起来:\(|\bar{d}|\)是\(|d_{jj'}|\)的线性平均,f是平方的加权平均。两者尺度不同,但通过Cauchy-Schwarz不等式可以约束比值。 3. 证明最小值:在等组权重下,固定f(即固定\(\sum_j d_j^2\)),最大化\(|\bar{d}|\)等价于最大化\(\sum_{j<j'} |d_{jj'}|\)。将组均值排序后,利用线性组合的Cauchy-Schwarz,得到最大值在等间距时达到,从而得到f/\(|\bar{d}|\)的最小值。
关键跳跃点: - 从f的定义到成对SMD的二次型表示:需要利用\(\bar{M}\)的加权平均性质,以及\(d_j\)与\(d_{jj'}\)的关系。这一步是核心代数技巧,使得f与现有实践直接可比。 - 最大化\(|\bar{d}|\)的线性规划:将绝对值求和转化为带符号的线性组合(利用排序),然后应用Cauchy-Schwarz。这需要注意到对于排序后的组均值,\(\sum_{j<j'} (x_j - x_i) = \sum_i (2i - k - 1) x_i\),从而将问题转化为在球面上最大化线性函数。
技术技巧点名: - Cauchy-Schwarz不等式:用于推导f/\(|\bar{d}|\)的最小值。 - 排序与线性组合:将绝对值求和转化为带符号的线性组合,这是处理有序组均值的标准技巧。 - 代数恒等式:f^2与成对SMD平方的关系,是整篇论文数学贡献的基础。
真实例子与应用¶
已在上文“主要结果”中详述。本文有真实数据例子(Section 4),使用疾病管理项目数据,展示了f和\(|\bar{d}|\)在加权前后的变化,并说明两者结论一致但尺度不同。该例子验证了模拟结果,并展示了组大小加权的影响(最大不平衡涉及大组时f相对较小)。
🔎 结论是否比证明窄¶
- 模拟的misspecification仅测试了一种:只遗漏了一个交互项,且偏差差异很小。作者在Limitations中承认:“only one form of generalized-propensity-score misspecification was tested… a more severe misspecification… might separate the two weighting arms more sharply”(Section 5.4)。因此,结论“f与|d|表现相当”可能不适用于更严重的misspecification。
- 非线性场景只测试了一种:只测试了Zhao & Yang (2022) 线性模型的扩展(加二次项和交互项),其他非线性形式未评估。作者承认“other nonlinear forms… were not evaluated”(Section 5.4)。
- f没有置信区间:作者开发了非中心F构造但发现无效(在稳健方差下),因此只报告点估计。这意味着无法判断f的差异是否显著。作者建议bootstrap,但未在模拟中实现。
- 阈值未建立:作者明确说“This paper does not establish a validated balance threshold for f”(Section 5.3),因此f的实际使用需要研究者自行校准。
四、开放问题(点到为止,扎根具体语句)¶
-
为f建立经过验证的平衡阈值:作者说“an investigator wanting one should derive it directly from the relationship between f and downstream bias in a design resembling their own”(Section 5.3)。这意味着需要针对具体应用场景,通过模拟或理论推导,确定f的“可接受”上限。扎根于Section 5.3的这句话。
-
f的置信区间构造:作者开发了非中心F构造但“found to be invalid under the robust variance estimator that sampling weights typically require”(Section 5.4),并建议bootstrap。这是一个开放的计算问题:能否找到解析或半解析的置信区间,避免bootstrap的计算成本?扎根于Section 5.4。
-
更严重的GPS misspecification下的比较:作者只测试了遗漏一个交互项,且偏差差异很小。更严重的misspecification(如遗漏重要协变量)可能使f与|d|的表现分化。扎根于Section 5.4:“a more severe misspecification… might separate the two weighting arms, and the diagnostics that track them, more sharply”。
-
其他非线性结果结构下的验证:作者只测试了一种非线性结构(来自Zhao & Yang的线性模型扩展)。其他非线性形式(如阈值效应、交互作用更强的模型)可能改变排名。扎根于Section 5.4:“other nonlinear forms… were not evaluated”。
-
f的组大小加权是否总是合适的:作者指出当每个成对对比同等重要时,f的加权可能不理想(Section 5.3)。这引出一个更一般的问题:对于不同的目标估计量(如平均处理效应ATE vs. 平均处理效应在 treated ATT),平衡度量应如何加权?扎根于Section 5.3的第四点建议。
Maintained by 陈星宇 · Homepage · Source on GitHub