Direct and Indirect Discrimination in Generalized Linear Models¶
作者: Bertille Tierny, Arthur Charpentier, François Hu
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2606.23116
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是公平性诊断中的预测差异分解,具体针对广义线性模型(GLM)。其根本的统计问题是:给定一个已拟合的预测模型,如何将不同敏感组(如种族、性别)之间的预测差异,分解为具有不同统计含义的若干通道(如敏感变量系数、通过非敏感协变量传递的间接效应、协方差结构差异、非线性链接函数效应),从而为模型审计和治理提供可操作的诊断信息。该方向当前处于从线性模型向非线性模型、从均值分解向分布性分解过渡的阶段,本文是这一过渡中的一个具体推进。
发展脉络(history)¶
从引言和参考文献中,可以梳理出以下发展脉络:
-
奠基工作:Oaxaca-Blinder 分解及其变体
- Kitagawa (1955), Oaxaca (1973), Blinder (1973):经典的三重分解,将两组间的观测结果均值差异分解为“特征差异”(endowments)和“系数差异”(coefficients)。本文在 2.1 节明确指出,其对象不同:它分解的是单个拟合预测器在不同组间产生的预测差异,而非分解观测结果差异。因此,与 Oaxaca-Blinder 的关系是“结构上的类比”,而非直接继承。
- Fairlie (2005):将 Oaxaca-Blinder 分解扩展到 logit 和 probit 模型,处理非线性链接下的均值分解。本文在 2.1 节提及,但将其定位为“相关非线性与分布性扩展”,而非本文的直接基础。
-
主要进展:线性模型下的公平性分解
- Tierny, Charpentier, Hu (2026):本文作者的前期工作(参考文献 [22]),在线性模型下建立了基于 Wasserstein 重心的分布性人口统计平价准则,并推导了四路分解(直接均值、间接均值、交互、结构)。本文的线性基准(第 2 节)直接建立在该工作之上,并为其 GLM 扩展提供了精确的基准。
-
当前 Frontier:非线性模型与分布性公平性
- Fukuchi & Sakuma (2023):从优化和 minimax 视角研究线性模型下的人口统计平价约束。本文在 2.1 节提及,但将其定位为“互补路线”——该工作关注约束下的最优性,而本文关注已拟合模型的诊断分解。
- Baumann & Loi (2023), Lindholm et al. (2022), Côté et al. (2025):这些工作从伦理、法律和因果图角度讨论保险中的公平性。本文在引言中引用它们来建立“公平性问题的复杂性”这一背景,但并未将其作为技术基础。
-
本文的位置:本文填补的是“GLM 下预测差异分解”这一缺口。它在线性基准的基础上,将分解逻辑扩展到 GLM,并显式处理了逆链接函数引入的曲率效应。其核心贡献是提出了一个两层近似分解(
U2(f),˜U2(f),D1(f)),并推导了 logistic、Poisson 和 Tweedie 分布的显式公式。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 线索一:均值分解(Oaxaca-Blinder 及其非线性扩展)。这一簇的工作关注的是均值差异的分解,主要工具是线性回归或 logit/probit 模型。代表工作:Kitagawa (1955), Oaxaca (1973), Blinder (1973), Fairlie (2005)。本文与这一线索的关系是“结构类比”,但对象不同(预测差异 vs. 结果差异)。
- 线索二:分布性公平性度量与分解。这一簇的工作关注的是整个预测分布的差异,而非仅均值。代表工作:Tierny et al. (2026)(线性模型下的 Wasserstein 分解)、Fukuchi & Sakuma (2023)(线性模型下的 minimax 约束)。本文是这一线索在 GLM 下的直接扩展。
这个方向在追问的核心问题¶
- 如何区分“直接歧视”与“间接歧视”? 即,预测差异是源于敏感变量本身的系数,还是源于敏感变量通过非敏感协变量(代理变量)的关联?
- 如何将线性模型下的分解扩展到非线性模型? 当预测是链接函数的非线性变换时,线性分解不再精确,需要处理曲率效应。
- 如何量化链接函数本身对差异的贡献? 逆链接函数可能会压缩、放大或重塑潜在得分上的差异。
- 如何评估分解的近似精度? 由于 GLM 分解是一阶的,需要显式报告近似误差。
当前主流方法与已知瓶颈:主流方法是 Oaxaca-Blinder 分解及其 logit 扩展,但瓶颈在于它们主要处理均值,且对非线性链接的处理是 ad-hoc 的。本文提出的矩分解框架试图提供一个更系统的方案,但其本身也是一阶近似,且仅跟踪前两阶矩,而非完整分布。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么? 作者将缺口 frame 为“线性模型直觉在 GLM 下不完整”。引言中反复强调:“GLM predictions are obtained by transporting a latent score through a nonlinear inverse link”,因此“the linear decomposition cannot be transferred mechanically to GLMs”。这使得本文的 GLM 扩展成为“显然的下一步”。
- 哪些竞争路线被他淡化或回避了? 作者明确淡化了与 Oaxaca-Blinder 分解的直接联系(2.1 节:“Our object is different”),并回避了与因果推断中 mediation 分析的联系。虽然本文的“直接/间接”术语与因果 mediation 的“直接/间接效应”在结构上同构,但作者并未引用任何因果 mediation 文献(如 Baron & Kenny, Imai et al., VanderWeele),也未讨论其分解与 NIE/NDE 的关系。这可能是作者有意为之,以保持其框架的“统计诊断”而非“因果推断”定位。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 最明显的缺失是因果推断中的 mediation 分析文献。本文的分解(直接均值、间接均值、交互)与因果 mediation 中的 natural direct effect (NDE), natural indirect effect (NIE), 以及交互效应(interaction)在结构上高度同构。此外,半参数效率理论(如 efficient influence function)也未出现,尽管本文的分解本质上是一个可估参数的分解,其估计量的效率性质是自然的问题。
张力¶
被引工作之间未见明显对立。线性模型下的分解(Tierny et al., 2026)与非线性扩展(本文)是继承关系,而非矛盾。Oaxaca-Blinder 分解与本文的分解是不同对象(结果 vs. 预测),因此也不构成直接张力。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
X ∈ ℝᵏ:非敏感协变量向量(随机变量)。S ∈ [M]:离散敏感属性(随机变量),如种族、性别。Y:响应变量(随机变量)。πₛ = P(S=s):敏感组 s 的比例。µ(s) = E[X|S=s]:组 s 的非敏感协变量均值向量。Σ(s) = Cov(X|S=s):组 s 的非敏感协变量协方差矩阵。β ∈ ℝᵏ:非敏感协变量的系数向量(参数)。γₛ ∈ ℝ:敏感属性 s 的组特定截距(参数)。β₀ ∈ ℝ:全局截距(参数)。η = ⟨x, β⟩ + γₛ + β₀:潜在得分(latent score)。h(·):逆链接函数(inverse link),如 logit 的h(t) = 1/(1+e⁻ᵗ),Poisson 的h(t) = eᵗ。f(x, s) = h(η):预测值(mean-scale prediction)。mₛ = E[η|S=s]:组 s 的潜在得分均值。vₛ = Var(η|S=s):组 s 的潜在得分方差。bₛ = √vₛ:组 s 的潜在得分标准差。M = mₛ(随机变量,随 S 变化),B = bₛ。¯m = Eₛ[M]:全局潜在得分均值。¯b = Eₛ[B]:全局潜在得分标准差均值。
-
模型:
- 数据生成机制:
(X, S, Y)来自某个联合分布。我们拟合一个 GLM:E[Y|X, S] = h(⟨X, β⟩ + γₛ + β₀)。注意:本文不关心Y的分布,只关心拟合的预测值f(X, S)在不同组间的差异。因此,模型是预测模型,而非因果模型。 - 已知:
h是已知的逆链接函数(如 logit, exp)。β, γₛ, β₀是已拟合的参数(视为已知)。 - 要估的对象:不同组间预测值
f(X, S)的分布差异,具体分解为几个统计通道。
- 数据生成机制:
-
可观测数据:
- 可观测:
(Xᵢ, Sᵢ, Yᵢ)的样本,i=1,...,n。由此可估计πₛ,µ(s),Σ(s),β,γₛ,β₀。 - 想要但观测不到:反事实预测值,例如“如果某个体属于另一敏感组,其预测值会是多少”。本文的分解不依赖于反事实,它只分解已拟合模型产生的预测差异,因此不需要因果识别假设。这是其与因果 mediation 分析的关键区别。
- 可观测:
第二步:讲最小内核¶
本文的最小内核是线性高斯基准下的四路分解。去掉所有 GLM 的复杂性(非线性链接、近似误差),核心思路在这个特例中完全展现。
最简特例:
- 假设 S 是二值(M=2),X 是一维(k=1)。
- 假设 X|S=s 服从高斯分布:X|S=s ~ N(µ(s), σ²(s))。
- 假设使用恒等链接(h(t)=t),因此预测值 f(x, s) = η = βx + γₛ + β₀。
- 在这个特例下,组 s 的预测值分布是高斯分布:f(X, S)|S=s ~ N(mₛ, b²ₛ),其中 mₛ = βµ(s) + γₛ + β₀,bₛ = |β|σ(s)。
核心思路:
1. 定义差异度量:使用 Wasserstein 重心准则 UW²(f) 来度量分布性人口统计平价的违反程度。在高斯假设下,它退化为一个简单的两矩准则 U²(f) = Varₛ(mₛ) + Varₛ(bₛ)。这是关键:分布性差异被简化为组间均值方差和组间标准差方差之和。
2. 分解均值方差:Varₛ(mₛ) 可以进一步分解。因为 mₛ = βµ(s) + γₛ + β₀,且 β₀ 是常数,所以:
- Varₛ(mₛ) = Varₛ(γₛ) + Varₛ(βµ(S)) + 2Covₛ(γₛ, βµ(S))。
- 这三项分别对应:直接均值(敏感变量系数 γₛ 的方差)、间接均值(非敏感协变量均值 µ(S) 通过 β 投影后的方差)、交互(前两者的协方差)。
3. 分解标准差方差:Varₛ(bₛ) = Varₛ(|β|σ(S))。这对应间接结构(非敏感协变量方差 σ²(S) 的差异)。
4. 组合:U²(f) = 直接均值 + 间接均值 + 交互 + 间接结构。
为什么这个特例是内核:
- 它展示了本文的核心思想:将分布性差异(Wasserstein 距离)简化为矩差异(两矩准则),再将矩差异分解为具有统计含义的线性分量。
- 所有 GLM 的复杂性(非线性链接、近似误差)都是在这个内核上“加壳”。GLM 扩展的核心就是处理 h 如何改变这个分解:h 的斜率缩放线性分量,h 的曲率引入新的耦合和放大项。
- 在这个特例下,分解是精确的(没有近似误差)。这为 GLM 下的近似分解提供了一个清晰的基准。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对广义线性模型(GLM)中的公平性诊断,提出一个基于矩的分解框架,用于区分拟合预测差异中的直接歧视(敏感变量系数)、间接歧视(通过代理协变量传递)、交互效应、结构效应以及逆链接函数诱导的曲率效应。
- 核心工具 / 方法:Wasserstein 重心准则、矩分解、一阶 delta 近似、泰勒展开。核心是构建三层对象:经验输出尺度准则
U²(f)、组内代理准则˜U²(f)、以及主导分解D₁(f),并显式量化近似误差。 - 主要结论:在线性高斯基准下,Wasserstein 准则退化为两矩准则,并精确分解为四路。对于 GLM,
U²(f)可近似分解为D₁(f) + ∆_within + ∆_across,其中D₁(f)保留了线性四路,并增加了曲率耦合和曲率放大两项。推导了 logistic、Poisson 和 Tweedie 分布的显式公式,并在 MEPS 数据上进行了实证演示。
关键设定与假设¶
- 设定:一个已拟合的 GLM 预测器
f(x, s) = h(⟨x, β⟩ + γₛ + β₀)。X是非敏感协变量,S是敏感属性。目标是分解f(X, S)在不同S组间的分布差异。 - 假设:
- A1(高斯组条件得分分布):
η|S=s ~ N(mₛ, b²ₛ)。这是线性基准下 Wasserstein 准则简化为两矩准则的充分条件。本文明确指出,该假设仅在恒等链接下是精确的,在 GLM 下不成立。 - A2(光滑逆链接与局部余项有界):
h二阶连续可导,且组内条件得分的三阶和四阶矩有界,h''在组内得分取值区间上有界。这是组内 delta 近似(Proposition 3.2)成立的条件。 - A3(跨组光滑性):
h ∈ C³在一个包含全局均值¯m和所有组均值mₛ的开区间上。这是跨组泰勒展开(Proposition 3.4)成立的条件。
- A1(高斯组条件得分分布):
- 相比已有文献的放宽/强化:相比线性模型(Tierny et al., 2026),本文放宽了恒等链接的假设,但引入了 A2 和 A3 作为近似精度的保证。相比 Oaxaca-Blinder 分解,本文不要求两组模型不同,而是分析单个模型。
主要结果¶
- 定理 2.3(线性四路分解):在恒等链接和高斯假设下,
U²(f)精确分解为直接均值、间接均值、交互、间接结构四项。这是整个 GLM 扩展的基准。 - 定理 3.6(GLM 两层分解):在 A2 和 A3 下,
U²(f) = D₁(f) + ∆_within(f) + ∆_across(f)。其中D₁(f)是主导分解,∆_within是组内 delta 近似误差,∆_across是跨组泰勒展开余项。这是本文的核心定理,它显式地将 GLM 分解的近似性质摆在了台面上。 - 定理 4.2(Logistic 分解):
D₁,logit(f)的显式公式,其中斜率因子a = ¯µ(1-¯µ),曲率因子a(1-2¯µ)。关键洞察:当¯µ=0.5时,曲率耦合项消失,分解退化为斜率缩放后的线性分解。 - 定理 5.1(Poisson 分解):
D₁,Pois(f)的显式公式,其中斜率因子¯µ,曲率因子¯µ。关键洞察:曲率耦合项的符号由Covₛ(M, B)决定,曲率放大项总是非负。 - 定理 6.4(Log-link Tweedie 分解):与 Poisson 分解形式相同。关键洞察:Tweedie 的方差幂参数
p不进入链接几何,只通过影响拟合系数间接影响分解。
证明路线与技术技巧¶
整体路线:
1. 建立线性基准:在恒等链接和高斯假设下,证明 Wasserstein 准则简化为两矩准则,并精确分解为四路(定理 2.3)。
2. 组内近似:对于 GLM,用 delta 方法将组内预测值的均值和标准差近似为潜在得分均值和标准差的函数(Proposition 3.2)。这产生了代理准则 ˜U²(f) 和组内误差 ∆_within。
3. 跨组展开:将代理准则 ˜U²(f) 中的 h(mₛ) 和 h'(mₛ)bₛ 在全局均值 ¯m 处进行二阶泰勒展开(Proposition 3.4)。这产生了主导分解 D₁(f) 和跨组误差 ∆_across。
4. 组合:U²(f) = ˜U²(f) + ∆_within = D₁(f) + ∆_across + ∆_within(定理 3.6)。
关键跳跃点: - 从 Wasserstein 距离到两矩准则:这是整个框架的基石。证明依赖于一维高斯分布下 Wasserstein 距离的解析形式(quantile function 的 L² 距离)。这个跳跃使得一个复杂的分布性公平性度量变得可分解。 - 处理非线性链接的曲率:这是 GLM 扩展的核心难点。作者的解法是不追求精确分解,而是接受一阶近似,并显式量化误差。通过 delta 方法和泰勒展开,将曲率效应分解为耦合项和放大项,并保留余项。这使得框架在理论上诚实,在应用上可操作。
技术技巧点名: - Wasserstein 距离的解析形式:用于将分布性公平性简化为矩。 - Delta 方法:用于组内矩的近似传输(Proposition 3.2)。 - 泰勒展开:用于跨组矩的近似展开(Proposition 3.4)。 - Bootstrap:用于评估估计量的不确定性(2.6 节,附录 B.6)。
真实例子与应用¶
- 数据:Medical Expenditure Panel Survey Household Component (MEPS-HC),2016 年数据。
- 场景:两个敏感比较:西班牙裔 vs. 非西班牙裔,无保险 vs. 有保险。四个模型:线性模型(log 支出)、logistic 模型(住院概率)、Poisson 模型(就诊次数)、Tweedie 模型(就诊次数,作为方差幂敏感性分析)。
- 方法应用:对每个模型,计算
U²(f),˜U²(f),D₁(f)及其分量,并报告近似误差∆_within和r_within。同时,应用潜在得分矩对齐后处理,并报告对齐后的U²和预测性能变化。 - 结果:
- 在所有模型中,直接均值分量是主导项,表明预测差异主要源于敏感变量本身的系数。
- 曲率项(耦合和放大)在 logistic 和 Poisson 模型中不可忽略,说明链接函数确实在重塑差异。
- 组内近似误差
r_within在某些情况下很大(如 Hispanic 比较的 logistic 模型达 39%,无保险比较的 Poisson 模型达 52.5%),表明一阶近似在这些情况下不够精确,U²(f)本身应作为主要报告指标。 - 潜在得分矩对齐几乎消除了
U²(f),但代价是预测性能的适度下降(如 deviance 增加)。
- 例子想说明什么:该框架是一个可操作的诊断工具,能够揭示预测差异的来源,并量化近似精度。它不是为了取代法律判断,而是为精算师提供结构化的信息。
🔎 结论是否比证明窄¶
- 是。论文在多个地方明确承认了其结论的局限性,这些局限性比证明本身更窄:
- 第 1 节:“The framework is not a legal test of discrimination, nor a full characterization of distributional parity outside the linear-Gaussian case.” —— 明确声明
U²(f)不是完全分布性公平性。 - 第 3 节:“Outside the linear-Gaussian benchmark, the proposed criterion is not a full characterization of distributional demographic parity. It tracks differences in the first two conditional moments of the fitted predictions, not equality of the full conditional prediction laws.” —— 再次强调矩准则的局限性。
- 第 3 节:“the GLM decomposition is first-order. Its accuracy depends on within-group score dispersion, separation of group-wise latent means, and curvature of the inverse link over the fitted score range.” —— 明确声明分解是一阶的,精度有依赖条件。
- 第 7 节:“the leading GLM decomposition is first-order.” —— 再次确认。
- 第 1 节:“The framework is not a legal test of discrimination, nor a full characterization of distributional parity outside the linear-Gaussian case.” —— 明确声明
- 这些声明表明,论文的核心结论(GLM 分解)是在一阶近似下成立的,且仅跟踪前两阶矩。它没有声称在一般非线性模型下能完全刻画分布性公平性,也没有声称分解是精确的。因此,结论的适用范围比证明所覆盖的“一阶近似”要窄,但论文通过显式报告误差项来诚实面对这一局限。
四、开放问题¶
-
扩展到多组件保险模型:论文在 7 节提到,零膨胀、hurdle 或频率-严重性模型需要多组件分解。扎根于:第 7 节 “Multi-component insurance models, such as zero-inflated, hurdle, or frequency–severity models, would require decompositions that separate disparities arising from occurrence, frequency, severity, and aggregation mechanisms.” 这是一个明确的未来工作方向。
-
分解分量的统计推断:论文使用 bootstrap 进行不确定性评估,但未讨论渐近分布或效率。扎根于:第 7 节 “Another direction is statistical inference for the decomposition components, for instance through bootstrap percentile intervals or asymptotic plug-in approximations.” 这是一个开放问题:能否为
D₁(f)的每个分量推导出渐近正态性?其半参数效率界是什么?这与用户对 semiparametric theory 和 efficiency theory 的兴趣直接相关。 -
条件公平性下的分解:论文在 7 节提到,分解可以应用于条件于“可接受评级信息”后的比较。扎根于:第 7 节 “In some insurance applications, the relevant question is not whether predictions are equal across sensitive groups unconditionally, but whether disparities remain after conditioning on admissible rating information or on legally accepted risk classes.” 如何形式化“可接受”信息?如何将分解与因果图或反事实框架结合?这指向了与因果推断中 mediation 分析的更深层联系。
-
与因果 mediation 分析的理论联系:本文的“直接/间接”分解与因果推断中的 NIE/NDE 在结构上同构,但本文刻意回避了因果语言。扎根于:引言中未引用任何因果 mediation 文献。这是一个值得研究者去查的问题:本文的分解能否被赋予因果解释?如果能,需要什么额外的识别假设(如 sequential ignorability)?如果不能,其与因果 mediation 的差异是什么?这直接连接用户的 primary interest 中的 causal inference 子方向。
Maintained by 陈星宇 · Homepage · Source on GitHub