Empirical Likelihood-Based Fairness Auditing: Distribution-Free Certification and Flagging¶
讲者: Jie Tang
会场: Advances in Trustworthy and Decentralized Learning
报告题目: Empirical Likelihood-Based Fairness Auditing: Distribution-Free Certification and Flagging
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是算法公平性的统计审计。其根本问题是:给定一个黑箱预测模型 \(h\) 和一个 holdout 数据集 \(\mathcal{D}\),如何在不依赖模型内部结构或强分布假设的前提下,统计上严格地判断模型是否对某些敏感子群体存在性能差异(disparity),并定位出哪些子群体受到了不利对待。该方向当前处于从“启发式度量”向“有统计保证的推断”过渡的阶段,核心挑战在于:审计必须同时处理多重比较、有限样本、以及审计者无法控制数据生成过程这一现实。
发展脉络(history)¶
作者在引言中勾勒了一条清晰的线索,从奠基工作到当前前沿,再到本文的位置:
-
奠基与早期审计框架:Tramèr et al. (2017) 提出 FairTest,首次将审计形式化为一个统计检验问题——拒绝零假设意味着检测到某个敏感组存在显著关联。Morina et al. (2019) 和 Xue et al. (2020) 分别从最优传输和个体公平性的角度扩展了审计范围。这些工作奠定了“认证”(certification,验证公平性)和“标记”(flagging,定位不公平组)的双重目标。
-
区间估计与多重检验:Cherian and Candès (2024) 是本文最直接的前驱和比较基准。他们提出了一个基于 bootstrap 的通用框架,用定义 (2.1) 统一了多种群体公平性度量,并给出了认证和标记的统计推断方法。作者引用其“disparity definitions”作为自己框架的基础。Yan and Zhang (2022) 和 von Zahn et al. (2023) 则聚焦于通过主动学习和多重假设检验来高效定位不公平子群体。
-
当前方法的瓶颈:作者明确指出了三条竞争路线的局限:
- 置换法(DiCiccio et al., 2020):要求组间数据分布相同(强假设),且计算成本高。
- Bootstrap 法(Xue et al., 2020; Roy and Mohapatra, 2023; Cherian and Candès, 2024):对重抽样方案敏感,在大规模数据上计算上不可行。
- 最优传输距离法(Morina et al., 2019; Taskesen et al., 2021; Si et al., 2021):局限于特定度量,需要模型内部知识,且在大规模子群体发现时优化复杂。
-
本文的位置:作者将 经验似然(EL) 方法引入公平性审计,声称其具有非参数、无需显式方差估计、数据自适应、以及 Bartlett 可校正(覆盖误差 \(O(n^{-2})\) 优于 bootstrap 的 \(O(n^{-1})\))等优势。本文声称是第一个将 EL 系统应用于公平性审计的工作(Liu and Zhao (2024) 仅用 EL 构建公平预测模型,而非审计)。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 线索一:基于区间估计的认证。代表:Xue et al. (2020), Maity et al. (2021), Roy and Mohapatra (2023), Cherian and Candès (2024)。核心是构造性能差异的置信区间,若区间包含零则通过认证。主要工具是 bootstrap 和渐近正态性。
- 线索二:基于多重假设检验的标记。代表:Yan and Zhang (2022), von Zahn et al. (2023)。核心是控制 FDR/FFR,定位哪些子群体存在显著差异。主要工具是 BH 过程及其变体。
- 线索三:基于经验似然的方法。代表:Liu and Zhao (2024) 以及本文。核心是利用 EL 的分布自由和计算优势。Liu and Zhao (2024) 用于构建公平模型,本文则用于审计。
这个方向在追问的核心问题¶
- 如何在不假设数据分布的情况下进行有效推断? 现有方法(如 bootstrap)依赖重抽样,其有效性依赖于样本量足够大且重抽样方案合适。EL 声称提供了一种无需重抽样的替代方案。
- 如何控制多重比较下的假阳性率? 当审计大量子群体时,必须控制错误发现率。BH 过程是标准工具,但其有效性依赖于 p 值的正确性。本文需要证明其 EL 导出的 p 值能用于 BH 过程。
- 如何实现计算上的可扩展性? Bootstrap 的计算成本随样本量和子群体数增长迅速。EL 和其变体 EEL 声称能大幅降低计算延迟。
- 如何处理不等式约束的零假设? 实际审计中,审计者可能只关心“差异是否超过某个容忍阈值”,而非严格为零。这需要处理复合假设和边界点上的渐近分布。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么? 作者将现有方法的瓶颈归结为“限制性的分布假设”和“高昂的计算开销”,从而将 EL 方法定位为“显然的下一步”。具体来说,作者声称 EL 是“non-parametric”、“avoids explicit variance estimation”、“data-adaptive”且“Bartlett-correctable”,这些优势使其成为 bootstrap 的天然替代品。
- 哪些竞争路线被他淡化或回避了? 作者淡化了 EL 方法本身的局限性:① EL 的渐近理论依赖于“0 在 \(g_i(\epsilon)\) 的凸包内”这一条件,这在有限样本下可能不成立,尤其当组样本量很小或数据高度不平衡时;② 作者回避了 EL 在高维(\(m\) 很大)或复杂结构(如重叠组)下的理论挑战,其定理假设 \(m\) 固定且有限;③ 作者将 bootstrap 描述为“computationally prohibitive”,但未与更高效的 bootstrap 变体(如 wild bootstrap、subsampling)进行比较。
- 什么明显该被引 / 该存在、却没出现在 intro 里? ① 没有引用任何关于 EL 在非标准设定下(如弱识别、高维、相依数据)的理论工作,这些工作可能揭示 EL 在审计场景下的潜在脆弱性。② 没有引用 关于“公平性审计的统计功效”的系统性研究,即给定一个不公平的模型,审计方法需要多少样本才能可靠地检测出来?本文的模拟仅展示了有限场景下的功效。③ 没有引用 关于“交叉性公平性”(intersectional fairness)的统计挑战 的文献,例如当子群体由多个敏感属性交叉定义时,样本量会急剧下降,EL 的渐近理论可能失效。
张力¶
未见明显对立引用。所有被引工作基本认同审计的目标和框架,分歧主要在于实现手段(bootstrap vs. EL vs. 最优传输)和计算效率上。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \((X, Y)\):协变量和结果变量,随机向量。
- \(h\):一个已训练好的预测规则(黑箱模型),审计者只能获得其输出 \(h(X)\)。
- \(M(h(X), Y)\):一个性能度量,例如平方误差 \((Y - h(X))^2\) 或正确分类指示 \(1\{h(X)=Y\}\)。
- \(G\):一个子群体,由 \(X\) 的某个子集定义(如“非洲裔美国人”)。\(\mathcal{G} = \{G_1, \dots, G_m\}\) 是待审计的子群体集合,\(m\) 固定且有限。
- \(\epsilon_G\):群体性能差异(disparity),定义见 (2.1):\(\epsilon_G = \mathbb{E}_P[M(h(X),Y) \mid (X,Y) \in G] - \theta_P\)。这是本文的核心 estimand。
- \(\theta_P\):目标值,一个已知或可估计的标量。例如,可以是总体平均值 \(\mathbb{E}_P[M(h(X),Y)]\),或某个参考组的条件期望。
- \(n\):holdout 数据集 \(\mathcal{D} = \{(X_i, Y_i)\}_{i=1}^n\) 的样本量。
- \(P(G)\):子群体 \(G\) 的概率 \(\mathbb{P}((X,Y) \in G)\)。
- \(g_i(\epsilon; \theta_P)\):估计函数,定义见 (3.2)。它是一个 \(m\) 维向量,其第 \(j\) 个分量为 \([M_i - \theta_P - \epsilon_{G_j}] \cdot 1\{ (X_i, Y_i) \in G_j \}\)。
- \(\Sigma_{\text{EL}}\):\(g_i\) 的协方差矩阵,定义见 (3.4)。
- \(\ell_{\text{EL}}(\epsilon; \theta_P)\):经验对数似然比统计量。
- \(\lambda\):拉格朗日乘子,用于求解 EL 权重。
-
模型:
- 数据生成机制:\((X_i, Y_i) \overset{\text{i.i.d.}}{\sim} P\),其中 \(P\) 是一个完全未知的联合分布。没有对 \(P\) 施加任何参数形式。
- 模型 \(h\) 被视为一个固定的、已知的函数。审计者不关心 \(h\) 是如何训练的,只关心其输出。
- 目标值 \(\theta_P\) 可以是已知常数,也可以是从数据中估计的(如总体均值 \(\hat{\theta} = n^{-1} \sum_i M_i\))。
-
可观测数据:
- 审计者能观测到的是 holdout 数据集 \(\mathcal{D} = \{(X_i, Y_i)\}_{i=1}^n\),以及模型 \(h\) 在这些数据上的输出 \(\{h(X_i)\}_{i=1}^n\)。
- 由此,可以计算出每个样本的性能度量 \(M_i = M(h(X_i), Y_i)\)。
- 想要但观测不到的量:子群体的条件期望 \(\mathbb{E}_P[M \mid G]\)。这是需要通过样本均值来估计的。审计者无法观测到模型 \(h\) 的训练过程或内部参数。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:只有一个子群体 \(G\),且目标值 \(\theta_P\) 已知。
-
特例设定:
- \(m = 1\),即只审计一个子群体 \(G\)。
- \(\theta_P\) 是一个已知常数(例如,法律规定所有申请人的平均批准率应为 0.5)。
- 性能度量 \(M\) 是二值的(例如,\(M=1\) 表示“获得贷款”,\(M=0\) 表示“被拒绝”)。
- 我们想检验零假设 \(H_0: \epsilon_G = 0\),即该子群体的平均结果与目标值无差异。
-
核心思路:
-
定义估计函数:对于这个特例,估计函数 (3.2) 退化为一个标量:
\[g_i(\epsilon_G) = [M_i - \theta_P - \epsilon_G] \cdot 1\{X_i \in G\}\]注意,\(g_i(\epsilon_G)\) 只在样本属于子群体 \(G\) 时非零。 -
构造经验似然:EL 的核心思想是,在约束 \(\sum_i p_i g_i(\epsilon_G) = 0\) 下,寻找一组概率权重 \(\{p_i\}\) 来最大化 \(\prod_i p_i\)。这个约束等价于:
\[\sum_{i: X_i \in G} p_i (M_i - \theta_P - \epsilon_G) = 0\]即,在加权后的分布下,子群体 \(G\) 内的平均偏差为零。 -
求解权重:通过拉格朗日乘子法,可以得到最优权重为:
\[p_i = \frac{1}{n} \cdot \frac{1}{1 + \lambda g_i(\epsilon_G)}\]其中 \(\lambda\) 是满足约束的标量。 -
检验统计量:经验对数似然比统计量为:
\[\ell_{\text{EL}}(\epsilon_G) = -2 \sum_{i=1}^n \log(n p_i) = 2 \sum_{i=1}^n \log(1 + \lambda g_i(\epsilon_G))\] -
渐近分布:在 \(H_0: \epsilon_G = 0\) 下,且满足一些正则条件(如 \(P(G) > 0\),\(\text{Var}(M|G) > 0\)),可以证明:
\[\ell_{\text{EL}}(0) \xrightarrow{d} \chi^2_1\]即,统计量渐近服从自由度为 1 的卡方分布。 -
决策规则:给定显著性水平 \(\alpha\),如果 \(\ell_{\text{EL}}(0) > \chi^2_{1, 1-\alpha}\),则拒绝 \(H_0\),认为该子群体存在显著差异(模型未通过认证)。否则,模型通过认证。
-
-
这个特例揭示了什么?
- 无需方差估计:EL 通过内部标准化(即求解 \(\lambda\) 的过程)自动处理了方差,无需像 Wald 检验那样显式估计 \(\text{Var}(M|G)\)。
- 分布自由:统计量的渐近分布是卡方,不依赖于 \(M\) 或 \(X\) 的具体分布。
- 数据自适应:权重 \(\{p_i\}\) 的形状完全由数据决定,反映了数据对零假设的支持程度。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了如何对黑箱机器学习模型进行统计上严格的公平性审计,包括认证(验证模型是否满足公平性约束)和标记(定位哪些子群体受到了不公平对待)两个任务。
- 核心工具/方法:提出了一个基于经验似然(EL) 的框架(ELFA),利用 EL 构造性能差异的置信区间和 p 值,并采用 Benjamini-Hochberg (BH) 过程控制标记任务中的错误发现率。作为计算更高效的替代,还提出了经验欧几里得似然(EEL) 版本。
- 主要结论:证明了 EL 和 EEL 的似然比统计量在零假设下渐近服从卡方分布(定理 1-3),并给出了不等式约束下(如 \(H_0: \epsilon_G \le \epsilon_0\))的混合卡方极限分布(定理 4)。模拟表明,ELFA 的覆盖概率比 bootstrap 更接近名义水平,且计算时间减少了几个数量级。在 COMPAS 数据集上,成功标记出了交叉性偏见(如年轻非裔男性获得更高阳性预测率)。
关键设定与假设¶
- 设定:审计者拥有一个 holdout 数据集 \(\mathcal{D} = \{(X_i, Y_i)\}_{i=1}^n \overset{\text{i.i.d.}}{\sim} P\),以及一个固定的预测规则 \(h\)。审计目标是检验群体性能差异 \(\epsilon_G = \mathbb{E}_P[M \mid G] - \theta_P\)。
- 假设:
- C1 (i.i.d.):数据独立同分布。这是所有渐近理论的基础。
- C2 (非退化):\(P(G)\) 和 \(\text{Var}(M \mid G)\) 对所有 \(G \in \mathcal{G}\) 都远离 0。这确保了协方差矩阵 \(\Sigma_{\text{EL}}\) 非奇异,且 EL 问题有唯一解。相比 bootstrap 方法,这是一个更弱的假设,因为 bootstrap 通常还需要组间分布相同。
- C3 (矩条件):\(\mathbb{E}[M^2] < \infty\),\(0 < \text{Var}(M) < \infty\),且 \(\|M\|_\infty < \infty\)。有界性假设(\(\|M\|_\infty < \infty\))是技术性的,用于经验过程理论,确保函数类是 Donsker 类。这比许多非参数方法要求的指数型尾部条件更强。
- C4 (有界差异):\(\epsilon_G\) 一致有界。这是一个正则性条件。
- C5 (协方差非奇异):\(\Sigma_{\text{EL}}\) 的特征值有正下界和有限上界。这是标准条件,确保卡方极限分布是良定义的。
- C6 (渐近线性):当 \(\theta_P\) 未知时,其估计量 \(\hat{\theta}\) 必须是渐近线性的,即 \(\sqrt{n}(\hat{\theta} - \theta_P) = n^{-1/2} \sum_i \psi(X_i, Y_i) + o_P(1)\)。这是一个非常标准的假设,适用于 M 估计量、Z 估计量等。作者指出,样本均值 \(\hat{\theta} = n^{-1} \sum_i M_i\) 满足此条件。
主要结果¶
- 定理 1 (EL 认证,\(\theta_P\) 已知):在 C1-C5 下,\(\ell_{\text{EL}}(\epsilon^*; \theta_P) \xrightarrow{d} \chi^2_m\)。这为构造置信域 (3.6) 和计算 p 值 (3.7) 提供了理论基础。技术难点:估计函数涉及指示函数与均值的乘积,需要经验过程理论来证明函数类的 Donsker 性质,从而保证 \(\hat{\Sigma}_{\text{EL}}\) 的一致收敛性。
- 定理 2 (EL 认证,\(\theta_P\) 未知):在 C1-C6 下,\(\ell_{\text{EL}}(\epsilon^*; \hat{\theta}) \xrightarrow{d} \chi^2_m\)。这表明用 \(\hat{\theta}\) 替换 \(\theta_P\) 不影响渐近分布。技术难点:需要证明替换带来的误差是 \(o_P(1)\),这依赖于 \(\hat{\theta}\) 的 \(\sqrt{n}\)-一致性和函数类的 Donsker 性质(引理 B.8)。
- 定理 3 (EEL 认证):在 C1-C5 下,\(\ell_{\text{EEL}}(\epsilon^*) \xrightarrow{d} \chi^2_m\)。EEL 用欧几里得距离替代了 EL 中的 Kullback-Leibler 散度,从而得到了一个闭式解 (3.8),避免了求解非线性方程 (3.3),大幅降低了计算复杂度。
- 定理 4 (不等式约束下的极限分布):对于单边检验 \(H_0: \epsilon_G \le \epsilon_0\),在最不利情况 \(\epsilon_G = \epsilon_0\) 下,\(T(G) \xrightarrow{d} \frac{1}{2}\chi^2_0 + \frac{1}{2}\chi^2_1\)。这是一个混合卡方分布,反映了检验统计量在边界点上的非标准行为。
- 定理 5 (Type I 误差控制):在 \(H_0: \epsilon_G \le \epsilon_0\) 下,若 \(\epsilon_G^* = \epsilon_0\),则 \(\lim_{n\to\infty} P(T(G) > z_{2\alpha}(1)) = \alpha\);若 \(\epsilon_G^* < \epsilon_0\),则极限为 0。这证明了检验在边界点处渐近控制 Type I 误差,在内部点处则趋于保守。
- 定理 6 (FFR 控制):对于不相交的组,将 BH 过程应用于 EL 导出的 p 值,可以渐近控制错误标记率(FFR)在 \(\alpha\) 水平。关键条件:组不相交保证了 p 值的独立性,这是 BH 过程有效性的经典条件。
证明路线与技术技巧¶
-
整体路线(以定理 1 为例):
- Step 1: 经验过程收敛:证明函数类 \(\mathcal{F} = \{ [M - \theta_P - \epsilon_G] \cdot 1_G : G \in \mathcal{G} \}\) 是 P-Glivenko-Cantelli 和 P-Donsker 类。这保证了样本协方差矩阵 \(\hat{\Sigma}_{\text{EL}}\) 一致收敛到总体协方差矩阵 \(\Sigma_{\text{EL}}\)(引理 B.3, B.4)。
- Step 2: 拉格朗日乘子的阶:利用 EL 的约束方程 (3.3) 和 Step 1 的结果,证明拉格朗日乘子 \(\lambda = O_P(n^{-1/2})\),且 \(\max_i |\lambda^\top g_i| = o_P(1)\)。
- Step 3: 泰勒展开:对 \(\ell_{\text{EL}}(\epsilon^*) = 2 \sum_i \log(1 + \lambda^\top g_i)\) 进行泰勒展开,得到 \(\ell_{\text{EL}}(\epsilon^*) = n \bar{g}^\top \hat{\Sigma}_{\text{EL}}^{-1} \bar{g} + o_P(1)\),其中 \(\bar{g} = n^{-1} \sum_i g_i\)。
- Step 4: 应用 CLT 和 Slutsky:由 CLT 知 \(\sqrt{n} \bar{g} \xrightarrow{d} N(0, \Sigma_{\text{EL}})\)。结合 Step 1 中 \(\hat{\Sigma}_{\text{EL}} \xrightarrow{p} \Sigma_{\text{EL}}\),由 Slutsky 定理得 \(\ell_{\text{EL}}(\epsilon^*) \xrightarrow{d} \chi^2_m\)。
-
关键跳跃点:
- 从“估计函数含指示函数”到“经验过程理论”:这是本文证明中最吃功夫的地方。标准的 EL 理论通常处理的是光滑的矩条件。本文的 \(g_i\) 包含 \(1_G\),使得函数类不再是 Donsker 类的直接推论。作者需要引用 Dudley (1984) 和 van der Vaart (1996) 的结果,证明当 \(\mathcal{G}\) 是 VC 类时,指示函数类是 Donsker 类,进而通过乘积和线性组合证明 \(g_i\) 所在的函数类也是 Donsker 类(引理 B.5-B.7)。
- 从“已知 \(\theta_P\)”到“未知 \(\theta_P\)”:替换 \(\theta_P\) 为 \(\hat{\theta}\) 后,需要证明新估计函数 \(\hat{g}_i = g_i(\epsilon; \hat{\theta})\) 的样本均值和协方差与 \(g_i(\epsilon; \theta_P)\) 的差异是 \(o_P(1)\)。这依赖于 \(\hat{\theta}\) 的 \(\sqrt{n}\)-一致性和函数类的 Donsker 性质,证明过程需要仔细处理高阶项(引理 B.8)。
- 不等式约束下的混合卡方分布:这是另一个关键跳跃。当零假设是复合的(如 \(\epsilon_G \le \epsilon_0\))时,检验统计量在边界点 \(\epsilon_G = \epsilon_0\) 处的渐近分布不再是简单的卡方。作者通过将检验统计量分解为 \(\ell_{\text{EL}}(\epsilon_0) \cdot 1\{\hat{\epsilon}_G > \epsilon_0\}\),并利用 \(\hat{\epsilon}_G\) 的渐近正态性,推导出极限分布是 \(\frac{1}{2}\chi^2_0 + \frac{1}{2}\chi^2_1\)(定理 4 证明)。
-
技术技巧点名:
- 经验过程理论 (Empirical Process Theory):用于证明函数类的 Donsker 和 Glivenko-Cantelli 性质,是处理含指示函数的矩条件的核心工具(引理 B.3-B.7)。
- 拉格朗日乘子法 (Lagrange Multiplier Method):用于求解 EL 权重,得到 \(p_i\) 和 \(\lambda\) 的表达式(附录 F)。
- 泰勒展开 (Taylor Expansion):用于将 EL 统计量展开为二次型,从而与 CLT 建立联系(定理 1 证明)。
- Slutsky 定理 (Slutsky's Theorem):用于将样本协方差矩阵替换为总体协方差矩阵。
- Benjamini-Hochberg (BH) 过程:用于控制多重比较下的错误发现率(定理 6)。
真实例子与应用¶
- 数据/场景:COMPAS 累犯预测数据集。分析目标是预测平价(Predictive Parity),即要求阳性预测值(PPV)在不同种族间一致。PPV 定义为 \(P(Y=1 \mid h(X)=1)\)。
- 方法应用:
- 认证:将非裔美国人作为受保护组 \(G\),白人作为参考组(\(\theta_P\) 为白人的 PPV)。构造 \(\epsilon(G) = \text{PPV}_{\text{AA}} - \text{PPV}_{\text{White}}\) 的 95% EL 置信区间,结果为 \([0.018, 0.058]\),不包含 0。结论:模型未通过预测平价认证,非裔美国人的 PPV 显著高于白人。
- 标记:将非裔美国人按性别和年龄进一步划分为 6 个交叉性子群体。以白人的 PPV 为参考,构造每个子群体的 95% 置信区间(图 4a)。结果显示,年轻非裔男性(<25 岁)的区间完全在 0 以上,表明该群体被“过度预测”为会再犯。
- 标记(阈值检验):设定容忍阈值 \(\epsilon_0 = 0.01\),检验 \(H_0: \epsilon(G) \le 0.01\)(即 PPV 不比白人高超过 1%)。ELBH 过程标记出“25 岁以下非裔男性”为不公平组(图 5)。类似地,以总体平均 PPV 为参考,检验 \(H_0: \epsilon(G) \ge -0.01\),标记出“25 岁以下女性”和“45 岁以上白人”为 PPV 低于平均的组(图 6)。
- 结果说明:这个例子展示了 ELFA 框架的实用性:① 能够发现交叉性偏见(intersectional bias),即单一属性(如种族)可能不显著,但交叉属性(如年轻非裔男性)却显著;② 能够处理不等式约束的检验,允许审计者设定一个可容忍的差异阈值,而非要求严格相等;③ 结果与 Cherian and Candès (2024) 的 bootstrap 方法定性一致,但计算更快。
🔎 结论是否比证明窄¶
- 窄结论 1:定理 6 要求组不相交。 定理 6 的陈述明确要求“the groups \(\{G\}_{G \in \mathcal{G}}\) are disjoint”。然而,在实际审计中,子群体往往是重叠的(例如,“非裔美国人”和“25 岁以下”)。作者在 COMPAS 例子中分析的交叉性子群体(如“非裔男性 <25”)是互斥的,但更一般的重叠组情况下的 FFR 控制并未被证明。作者在定理 6 的证明中直接引用了 Benjamini and Hochberg (1995) 的引理 C.1,该引理要求检验统计量独立。对于重叠组,p 值不再独立,BH 过程可能失效。这是一个重要的理论缺口。
- 窄结论 2:所有渐近结果都假设 \(m\) 固定。 定理 1-3 的极限分布是 \(\chi^2_m\),其中 \(m\) 是固定的。当 \(m\) 随 \(n\) 增长时(例如,审计大量细粒度的交叉性子群体),这些结果不再成立。作者在模拟中只考虑了 \(m=2,5,10\),未涉及高维情形。
- 窄结论 3:假设 C3 要求 \(M\) 有界。 对于许多实际性能度量(如平方误差),\(M\) 可能无界。虽然作者在模拟中使用了正态误差(无界),但理论证明依赖于有界性来保证 Donsker 性质。对于无界 \(M\) 的 EL 理论,需要更复杂的工具(如经验过程理论的泛化)。
- 泛泛 claim: 作者在摘要和引言中声称 EL 是“Bartlett-correctable”,但本文并未证明或利用这一性质。Bartlett 校正可以将覆盖误差从 \(O(n^{-1})\) 降至 \(O(n^{-2})\),但本文的所有定理和模拟都基于一阶渐近。作者没有展示在有限样本下,EL 的覆盖概率是否真的优于 bootstrap 的 \(O(n^{-1})\) 误差率。这是一个被提及但未被验证的潜在优势。
四、开放问题¶
- 重叠组下的 FFR 控制:定理 6 要求组不相交,但实际审计中组往往是重叠的。要证什么:证明在重叠组下,将 BH 过程应用于 EL 导出的 p 值,是否仍能渐近控制 FFR?或者需要开发新的校正方法?扎根点:定理 6 的陈述和证明中“disjoint”这一关键假设。
- 高维子群体(\(m\) 随 \(n\) 增长)下的 EL 理论:本文所有理论都假设 \(m\) 固定。要估什么:当 \(m\) 很大(如 \(m \gg n\))时,EL 统计量的渐近分布是什么?是否仍为卡方?如何在高维下进行有效的认证和标记?扎根点:所有定理的极限分布都是 \(\chi^2_m\),且模拟中 \(m\) 最大仅为 10。
- 无界性能度量 \(M\) 下的理论保证:假设 C3 要求 \(M\) 有界。要证什么:当 \(M\) 无界(如平方误差、对数损失)时,本文的定理是否仍然成立?需要哪些额外的条件(如指数型尾部)?扎根点:假设 C3 中 \(\|M\|_\infty < \infty\) 这一条件。
- Bartlett 校正的有限样本收益:作者声称 EL 是 Bartlett 可校正的,但未在本文中实现。要算什么:对于公平性审计中的典型样本量(如 \(n=1000\) 或 \(5000\)),Bartlett 校正能带来多大的覆盖概率提升?其计算成本如何?扎根点:引言中“EL is Bartlett-correctable, reducing coverage error to \(O(n^{-2})\)”这一说法,以及模拟中 EL 的覆盖概率在 \(n=2000\) 时仍略低于名义水平 0.95 的现象(表 1)。
Maintained by 陈星宇 · Homepage · Source on GitHub