An Entropy-based Coefficient of Determination with Adjustment of Optimization Bias¶
作者: Longhai Li
主题: 数理统计 / 假设检验
相关性: 6/10
链接: https://arxiv.org/abs/2608.06624
一、领域脉络与小综述¶
这个方向是什么¶
本文所针对的根本问题是:在经典假设检验(如似然比检验)和信息准则(如AIC)中,统计显著性会随样本量膨胀,导致在大型数据集中,即使实际效应微不足道,也会被标记为“显著”。该子方向旨在开发一种尺度无关、样本量无关、且能校正训练乐观偏差的预测效应量度量,作为传统p值和信息准则的替代,以量化模型的实际预测价值而非统计显著性。
发展脉络(history)¶
- 奠基工作:经典R²与信息准则:OLS中的确定系数(R²)和调整R²通过量化残差方差的比例缩减来度量效应量。AIC(Akaike, 1973)和LRT(Wilks定理)则基于似然比,但作者指出它们本质上都是统计显著性度量,因为其非中心参数随样本量增长(Burnham & Anderson, 2002; Lin et al., 2013)。
- 主要进展:伪R²的两种范式:
- 方差基伪R²:将OLS公式直接移植到广义线性模型(Efron, 1978; Gelman et al., 2019; Nakagawa et al., 2017; Zhang, 2017)。作者认为其关键局限是仅通过均值轨迹度量变异,对高阶分布改进(如异方差、零膨胀)不敏感,且缺乏对单调变换的不变性。
- 熵基伪R²:直接从负对数似然(偏差)构造。McFadden's R²(McFadden, 1974)在连续数据中因微分熵无下界而失效。Cox & Snell R²(Cox & Snell, 1989)通过指数化交叉熵解决了尺度不变性,但作者指出它依赖未惩罚的经验熵,易受过拟合影响且缺乏推断框架。Nagelkerke's R²(Nagelkerke, 1991)通过离散调整恢复了[0,1]尺度。
- 当前前沿与本文位置:作者认为,这些历史挑战源于对有限样本熵分布的刻画不足——领域长期将残差平方和(RSS)与偏差错误等同。本文声称通过证明熵方差(EV) 是OLS RSS在一般正则参数族下的严格推广,从而打破这一等价。作者将EV定义为指数化交叉熵,并基于其构建了带自由度校正的R²_V和R²_SVP,以及基于F分布的推断框架。
子线索聚类¶
- 方差基R²推广:Efron (1978), Gelman et al. (2019), Nakagawa et al. (2017), Zhang (2017, 2022), Rights & Sterba (2019), Tjur (2009)。这些工作试图在GLM和混合模型中保留“方差解释比例”的解释。
- 熵基伪R²与信息准则:McFadden (1974), Cox & Snell (1989), Nagelkerke (1991), Akaike (1973), Burnham & Anderson (2002)。这些工作基于似然或信息论,但面临尺度、有界性或样本量膨胀问题。
- 有限样本分布校正:Bartlett (1937), Lawley (1956), Cordeiro (1983), Sur et al. (2019)。这些工作改进似然比统计量的有限样本分布,但作者指出它们依赖模型特定的Fisher信息矩阵,而本文的F_V分布声称是普适的。
这个方向在追问的核心问题¶
- 如何定义一种尺度无关、样本量无关的效应量度量? 当前主流方法(如ATE)依赖期望算子,与原始坐标尺度绑定;伪R²要么缺乏尺度不变性(方差基),要么在连续数据中无界(McFadden's)。
- 如何校正训练乐观偏差? 经验熵(或伪R²)直接代入会因过拟合而高估效应量。现有方法(如调整R²)在OLS外缺乏严格推广。
- 如何为这种效应量建立推断框架? 即构造p值和置信区间,而不依赖模型特定的Fisher信息矩阵。
⚠️ 作者的framing¶
- 作者把缺口frame成什么:作者将问题frame为“熵方差(EV)是OLS残差方差的严格数学推广”,从而将OLS的整套推断机制(F检验、调整R²、预测R²)推广到一般正则参数族。这使得本文成为“显然的下一步”:既然EV是RSS的推广,那么基于EV的F统计量、R²和预测R²自然也是OLS对应物的推广。
- 哪些竞争路线被他淡化或回避了:
- 作者淡化了方差基R²的实用性,主要批评其缺乏对单调变换的不变性和对高阶分布改进的敏感性。但未深入讨论在特定模型(如线性模型)下,方差基R²的简单性和广泛接受度。
- 作者回避了交叉验证(CV) 作为预测性能评估的黄金标准。虽然本文的R²_SVP声称是CV的解析近似,但并未与CV进行系统比较,也未讨论CV在非参数或复杂模型中的优势。
- 作者回避了贝叶斯方法(如WAIC, Vehtari et al., 2017)在模型评估中的角色,仅在未来工作中提及。
- 什么明显该被引/该存在、却没出现在intro里?
- Chatterjee (2021) 的相关系数:该文提出了一种新的相关系数,也旨在解决p值随样本量膨胀的问题,且具有类似的不变性。本文在intro中引用了它,但未深入讨论其与EV-R²的关系或差异。
- 条件随机场(CRF)或更一般的图模型:本文的EV框架适用于“正则参数族”,但未讨论其在高维或结构化预测模型(如图模型)中的适用性。
- 高维似然比检验的近期工作:Sur et al. (2019) 被引用,但仅作为高维缩放极限的一个例子。本文未讨论其与本文F_V分布在高维设定下的关系或竞争。
张力¶
未见明显对立引用。所有被引工作基本沿着“从OLS R²到广义R²”的渐进线展开,作者的工作被定位为这条线上的一个突破点。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( Y_i \): 响应变量(随机变量)。
- \( \mathbf{x}_i \): 协变量向量(固定或随机)。
- \( f_j(y \mid \mathbf{x}_i, \boldsymbol{\theta}_j) \): 模型 \( \mathcal{M}_j \) 指定的条件预测密度,参数为 \( \boldsymbol{\theta}_j \)。
- \( f^* \): 真实数据生成过程(DGP)。
- \( \boldsymbol{\theta}_j^* \): 模型 \( \mathcal{M}_j \) 的“投影参数”,即最小化期望交叉熵的参数:\( \boldsymbol{\theta}_j^* = \arg\min_{\boldsymbol{\theta}} \mathbb{E}_{f^*} [-\log f_j(Y \mid \mathbf{X}, \boldsymbol{\theta})] \)。
- \( h_j^*(\boldsymbol{\theta}) \): 期望平均交叉熵:\( h_j^*(\boldsymbol{\theta}) = \frac{1}{n} \sum_{i=1}^n \mathbb{E}_{Y_i \sim f^*} [-\log f_j(Y_i \mid \mathbf{x}_i, \boldsymbol{\theta})] \)。
- \( \nu_j^* \): 总体熵方差 (Population EV):\( \nu_j^* = \exp(2 h_j^*(\boldsymbol{\theta}_j^*)) \)。这是本文的核心总体参数,是OLS中误差方差 \( \sigma^2 \) 的推广。
- \( \rho^2_V \): 总体效应量:\( \rho^2_V = 1 - \nu_1^* / \nu_0^* \),其中 \( \mathcal{M}_0 \subset \mathcal{M}_1 \) 是嵌套模型。这是本文要估计和推断的目标。
- \( \hat{h}_j(\boldsymbol{\theta}_j) \): 经验平均交叉熵:\( \hat{h}_j(\boldsymbol{\theta}_j) = -\frac{1}{n} \sum_{i=1}^n \log f_j(y_i \mid \mathbf{x}_i, \boldsymbol{\theta}_j) \)。
- \( \hat{v}_j \): 经验熵方差 (Empirical EV):\( \hat{v}_j = \exp(2 \hat{h}_j(\hat{\boldsymbol{\theta}}_j)) \),其中 \( \hat{\boldsymbol{\theta}}_j \) 是MLE。这是 \( \nu_j^* \) 的有偏估计。
- \( \hat{v}^c_j \): 偏差校正后的EV:\( \hat{v}^c_j = \hat{v}_j / (1 - p_j/n) \),其中 \( p_j \) 是模型 \( \mathcal{M}_j \) 的参数个数。
- \( R^2_V \): 基于偏差校正EV的样本内R²:\( R^2_V = 1 - \hat{v}^c_1 / \hat{v}^c_0 \)。
- \( R^2_{SVP} \): 样本外预测R²:\( R^2_{SVP} = 1 - \hat{v}^{\text{test}}_1 / \hat{v}^{\text{test}}_0 \),其中 \( \hat{v}^{\text{test}}_j = \hat{v}_j / (1 - p_j/n)^2 \)。
- \( F_V \): 基于EV的F统计量:\( F_V = \frac{n-p_1}{k} (\exp(2\Delta\hat{h}) - 1) \),其中 \( k = p_1 - p_0 \),\( \Delta\hat{h} = \hat{h}_0(\hat{\boldsymbol{\theta}}_0) - \hat{h}_1(\hat{\boldsymbol{\theta}}_1) \)。
-
模型:
- 数据生成机制:\( (Y_i, \mathbf{x}_i) \) 独立同分布,来自某个未知的真实分布 \( f^* \)。
- 统计模型:考虑两个嵌套的正则参数族 \( \mathcal{M}_0 \subset \mathcal{M}_1 \),每个族指定一个条件密度 \( f_j(y \mid \mathbf{x}, \boldsymbol{\theta}_j) \)。模型是“正则的”,意味着MLE具有标准渐近性质(一致性、渐近正态性)。
- 已知/未知:\( f^* \) 未知。\( \mathcal{M}_0 \) 和 \( \mathcal{M}_1 \) 由研究者指定。参数 \( \boldsymbol{\theta}_j \) 是待估的。
-
可观测数据:
- 可观测:\( n \) 个独立观测 \( \{(y_i, \mathbf{x}_i)\}_{i=1}^n \)。
- 潜在/不可观测:真实分布 \( f^* \),以及总体交叉熵 \( h_j^*(\boldsymbol{\theta}) \) 和总体EV \( \nu_j^* \)。这些只能通过假设和估计来逼近。
第二步:讲最小内核¶
本文的核心思路可以用线性回归这个最简特例来完全理解。在这个特例下,所有复杂的熵基概念都退化为熟悉的OLS概念。
-
最简特例:线性回归
- 模型:\( Y_i = \mathbf{x}_i^\top \boldsymbol{\beta} + \epsilon_i \),其中 \( \epsilon_i \sim N(0, \sigma^2) \)。模型 \( \mathcal{M}_j \) 对应不同的协变量集。
- 可观测数据:\( \{(y_i, \mathbf{x}_i)\}_{i=1}^n \)。
- 核心退化:
- 经验交叉熵 \( \hat{h}_j(\hat{\boldsymbol{\theta}}_j) = \frac{1}{2} \log(2\pi e \hat{\sigma}^2_j) \),其中 \( \hat{\sigma}^2_j = \text{RSS}_j / n \)。
- 经验EV \( \hat{v}_j = \exp(2\hat{h}_j) = 2\pi e \hat{\sigma}^2_j \)。
- 总体EV \( \nu_j^* = 2\pi e \sigma^2_j \)。
- 总体效应量 \( \rho^2_V = 1 - \nu_1^* / \nu_0^* = 1 - \sigma^2_1 / \sigma^2_0 \)。这正是经典的总体R²。
- 偏差校正EV \( \hat{v}^c_j = \hat{v}_j / (1 - p_j/n) = 2\pi e \cdot \text{RSS}_j / (n-p_j) \)。
- 样本内R² \( R^2_V = 1 - \hat{v}^c_1 / \hat{v}^c_0 = 1 - \frac{\text{RSS}_1/(n-p_1)}{\text{RSS}_0/(n-p_0)} \)。这正是经典的调整R²。
- F统计量 \( F_V = \frac{n-p_1}{k} (\exp(2\Delta\hat{h}) - 1) = \frac{n-p_1}{k} (\frac{\hat{v}_0}{\hat{v}_1} - 1) = \frac{(\text{RSS}_0 - \text{RSS}_1)/k}{\text{RSS}_1/(n-p_1)} \)。这正是经典的ANOVA F统计量。
- 预测R² \( R^2_{SVP} = 1 - \frac{\hat{v}_1/(1-p_1/n)^2}{\hat{v}_0/(1-p_0/n)^2} = 1 - \frac{\text{MSPE}_1}{\text{MSPE}_0} \),其中MSPE是均方预测误差的估计。这近似于经典的预测R²。
-
核心思路: 本文的核心贡献在于证明,上述从OLS到EV-R²的退化路径并非巧合,而是一个普适的数学结构。对于任何正则参数族(如逻辑回归、泊松回归),只要将“残差平方和”替换为“总经验EV”(\( \hat{V}_j = n\hat{v}_j \)),将“误差方差”替换为“总体EV”(\( \nu_j^* \)),那么OLS中关于R²、调整R²、F检验和预测R²的整套推断机制,都可以通过EV的指数化定义和自由度校正,被严格地推广到一般似然推断中。本文的数学工作就是证明这个推广在渐近意义下成立,并给出其有限样本的F分布近似。
三、这篇论文做了什么¶
-
三句话:
- 研究了什么问题:针对经典似然比检验和伪R²的缺陷,提出一种基于熵方差(EV)的、尺度无关且能校正训练乐观偏差的预测效应量度量(\( \rho^2_V \))及其估计量(\( R^2_{SV}, R^2_{SVP} \))。
- 核心工具/方法:将OLS的残差方差概念推广为“熵方差”(EV = exp(2×交叉熵)),并证明基于EV的信噪比(SNR)的F统计量(\( F_V \))渐近服从(非中心)F分布。
- 主要结论:基于F_V分布,可以构造\( \rho^2_V \)的校正p值和置信区间,无需计算Fisher信息矩阵。模拟和真实数据表明,基于EV-R²的变量选择能大幅降低假发现率(FDR),同时保留信号召回。
-
关键设定与假设:
- 正则参数族:模型 \( \mathcal{M}_j \) 必须是“正则的”,即满足标准MLE渐近理论的条件(如Cramér-Rao正则条件)。这是所有渐近结果的基础。
- 嵌套模型:比较的两个模型 \( \mathcal{M}_0 \subset \mathcal{M}_1 \) 必须是嵌套的。
- MLE估计:所有经验EV和偏差均基于最大似然估计(MLE)\( \hat{\boldsymbol{\theta}}_j \)。
- 局部备择假设:非中心F分布(定理S9)的推导依赖于“局部连续备择假设”,即总体效应量 \( \rho^2_V \) 随样本量 \( n \) 以 \( O(1/n) \) 的速度趋于0。作者承认,对于非常大的效应量或小样本,该近似可能引入偏差。
- 与已有文献的对比:相比Bartlett校正(需要模型特定的Fisher信息矩阵),本文的F_V分布声称是普适的,不依赖模型具体形式。相比Wilks定理(\( \chi^2 \) 近似),F_V分布通过引入分母自由度(\( n-p_1 \))提供了更准确的有限样本校正。
-
主要结果:
- 定理S6(中心EV-SNR分布):在原假设 \( \rho^2_V = 0 \) 下,经验EV-SNR \( \widehat{\text{SNR}}_V \) 渐近服从 \( \chi^2_k / \chi^2_{n-p_1} \) 的比率分布,因此 \( F_V \sim F_{k, n-p_1} \)。这为假设检验提供了基础。
- 定理S9(非中心EV-SNR分布):在备择假设下,\( F_V \) 渐近服从非中心F分布 \( F_{k, n-p_1}(\lambda_V) \),其中非中心参数 \( \lambda_V = n \rho^2_V / (1-\rho^2_V) \)。这为构造置信区间提供了基础。
- 定理S7(训练EV的偏倚):经验EV \( \hat{v}(\hat{\boldsymbol{\theta}}) \) 的期望是总体EV \( \nu^* \) 的 \( (1-p/n) \) 倍,这为 \( R^2_V \) 的自由度校正提供了理论依据。
- 定理S8(预测EV的膨胀):期望预测EV \( v^{\text{test}} \) 相对于总体EV \( \nu^* \) 有 \( 1/(1-p/n) \) 的膨胀因子,这为 \( R^2_{SVP} \) 的平方校正提供了理论依据。
- 模拟结果(表3):在LASSO路径上应用数据分割和EV-R²阈值,将FDR从内部排序的80.7%降至5.6%,同时保留了86.4%的信号召回。
- 真实数据结果(图7):在帕金森微生物组数据中,严格数据分割下的最优预测模型仅包含4个预测因子,\( R^2_{SV} \) 为34%,远低于内部评估的81%。
-
证明路线与技术技巧:
- 整体路线:
- 建立EV与OLS RSS的对应关系:通过指数化交叉熵,定义EV。在线性高斯模型中,EV退化为 \( 2\pi e \sigma^2 \),与RSS成比例。
- 刻画经验EV的分布:利用MLE的渐近理论,将经验EV的偏差(训练乐观)和膨胀(预测悲观)与自由度 \( p \) 和样本量 \( n \) 联系起来。核心是证明 \( \hat{v}(\hat{\boldsymbol{\theta}}) / \hat{v}(\boldsymbol{\theta}^*) \) 近似服从Beta分布(定理S5),从而导出偏差校正因子 \( (1-p/n) \)。
- 推导EV-SNR的分布:将两个嵌套模型的经验EV之比(即EV-SNR)映射为两个独立 \( \chi^2 \) 变量之比,从而得到中心和非中心F分布。关键步骤是利用绝对偏差分解(\( D^{\text{abs}}_1 = D^{\text{abs}}_0 + D_{1\backslash 0} \))和渐近独立性。
- 构造估计量和推断:基于上述分布,定义偏差校正的 \( R^2_V \) 和 \( R^2_{SVP} \),并利用非中心F分布的反演构造置信区间。
- 关键跳跃点:
- 从“偏差”到“F分布”:证明经验EV的比率(SNR)服从F分布,而不是直接证明EV本身服从某个分布。这是关键的一步,因为EV本身(如总EVT)不服从 \( \chi^2 \) 分布(作者在B.7.2节中解释了原因),但其比率却可以。
- 从“绝对偏差”到“相对SNR”:通过将绝对偏差分解(\( D^{\text{abs}}_1 = D^{\text{abs}}_0 + D_{1\backslash 0} \))和渐近独立性,将相对SNR的分布与绝对偏差的Beta分布联系起来,从而导出F分布。
- 技术技巧点名:
- 矩母函数(MGF)展开:在定理S5和S6的证明中,使用MGF展开来比较经验EV-SNR的分布与 \( \chi^2 \) 比率分布的差异,并量化Bartlett校正项的影响。
- Beta分布:利用Beta分布作为中间桥梁,将EV比率与 \( \chi^2 \) 比率联系起来。
- 非中心F分布:用于构造置信区间和进行功效分析。
- 数据分割:在模拟和真实数据应用中,使用数据分割来消除变量选择和模型评估之间的乐观偏差。
- 整体路线:
-
真实例子与应用:
- 数据:帕金森病(PD)人类肠道微生物组数据集(Hill-Burns et al., 2017),包含328个样本和378个预测变量(微生物OTU、年龄、性别等)。
- 方法应用:将数据分割为排序集(n=128)和评估集(n=200)。在排序集上用LASSO确定变量进入顺序,然后在评估集上顺序拟合逻辑回归模型,计算每个步骤的 \( R^2_{SV} \) 和 \( R^2_{SVP} \)。
- 结果:最优预测模型(基于 \( R^2_{SVP} \) 峰值)仅包含4个预测因子(Roseburia, Lactobacillus, Bacteroidales, sex_age),\( R^2_{SV} \) 为34%。这远低于内部评估的81%(图S16),且所选微生物与PD已知文献一致。
- 例子想说明什么:验证了EV-R²在真实高维生物医学数据中的实用性,展示了其通过数据分割和预测效应量阈值,能够识别出生物学上可解释且预测性能稳健的稀疏模型,同时纠正了内部评估的乐观偏差。
-
🔎 结论是否比证明窄:
- 是。作者在结论中声称“建立了统一的推断机制”,但证明(特别是非中心F分布)依赖于局部备择假设(\( \rho^2_V = O(1/n) \))。对于固定且较大的效应量,该近似的精度未在理论上严格刻画。作者在定理S9的证明后也承认了这一点:“如果真实信号很大...线性泰勒展开开始系统性地发散”。
- 是。作者声称F_V分布“适用于所有正则参数族”,但证明依赖于MLE的渐近正态性和Bartlett校正,这些在非正则模型(如奇异模型、高维模型)中可能不成立。作者在未来工作中也提到了这一点。
- 是。模拟和真实数据例子都集中在逻辑回归上。虽然理论声称适用于一般正则族,但论文并未提供其他分布(如泊松、伽马)的实证验证。
四、开放问题¶
-
推广到奇异似然模型和惩罚回归:作者在结论中明确指出,当模型涉及奇异似然(如神经网络)或惩罚(如LASSO)时,简单的参数计数 \( p \) 不足以校正偏差。如何定义有效的模型复杂度(如Watanabe的实对数规范阈值)并将其整合到EV-R²框架中?(扎根于论文结论段:“adjusting for finite-sample bias using simple parameter counts (p) becomes fundamentally inadequate... exploring Watanabe’s real log canonical threshold”)
-
处理内部变量预选带来的乐观偏差:本文通过数据分割解决了LASSO路径评估的偏差,但数据分割会降低有效样本量。能否开发一种无需数据分割、能解析校正内部预选偏差的EV-R²版本?(扎根于论文结论段:“addressing the complex optimism induced by internal variable pre-selection”)
-
非局部备择假设下的有限样本精度:本文的非中心F分布推导依赖于局部备择假设。对于固定且较大的效应量,该近似的误差有多大?能否推导出更精确的有限样本分布,或给出该近似失效的边界条件?(扎根于定理S9证明后的“Remarks on the Approximating Accuracy”部分)
-
与因果推断中效应量度量的结合:本文的EV-R²提供了一种尺度无关的模型拟合度量。能否将其应用于因果推断,例如评估条件平均处理效应(CATE)模型的预测性能,或作为敏感性分析中衡量未测量混杂因素影响的一个无量纲指标?(这是一个基于研究者兴趣的延伸,但论文本身未提及,需要研究者自行判断其可行性)
Maintained by 陈星宇 · Homepage · Source on GitHub