Block Empirical Likelihood Inference for Longitudinal Generalized Partially Linear Single-Index Models¶
讲者: Tianni Zhang
会场: Statistical Innovations for Single-Cell and High-Throughput Biomedical Data
报告题目: Block Empirical Likelihood Inference for Longitudinal Generalized Partially Linear Single-Index Models
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是纵向数据下半参数回归模型的推断,具体针对广义部分线性单指标模型(GPLSIM)。根本的统计问题:在重复测量数据存在组内相关性的情况下,如何对有限维参数(线性系数和单指标方向)进行有效且可靠的推断,同时估计未知的非参数链接函数。当前成熟度:纵向GEE框架和单指标模型各自已有大量工作,但将两者结合并利用经验似然(EL)实现“自动学生化”推断仍是一个活跃的开放方向。
发展脉络(history)¶
- 奠基工作:Liang and Zeger (1986) 提出广义估计方程(GEE),用工作相关矩阵处理组内相关,避免完全似然指定。这是纵向数据半参数推断的基石。Hardle et al. (1993) 研究了单指标模型的最优光滑化,奠定了降维结构。Carroll et al. (1997) 引入广义部分线性单指标模型(GPLSIM),将未知链接嵌入广义均值结构。
- 主要进展:在纵向半参数回归方面,Lin and Carroll (2001) 用GEE处理聚类数据的半参数回归;Fan and Li (2004) 发展了纵向半参数建模的估计与模型选择。在单指标模型方面,Xia and Hardle (2006) 建立了部分线性单指标模型的半参数估计理论;Liang et al. (2010) 专门研究了纵向部分线性单指标模型的估计与检验。在经验似然方面,Owen (2001) 和 Kolaczyk (1994) 奠定了EL在估计方程中的基础;You et al. (2006) 提出块经验似然(BEL)用于纵向部分线性模型;Yu et al. (2014) 将EL推广到纵向GPLSIM。
- 当前frontier:后续工作沿多条方向扩展:稳健化(Hu and Xu, 2022 结合稳健GEE与EL)、惩罚EL(Tan and Yan, 2021 用于纵向GLM)、测量误差(Zhang et al., 2022)、外部信息整合(Sheng et al., 2022)、贝叶斯EL(Ouyang and Bondell, 2023)、高维去相关(Geng and Zhang, 2024)、函数数据分析中的EL(Chang and McKeague, 2025)。
- 本文的位置:本文在Yu et al. (2014) 的基础上,将块经验似然与样条筛profile估计结合,为纵向GPLSIM建立了Wilks型卡方极限,并提供了完整的渐近理论和模拟/实证验证。作者声称其贡献在于“profile-orthogonality property”使得η的估计误差对θ的推断是二阶的,从而在纵向相关下实现EL的自动学生化。
子线索聚类¶
- 纵向数据半参数回归方法:GEE (Liang and Zeger, 1986)、半参数GEE (Lin and Carroll, 2001)、局部多项式混合效应 (Wu and Zhang, 2002)、样条推断 (Huang et al., 2004)、二次推断函数 (Qu et al., 2000)。这一簇关注如何用工作相关和光滑技术处理组内相关。
- 单指标模型及其半参数推断:单指标光滑 (Hardle et al., 1993)、部分线性单指标 (Yu and Ruppert, 2002; Xia and Hardle, 2006)、广义部分线性单指标 (Carroll et al., 1997)、纵向单指标 (Liang et al., 2010; Bai et al., 2009)。这一簇关注降维结构和非参数链接的估计。
- 经验似然在纵向数据中的应用:块EL (You et al., 2006)、纵向GPLSIM的EL (Yu et al., 2014)、稳健EL (Hu and Xu, 2022)、惩罚EL (Tan and Yan, 2021; Sheng et al., 2022)、测量误差EL (Zhang et al., 2022)、贝叶斯EL (Ouyang and Bondell, 2023)、高维去相关EL (Geng and Zhang, 2024)。这一簇关注如何用EL避免方差估计,同时处理相关性和半参数。
- 稳健性和测量误差处理:Qin and Zhu (2008) 纵向部分线性模型的稳健估计;Liu and Lian (2018) 纵向变系数模型的稳健过程;Zhang et al. (2022) 纵向测量误差的EL推断。
这个方向在追问的核心问题¶
- 如何对纵向GPLSIM中的有限维参数进行有效推断,同时避免不稳定的sandwich方差估计? 主流方法:Wald型推断需要估计sandwich方差,在中等样本下不稳定;EL提供自动学生化,但需要处理组内相关和非参数分量。
- 非参数链接函数的估计误差如何影响参数推断? 已知瓶颈:如果η的估计误差不是二阶的,则参数推断的收敛速度会变慢。本文通过profile-orthogonality和样条筛条件(K增长足够慢)确保η的估计对θ是渐近可忽略的。
- 工作相关矩阵的指定对推断的影响有多大? 主流方法:GEE在正确指定工作相关时效率更高,但错误指定仍保持相合性。EL的块构造天然尊重组内相关,但效率可能受工作相关影响。本文通过模拟显示BEL对工作相关选择不敏感。
- 如何扩展到更复杂的结构(多指标、高维、缺失数据)? 当前瓶颈:多指标导致维数诅咒,高维需要正则化,缺失数据需要处理非随机机制。
⚠️ 作者的framing¶
作者将缺口frame为:“Wald-type inference based on sandwich covariance estimation can be unstable when the number of clusters is moderate and the working correlation is difficult to calibrate in practice” (引言第2段)。因此,他们提出BEL作为替代,声称“likelihood-free confidence regions without explicit sandwich variance estimation” (摘要)。他们淡化或回避了以下竞争路线: - 二次推断函数 (QIF) (Qu et al., 2000):同样避免sandwich方差,但需要矩条件扩展。作者只在引言中提及QIF作为“alternative moment construction”,未在模拟中比较。 - 直接bootstrap:他们用bootstrap做η的置信带,但对θ的推断选择EL而非bootstrap,未解释原因。 - 贝叶斯方法:Ouyang and Bondell (2023) 的贝叶斯EL被提及但未比较。
什么明显该被引/该存在、却没出现在intro里? 作者未引用任何关于计算-统计权衡或低度多项式障碍的文献,这与用户的研究兴趣(computationally constrained statistics)无关,但值得注意:本文的方法完全基于多项式时间可计算的profile GEE和EL,没有讨论计算复杂度或信息-计算差距。此外,作者未引用高维纵向数据的近期工作(如高维GEE、惩罚GEE),尽管他们在未来工作中提到了高维扩展。
张力¶
未见明显对立引用。所有被引工作基本一致地认为EL在纵向数据中具有自动学生化的优势,且半参数profile估计在适当条件下不影响参数推断。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(i=1,\dots,n\):独立个体(subject)索引;\(j=1,\dots,m_i\):个体i的重复测量索引。\(m_i\)有界:\(\max_i m_i \le M\)。 - \(Y_{ij}\):响应变量(可观测)。 - \(\mathbf{x}_{ij} \in \mathbb{R}^p\):线性部分协变量(可观测)。 - \(\mathbf{z}_{ij} \in \mathbb{R}^q\):单指标部分协变量(可观测)。 - \(\boldsymbol{\beta}_0 \in \mathbb{R}^p\):线性系数(待估参数)。 - \(\boldsymbol{\alpha}_0 \in \mathbb{R}^q\):单指标方向(待估参数),满足\(\|\boldsymbol{\alpha}_0\|_2 = 1\)且第一个元素>0(可识别性约束)。 - \(\eta_0(\cdot)\):未知光滑链接函数(非参数分量)。 - \(g(\cdot)\):已知链接函数(如logit, log, identity)。 - \(\mu_{ij} = \mathbb{E}(Y_{ij} \mid \mathbf{x}_{ij}, \mathbf{z}_{ij})\),模型:\(g(\mu_{ij}) = \mathbf{x}_{ij}^\top \boldsymbol{\beta}_0 + \eta_0(\mathbf{z}_{ij}^\top \boldsymbol{\alpha}_0)\)。 - 重新参数化:令\(\boldsymbol{\phi} \in \mathbb{R}^{q-1}\),\(\|\boldsymbol{\phi}\|_2 < 1\),定义\(\boldsymbol{\alpha}(\boldsymbol{\phi}) = (\sqrt{1-\|\boldsymbol{\phi}\|_2^2}, \boldsymbol{\phi}^\top)^\top\)。则有限维参数\(\boldsymbol{\theta} = (\boldsymbol{\beta}^\top, \boldsymbol{\phi}^\top)^\top \in \mathbb{R}^d\),\(d = p+q-1\)。 - 样条近似:\(\eta(u) \approx \mathbf{B}(u)^\top \boldsymbol{\gamma}\),其中\(\mathbf{B}(u) \in \mathbb{R}^K\)是B样条基,\(\boldsymbol{\gamma} \in \mathbb{R}^K\)是样条系数(K随n增长)。 - 工作协方差:\(\mathbf{V}_i(\boldsymbol{\theta}, \boldsymbol{\gamma}) = \mathbf{A}_i^{1/2} \mathbf{R}_i(\boldsymbol{\rho}) \mathbf{A}_i^{1/2}\),其中\(\mathbf{A}_i = \text{diag}\{v(\mu_{i1}),\dots,v(\mu_{im_i})\}\),\(v(\cdot)\)是方差函数,\(\mathbf{R}_i(\boldsymbol{\rho})\)是工作相关矩阵(如独立、可交换、AR(1))。 - 估计函数:\(\mathbf{g}_i(\boldsymbol{\theta}) = \mathbf{G}_i(\boldsymbol{\theta})^\top \widehat{\mathbf{V}}_i(\boldsymbol{\theta})^{-1} \{\mathbf{Y}_i - \widehat{\boldsymbol{\mu}}_i(\boldsymbol{\theta})\} \in \mathbb{R}^d\),其中\(\widehat{\boldsymbol{\mu}}_i(\boldsymbol{\theta})\)是profile后的均值,\(\mathbf{G}_i(\boldsymbol{\theta})\)是profile均值的全导数。
模型:纵向GPLSIM(公式1)。数据生成机制:给定协变量,响应Y的条件均值由线性部分和单指标部分通过已知链接函数决定;组内相关性通过潜在随机效应或工作相关建模,但模型只指定边际均值结构。
可观测数据:\(\{ (Y_{ij}, \mathbf{x}_{ij}, \mathbf{z}_{ij}) : i=1,\dots,n, j=1,\dots,m_i \}\)。不可观测:\(\eta_0(\cdot)\)、\(\boldsymbol{\alpha}_0\)、\(\boldsymbol{\beta}_0\)、组内相关结构(真实相关未知,工作相关是假设)。
第二步:最小内核¶
考虑最简特例:高斯响应、恒等链接、p=1, q=1、m_i=2(每个个体两个时间点)、工作相关取独立(即忽略相关)。此时模型退化为:
最小内核问题:在纵向GPLSIM中,对\(\boldsymbol{\theta}_0\)进行推断。核心困难:\(\eta_0\)未知且需要估计,其估计误差可能影响\(\boldsymbol{\theta}\)的推断。本文的关键想法:通过样条筛profile估计,将\(\eta\)的估计误差控制在二阶小量(在\(\sqrt{n}\)尺度下可忽略),然后利用块经验似然(每个subject作为一个独立块)构造置信域,无需显式估计sandwich方差。
具体在特例中: - 样条近似:\(\eta(u) \approx \sum_{k=1}^K \gamma_k B_k(u)\),K固定(为简单,比如K=6)。 - Profile步骤:对每个固定的\(\boldsymbol{\theta}=(\beta,\phi)\),用GEE(工作独立)解出样条系数\(\widehat{\boldsymbol{\gamma}}(\boldsymbol{\theta})\)(公式8)。然后计算profile均值\(\widehat{\mu}_{ij}(\boldsymbol{\theta}) = x_{ij}\beta + \mathbf{B}(z_{ij}\alpha(\phi))^\top \widehat{\boldsymbol{\gamma}}(\boldsymbol{\theta})\)。 - 构造subject-level估计函数:\(\mathbf{g}_i(\boldsymbol{\theta}) = \mathbf{G}_i(\boldsymbol{\theta})^\top \{\mathbf{Y}_i - \widehat{\boldsymbol{\mu}}_i(\boldsymbol{\theta})\}\),其中\(\mathbf{G}_i(\boldsymbol{\theta})\)是\(\widehat{\boldsymbol{\mu}}_i\)对\(\boldsymbol{\theta}\)的导数(2×2矩阵)。由于工作独立,\(\widehat{\mathbf{V}}_i = \mathbf{I}_2\)。 - BEL统计量:\(\ell(\boldsymbol{\theta}) = 2\sum_{i=1}^n \log(1 + \boldsymbol{\lambda}^\top \mathbf{g}_i(\boldsymbol{\theta}))\),其中\(\boldsymbol{\lambda}\)满足\(\sum_i \mathbf{g}_i/(1+\boldsymbol{\lambda}^\top \mathbf{g}_i)=0\)。 - 理论:在\(\boldsymbol{\theta}_0\)处,\(\ell(\boldsymbol{\theta}_0) \Rightarrow \chi^2_2\),因此95%置信域为\(\{\boldsymbol{\theta}: \ell(\boldsymbol{\theta}) \le \chi^2_{2,0.95}\}\)。
这个特例展示了核心思路:即使工作相关错误指定(独立vs真实相关),只要subject-level的\(\mathbf{g}_i\)是i.i.d.的(因为subject独立),EL的Wilks现象仍然成立,且profile步骤保证了\(\eta\)的估计不影响极限分布。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:为纵向广义部分线性单指标模型(GPLSIM)提出一种基于样条筛profile估计和块经验似然(BEL)的推断方法,用于对有限维参数(线性系数和单指标方向)进行置信域构建,同时用bootstrap对非参数链接函数进行不确定性量化。
- 核心工具/方法:profile GEE(用B样条近似未知链接,通过内层方程估计样条系数,外层方程估计参数)+ 块经验似然(以每个subject为块构造估计函数,利用拉格朗日乘子得到似然比统计量)。
- 主要结论:在正则条件下,profile估计量是\(\sqrt{n}\)-相合且渐近正态的;BEL统计量在真参数处收敛到\(\chi^2_d\)分布(Wilks现象),从而无需显式sandwich方差估计即可构造置信域;模拟和癫痫数据实例验证了有限样本性能。
关键设定与假设¶
在第二节最小记号基础上,补全完整设定: - 模型:公式(1):\(g(\mu_{ij}) = \mathbf{x}_{ij}^\top \boldsymbol{\beta}_0 + \eta_0(\mathbf{z}_{ij}^\top \boldsymbol{\alpha}_0)\)。 - 可识别性约束:\(\|\boldsymbol{\alpha}_0\|_2 = 1\),\(\alpha_{0,1} > 0\);通过重新参数化(3)处理。 - 样条筛:公式(4):\(\eta(u) \approx \mathbf{B}(u)^\top \boldsymbol{\gamma}\),采用三次B样条,准均匀节点。 - 工作协方差:公式(6):\(\mathbf{V}_i = \mathbf{A}_i^{1/2} \mathbf{R}_i(\boldsymbol{\rho}) \mathbf{A}_i^{1/2}\),其中\(\mathbf{R}_i\)是工作相关矩阵(独立、可交换或AR(1))。 - profile估计:内层方程(8)估计\(\boldsymbol{\gamma}\),外层方程(9)估计\(\boldsymbol{\theta}\)。 - BEL:公式(11)-(13),以subject为块,估计函数\(\mathbf{g}_i(\boldsymbol{\theta})\)定义于(10)。
假设(Section 4.1): 1. 采样与簇大小:subject独立,簇大小有界(\(\max_i m_i \le M\))。 2. 协变量与矩:协变量有界紧集,\(\mathbb{E}\|\mathbf{g}_{i,0}(\boldsymbol{\theta}_0)\|_2^4 < \infty\)。 3. 链接与方差正则性:逆链接二次可微,方差函数连续有界,\(\dot{\mu}_{ij}\)有界远离0和∞。 4. \(\eta_0\)光滑性:\(s \ge 2\)次连续可微。 5. 指数支撑与密度:单指数\(U_{ij,0}\)落在紧区间,密度有界。 6. 筛维数增长:\(K \to \infty\),\(K^2/n \to 0\),\(\sqrt{n} K^{-s} \to 0\)。 7. 工作协方差:特征值一致有界;若更新\(\boldsymbol{\rho}\),则收敛到确定性极限。 8. 局部可识别性与非奇异性:\(\|\boldsymbol{\phi}_0\|_2 < 1\),\(\mathbf{H}_0\)非奇异。
相比已有文献:假设6是关键的放宽条件——它允许K增长但足够慢,使得筛偏差和方差在\(\sqrt{n}\)尺度下可忽略。这与Liang et al. (2010)的纵向部分线性单指标模型类似,但本文额外要求\(K^2/n \to 0\)(而非\(K/n \to 0\)),这是为了控制profile估计的均匀性。
主要结果¶
定理1(相合性与收敛速度):存在profile估计\(\widehat{\boldsymbol{\theta}}\)满足\(\|\widehat{\boldsymbol{\theta}} - \boldsymbol{\theta}_0\|_2 = O_P(n^{-1/2})\);且\(\sup_u |\widehat{\eta}(u) - \eta_0(u)| = O_P(K^{-s} + \sqrt{K/n})\)。
定理2(渐近正态性):\(\sqrt{n}(\widehat{\boldsymbol{\theta}} - \boldsymbol{\theta}_0) \Rightarrow N(\mathbf{0}, \mathbf{H}_0^{-1} \mathbf{S}_0 (\mathbf{H}_0^{-1})^\top)\),其中\(\mathbf{H}_0\)是profile估计方程的雅可比,\(\mathbf{S}_0\)是估计函数的方差。
定理3(Wilks现象):BEL统计量\(\ell(\boldsymbol{\theta}_0) \Rightarrow \chi^2_d\);profile BEL统计量\(\ell_{\text{prof}}(\boldsymbol{\theta}_{1,0}) \Rightarrow \chi^2_r\)(r为子向量维数)。
直觉:定理1和2是profile GEE的标准结果,但需要验证筛估计的均匀性(引理3)。定理3依赖于引理1(BEL的二次展开),其核心是证明\(\mathbf{g}_i(\boldsymbol{\theta}_0)\)的i.i.d.性质和profile估计误差的渐近可忽略性。
必要条件:假设6(\(K^2/n \to 0\))确保筛偏差和方差在\(\sqrt{n}\)尺度下可忽略;假设8确保局部可识别。
解决的技术难点:profile估计中,\(\boldsymbol{\gamma}\)的维数K增长,需要证明\(\widehat{\boldsymbol{\gamma}}(\boldsymbol{\theta})\)的一致性和均匀性(引理3),以及profile估计方程的可微性和线性化(引理4)。这些通过经验过程理论和隐函数定理实现。
证明路线与技术技巧¶
整体路线(3-5步): 1. 筛近似:用B样条逼近\(\eta_0\),控制逼近误差为\(O(K^{-s})\)(引理2)。 2. 内层估计的一致性:对每个\(\boldsymbol{\theta}\),证明样条系数估计\(\widehat{\boldsymbol{\gamma}}(\boldsymbol{\theta})\)在\(\boldsymbol{\theta}\)的邻域内一致收敛到其总体版本\(\boldsymbol{\gamma}_0(\boldsymbol{\theta})\),速度为\(O_P(\sqrt{K/n} + K^{-s})\)(引理3)。关键:利用经验过程控制样本方程与总体方程的偏差,结合雅可比的一致可逆性。 3. profile估计方程的线性化:证明样本profile估计函数\(\mathbf{U}_n(\boldsymbol{\theta})\)可近似为\(\mathbf{U}_{n,0}(\boldsymbol{\theta})\)(用总体\(\boldsymbol{\gamma}_0\)代替估计),且后者在\(\boldsymbol{\theta}_0\)附近可线性展开(引理4)。这需要证明profile估计误差是\(o_P(n^{-1/2})\)(由假设6保证)。 4. 参数估计的渐近性质:由线性化得到\(\widehat{\boldsymbol{\theta}}\)的\(\sqrt{n}\)-相合性和渐近正态性(定理1,2)。 5. BEL的二次展开:在\(\boldsymbol{\theta}_0\)处,证明拉格朗日乘子\(\boldsymbol{\lambda}\)的显式表达式(引理5),然后展开\(\ell(\boldsymbol{\theta}_0)\)得到\(n \bar{\mathbf{g}}^\top \mathbf{S}_n^{-1} \bar{\mathbf{g}} + o_P(1)\)(引理1)。最后用CLT得到\(\chi^2\)极限(定理3)。
关键跳跃点: - 引理3的证明:需要同时控制\(\boldsymbol{\theta}\)和\(\boldsymbol{\gamma}\)的变化。作者利用\(\boldsymbol{\theta}\)的紧邻域和\(\boldsymbol{\gamma}\)的有界集,通过经验过程得到均匀收敛速度。难点在于K增长时,函数类的复杂度增加,但作者假设\(K^2/n \to 0\)使得\(\sqrt{K/n}\)项可控。 - 引理4的线性化:需要证明\(\mathbf{U}_n(\boldsymbol{\theta}) - \mathbf{U}_{n,0}(\boldsymbol{\theta}) = o_P(n^{-1/2})\)。这依赖于引理3的均匀速度以及\(\mathbf{g}_i\)对\(\boldsymbol{\gamma}\)的Lipschitz性质。假设6(\(\sqrt{n}K^{-s} \to 0\)和\(K^2/n \to 0\))确保该余项可忽略。 - 引理5(EL乘子展开):需要验证凸包条件(原点在\(\{\mathbf{g}_i\}\)的凸包内)和\(\max_i |\boldsymbol{\lambda}^\top \mathbf{g}_i| = o_P(1)\)。由于\(\mathbf{g}_i\)是i.i.d.且方差非退化,标准EL论证成立。
技术技巧点名: - 样条筛:用B样条近似非参数函数,控制偏差和方差。 - 经验过程:用于证明内层估计的均匀收敛(引理3),处理K增长时的函数类复杂度。 - 隐函数定理:用于建立\(\boldsymbol{\gamma}_0(\boldsymbol{\theta})\)的Lipschitz性质(引理3证明中)。 - EL的拉格朗日乘子展开:标准技巧,但需要验证profile估计误差不影响展开(引理5)。 - 分块论证:将subject视为独立块,利用i.i.d.结构简化EL理论。
真实例子与应用¶
数据:epil数据集(MASS包),来自纵向癫痫研究,1852个观测。响应变量:癫痫发作次数(计数)。协变量:治疗指示、基线严重程度、年龄等。时间:随访期。
方法应用:拟合模型(19):\(\log \mathbb{E}(Y_{ij} \mid \mathbf{X}_{ij}, t_{ij}) = \mathbf{X}_{ij}^\top \boldsymbol{\theta} + \eta(t_{ij})\),其中\(t_{ij}\)是标准化时间。用B样条近似\(\eta\),K由BIC选择。比较四种方法:Profile-BEL、Naive-EL(忽略相关)、GEE-Wald、GEE-Poly(多项式近似\(\eta\))。工作相关取独立、AR(1)、可交换。
结果: - 预测性能(表5):Profile-BEL在独立和AR(1)工作相关下取得最低的交叉验证Poisson偏差(4.5251和4.5113),优于其他方法。 - 参数推断(表6):治疗系数\(\theta_{\text{trt}}\)的Profile-BEL置信区间在独立和AR(1)下排除零(如[-0.306, -0.020]),而GEE-Wald和Naive-EL的区间包含零。基线严重程度系数\(\theta_{\text{base}}\)的Profile-BEL区间更窄(如[0.585, 0.640] vs GEE-Wald [0.540, 0.670])。 - 稳定性(表7):Profile-BEL的CI长度跨工作相关的变化范围最小(如\(\theta_{\text{trt}}\)的Range=0.1161,远小于GEE-Wald的0.2726)。 - 非参数分量(图3):Profile-BEL估计的\(\eta(t)\)在独立和AR(1)下形状相似,bootstrap置信带合理;而GEE-Poly的估计在可交换相关下偏离。
这个例子想说明:Profile-BEL在实际纵向数据中能提供更紧、更稳定的置信区间,且对工作相关选择不敏感,验证了理论优势。
🔎 结论是否比证明窄¶
- 定理1和2的证明假设了簇大小有界(Assumption 1: \(\max_i m_i \le M\))。但结论陈述中未强调此条件,可能被泛化为“任意簇大小”。作者在Section 7的扩展中承认“bounded cluster size”是当前框架的限制,并提到研究\(m_i\)增长的情况。
- 定理3的证明依赖于引理1的二次展开,而引理1又依赖于引理5(EL乘子展开)和引理4(profile方程线性化)。这些引理都假设了Assumption 6(\(K^2/n \to 0\))。如果K增长更快(例如\(K \propto n^{1/2}\)),则\(K^2/n \to \text{常数}\),profile估计误差可能不再是\(o_P(n^{-1/2})\),Wilks现象可能失效。作者在模拟中K选为6-12(n=100-200),满足\(K^2/n \le 144/100=1.44\),并不严格满足\(K^2/n \to 0\)(因为n有限),但模拟显示近似有效。这是一个理论上的窄结论:定理要求K增长足够慢,但实际选择可能不严格满足。
- 定理3的profile版本(\(\ell_{\text{prof}} \Rightarrow \chi^2_r\))的证明在论文中仅简要提及(“by the same self-normalized CLT argument”),未给出详细论证。这依赖于分块信息矩阵的Schur补,但需要验证profile EL的二次近似在子向量上一致成立。这是一个潜在的gap:证明不够完整。
四、开放问题¶
-
簇大小增长的情况:当前假设\(\max_i m_i \le M\)固定。当\(m_i\)随n增长时(如密集纵向数据),subject-level的\(\mathbf{g}_i\)不再是i.i.d.同分布(因为\(m_i\)不同),且其维数可能变化。需要发展新的归一化或经验过程论证。扎根于Section 7:“First, the current framework assumes a bounded cluster size; it would be useful to study regimes where the number of repeated measurements grows with n, potentially requiring refined empirical-process arguments and alternative normalization.”
-
多指标扩展:允许\(\sum_{\ell=1}^L \eta_\ell(\mathbf{z}^\top \boldsymbol{\alpha}_\ell)\)。这增加了模型灵活性,但带来可识别性问题和计算复杂度(需要同时估计多个方向和链接)。扎根于Section 7:“Third, the index structure can be enriched by allowing multiple indices, leading to an additive multi-index link \(\sum_{\ell=1}^L \eta_\ell(\mathbf{z}^\top \boldsymbol{\alpha}_\ell)\) that balances interpretability and flexibility.”
-
高维线性分量:当p随n增长时,需要正则化(如Lasso)。如何将profile EL与惩罚估计方程结合,同时保持Wilks现象?扎根于Section 7:“Fourth, it is natural to consider high-dimensional linear components with structured regularization, where one can combine profiling with penalized estimating equations to enable variable selection in the presence of an unknown link function.”
-
缺失数据与不规则观测时间:当前假设完全观测和规则时间。实际纵向数据常有缺失或不等间隔。如何将BEL扩展到这些设定?扎根于Section 7:“Finally, extending the current methodology to handle irregular observation times, missingness mechanisms, and more complex measurement error structures would broaden its applicability in real longitudinal studies.”
提醒:要确认这些是否真gap,建议去读同子领域近期约5篇的intro(如Biometrics, JASA, Statistica Sinica上的纵向半参数EL论文)。如果多篇都指向同一方向,则是共识性gap;如果互相打架(如有的认为簇大小增长不影响,有的认为需要新方法),则是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub