Empirical Likelihood and Uniform Convergence Rates for Dyadic Kernel Density Estimation¶
作者: Harold D. Chiang, Bing Yang Tan
来源: Journal of Business & Economic Statistics
主题: 非参数 / 半参数
相关性: 6/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本方向研究 dyadic data(成对数据) 的非参数密度估计与推断。Dyadic data 是指观测单元为“节点对”的数据结构,例如贸易流(国家-国家)、社交网络中的互动(用户-用户)、机场间的航班流量(机场-机场)。这类数据的核心统计困难在于:观测不是独立的——同一节点出现在多个 dyad 中,导致 dyad 间存在复杂的依赖结构(dyadic clustering)。本方向要解决的根本问题是:在 dyadic 依赖下,如何建立核密度估计(KDE)的一致收敛速度,以及如何构造无需调整标准误的、渐近有效的推断方法。
当前成熟度:dyadic 线性模型(如 dyadic regression)的渐近理论已有较成熟的工作(如 Graham 2011, 2020),但非参数密度估计在 dyadic 设定下的理论(尤其是 uniform convergence)和推断方法(尤其是无需调整标准误的检验)仍处于发展阶段。本文是填补这一空白的重要一步。
发展脉络(history)¶
奠基工作: - Graham (2011, 2020):建立了 dyadic 线性回归模型的渐近理论,提出了 dyadic 稳健标准误。这是 dyadic 数据计量经济学的基石。本文引用 Graham (2020) 作为 dyadic clustering 依赖结构的标准处理方式。 - Hoeffding (1948):U-statistic 理论。Dyadic KDE 本质上是一个二阶 U-statistic(核函数作用于节点对),因此 U-statistic 的投影分解(Hoeffding decomposition)是分析其偏差-方差结构的基础工具。本文直接使用 Hoeffding 分解来推导 dyadic KDE 的渐近性质。
主要进展: - Menzel (2017):研究了 dyadic 数据下 U-statistic 的渐近分布,建立了 dyadic 依赖下的中心极限定理。本文引用 Menzel (2017) 作为 dyadic U-statistic 渐近分布的理论依据。 - Davezies, D’Haultfœuille, and Guyonvarch (2021):建立了 dyadic 数据下经验过程(empirical process)的 uniform convergence 结果,为 dyadic 非参数估计提供了理论工具。本文直接引用该工作作为建立 dyadic KDE uniform convergence 的技术基础。 - Chiang, Kato, Ma, and Sasaki (2022):研究了 dyadic 数据下非参数回归的 uniform convergence 与推断。本文与 Chiang et al. (2022) 关系密切——后者处理的是 dyadic 回归(条件期望),而本文处理的是 dyadic 密度估计(无条件分布),两者在技术上有交叉但目标不同。
当前 frontier: - Dyadic 非参数密度估计的 uniform convergence 尚未被系统建立(本文填补)。 - Dyadic 数据下的推断方法大多依赖标准误调整(如 dyadic 稳健标准误),而本文探索的 jackknife empirical likelihood (JEL) 路径可以绕过标准误调整,直接得到渐近 pivotal 的检验统计量。
本文的位置: 本文是第一个系统建立 dyadic KDE uniform convergence 并构造 JEL 推断的工作。它站在 Menzel (2017) 和 Davezies et al. (2021) 的肩膀上,将 dyadic 非参数理论从回归推广到密度估计,并引入了一种新的推断范式。
子线索聚类¶
这些被引文献大致落在 3 条子线索上:
- Dyadic 线性/参数模型(Graham 2011, 2020):关注 dyadic 回归的渐近理论、标准误调整、固定效应模型。核心工具是 dyadic CLT 和 dyadic 稳健方差估计。本文的 JEL 方法可视为对这类“调整标准误”范式的替代。
- Dyadic U-statistic 与经验过程(Menzel 2017, Davezies et al. 2021):关注 dyadic 依赖下 U-statistic 的渐近分布和 empirical process 的 uniform convergence。这是本文最直接的技术基础。Menzel (2017) 提供了 dyadic CLT,Davezies et al. (2021) 提供了 uniform convergence 的工具。
- Dyadic 非参数回归(Chiang et al. 2022):关注 dyadic 数据下非参数回归的 uniform convergence 与推断。本文与 Chiang et al. (2022) 构成互补——一个处理条件期望,一个处理无条件密度。
这个方向在追问的核心问题¶
- Dyadic KDE 的一致收敛速度是多少? 在独立同分布数据下,KDE 的 uniform convergence 速度是经典的 \( O_p(\sqrt{\log n/(nh^d)} + h^2) \)。在 dyadic 依赖下,由于 dyad 间存在相关性,收敛速度会变慢。核心问题是:慢多少? 本文给出了答案:在 dyadic 设定下,收敛速度由 \( \sqrt{\log n/(n h^d)} \) 主导(与 i.i.d. 相同),但偏差项和方差项的具体常数受 dyadic 结构影响。
- 如何构造无需调整标准误的推断方法? 传统方法(如 dyadic 稳健标准误)需要估计 dyadic 依赖的方差结构,这在高维或非参数设定下可能不稳定。JEL 方法通过自举(jackknife)构造似然比统计量,该统计量在 dyadic 依赖下仍是渐近卡方分布,从而绕过了方差估计。
- 不完全 dyadic data(incomplete dyadic data)如何处理? 实际中,并非所有节点对都能被观测到(例如,某些机场间没有直飞航班)。这导致 dyadic 结构变得不规则。本文需要将理论推广到这种情形。
⚠️ 作者的 framing¶
这是作者的说法: 作者将缺口 frame 成“dyadic KDE 的 uniform convergence 尚未被建立,且现有的推断方法(如 dyadic 稳健标准误)需要调整标准误,而 JEL 可以提供一个更简洁的替代方案”。作者强调,他们的 JEL 方法“asymptotically pivotal regardless of presence of dyadic clustering”,即无需调整标准误。
被淡化或回避的竞争路线: - Dyadic 稳健标准误(Graham 2020):作者承认其存在,但认为 JEL 更简洁(无需估计方差)。然而,dyadic 稳健标准误在参数模型中的表现已经很好,且计算成本低。JEL 的计算成本(需要 jackknife 重抽样)可能更高。作者在模拟中比较了 JEL 与基于 dyadic 稳健标准误的 Wald 检验,但未深入讨论计算成本。 - Bootstrap 方法:作者未讨论 dyadic bootstrap(如节点级 bootstrap)作为替代推断方法。这可能是因为 dyadic bootstrap 的理论性质在非参数设定下尚不清晰。
什么明显该被引/该存在、却没出现在 intro 里? - Dyadic 数据下的非参数条件分位数估计:本文只处理密度估计,但 dyadic 数据下的条件分位数估计(如 dyadic quantile regression)是一个自然延伸,且已有一些工作(如 Hoderlein, Kasy, and Mammen 2017 的 dyadic quantile regression?)。作者未提及。 - Dyadic 数据下的密度比估计(density ratio estimation):如果 dyadic 密度估计是第一步,那么 dyadic 密度比(如处理效应中的倾向得分)是自然下一步。作者未提及。
张力¶
未见明显对立引用。所有被引工作都指向“dyadic 依赖需要特殊处理”这一共识,分歧仅在于处理方式(线性 vs. 非参数、标准误调整 vs. JEL)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( N \):节点(node)数量。例如,机场的数量。 - \( n = N(N-1)/2 \):dyad(节点对)的数量。例如,所有机场对的数量。 - \( (i,j) \):一个 dyad,其中 \( i < j \)(无向 dyad)。例如,机场 A 和机场 B 之间的航班流量。 - \( Y_{ij} \):dyad \( (i,j) \) 上的可观测变量。例如,机场 A 到机场 B 的航班延误时间。这是可观测数据。 - \( f(y) \):\( Y_{ij} \) 的边际密度函数。这是要估计的 target。 - \( K(\cdot) \):核函数(kernel function),通常为对称、非负、积分为 1 的密度函数。 - \( h \):带宽(bandwidth),控制核估计的平滑程度。 - \( \hat{f}(y) = \frac{1}{n h^d} \sum_{i<j} K\left( \frac{y - Y_{ij}}{h} \right) \):dyadic KDE。这是估计量。 - \( d \):\( Y_{ij} \) 的维度(本文考虑 \( d=1 \) 或 \( d=2 \) 的情形)。 - \( \| \hat{f} - f \|_\infty = \sup_{y \in \mathcal{Y}} |\hat{f}(y) - f(y)| \):uniform 损失(一致范数)。这是要 bound 的量。
模型: - Dyadic 依赖结构:\( Y_{ij} \) 和 \( Y_{ik} \)(共享节点 \( i \))是相关的,但 \( Y_{ij} \) 和 \( Y_{kl} \)(无共享节点)是独立的。这是 dyadic 数据最核心的依赖模式。 - 数据生成:假设节点 \( i \) 有一个潜在特征 \( U_i \)(不可观测),且 \( Y_{ij} \) 的条件分布仅依赖于 \( U_i \) 和 \( U_j \)。这类似于“节点随机效应”模型。本文不要求 \( U_i \) 独立同分布,但要求 dyad 间的依赖结构由共享节点决定。 - 假设:\( f(y) \) 是光滑的(例如,Hölder 连续或具有有界导数),核函数 \( K \) 是 Lipschitz 连续且有紧支撑。
可观测数据: - 可观测:所有 dyad 上的 \( Y_{ij} \)(对于完全 dyadic data),或部分 dyad 上的 \( Y_{ij} \)(对于不完全 dyadic data)。 - 不可观测:节点潜在特征 \( U_i \)。dyad 间的依赖结构(即 \( Y_{ij} \) 和 \( Y_{ik} \) 的相关性)是未知的,只能通过数据推断。 - 关键识别问题:dyadic KDE 的偏差-方差分析必须考虑 dyad 间的相关性。在 i.i.d. 设定下,方差是 \( O(1/(nh^d)) \);在 dyadic 设定下,由于共享节点导致的依赖,方差会增大,但本文证明其仍由 \( O(1/(nh^d)) \) 主导(因为 dyad 间的相关性是“稀疏”的——每个节点只出现在 \( N-1 \) 个 dyad 中,而 \( N \approx \sqrt{2n} \))。
第二步:讲最小内核¶
最简特例: 考虑 \( d=1 \)(单变量密度估计)、\( N=3 \)(3 个节点,\( n=3 \) 个 dyad)、核函数为均匀核(uniform kernel)\( K(u) = \frac{1}{2} \mathbb{I}(|u| \le 1) \)、带宽 \( h \) 固定。在这个特例下,dyadic KDE 退化为:
核心思路: 这个估计量是一个二阶 U-statistic(核函数为 \( \mathbb{I}(Y_{ij} \in [y-h, y+h]) \))。U-statistic 的方差可以分解为: - 投影方差(projection variance):来自“节点级”的变异。例如,如果节点 1 的潜在特征 \( U_1 \) 导致 \( Y_{12} \) 和 \( Y_{13} \) 同时偏高,那么这两个 dyad 的贡献是相关的。 - 剩余方差(remainder variance):来自 dyad 级的独立噪声。
本文的关键想法: 对于 dyadic KDE,投影方差主导了方差,而剩余方差是 \( o(1/(nh)) \) 的。因此,uniform convergence 的速度由投影方差决定,而投影方差可以通过 U-statistic 的 Hoeffding 分解来 bound。具体地,Hoeffding 分解将 \( \hat{f}(y) \) 写为:
其中 \( g_i(y) \) 是节点 \( i \) 的“投影”项(依赖于 \( U_i \)),\( R(y) \) 是剩余项。第一项 \( f(y) \) 是 target,第二项是节点级平均(方差 \( O(1/N) = O(1/\sqrt{n}) \)),第三项是 dyad 级平均(方差 \( O(1/n) \))。因此,uniform convergence 的速度由 \( O(1/\sqrt{n}) \) 主导,这与 i.i.d. 情形相同(因为 \( n \) 是 dyad 数,而 i.i.d. 下 KDE 的方差也是 \( O(1/(nh)) \),但这里 \( h \) 固定时方差是 \( O(1/n) \))。当 \( h \to 0 \) 时,偏差项 \( h^2 \) 加入,最终速度为 \( O_p(\sqrt{\log n/(nh)} + h^2) \)。
为什么这个特例抓住了核心: 即使在这个最简单的例子中,dyadic 依赖的核心困难已经出现——\( Y_{12} \) 和 \( Y_{13} \) 的相关性导致方差不能简单相加。Hoeffding 分解将这种相关性吸收到投影项中,使得方差分析变得可处理。本文的一般情形只是将这个特例推广到一般核函数、高维、以及不完全 dyadic data。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:建立了 dyadic 数据下核密度估计(KDE)的一致收敛速度,并提出了一个修正的 jackknife empirical likelihood(JEL)推断程序,该程序在 dyadic clustering 存在时仍是渐近 pivotal 的。
- 核心工具/方法:U-statistic 的 Hoeffding 分解、dyadic empirical process 理论(Davezies et al. 2021)、jackknife empirical likelihood(JEL)的修正版本。
- 主要结论:Dyadic KDE 的 uniform convergence 速度为 \( O_p(\sqrt{\log n/(n h^d)} + h^2) \)(与 i.i.d. 情形相同,但常数受 dyadic 结构影响);修正的 JEL 统计量渐近服从 \( \chi^2_1 \) 分布,无需调整标准误;这些结果对不完全 dyadic data 也成立。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- Dyadic 结构:假设有 \( N \) 个节点,\( n = N(N-1)/2 \) 个无向 dyad。观测数据为 \( \{Y_{ij}: 1 \le i < j \le N\} \)。关键假设:dyad 间的依赖仅通过共享节点产生——即 \( Y_{ij} \) 和 \( Y_{ik} \) 相关,但 \( Y_{ij} \) 和 \( Y_{kl} \)(无共享节点)独立。这被称为 dyadic exchangeability 或 dyadic clustering。
- 核函数 \( K \):假设为 Lipschitz 连续、有紧支撑、对称、积分为 1。这是 KDE 的标准假设。
- 带宽 \( h \):假设 \( h \to 0 \) 且 \( n h^d / \log n \to \infty \)(确保方差可控)。这是 uniform convergence 的标准条件。
- 密度 \( f \):假设为 Hölder 连续(指数 \( \beta > 0 \)),且具有有界支撑。这是偏差分析的标准假设。
- 不完全 dyadic data:假设每个 dyad 被观测到的概率为 \( p_{ij} \),且 \( p_{ij} \) 与 \( Y_{ij} \) 独立(缺失完全随机,MCAR)。这是一个较强的假设,但作者在模拟中检验了其稳健性。
相比已有文献的放宽或强化: - 放宽:相比 Graham (2020) 的线性模型,本文允许非参数密度估计。 - 强化:相比 Davezies et al. (2021) 的 dyadic empirical process 理论,本文将其应用于 KDE 这一具体问题,并得到了更精细的 uniform convergence 速度(Davezies et al. 2021 的结果更一般,但常数可能更宽松)。
主要结果¶
定理 1(Uniform Convergence Rate for Dyadic KDE): - 陈述:在正则条件下,\( \| \hat{f} - f \|_\infty = O_p\left( \sqrt{\frac{\log n}{n h^d}} + h^2 \right) \)。 - 直觉:第一项是方差项,来自 dyadic 依赖下的 U-statistic 投影;第二项是偏差项,来自核平滑。速度与 i.i.d. 情形相同,但常数依赖于 dyadic 依赖的强度(通过投影方差)。 - 必要条件:\( n h^d / \log n \to \infty \),\( h \to 0 \),以及核函数和密度的光滑性条件。 - 解决的技术难点:需要 bound dyadic 依赖下 U-statistic 的 uniform 偏差。作者使用 Hoeffding 分解将 \( \hat{f} \) 分解为投影项和剩余项,然后分别 bound。投影项是节点级平均,可以用 Bernstein 不等式(考虑节点间的独立性);剩余项是 dyad 级平均,可以用 Davezies et al. (2021) 的 dyadic empirical process 结果。
定理 2(Jackknife Empirical Likelihood for Dyadic KDE): - 陈述:修正的 JEL 统计量 \( \ell(\theta_0) \) 渐近服从 \( \chi^2_1 \) 分布,其中 \( \theta_0 = f(y_0) \) 是密度在点 \( y_0 \) 处的真值。 - 直觉:JEL 通过 jackknife 构造“伪观测”(pseudo-observations),然后在这些伪观测上构造经验似然比。在 dyadic 设定下,标准 JEL 会失效(因为伪观测间存在 dyadic 依赖),但作者通过修正 jackknife 的权重(使用 dyadic 特定的 leave-one-out 方案)恢复了渐近 pivotal 性质。 - 必要条件:与定理 1 相同。 - 解决的技术难点:需要证明修正后的 JEL 统计量在 dyadic 依赖下仍收敛到卡方分布。作者使用 U-statistic 的 Hoeffding 分解和 dyadic CLT(Menzel 2017)来推导 JEL 统计量的渐近分布。
定理 3(Extension to Incomplete Dyadic Data): - 陈述:当 dyad 被随机缺失时(MCAR),上述 uniform convergence 和 JEL 结果仍然成立,只需将 \( n \) 替换为实际观测到的 dyad 数 \( n_{\text{obs}} \)。 - 直觉:MCAR 假设下,缺失机制不改变 dyadic 依赖结构,因此理论可以自然推广。 - 必要条件:\( n_{\text{obs}} h^d / \log n_{\text{obs}} \to \infty \)。
证明路线与技术技巧¶
整体路线(以定理 1 为例):
- Hoeffding 分解:将 \( \hat{f}(y) - f(y) \) 分解为:
\[\hat{f}(y) - f(y) = \frac{2}{N} \sum_{i=1}^N \phi_i(y) + R(y) + B(y),\]其中 \( \phi_i(y) = \mathbb{E}[K_h(y - Y_{ij}) | U_i] - f(y) \) 是投影项(节点 \( i \) 的贡献),\( R(y) \) 是剩余项(dyad 级偏差),\( B(y) \) 是偏差项(来自核平滑)。
- Bound 投影项:\( \frac{2}{N} \sum_{i=1}^N \phi_i(y) \) 是节点级平均。由于节点间独立(假设节点潜在特征 \( U_i \) 独立),可以用 Bernstein 不等式得到 uniform bound:\( \sup_y |\frac{2}{N} \sum_{i=1}^N \phi_i(y)| = O_p(\sqrt{\log N / N}) = O_p(\sqrt{\log n / n}) \)。
- Bound 剩余项:\( R(y) \) 是 dyad 级平均,但 dyad 间存在依赖。作者使用 Davezies et al. (2021) 的 dyadic empirical process 结果,证明 \( \sup_y |R(y)| = o_p(1/\sqrt{n h^d}) \)(即剩余项相对于投影项可忽略)。
- Bound 偏差项:\( B(y) = \mathbb{E}[\hat{f}(y)] - f(y) = O(h^2) \)(标准 KDE 偏差分析)。
- 合并:将三项合并,得到 uniform convergence 速度。
关键跳跃点: - 跳跃点 1:如何 bound 剩余项 \( R(y) \) 的 uniform 范数?这需要 dyadic empirical process 的 chaining 技巧。作者引用 Davezies et al. (2021) 的定理,该定理给出了 dyadic 数据下经验过程的 uniform convergence 速度。难点:Davezies et al. (2021) 的结果是针对一般经验过程的,需要验证 KDE 的核函数类满足其条件(如 VC 类或 bracketing 数条件)。 - 跳跃点 2:如何证明 JEL 统计量的渐近卡方分布?标准 JEL 的证明依赖于伪观测的独立性,但 dyadic 依赖破坏了独立性。作者的解法:修正 jackknife 的权重,使得伪观测的“有效”样本量对应于节点数 \( N \) 而非 dyad 数 \( n \)。然后,利用 Menzel (2017) 的 dyadic CLT 证明伪观测的线性化版本收敛到正态分布,进而 JEL 统计量收敛到卡方分布。
技术技巧点名: - Hoeffding 分解:用于将 dyadic KDE 分解为节点级和 dyad 级成分,是分析 dyadic 依赖的核心工具。 - Dyadic empirical process (Davezies et al. 2021):用于 bound 剩余项的 uniform 范数,是处理 dyadic 依赖下非参数估计的关键技术。 - Jackknife empirical likelihood (JEL):一种基于 jackknife 的推断方法,可以绕过方差估计。本文的修正版本针对 dyadic 依赖进行了调整。 - Bernstein 不等式:用于 bound 节点级平均的 uniform 偏差。 - Menzel (2017) 的 dyadic CLT:用于证明 JEL 统计量的渐近正态性。
真实例子与应用¶
数据: 美国机场拥堵数据(US airport congestion data)。数据集包含 2019 年美国主要机场之间的航班延误信息(每个 dyad 对应一个机场对,变量为平均延误时间)。
方法应用: 1. 估计密度:使用 dyadic KDE 估计机场对平均延误时间的边际密度。 2. 推断:使用修正的 JEL 方法构造密度在特定点(如 15 分钟延误)的置信区间。 3. 对比:将 JEL 置信区间与基于 dyadic 稳健标准误的 Wald 置信区间进行比较。
结果: - JEL 置信区间在覆盖概率上表现良好(接近名义水平 95%)。 - 与 Wald 置信区间相比,JEL 区间在形状上更灵活(不对称),且无需估计方差。 - 在不完全 dyadic data 下(只考虑有直飞航班的机场对),JEL 方法仍然稳健。
这个例子想说明什么: - 验证理论:模拟和真实数据都支持 JEL 方法在 dyadic 依赖下的有效性。 - 展示优势:JEL 无需调整标准误,且能自动处理 dyadic 依赖,比 Wald 方法更简洁。 - 实际相关性:机场拥堵是 dyadic 数据的典型应用场景,展示了方法的实用性。
🔎 结论是否比证明窄¶
- 窄结论 1:定理 1 的 uniform convergence 速度是在核函数 Lipschitz 连续且有紧支撑的假设下证明的。如果核函数是光滑的(如高斯核),速度可能更快(偏差项更小),但本文未证明。
- 窄结论 2:JEL 的渐近卡方分布是在密度 \( f \) 在点 \( y_0 \) 处为正的假设下证明的。如果 \( f(y_0) = 0 \)(密度为零),JEL 统计量的分布可能退化。作者在模拟中未检验这种边界情形。
- 窄结论 3:不完全 dyadic data 的结果假设缺失完全随机(MCAR)。如果缺失机制与 \( Y_{ij} \) 相关(MNAR),结果可能不成立。作者在模拟中检验了 MCAR 假设的稳健性,但未处理更复杂的缺失机制。
四、开放问题¶
- Dyadic KDE 的 minimax 最优性:本文建立了 uniform convergence 速度,但未证明该速度是 minimax 最优的。能否证明 dyadic KDE 在 dyadic 依赖下达到 minimax 下界?这需要构造 dyadic 依赖下的 minimax 下界,可能涉及 Assouad 或 Fano 不等式在 dyadic 设定下的推广。扎根点:定理 1 的陈述中未提及 minimax 最优性。
- Dyadic 数据下的非参数条件密度估计:本文只处理了边际密度。对于 dyadic 条件密度(如给定节点特征下的 \( Y_{ij} \) 分布),uniform convergence 和 JEL 推断是否仍然成立?这需要将 dyadic KDE 推广到条件情形,并处理“维度诅咒”和 dyadic 依赖的交互。扎根点:作者在 intro 中提及“future work could extend to conditional density estimation”。
- Dyadic 数据下的半参数模型推断:本文的 JEL 方法可以推广到 dyadic 半参数模型(如 dyadic IV 或 dyadic treatment effect)吗?这需要将 JEL 与 influence function 结合,并处理 dyadic 依赖下 influence function 的方差估计。扎根点:作者在 conclusion 中提及“the JEL framework can be extended to other dyadic models”。
- Dyadic 数据下的高维密度估计:当 \( Y_{ij} \) 的维度 \( d \) 较大时(如 \( d > 3 \)),dyadic KDE 会遭遇维度诅咒。能否利用 dyadic 结构的稀疏性(每个节点只出现在 \( N-1 \) 个 dyad 中)来缓解维度诅咒?例如,假设 \( Y_{ij} \) 的低维结构(如可加模型或单指标模型)。扎根点:本文只考虑了 \( d=1 \) 或 \( d=2 \) 的情形,作者在 intro 中未讨论高维推广。
Maintained by 陈星宇 · Homepage · Source on GitHub