On efficiency gains via augmenting a tiny sample with a massive auxiliary sample¶
作者: Yen-Chi Chen
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.26610
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:如何利用一个海量但存在选择偏差的辅助样本,来提升对一个极小目标样本的统计推断效率? 这是一个典型的“数据不平衡”或“传输学习”问题。研究者拥有两个样本:一个来自目标总体(样本量极小,记为 \(n_0\)),另一个来自一个与目标总体分布不同但相关的辅助总体(样本量极大,记为 \(n_1 \gg n_0\))。核心挑战在于,如何借用辅助样本的信息来更精确地估计目标总体的参数或分布,同时校正两个总体之间的偏差。这个问题的成熟度处于理论探索与实证应用并行的阶段:在调查抽样和流行病学中已有大量应用(如数据整合、非概率样本校准),但其效率理论,特别是“在什么条件下辅助样本能带来超越目标样本量的收敛速率”,在本文之前尚不清晰。
发展脉络(history)¶
- 奠基工作:Tukey's factorization 与密度比模型。Tukey (1986) 提出了将联合分布分解为目标分布与 odds 的乘积形式,为后续方法提供了统一的代数框架。Anderson (1972) 和 Prentice & Pyke (1979) 在病例-对照研究中建立了 logistic 回归与密度比模型的联系,奠定了 odds 模型在选择性抽样中的核心地位。
- 主要进展:IPW 与 FL 方法的并行发展。
- IPW 路线:Robins, Rotnitzky & Zhao (1994) 将逆概率加权系统引入缺失数据和因果推断,成为处理选择偏差的标准工具。在数据整合领域,Elliott & Valliant (2017) 和 Chen, Li & Wu (2020) 将 IPW 用于非概率样本的校准,但其主要关注点是一致性和偏差校正,而非效率提升。作者指出:“Most related work in statistics frames this as ‘data integration’ within survey sampling, where the goal is to adjust non-probability samples using probability reference samples [8, 4, 17, 13, 33, 10].” 这些工作为 IPW 提供了稳健性基础,但留下了效率瓶颈。
- FL 路线:Qin, Leung & Shao (2002) 和 Little & Rubin (2019) 提出了联合建模目标分布与缺失机制的完整似然方法。在机器学习中,Sugiyama et al. (2012) 和 Gretton et al. (2009) 在协变量偏移下发展了密度比估计。然而,作者强调:“the exact conditions under which a massive auxiliary sample yields a fast convergence rate for target parameters remain theoretically obscure in the statistical literature.” 即 FL 方法的效率增益条件是未解之谜。
- 当前 frontier 与本文位置:本文直接切入这个理论空白。作者通过一个简单的高斯-逻辑斯蒂模型(Gaussian-logistic model)作为引子,展示了 FL 方法在估计方差参数时能达到惊人的效率提升(MSE 比 IPW 小近 100 倍),并由此提出“完全效率增益”(full efficiency gain)的概念。本文的核心贡献在于:系统性地刻画了 FL 方法在指数族模型下实现完全效率增益的几何条件(参数正交性),并对比了 IPW 方法在非参数设定下的“参数速率”效率增益。本文是 Chen 系列工作(如 Suen & Chen, 2026 关于共轭 odds 的工作)的一部分,将 Tukey 分解从缺失数据推广到数据整合的效率理论。
子线索聚类¶
- 数据整合与调查抽样:以 Elliott & Valliant (2017), Chen, Li & Wu (2020), Kim & Tam (2021) 为代表。核心是稳健性,使用 IPW 或校准方法校正非概率样本的偏差,目标通常是总体均值或总量。效率不是首要目标。
- 传输学习与协变量偏移:以 Sugiyama et al. (2012), Gretton et al. (2009), Shimodaira (2000) 为代表。核心是密度比估计,通过加权辅助样本使其分布接近目标分布。方法上偏向于非参数或核方法,效率分析通常关注密度比本身的估计误差,而非目标参数的效率界。
- 因果推断中的敏感性分析与缺失数据:以 Franks, D'Amour & Feller (2020), Suen & Chen (2026) 为代表。核心是Tukey 分解在不可忽略缺失或未观测混杂下的应用,将识别问题转化为对 odds 函数的建模。本文的 FL 方法可视为这类框架在数据整合场景下的一个特例,其中 odds 模型被假设为已知形式(如 logistic)。
这个方向在追问的核心问题¶
- 一致性:当 \(n_0\) 固定、\(n_1 \to \infty\) 时,哪些参数能被一致估计?IPW 方法在此极限下失效,但 FL 方法可能成功。
- 效率增益的极限:辅助样本能将目标参数的收敛速率提升到多快?是 \(O_p(1/\sqrt{n_0})\)(目标样本速率)还是 \(O_p(1/\sqrt{n})\)(全样本速率)?
- 增益的条件:实现“完全效率增益”(全样本速率)需要目标分布和 odds 模型满足什么结构条件?参数正交性是否是关键?
- 稳健性与效率的权衡:FL 方法效率高但依赖模型正确性,IPW 方法稳健但效率受限。在实际应用中如何选择?
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口 frame 成“在什么条件下,FL 方法能让某些参数达到全样本收敛速率,而 IPW 方法不能”。通过一个引人注目的模拟(图1),作者将读者的注意力从“如何校正偏差”转移到“如何最大化效率增益”上。这使得本文成为“显然的下一步”:既然 IPW 受限于 \(n_0\),那么探索 FL 的潜力就是自然的方向。
- 被淡化或回避的竞争路线:
- 非参数密度比方法:如 Gretton et al. (2009) 的核均值匹配。作者在 Section 6 中讨论了非参数 IPW 的“参数速率”效率增益,但将其定位为“不同于完全效率增益的另一种现象”。作者没有深入比较 FL 与非参数密度比方法在效率上的优劣,而是将非参数方法归入 IPW 框架。
- 半参数效率理论:作者没有使用半参数效率界(efficient influence function)来刻画 FL 方法的效率上界,而是直接计算 Fisher 信息矩阵。这回避了在模型误设下效率界的复杂讨论(Remark 3 中仅提及 sandwich 形式)。
- 什么明显该被引/该存在、却没出现在 intro 里?
- 半参数效率理论文献:如 Bickel et al. (1993) 的《Efficient and Adaptive Estimation for Semiparametric Models》,或 Tsiatis (2006) 的《Semiparametric Theory and Missing Data》。这些文献为处理“部分可识别参数”的效率界提供了标准框架,与本文的“参数正交性”和“未识别曲线”概念高度相关。作者在证明中使用了 Fisher 信息矩阵的 Schur 补,这本质上是半参数效率计算的一个特例,但未明确引用。
- 传输学习中的 minimax 最优率:如 Blanchard et al. (2011) 或 Cortes et al. (2010) 关于协变量偏移下 minimax 风险的工作。这些工作可能为本文的“完全效率增益”提供更一般的下界视角。
张力¶
未见明显对立引用。所有被引工作基本认同 IPW 的稳健性和 FL 的潜在效率优势,但本文是第一个系统性地刻画 FL 效率增益条件的工作。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(X \in \mathbb{R}\):感兴趣的变量(可推广到多元)。
- \(A \in \{0, 1\}\):群体指示变量。\(A=0\) 表示来自目标总体(target population),\(A=1\) 表示来自辅助总体(auxiliary population)。
- \(n_0\):目标样本的样本量(极小)。
- \(n_1\):辅助样本的样本量(极大)。总样本量 \(n = n_0 + n_1\)。核心设定是 \(n_0 \ll n_1\),且 \(n_0 / n \to 0\)。
- \(p(x|A=0)\):目标总体的概率密度函数(PDF),是要估计的对象。
- \(p(x|A=1)\):辅助总体的 PDF,是可观测的。
- \(O(x) = \frac{P(A=1|x)}{P(A=0|x)}\):odds 函数,刻画了选择偏差。它是连接两个总体的桥梁。
- \(\mu, \sigma^2\):在 Gaussian 例子中,目标分布的均值和方差。
- \(\alpha, \beta\):在 logistic odds 模型中,\(\log O(x) = \alpha + \beta x\)。
- \(\lambda\):指数族模型中的自然参数。
- \(S(x)\):指数族模型中的充分统计量。
- \(T(x)\):odds 模型中用于线性预测的已知函数,\(\log O(x) = \alpha + \beta^T T(x)\)。
-
模型:
- 目标分布模型:假设 \(p(x|A=0)\) 属于一个参数族,例如指数族:\(p(x|A=0) = h(x) \exp\{\lambda^T S(x) - \Psi(\lambda)\}\)。
- Odds 模型:假设 odds 函数具有参数形式,例如广义线性模型:\(\log O(x) = \alpha + \beta^T T(x)\)。
- 数据生成机制:观测数据 \((X_i, A_i)\) 是独立同分布的,但 \(A_i\) 的分布依赖于 \(X_i\)(即选择偏差)。联合分布由 \(p(x|A=0)\) 和 \(O(x)\) 通过 Tukey 分解唯一确定。
-
可观测数据:
- 可观测:\(\{(X_i, A_i)\}_{i=1}^n\)。即我们知道每个观测来自哪个群体,以及该观测的 \(X\) 值。
- 想要但观测不到:我们想要的是目标总体的分布 \(p(x|A=0)\)。辅助样本的分布 \(p(x|A=1)\) 是偏差的,不能直接使用。我们只能通过 odds 模型 \(O(x)\) 来“校正”辅助样本,使其近似目标分布。
第二步:讲最小内核——高斯-逻辑斯蒂模型¶
本文的核心思路可以通过一个最简单的特例完全展现:目标分布是单变量高斯分布,odds 模型是 logistic 回归。
-
特例设定:
- 目标分布:\(X|A=0 \sim \mathcal{N}(\mu, \sigma^2)\)。参数 \(\mu\)(均值)和 \(\sigma^2\)(方差)是我们要估计的。
- Odds 模型:\(\log O(x) = \alpha + \beta x\)。参数 \(\alpha, \beta\) 是 nuisance 参数。
- 可观测数据:\(\{(X_i, A_i)\}_{i=1}^n\),其中 \(n_0\) 个来自目标,\(n_1\) 个来自辅助。
-
IPW 方法(两阶段):
- 估计 odds:用 logistic 回归拟合 \(A\) 对 \(X\),得到 \(\hat{\alpha}_{IPW}, \hat{\beta}_{IPW}\),从而得到 \(\hat{O}(x) = e^{\hat{\alpha}_{IPW} + \hat{\beta}_{IPW} x}\)。
- 加权估计目标参数:构造加权对数似然:
\[\ell_{IPW}(\mu, \sigma^2) = \sum_{i=1}^n \left[ (1-A_i) + \frac{A_i}{\hat{O}(X_i)} \right] \log \phi(X_i; \mu, \sigma^2)\]其中 \(\phi\) 是高斯密度。最大化这个加权似然得到 \(\hat{\mu}_{IPW}, \hat{\sigma}^2_{IPW}\)。
- 核心问题:\(\hat{\beta}_{IPW}\) 的收敛速率是 \(O_p(1/\sqrt{n_0})\),因为 logistic 回归中,有效样本量由较小的那个群体(目标样本)决定。这个慢速的 \(\hat{\beta}\) 会污染到第二阶段的 \(\hat{\mu}_{IPW}\) 和 \(\hat{\sigma}^2_{IPW}\),导致它们都只能达到 \(O_p(1/\sqrt{n_0})\) 的速率。IPW 无法利用辅助样本的大样本量来提升目标参数的估计效率。
-
FL 方法(单阶段):
- 写出联合似然:利用 Tukey 分解,写出单个观测 \((x, a)\) 的对数似然:
\[\ell(\mu, \sigma^2, \alpha, \beta | x, a) = \log \phi(x; \mu, \sigma^2) + a(\alpha + \beta x) - \log\left(1 + e^{\alpha + \mu\beta + \frac{1}{2}\beta^2\sigma^2}\right)\]注意,最后一项是归一化常数 \(\log P(A=0)\) 的显式表达式。
- 联合最大化:同时最大化所有四个参数:\((\hat{\mu}_{FL}, \hat{\sigma}^2_{FL}, \hat{\alpha}_{FL}, \hat{\beta}_{FL}) = \arg\max \sum_{i=1}^n \ell(\mu, \sigma^2, \alpha, \beta | X_i, A_i)\)。
- 核心洞察:为什么 FL 能成功?因为辅助样本的分布 \(p(x|A=1)\) 可以通过 Tukey 分解推导出来:
\[p(x|A=1) \propto p(x|A=0) \cdot O(x) \propto \exp\left\{ -\frac{(x-\mu)^2}{2\sigma^2} + \beta x \right\} \propto \exp\left\{ -\frac{(x - (\mu + \beta\sigma^2))^2}{2\sigma^2} \right\}\]这是一个均值为 \(\mu + \beta\sigma^2\)、方差为 \(\sigma^2\) 的高斯分布!关键发现:辅助样本的方差恰好等于目标样本的方差 \(\sigma^2\),与 \(\beta\) 无关。这意味着 \(\sigma^2\) 这个参数在辅助样本中是“完全可识别的”,不受 odds 模型参数 \(\beta\) 的干扰。因此,FL 方法可以利用海量辅助样本来精确估计 \(\sigma^2\),达到 \(O_p(1/\sqrt{n})\) 的全样本速率,即“完全效率增益”。而均值 \(\mu\) 则与 \(\beta\) 纠缠在一起(通过 \(\mu + \beta\sigma^2\)),只能达到 \(O_p(1/\sqrt{n_0})\) 的慢速。
- 写出联合似然:利用 Tukey 分解,写出单个观测 \((x, a)\) 的对数似然:
-
最小内核总结:本文的核心数学问题是:在指数族模型下,哪些参数与 odds 模型是“正交”的,从而能在 FL 框架下实现全样本收敛速率? 高斯-逻辑斯蒂模型展示了这个正交性的一个完美例子:方差参数 \(\sigma^2\) 与 odds 的线性项 \(\beta x\) 正交,因此受益于全样本。这个特例揭示了“参数正交性”是驱动完全效率增益的几何机制。
三、这篇论文做了什么¶
- 三句话:
- 研究了什么问题:在目标样本极小 (\(n_0\)) 而辅助样本极大 (\(n_1\)) 的数据整合问题中,比较逆概率加权 (IPW) 和全似然 (FL) 两种方法的估计效率,并揭示 FL 方法在特定条件下能实现“完全效率增益”(即某些参数达到 \(O_p(1/\sqrt{n})\) 的全样本收敛速率)。
- 核心工具/方法:利用 Tukey 分解将目标分布和 odds 模型联合建模,通过分析 Fisher 信息矩阵的 Schur 补,揭示了参数正交性(parameter orthogonality)是驱动完全效率增益的几何机制。
- 主要结论:在指数族和指数族混合模型下,若目标分布的充分统计量 \(S(x)\) 可分解为 \(S_1(x)\) 和 \(S_2(x)\),且 odds 模型仅依赖于 \(S_2(x)\) 的线性组合(即 \(T(x) = Q S_2(x)\)),则 \(S_1(x)\) 对应的参数 \(\lambda_1\) 可实现完全效率增益。IPW 方法虽然无法实现完全效率增益,但在非参数密度估计中,通过重归一化技巧(ASR-KDE)可实现目标样本量的参数速率(\(O_p(1/\sqrt{n_0})\))。
关键设定与假设¶
- 核心设定:\(n_0 \ll n_1\),且 \(n_0 / n \to 0\)。这是“数据不平衡”的极限情况。
- 假设 (A1):充分统计量 \(S(x) = (S_1(x), S_2(x))\) 可分解,且 odds 模型中的 \(T(x) = Q S_2(x)\)。这是实现完全效率增益的关键假设。它意味着 odds 模型只依赖于 \(S_2(x)\) 的线性组合,而 \(S_1(x)\) 完全不受选择偏差的影响。相比已有文献,这个假设明确刻画了“哪些参数是正交的”。
- 假设 (A2-4):充分统计量仿射独立、参数在内部、Fisher 信息正定。这些都是 MLE 理论的常规条件,很温和。
- 模型正确性:Theorem 2-4 假设目标分布和 odds 模型都正确指定。Remark 3 讨论了模型误设下的 sandwich 形式,但未深入分析。
主要结果¶
- Theorem 2 (指数族下的完全效率增益):在假设 (A1-4) 下,当 \(n_0 / n_1 \to 0\) 时,FL 估计量 \(\hat{\lambda}_1\) 是渐近正态的,且收敛速率为 \(O_p(1/\sqrt{n})\)(全样本速率)。而 \(\hat{\lambda}_2\) 和 \(\hat{\beta}\) 的收敛速率是 \(O_p(1/\sqrt{n_0})\)(目标样本速率)。直觉:辅助样本的分布 \(p(x|A=1)\) 只依赖于 \(\lambda_2 + Q^T \beta\) 这个线性组合,形成一个“未识别曲线”(unidentifiable curve)。\(\lambda_1\) 正交于这条曲线,因此可以被辅助样本精确识别。技术难点:证明的关键在于处理 Fisher 信息矩阵中由 \(n_0 / n_1 \to 0\) 引起的奇异性,通过 Schur 补和 Woodbury 恒等式精确分离出 \(O(1/\epsilon)\) 项(\(\epsilon = n_0/n\))。
- Theorem 3 (正交效率投影):将 \(\lambda_2\) 投影到由 \(Q\) 张成的子空间上,得到 \(\lambda_{2,\parallel}\)(与 odds 纠缠)和 \(\lambda_{2,\perp}\)(与 odds 正交)。\(\hat{\lambda}_{2,\perp}\) 也能达到全样本速率。直觉:这提供了一个更清晰的几何视角:完全效率增益发生在与 odds 模型正交的充分统计量方向上。
- Theorem 4 (混合指数族):将结果推广到混合模型。\(\lambda_{k,1}\)(每个组分的正交参数)仍能实现完全效率增益。但混合权重 \(w_k\) 和 \(\lambda_{k,2}\) 会陷入更复杂的未识别子空间。
- Theorem 5 (IPW 的参数速率效率增益):对于非参数密度估计,使用辅助样本重归一化的核密度估计(ASR-KDE)可以达到 \(O_p(1/\sqrt{n_0})\) 的参数速率(相对于目标样本量)。直觉:这不同于完全效率增益。它依赖于 odds 模型的正确性,但目标分布可以是任意的。其速率受限于 odds 模型的估计误差(\(O_p(1/\sqrt{n_0})\)),因此无法突破目标样本量的限制。
证明路线与技术技巧¶
- 整体路线 (Theorem 2):
- 写出联合似然与得分函数:基于 Tukey 分解,写出完整数据的对数似然,并推导出关于参数 \(\theta = (\lambda_1, \lambda_2, \beta)\) 的得分函数 \(U\)。
- 计算 Fisher 信息矩阵:利用条件方差公式 \(I = \mathbb{E}[\text{Var}(U|A)] + \text{Var}(\mathbb{E}[U|A])\)。关键一步是证明,由于截距项 \(\alpha\) 的存在,组间方差项 \(\text{Var}(\mathbb{E}[U|A])\) 在求 Schur 补时会被精确抵消,因此 Fisher 信息矩阵简化为 \(I_0 = \mathbb{E}[\text{Var}(U|A)]\)。
- 分解 \(I_0\):将 \(I_0\) 写成目标样本和辅助样本条件方差的加权和:\(I_0 = \epsilon V^0 + (1-\epsilon) V^1\),其中 \(\epsilon = n_0/n \to 0\)。
- 分析 \(V^1\) 的奇异性:由于辅助样本中 \(\lambda_2\) 和 \(\beta\) 的得分函数是线性相关的(都依赖于 \(S_2(x)\)),\(V^1\) 是奇异的,其零空间对应“未识别曲线”。
- 求逆并提取 \(\lambda_1\) 的块:对 \(I_0\) 应用块矩阵求逆公式,特别是对包含 \(\lambda_2\) 和 \(\beta\) 的块求 Schur 补。通过 Woodbury 恒等式展开,精确分离出 \(O(1/\epsilon)\) 项。最终发现,\(\lambda_1\) 对应的 Schur 补中,所有 \(O(1/\epsilon)\) 项都被精确抵消,留下一个 \(O(1)\) 的矩阵。因此,\(\hat{\lambda}_1\) 的渐近方差是 \(O(1/n)\),即全样本速率。
- 关键跳跃点:证明 \(V^1\) 的零空间与 \(\lambda_1\) 正交。这是整个证明的核心。它依赖于假设 (A1):\(T(x) = Q S_2(x)\),这意味着 odds 模型完全不涉及 \(S_1(x)\)。因此,在辅助样本中,\(\lambda_1\) 的得分函数与 \(\lambda_2, \beta\) 的得分函数线性无关,从而 \(\lambda_1\) 不会受到 \(V^1\) 奇异性的影响。
- 技术技巧点名:
- 条件方差分解:用于简化 Fisher 信息矩阵的计算。
- Schur 补与块矩阵求逆:用于处理高维参数矩阵的求逆,并隔离出感兴趣参数的渐近方差。
- Woodbury 矩阵恒等式:用于展开 \(\epsilon V^0 + (1-\epsilon) V^1\) 的逆,并精确追踪 \(O(1/\epsilon)\) 项的来源与抵消。
真实例子与应用¶
- 模拟实验:
- 5D Gaussian (Section 8.1):验证了 Theorem 3 的正交投影思想。展示了当 odds 模型被正确限制(排除正交方向)时,正交对比(如 \(\mu_1 - 2\mu_2\))和方差 \(\sigma^2\) 的 MSE 比 IPW 和未限制的 FL 小几个数量级。目的:强调实现完全效率增益需要正确指定 odds 模型的结构,不能过度参数化。
- Ising 模型 (Section 8.2):验证了 Theorem 2 在离散图模型中的应用。展示了当 odds 模型仅依赖于主效应(main effects)时,交互作用参数(network edges)的估计 MSE 随 \(n_1\) 增加而持续下降,而 IPW 的 MSE 则停滞不前。目的:展示完全效率增益在真实科学问题(网络结构恢复)中的巨大潜力。
- 高斯混合模型 (Section 8.3):验证了 Theorem 4。展示了在混合模型中,正交的方差参数 \(\sigma^2_1\) 能实现完全效率增益(MSE 随 \(n_1\) 增加而急剧下降),而纠缠的均值 \(\mu_1\) 和权重 \(w_1\) 则受限于 \(n_0\)。目的:展示结果对更复杂模型的推广。
- 非参数密度估计 (Section 8.4):验证了 Theorem 5。展示了 ASR-KDE 和 IPW-KDE 的 MISE 随 \(n_0\) 增加以 \(O(1/n_0)\) 的速率下降(参数速率),而目标样本仅 KDE 的速率更慢。目的:展示 IPW 方法在非参数设定下的另一种效率增益形式。
🔎 结论是否比证明窄¶
- 窄的结论:Theorem 2 和 3 的证明严格依赖于假设 (A1),即 odds 模型是 \(S_2(x)\) 的线性函数。作者在 Remark 5 中明确指出,如果 odds 模型包含了正交的充分统计量(如 \(Z_\perp\)),则完全效率增益会丧失。这是一个非常具体的条件。
- 泛化的 claim:作者在摘要和引言中声称 FL 方法“may estimate some model parameters at the rate of the massive auxiliary sample size”。这个结论在指数族框架下是严格证明的,但作者在 Section 5.4 中用一个均匀分布的反例展示了,对于一般的位置-尺度族,即使方差参数也可能无法实现完全效率增益。因此,“完全效率增益”并非 FL 方法的普遍性质,而是指数族模型在特定正交性条件下的特例。作者在 Section 9.2 中将其总结为“full efficiency gain”的一种类型,但并未给出一个更一般的充分必要条件。
四、开放问题¶
- 非指数族模型下的完全效率增益条件:本文的完全效率增益理论严格依赖于指数族结构。对于更一般的参数模型(如 Section 5.4 中的位置-尺度族),是否存在类似的正交性条件,使得某些参数能突破 \(n_0\) 的限制?这扎根于 Section 5.4 的“Failure of nonparametric full efficiency gain”和 Section 9.2 对两种效率增益类型的区分。
- 神经网络 FL 方法的实际可行性:Section 7 提出了一个用神经网络同时训练目标分布和 odds 模型的 FL 框架,但作者承认其实际效率“remains unclear”。一个开放问题是:在深度生成模型的背景下,REINFORCE 或重参数化技巧的方差是否能被有效控制,使得 FL 方法在复杂高维数据(如图像)上也能实现效率增益?这扎根于 Section 7.3 的“Practical challenges”。
- 模型误设下的稳健推断:本文的 FL 方法在模型误设下会失效(Section 6.1)。一个重要的开放问题是:能否设计一种双稳健的 FL 方法,使得只要目标分布或 odds 模型之一正确,就能保持一致性,并在两者都正确时实现完全效率增益?这扎根于 Section 6.1 对模型误设的讨论和 Remark 3 对 sandwich 形式的提及。
- 完全效率增益的 minimax 下界:本文证明了 FL 方法在特定条件下能达到全样本速率,但未证明这个速率是 minimax 最优的。一个理论问题是:在假设 (A1) 下,对于 \(\lambda_1\) 的估计,\(O_p(1/\sqrt{n})\) 是否是不可超越的 minimax 下界?这扎根于本文对效率增益的刻画,但缺少一个下界分析来确认其最优性。
Maintained by 陈星宇 · Homepage · Source on GitHub