CRT*: Conditional Randomization Testing with Heterogeneous External and Unlabeled Data¶
作者: Yingjie Zhang, Ziqi Chen, Chenlei Leng
主题: 数理统计 / 假设检验
相关性: 8/10
链接: https://arxiv.org/abs/2607.17859
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是条件独立性(CI)检验:给定一组高维协变量 \(Z\),判断两个随机变量 \(X\) 和 \(Y\) 是否条件独立。这是因果推断、图模型和变量选择的基石。当前子方向的成熟度较高,但核心瓶颈在于:当 \(Z\) 的维度 \(p\) 很大、样本量 \(n\) 有限时,传统方法要么无法控制第一类错误(因条件分布估计不准),要么功效(power)极低。本文试图通过引入外部异质性数据和无标签数据来同时解决这两个问题。
发展脉络(history)¶
奠基工作: - Candès et al. [2018](Model-X knockoffs):提出条件随机化检验(CRT)框架,在已知 \(X|Z\) 条件分布时,可精确控制第一类错误。这是本文的起点。 - Berrett et al. [2020](条件置换检验 CPT):放宽了“已知条件分布”的要求,证明第一类错误膨胀被期望总变差(TV)距离上界控制。但 Shi et al. [2021] 指出,该 TV 距离在样本量趋于无穷时可能不趋于零。
主要进展: - Liu et al. [2022](蒸馏 CRT, dCRT):提出“蒸馏统计量”(先估计条件期望再取残差协方差),大幅降低计算成本,并允许使用复杂机器学习模型。本文直接借用了其蒸馏统计量的构造。 - Katsevich and Ramdas [2022] 与 Wang and Janson [2022]:首次对 CRT 进行局部渐近功效分析,但局限于已知条件分布或仅知前两阶矩的窄设定。本文将其推广到高维部分线性模型且条件分布未知的场景。 - Niu et al. [2024]:证明 dCRT 具有双重稳健性(doubly robust),并与广义协方差测度(GCM)检验渐近等价。这为本文的蒸馏统计量选择提供了理论支撑。
当前 frontier: - Li and Liu [2023](Maxway CRT):试图通过最大条件分位数提升 CRT 对条件分布误设的鲁棒性,但本文表 1 显示其在异质性数据下仍会严重膨胀第一类错误。 - Shi et al. [2021](双 GAN 检验)与 Zhang et al. [2026](双重稳健 GNN 检验):用生成模型近似条件分布,但 Shi et al. 已证明 GAN 的 TV 距离可能不收敛。 - Yang et al. [2025](条件扩散模型 CRT):用扩散模型近似 \(X|Z\),理论上比 GAN 更准,但仍未解决异质性外部数据的利用问题。
本文的位置:作者声称 CRT* 是“第一个统一利用内部、外部和无标签数据进行 CI 检验的框架”。它填补了两个缺口:① 现有 CRT 无法利用外部数据提升功效;② 现有数据融合文献(如 Chatterjee et al. [2016], Shen et al. [2020])只关注参数估计,不关注 CI 检验的功效最大化。
子线索聚类¶
- CRT 及其变体(核心线索):Candès et al. [2018] → Berrett et al. [2020] → Liu et al. [2022] → Li and Liu [2023] → Niu et al. [2024] → Yang et al. [2025]。这一簇在解决“条件分布未知时如何控制第一类错误”,但均未考虑外部数据。
- 数据融合与迁移学习(辅助线索):Li et al. [2022](Trans-Lasso)→ Tian and Feng [2023](高维 GLM 迁移)→ Zhao et al. [2026](残差重要性加权)。这一簇专注于参数估计的精度提升,而非假设检验。
- 非参数条件分布估计(技术支撑):Neumeyer [2009](平滑残差自助法 SRB)→ Lopes [2014](高维残差自助法)。本文首次将 SRB 用于 CI 检验,并证明其 TV 距离收敛。
这个方向在追问的核心问题¶
- 如何在高维 \(p \gg n\) 下控制 CRT 的第一类错误? 当前主流方法是靠大量无标签数据来估计条件分布(如 Berrett et al. [2020]),但 Shi et al. [2021] 指出 TV 距离可能不收敛。
- 如何提升 CRT 在有限样本下的功效? 现有方法要么假设条件分布已知(Katsevich and Ramdas [2022]),要么仅用内部数据(Liu et al. [2022]),功效受限于 \(n\)。
- 如何利用异质性外部数据而不引入偏差? 数据融合文献(Chatterjee et al. [2016], Shen et al. [2020])的权重选择针对参数估计的方差最小化,而非检验功效最大化。
- 外部数据不满足条件独立性时,是否仍能用于提升内部检验的功效? 本文定理 1 允许外部数据有弱条件依赖,但需控制其条件互信息 \(I(X^E; Y^E|Z^E) = o(1/|I_E|)\)。
⚠️ 作者的 framing¶
作者把缺口 frame 成:“现有 CRT 无法利用异质性外部数据,而数据融合文献只关注参数估计,因此 CRT 是‘显然的下一步’。” 具体来说: - 被淡化的竞争路线:双重稳健方法(如 Niu et al. [2024] 的 dCRT 与 GCM 等价性)被作者一笔带过,仅在第 1.4 节末尾提了一句“现有 CRT 方法不利用外部数据”。但 Niu et al. [2024] 已证明 dCRT 在部分线性模型下是半参数有效的——这意味着如果外部数据与内部数据同分布,dCRT 可能已经最优。作者回避了“为什么在异质性下 dCRT 不能直接推广”的讨论。 - 被回避的明显缺失:作者没有引用 Cai and Guo [2017](Confidence intervals for high-dimensional linear regression: Minimax rates and adaptivity)或 Zhang and Zhang [2014](Confidence intervals for low dimensional parameters in high dimensional linear models)——这些工作涉及高维线性模型中的去偏推断,与本文的 SRB 残差构造直接相关。此外,van der Vaart [2000] 的局部渐近正态性(LAN)框架被引用,但作者未讨论 CRT 是否达到半参数效率界(只给了功效表达式,未与效率界对比)。 - 值得研究者去查的问题:① 为什么作者选择 Trans-Lasso 而非更简单的去偏 Lasso(debiased Lasso)?Trans-Lasso 的 oracle 性质是否在本文的异质性设定下成立?② 作者声称“第一个 TV 距离收敛的残差自助法结果”,但 Lopes [2014] 已证明 Mallows 距离收敛——Mallows 收敛与 TV 收敛之间的 gap 是否真的如作者所说“不可逾越”?③ 外部数据的条件互信息项 \(I(X^E; Y^E|Z^E)\) 在定理 1 中要求 \(o(1/|I_E|)\),这个条件在实际中如何验证?
张力¶
未见明显对立引用。所有被引工作基本沿着“CRT 有效性 → 条件分布估计 → 数据融合”的线性叙事,没有出现同一问题下不同方法得出相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(X\):目标变量(标量),要检验其与 \(Y\) 的条件独立性。 - \(Y\):响应变量(标量)。 - \(Z \in \mathbb{R}^p\):高维协变量向量,\(p\) 可随样本量 \(n\) 发散。 - \(n\):内部(internal)样本量。 - \(n_E\):外部(external)样本量。 - \(n_k\):第 \(k\) 个无标签数据集的样本量,\(k=1,\dots,K\),\(K\) 固定。 - \(\beta \in \mathbb{R}^p\):内部数据中 \(X\) 对 \(Z\) 的回归系数(稀疏,\(\|\beta\|_0 \le s\))。 - \(\beta^E\):外部数据中 \(X^E\) 对 \(Z^E\) 的回归系数。 - \(w^{(k)}\):第 \(k\) 个无标签数据集中 \(X^{(k)}\) 对 \(Z^{(k)}\) 的回归系数。 - \(\epsilon, \epsilon^E, \epsilon^{(k)}\):子高斯噪声,均值为 0,方差 \(\tilde{\sigma}^2\)。 - \(\rho(\cdot|Z)\):\(X|Z\) 的真实条件分布。 - \(\hat{\rho}(\cdot|Z)\):估计的条件分布。 - \(d_{TV}(\cdot, \cdot)\):总变差距离。 - \(T_{\text{int}}, T_{\text{ext}}\):内部和外部数据的蒸馏统计量。 - \(w\):融合权重,\(w \in [0,1]\)。 - \(M\):CRT 重抽样次数(本文取 200)。 - \(\alpha\):名义显著性水平(本文取 0.05)。
模型: - 内部数据:\(X = Z\beta + \epsilon\),\(Z \perp\!\!\!\perp \epsilon\)。\(Y = cX + \bar{g}(Z) + \epsilon_y\),\((X,Z) \perp\!\!\!\perp \epsilon_y\)。 - 外部数据:\(X^E = Z^E \beta^E + \epsilon^E\),\(Y^E = c^E X^E + \bar{g}^E(Z^E) + \epsilon_y^E\)。 - 无标签数据:\(X^{(k)} = Z^{(k)} w^{(k)} + \epsilon^{(k)}\),\(k=1,\dots,K\)。 - 所有噪声项均为子高斯,且 \(Z, Z^E, Z^{(k)}\) 独立同分布于 \(N(0, \Sigma)\)(特征值有界)。
可观测数据: - 内部数据:\(\{(X_i, Y_i, Z_i)\}_{i=1}^n\) —— 全部可观测。 - 外部数据:\(\{(X_i^E, Y_i^E, Z_i^E)\}_{i=1}^{n_E}\) —— 全部可观测,但分布与内部数据不同。 - 无标签数据:\(\{(X_i^{(k)}, Z_i^{(k)})\}_{i=1}^{n_k}\) —— 只有 \(X\) 和 \(Z\),没有 \(Y\)。 - 不可观测:真实条件分布 \(\rho(\cdot|Z)\)、噪声分布、回归系数 \(\beta, \beta^E, w^{(k)}\)、条件期望函数 \(\bar{g}(Z) = \mathbb{E}[Y|Z]\) 和 \(\mu(Z) = \mathbb{E}[X|Z]\)。
第二步:最小内核¶
最简特例:假设 \(p=1\)(一维协变量),所有数据同分布(\(\beta = \beta^E = w^{(k)}\),\(\bar{g} = \bar{g}^E\)),且噪声 \(\epsilon, \epsilon_y\) 均为高斯。此时 CRT* 退化为一个极其简单的过程:
- 估计条件分布:用所有数据(内部 + 外部 + 无标签)拟合线性回归 \(X = \beta Z + \epsilon\),得到 \(\hat{\beta}\) 和残差 \(\hat{\epsilon}_i = X_i - Z_i \hat{\beta}\)。
- SRB 采样:从残差中有放回抽取 \(\epsilon''_i\),加上一个小的高斯噪声 \(a_n U_i\)(\(U_i \sim N(0,1)\)),得到平滑残差 \(\tilde{\epsilon}_i = \epsilon''_i + a_n U_i\)。然后生成伪样本 \(\tilde{X}_i = Z_i \hat{\beta} + \tilde{\epsilon}_i\)。
- 计算蒸馏统计量:用 Lasso 估计 \(\hat{g}(Z) = \hat{\mathbb{E}}[Y|Z]\) 和 \(\hat{\mu}(Z) = \hat{\mathbb{E}}[X|Z]\),然后计算 \(T_{\text{int}} = \frac{1}{n} \sum_i (Y_i - \hat{g}(Z_i))(X_i - \hat{\mu}(Z_i))\)。
- CRT p 值:重复步骤 2-3 共 \(M\) 次,得到 \(T^{(1)}, \dots, T^{(M)}\),p 值为 \(\frac{1}{M+1}(1 + \sum_{m=1}^M \mathbb{I}\{T^{(m)} \ge T_{\text{obs}}\})\)。
核心思路:在这个特例下,CRT* 的本质就是“用平滑残差自助法生成与观测数据在 \(Z\) 下条件同分布的伪 \(X\),然后比较真实统计量与伪统计量的分布”。平滑步骤(加 \(a_n U_i\))是关键的数学创新:没有它,残差自助法生成的分布是离散的,与真实连续分布的 TV 距离恒为 1,导致第一类错误无法控制。加上平滑后,TV 距离可以随 \(n \to \infty\) 趋于 0。
为什么这个特例抓住了核心:即使 \(p=1\) 且同分布,CRT* 的数学困难(TV 距离收敛、平滑的必要性)已经全部体现。高维 \(p\) 和异质性只是在这个内核上“加壳”——用 Trans-Lasso 处理高维稀疏估计,用“信息集”\(\mathcal{A}\) 处理异质性,用凸组合权重 \(w\) 处理外部数据融合。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在内部数据有限、外部数据存在分布异质性、无标签数据可用的高维场景下,如何对 \(X \perp\!\!\!\perp Y \mid Z\) 进行条件独立性检验,同时控制第一类错误并提升功效。
- 核心工具 / 方法:提出 CRT* 框架,包含三个组件——① 平滑残差自助法(SRB)结合迁移学习(Trans-Lasso)来估计条件分布;② 蒸馏统计量(distilled statistic)作为检验统计量;③ 通过最优凸组合自适应融合内部和外部统计量。
- 主要结论:① SRB 估计量在期望 TV 距离下收敛到真实条件分布(收敛速率 \(\sqrt{|I_I|} \left( \frac{\tilde{s} \log p}{|I_I^c| + N_\mathcal{A}} + \frac{\tilde{s} \log p}{\tilde{n}} \wedge \tilde{\eta}_h \right)^{1/4}\));② CRT 渐近控制第一类错误(即使外部数据仅有弱条件依赖);③ CRT 的局部渐近功效严格高于不使用外部数据的标准 CRT;④ 模拟和 RNA-seq 数据验证了方法在异质性下的优势。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - 数据分割:内部数据分为 \(I_I\)(hold-out,用于计算统计量,大小 \(\lfloor w_1 n \rfloor\))和 \(I_I^c\)(用于估计条件分布);外部数据类似分为 \(I_E\) 和 \(I_E^c\)。 - 信息集:\(\mathcal{A} = \{k: \|\beta - w^{(k)}\|_1 \le h\}\),\(\mathcal{A}^E = \{k: \|\beta^E - w^{(k)}\|_1 \le h^E\}\)。\(h\) 和 \(h^E\) 控制异质性程度。 - 稀疏性:\(\|\beta\|_0 \le s\),\(\|\beta^E\|_0 \le s^E\),\(\|w^{(k)}\|_0 \le s^{(k)}\),且 \(s, s^E, s^{(k)} \ll p\)。 - 局部备择:\(c = t / \sqrt{n}\),\(c^E = t / \sqrt{f_n}\),其中 \(f_n / n \to \zeta > 0\)。
关键假设: - (A1) \(Z, Z^E, Z^{(k)}\) 独立同分布于 \(N(0, \Sigma)\),\(\Sigma\) 的特征值有界。这是高维稀疏回归的标准假设,用于保证 Lasso 和 Trans-Lasso 的估计误差界。 - (A2) 噪声为子高斯,密度满足正则性条件(见补充材料 S.4)。这比 CRT 文献中常见的高斯假设(如 Wang and Janson [2022])更宽松。 - 条件 (17)-(21):对蒸馏统计量的估计误差要求——\(\hat{g}\) 和 \(\hat{\mu}\) 的均方误差为 \(o_P(1)\),且交叉项为 \(o_P(|I_I|^{-1})\)。这允许“样本内拟合”(即用同一批数据估计条件期望和计算统计量),比 Liu et al. [2022] 的样本分割要求更宽松。 - 相比已有文献的放宽:① 允许 \(p\) 随 \(n\) 发散(高维);② 允许外部数据有弱条件依赖(\(I(X^E; Y^E|Z^E) = o(1/|I_E|)\));③ 允许噪声非高斯(子高斯即可);④ 允许 \(\hat{g}, \hat{\mu}\) 样本内拟合(条件 (18)-(21) 比交叉拟合更弱)。
主要结果¶
定理 1(第一类错误控制): - 陈述:对任意 \(\alpha \in [0,1]\),CRT* 的 p 值满足 \(P_{H_0}(p \le \alpha) \le \alpha + \sqrt{\frac{1}{2}|I_E| \cdot I(X^E; Y^E|Z^E)} + \mathbb{E}[d_{TV}(\rho_{|I_I|}, \hat{\rho}_{|I_I|})] + \mathbb{E}[d_{TV}(\rho^E_{|I_E|}(\cdot|Z^E_{I_E}), \hat{\rho}^E_{|I_E|})]\)。 - 直觉:第一类错误膨胀来自三个源头——外部数据的条件依赖、内部条件分布估计误差、外部条件分布估计误差。如果三者都趋于 0,则渐近控制。 - 必要条件:\(I(X^E; Y^E|Z^E) = o(1/|I_E|)\) 且两个 TV 距离期望趋于 0。 - 解决的技术难点:将 Berrett et al. [2020] 的定理 4 推广到包含外部数据的情形,并证明 TV 距离上界可分解为三个可分别处理的部分。
定理 2(局部渐近功效): - 陈述:在局部备择 \(c = t/\sqrt{n}\) 下,CRT* 使用 \(| \hat{T}_{\text{comb}} |\) 的渐近功效为 \(\Phi(\xi - z_{1-\alpha/2}) + \Phi(-\xi - z_{1-\alpha/2})\),其中 \(\xi = \frac{\sqrt{w_1} t (1-w^*) \tilde{\sigma} + w^* \tilde{\sigma} / \sqrt{\zeta}}{\sqrt{(1-w^*)^2 \sigma^2 + (w^*)^2 w_1 \sigma_E^2 / (w_2 \tau)}}\)。 - 直觉:功效随 \(t\)(信号强度)、\(\tau = n_E/n\)(外部样本量比例)、\(\tilde{\sigma}^2\)(\(X|Z\) 噪声方差)增大而增大,随 \(\sigma^2\)(\(Y|X,Z\) 噪声方差)和 \(\zeta\)(外部信号衰减因子)增大而减小。 - 必要条件:条件 (17)-(21) 及其外部对应版本,以及 \(|I_I|/n \to w_1\),\(|I_E|/n_E \to w_2\)。 - 解决的技术难点:① 证明 SRB 重抽样与真实条件分布重抽样在局部备择下渐近等价(引理 S.4 的条件弱收敛可加性);② 将 Katsevich and Ramdas [2022] 的功率分析从已知条件分布推广到未知且高维的情形。
定理 3(最优权重的一致性): - 陈述:逆残差权重 \(\hat{w} = \frac{S_{\text{int}} / \sqrt{\zeta}}{S_{\text{ext}} / (|I_E|/|I_I|) + S_{\text{int}} / \sqrt{\zeta}}\) 是 \(w_{\text{opt}}\) 的一致估计,其中 \(S_{\text{int}} = |I_I|^{-1} \sum_{i \in I_I} (Y_i - \hat{g}(Z_i))^2\)。 - 直觉:最优权重 \(w_{\text{opt}} = \frac{\sigma^2 / \sqrt{\zeta}}{w_1 \sigma_E^2 / (w_2 \tau) + \sigma^2 / \sqrt{\zeta}}\) 依赖于未知的 \(\sigma^2, \sigma_E^2\),但可用残差方差一致估计。 - 必要条件:\(\max\{\mathbb{E}[\epsilon_y^4], \mathbb{E}[(\epsilon_y^E)^4]\} < \infty\) 且 \(\hat{g}, \hat{g}^E\) 的均方误差为 \(o_P(1)\)。
证明路线与技术技巧¶
整体路线(以定理 2 为例): 1. 第一步:将 CRT* 的 p 值转化为条件分布比较问题。利用 CRT 的交换性引理,证明 p 值的分布由 \(\rho_{|I_I|} \cdot \rho^E_{|I_E|}(\cdot|Y^E, Z^E)\) 与 \(\hat{\rho}_{|I_I|} \cdot \hat{\rho}^E_{|I_E|}\) 的 TV 距离控制。 2. 第二步:分解 TV 距离。利用三角不等式和条件独立性,将 TV 距离分解为内部项、外部项和交叉项。内部项用 SRB 的 TV 收敛速率控制,外部项用条件互信息控制。 3. 第三步:证明 SRB 的 TV 收敛。这是最吃劲的部分。作者将 SRB 估计量 \(\hat{\rho}\) 的 TV 距离分解为偏差(smoothing bias)和方差(系数估计误差 + 残差分布估计误差)。偏差项为 \(a_n \sqrt{|I_I|}\),方差项为 \(\frac{\sqrt{|I_I|}}{a_n} \cdot \left( \frac{\tilde{s} \log p}{|I_I^c| + N_\mathcal{A}} + \frac{\tilde{s} \log p}{\tilde{n}} \wedge \tilde{\eta}_h \right)\)。通过选择 \(a_n\) 平衡两者得到最优速率。 4. 第四步:建立局部备择下的功效表达式。利用蒸馏统计量的渐近正态性(引理 S.5),证明在局部备择下 \(\hat{T}_{\text{comb}}\) 收敛到均值为 \(\xi\)、方差为 1 的正态分布。关键步骤是证明 SRB 重抽样不改变这个极限分布(引理 S.4 的条件弱收敛可加性)。 5. 第五步:证明最优权重的一致性。利用残差方差的一致估计和连续映射定理。
关键跳跃点: - TV 距离收敛的证明(定理 S.2):这是全文最核心的技术贡献。难点在于:① 残差自助法生成的分布是离散的,TV 距离恒为 1;② 平滑步骤引入的偏差需要与方差平衡;③ 高维系数估计误差(来自 Trans-Lasso)需要转化为 TV 距离的界。作者的处理是:先用平滑使分布连续(偏差 \(a_n \sqrt{|I_I|}\)),再用 Berry-Esseen 型不等式将系数估计误差转化为分布误差(方差项),最后用 \(a_n\) 平衡。 - 条件弱收敛的可加性(引理 S.4):这是将独立同分布情形的经典结果(Van der Vaart [2000])推广到条件独立情形。作者证明:如果 \(W_{ni}\) 在给定 \(Z\) 下条件独立,且满足 Lindeberg 条件,则 \(\sum_i W_{ni}\) 条件弱收敛到正态分布。这个引理是连接 SRB 重抽样与真实条件分布的关键桥梁。
技术技巧点名: - 平滑残差自助法(SRB):用于使估计的条件分布连续,TV 距离可收敛。来源:Neumeyer [2009]。 - Trans-Lasso:用于高维稀疏迁移学习,估计 \(\beta\) 和 \(w^{(k)}\)。来源:Li et al. [2022]。 - 蒸馏统计量:先估计条件期望再取残差协方差,避免直接估计高维联合分布。来源:Liu et al. [2022]。 - 凸组合 + 逆残差权重:用于自适应融合内部和外部统计量,权重由残差方差决定。这是本文的新技巧。 - 条件弱收敛可加性(引理 S.4):推广 Van der Vaart [2000] 的经典结果到条件独立情形。 - Berry-Esseen 型不等式:用于将系数估计误差转化为分布误差。
真实例子与应用¶
数据:RNA-seq 乳腺癌基因表达数据。 - 内部数据:TCGA-BRCA 队列中的非洲裔美国人患者(\(n=187\))。 - 外部数据:同一队列中的白人患者(\(n_E=680\))。 - 无标签数据:GEO 数据库中的 5 个 PAM50 亚型(Basal, Her2, LumA, LumB, Normal-like),共 3409 个样本,缺少 BRCA1P1 表达数据。 - 目标:检验 BRCA1(\(X\))与 BRCA1P1(\(Y\))在给定其他 199 个基因(\(Z\))下是否条件独立。
方法应用: 1. 用 Trans-Lasso 识别信息集 \(\mathcal{A}\) 和 \(\mathcal{A}^E\)(无标签数据中与内部/外部回归系数相似的亚型)。 2. 用 SRB 估计条件分布,生成伪样本。 3. 用蒸馏 Lasso 统计量计算 \(T_{\text{int}}\) 和 \(T_{\text{ext}}\),用逆残差权重融合。 4. 计算 p 值。
结果: - CRT 的 p 值为 0.010(样本内训练),显著低于仅用内部数据的 0.015 和外部数据的 0.045。 - 在 100 次随机分割的 hold-out 训练中,CRT 的拒绝率为 87%,远高于仅用内部数据的 43% 和 Maxway CRT 的 48%。 - 对比方法中,“Pool Stat”(简单池化统计量)的 p 值为 0.055(未拒绝),说明异质性下简单池化会损失功效。
这个例子想说明什么: - 验证理论:在异质性真实数据中,CRT 确实能控制第一类错误(p 值 0.010 < 0.05)并提升功效(比内部数据更显著)。 - 展示相对优势:① 对比“Pool Stat”说明自适应融合的必要性;② 对比“Internal”说明外部数据的价值;③ 对比 Maxway CRT 说明 CRT 在异质性下的鲁棒性。 - 生物学意义:为 BRCA1 与 BRCA1P1 之间的调控关系提供了统计证据,支持了 Han et al. [2021] 的生物学发现。
🔎 结论是否比证明窄¶
- 定理 2 的“严格更高功效”:作者声称 CRT 的渐近功效“严格高于”标准 CRT。但定理 2 只在局部备择 \(c = t/\sqrt{n}\) 下成立,且假设外部数据满足 \(c^E = t/\sqrt{f_n}\)(即信号强度与内部成比例)。如果外部数据信号极弱(\(c^E \approx 0\)),则 \(w_{\text{opt}} \approx 0\),CRT 退化为标准 CRT,功效相等而非严格更高。作者在定理 2 后的讨论中承认了这一点(“power gain is monotonically increasing with ... the strength of the external conditional dependence”),但摘要和引言中的“strictly higher power”表述可能过于绝对。
- 定理 1 的“渐近控制”:作者证明 \(P_{H_0}(p \le \alpha) \le \alpha + o(1)\),但 \(o(1)\) 的收敛速率依赖于 SRB 的 TV 收敛速率(定理 S.2)。这个速率涉及多个参数(\(s, p, n, N_\mathcal{A}, h\)),在实际中可能很慢。作者没有给出有限样本下的非渐近界。
- 定理 3 的“一致估计”:作者证明 \(\hat{w} \to w_{\text{opt}}\) 在局部备择下成立,但未讨论在全局备择(\(c\) 固定而非 \(t/\sqrt{n}\))下是否仍然一致。全局备择下,\(\hat{g}\) 和 \(\hat{\mu}\) 的估计误差可能更大,影响残差方差的一致性。
四、开放问题¶
-
未知异质性程度下的自适应:本文假设信息集 \(\mathcal{A}\) 和 \(\mathcal{A}^E\) 已知(或可通过阈值 \(h\) 识别)。当异质性程度 \(h\) 未知且无法从数据中可靠估计时,如何自适应地选择信息集?这扎根于定理 S.2 的收敛速率中 \(\tilde{\eta}_h = (h \sqrt{\log p / \tilde{n}}) \wedge h^2\) 项——如果 \(h\) 被高估,收敛速率会变慢甚至不收敛。
-
非线性条件分布的推广:本文假设 \(X|Z\) 服从高维稀疏线性模型。当 \(X|Z\) 为非线性(如广义线性模型、加性模型)时,SRB 的 TV 收敛是否仍然成立?这扎根于第 2.1 节“我们假设……高维稀疏线性回归是自然且有效的框架”——这个假设在基因表达数据中合理,但在其他领域(如社会科学)可能不成立。
-
最优权重对模型误设的敏感性:定理 3 的逆残差权重依赖于蒸馏统计量的方差结构。如果 \(\hat{g}\) 或 \(\hat{\mu}\) 严重误设(例如,真实模型为非线性但用了线性估计),残差方差 \(S_{\text{int}}\) 是否仍能一致估计 \(\sigma^2\)?这扎根于条件 (18)-(21) 的 \(o_P(1)\) 要求——如果这些条件不满足,权重可能偏离最优值,导致功效损失。
-
计算效率与多重检验:本文的 CRT 需要 \(M=200\) 次重抽样,每次重抽样都要重新计算蒸馏统计量。当需要同时对成千上万个 \((X,Y)\) 对进行 CI 检验(如基因调控网络推断)时,计算成本可能过高。Liu et al. [2022] 的蒸馏 CRT 通过“一次拟合、多次重抽样”大幅降低了计算成本——CRT 能否借鉴类似思路?这扎根于第 4 节的应用场景(检验 BRCA1 与 BRCA1P1 的单一边),但作者在结论中提到了“基因调控网络”的潜在应用。
Maintained by 陈星宇 · Homepage · Source on GitHub