Estimating heterogeneous treatment effects from randomised trials: a comparison of the risk modelling and treatment effect modelling approaches¶
作者: Frederik Luca Philipona, Marta Mainetti, Orestis Efthimiou, Georgia Salanti
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.21526
一、领域脉络与小综述¶
这个方向是什么:个性化医疗(precision medicine)的核心统计问题之一,是从随机对照试验(RCT)数据中估计异质性处理效应(heterogeneous treatment effects, HTE),即不同患者特征下处理效应的差异。本文聚焦于两种具体的建模策略——风险建模(risk modelling, RM)与处理效应建模(treatment effect modelling, EM)——在二分类结局的RCT中预测个体化处理效应(以风险差 RD 为指标)的相对表现。这是一个偏应用、偏"建模策略选择"的子方向,处于因果推断与预测建模的交界处:它不讨论识别(RCT 中随机化保证了识别),而是讨论在有限样本下哪种参数化方式能更准确地估计个体化处理效应。该方向当前成熟度中等:已有大量 HTE 估计方法(如 meta-learners、因果森林、贝叶斯加性回归树等),但针对"基线风险作为效应修饰因子"这一具体降维策略的系统比较仍然稀缺。
发展脉络(按 intro 引用顺序):
- 奠基工作:Kent et al. (2018, BMJ) 提出"基线风险是处理效应的数学决定因素"这一核心论点,指出对于二分类结局,几乎所有处理效应度量(RD、RR、OR)都随基线风险变化,因此基线风险本身是最重要的效应修饰因子。这一观察为 RM 提供了理论基础。
- 临床论证:Glasziou & Irwig (1995, BMJ) 更早地从临床角度论证:许多治疗措施的绝对获益随患者基线风险单调变化,临床决策应基于患者的绝对风险而非相对风险。这是 RM 思想的临床源头。
- 方法框架化:PATH 声明(Kent et al., 2020, Annals of Internal Medicine)系统阐述了"预测方法"(即先预测基线风险,再估计风险-处理效应关系)在 HTE 估计中的价值,将其与传统的"交互项检验"范式对立起来。这是 RM 方法被正式命名和推广的关键文献。
- 实证比较:Van Klaveren et al. (2015, J Clin Epidemiol) 在冠心病数据上比较了 RM 与 EM,发现两者在预测个体治疗获益时存在实质性差异,且 RM 在某些情况下更稳健;Van Klaveren et al. (2019, J Clin Epidemiol) 进一步指出 EM 的交互项模型容易过拟合,导致治疗推荐不稳定。
- 模拟研究:Rekkas et al. (2023, BMC Med Res Methodol) 做了模拟比较,但其中 RM 的实现方式与本文不同(本文作者指出其 RM 定义与标准两阶段 RM 有差异),且未系统变化样本量与假设违背程度。本文作者认为这是文献中缺乏"公平、全面"模拟比较的体现。
子线索聚类:
- RM 方法线(Kent 2018; Glasziou & Irwig 1995; Van Klaveren 2015, 2019):强调基线风险作为降维工具,通过两阶段建模(先预测基线风险,再估计基线风险与处理的交互)来减少参数数量、防止过拟合。核心假设是:基线风险充分捕捉了协变量对处理效应的修饰作用。
- EM 方法线(PATH 声明中的"完整交互模型"范式;Van Klaveren 2015 中的对照方法):直接对所有协变量与处理做交互,不预设基线风险的特殊地位。更灵活,但参数更多,小样本下方差更大。
- 模拟比较线(Rekkas 2023; 本文):通过人为设定的数据生成机制,系统比较两种方法在不同样本量、不同假设违背程度下的表现。这条线目前文献最少,本文是第一个"公平"比较。
这个方向在追问的核心问题:
- 降维 vs 灵活性:RM 通过将 p 维协变量压缩为 1 维基线风险来降维,但代价是假设所有效应修饰都通过基线风险传导。这个假设在多大程度上成立?何时失效?
- 样本量的调节作用:RM 的降维优势在小样本中应该更明显,EM 的灵活性优势在大样本中应该更明显——这个直觉是否被模拟证实?转折点在哪里?
- 模型误设的鲁棒性:当真实数据生成机制不服从 RM 的假设(如存在纯效应修饰因子)时,RM 的偏差有多大?是否仍能通过方差优势胜出?
⚠️ 作者的 framing(这是作者的说法):作者将缺口 frame 成"缺乏一个公平、全面的模拟比较"——具体来说,(1) 已有比较(Van Klaveren 2015)是在单个数据集上做的,无法推广;(2) Rekkas 2023 的模拟中 RM 的实现方式偏离了标准两阶段 RM(作者在 intro 中明确说 "the RM approach used was substantially different from the two-stage approach commonly considered");(3) 没有研究系统变化样本量、基线风险分布、效应修饰异质性程度等关键因素。作者因此设计了 4 个主要场景 × 7 个子场景 × 3 个样本量的模拟矩阵,试图给出一个"决定性"的比较。被作者淡化或回避的竞争路线包括:meta-learners(Künzel et al. 2018; Nie & Wager 2021)——作者只在讨论部分提到"未与现代机器学习方法比较";以及贝叶斯非参数方法。什么明显该被引、却没出现在 intro 里:Künzel et al. (2018) 的 meta-learner 综述、Wager & Athey (2018) 的因果森林、Athey & Imbens (2016) 的递归划分方法——这些是 HTE 估计领域最主流的方法,本文完全未在 intro 中提及,只在讨论部分一笔带过。这暗示作者有意将比较范围限定在"传统回归框架"内。
张力:文献中存在一个未被明确解决的矛盾——PATH 声明(Kent et al. 2020)主张 RM 应作为首选方法,而 Van Klaveren et al. (2015) 的实证结果也支持 RM 的稳健性;但 Rekkas et al. (2023) 的模拟发现 EM 在某些场景下更优。本文的模拟结果(RM 在多数场景占优,但大样本下 EM 反超)部分调和了这一矛盾,但作者自己也承认结论依赖于模拟场景的选择。未见明显对立的引用关系,但"RM 是否应作为默认方法"这一问题在文献中远未达成共识。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据¶
可观测数据:来自单中心 RCT 的 n 个独立同分布样本。对每个个体 i,观测到: - \(X_i \in \mathbb{R}^p\):基线协变量向量(p = 6 或 5,取决于场景) - \(T_i \in \{0,1\}\):处理分配指示(1 = 试验组,0 = 对照组/安慰剂组) - \(Y_i \in \{0,1\}\):二分类结局(1 = 发生不良事件)
潜在结果 / 反事实量(RCT 中因随机化而可识别): - \(Y_i(0)\):个体 i 在对照组的潜在结局 - \(Y_i(1)\):个体 i 在试验组的潜在结局 - 基线风险:\(\phi_0(x) = P(Y(0)=1 \mid X=x)\),即未接受处理时的结局概率 - 处理风险:\(\phi_1(x) = P(Y(1)=1 \mid X=x)\) - 个体化处理效应(本文目标量):\(\tau(x) = \phi_0(x) - \phi_1(x)\),即风险差(RD)
核心记号: - \(h_i = \text{logit}(\phi_0(x_i))\):个体 i 的基线风险对数几率(log-odds),是 RM 第二阶段的核心变量 - \(\hat{h}_i\):第一阶段模型对 \(h_i\) 的估计值 - \(\boldsymbol{b}_i\):既是预后因子又是效应修饰因子的协变量子集(p_b 个) - \(\boldsymbol{f}_i\):纯预后因子(只影响基线风险,不影响处理效应,p_f 个) - \(\boldsymbol{m}_i\):纯效应修饰因子(只影响处理效应,不影响基线风险,p_m 个)
模型设定(本文的模拟框架):
EM 模型(公式 1):
参数个数:\(2 + 2p_b + p_f + p_m\)(截距 + 处理主效应 + 预后主效应 + 交互项)
RM 模型(公式 2-3): - 第一阶段(公式 2):\(\text{logit}(E[Y_i \mid x_i, t_i=0]) = \alpha^{RM1} + \boldsymbol{\gamma}_b^{RM1} \boldsymbol{b}_i + \boldsymbol{\gamma}_f^{RM1} \boldsymbol{f}_i = h_i\) - 第二阶段(公式 3):\(\text{logit}(E[Y_i \mid x_i, t_i]) = \alpha^{RM2} + \beta^{RM2} t_i + \gamma^{RM2} \hat{h}_i + \delta^{RM2} \hat{h}_i t_i\)
参数个数:\((1 + p_b + p_f) + 4 = 5 + p_b + p_f\)(第一阶段系数 + 第二阶段 4 个参数)
关键差异:当 \(p_b + p_f > 2\) 时,RM 的参数个数少于 EM。例如在 BOTH 场景中(p_b = 6),EM 估计 \(2 + 2 \times 6 = 14\) 个参数,RM 估计 \(5 + 6 = 11\) 个参数。更重要的是,RM 将 p 维交互问题压缩为 1 维交互(\(\delta^{RM2} \hat{h}_i t_i\)),而 EM 需要估计 p 个独立的交互系数。
第二步:最小内核¶
最简例子:假设只有一个协变量 \(X\)(例如年龄),且 \(X\) 既是预后因子又是效应修饰因子(即 \(X \in \boldsymbol{b}\))。真实数据生成机制为:
即处理效应在对数几率尺度上为 \(\beta_0 + \delta_1 x\),随 \(x\) 线性变化。
EM 方法:直接拟合 \(\text{logit}(P(Y=1 \mid x, t)) = \alpha + \beta t + \gamma x + \delta x t\),估计 4 个参数 \((\alpha, \beta, \gamma, \delta)\)。当 \(n\) 足够大时,EM 能一致估计真实参数,\(\hat{\delta} \to \delta_1\)。
RM 方法: - 第一阶段:拟合 \(\text{logit}(P(Y=1 \mid x, t=0)) = \alpha_0 + \gamma_0 x\)(只用对照组数据,或用全部数据但忽略处理),得到 \(\hat{h}(x) = \hat{\alpha}_0 + \hat{\gamma}_0 x\) - 第二阶段:拟合 \(\text{logit}(P(Y=1 \mid x, t)) = \alpha + \beta t + \gamma \hat{h}(x) + \delta \hat{h}(x) t\),估计 4 个参数
为什么 RM 能工作:将 \(\hat{h}(x) = \hat{\alpha}_0 + \hat{\gamma}_0 x\) 代入第二阶段,得到:
对比真实模型 \(\gamma_0 + \gamma_1 x + \beta_0 + \delta_1 x t\),RM 隐含地估计了交互系数 \(\delta \hat{\gamma}_0\) 来逼近 \(\delta_1\)。关键限制:RM 假设交互效应与主效应成比例(\(\delta \hat{\gamma}_0\) 是标量 \(\delta\) 乘以主效应系数 \(\hat{\gamma}_0\)),而 EM 允许每个协变量有独立的交互系数。当真实模型中存在"纯效应修饰因子"(即 \(X\) 不影响基线风险但影响处理效应)时,RM 的第一阶段会赋予 \(X\) 零系数,第二阶段无法捕捉其修饰作用——这是 RM 的根本局限。
为什么样本量是关键:在单协变量例子中,EM 和 RM 参数个数相同(都是 4),RM 没有降维优势。但当 \(p\) 增大时(如本文的 p=6),EM 需要估计 \(2 + 2p\) 个参数,RM 只需估计 \(5 + p\) 个参数。在 \(n=500\) 的小样本下,EM 的交互项估计方差很大,RM 的降维(将 6 维交互压缩为 1 维)显著降低方差;在 \(n=5000\) 下,EM 的方差已足够小,其灵活性(能捕捉纯效应修饰因子)开始体现为更低的偏差。本文的核心发现正是这个偏差-方差权衡的实证刻画。
三、这篇论文做了什么¶
三句话¶
① 本文在二分类结局的 RCT 模拟框架下,系统比较了 RM(两阶段:先估计基线风险,再将其作为唯一效应修饰因子)与 EM(全交互 LASSO 逻辑回归)在预测个体化风险差(RD)上的表现。② 通过 4 个主要场景 × 7 个子场景 × 3 个样本量(500/2000/5000)的模拟矩阵,发现 RM 在大多数场景和样本量下优于 EM,尤其在 \(n=500\) 时优势最大;EM 仅在 \(n=5000\) 且存在纯效应修饰因子时反超。③ 作者从理论上论证了基线风险作为效应修饰因子的合理性,并指出样本量是决定两种方法相对表现的首要因素,建议实际应用中根据样本量和假设合理性选择方法。
关键设定与假设¶
模拟框架(核心设计):
- 协变量生成:6 个(或 5 个)协变量从多元正态分布 \(N(\mu, \sigma R)\) 生成,相关系数矩阵 \(R_{ij} = 0.25^{|i-j|}\)(即相邻协变量相关 0.25,间隔越远相关越弱)。部分协变量被二值化(通过阈值分割),模拟临床中的分类变量。
- 结局生成:对照组风险 \(\phi_0(x) = \text{expit}(\boldsymbol{\gamma}_b \boldsymbol{b} + \boldsymbol{\gamma}_f \boldsymbol{f})\),处理组风险 \(\phi_1(x)\) 根据场景不同而不同(见下)。结局 \(Y \sim \text{Bernoulli}(\phi_T(x))\)。
- 处理分配:1:1 随机化。
4 个主要场景(系统变化 RM 假设的违背程度):
| 场景 | 协变量构成 | RM 假设违背程度 | 关键特征 |
|---|---|---|---|
| BOTH | 6 个 b(既是预后因子又是效应修饰因子) | 轻度违背 | 所有协变量都影响基线风险,但每个协变量的效应修饰系数不同(\(\boldsymbol{\delta}_b\) 与 \(\boldsymbol{\gamma}_b\) 不成比例) |
| PF | 6 个 f(纯预后因子) | 无违背(RM 正确) | 处理效应为常数 OR(\(\text{logit}(\phi_1) = \text{logit}(\phi_0) + \beta'\)),基线风险是唯一效应修饰因子 |
| BOTH+PF | 4 个 b + 2 个 f | 中度违背 | 纯预后因子 f 在 RM 第二阶段被错误地当作效应修饰因子 |
| BOTH+PF+M | 3 个 b + 2 个 f + 1 个 m(纯效应修饰因子) | 严重违背 | 存在 RM 第一阶段完全无法捕捉的纯效应修饰因子 m |
子场景(进一步变化):
- 基线风险与处理效应的关系:三种——"对高基线风险有效"(处理效应随 \(\phi_0\) 增加)、"对低基线风险有效"(处理效应随 \(\phi_0\) 减少)、"对高低都有效"(非线性关系)。这通过 \(\beta_1(\phi_0)\) 的不同函数形式实现。
- 效应修饰系数的异质性:小 vs 大(\(\boldsymbol{\delta}_b\) 的取值离散程度)。
- 样本量:500、2000、5000。
- 基线风险分布:现实(右偏,中位数 35%)、均匀(中位数 50%)、罕见事件(中位数 5%)。
- 预后信息完整性:是否排除最重要的预后因子(模拟" imperfect prognostic information")。
分析模型: - EM:LASSO 惩罚的逻辑回归,包含所有协变量主效应 + 所有协变量×处理交互项。惩罚参数通过 10 折交叉验证选择(最小化结局预测误差)。 - RM:第一阶段用 LASSO 逻辑回归(忽略处理分配)估计基线风险 \(\hat{h}_i\);第二阶段拟合 \(\text{logit}(P(Y=1)) = \alpha + \beta t + \gamma \hat{h}_i + \delta \hat{h}_i t\),无惩罚。
性能评估:在独立测试集上计算预测 RD(\(\hat{\tau}(x) = \hat{\phi}_0(x) - \hat{\phi}_1(x)\))与真实 RD 的均方根误差(RMSE)和偏差。重复 1000 次模拟。
主要结果¶
核心发现(从表 4、表 5、表 6 提取):
-
RM 在多数场景下 RMSE 更低:在 4 个主要场景 × 7 个子场景的 28 个组合中,RM 在 \(n=500\) 时几乎全部优于 EM(RMSE 更低),在 \(n=2000\) 时多数场景仍占优,在 \(n=5000\) 时约一半场景 EM 反超。RM 的优势在"现实基线风险分布"(右偏)和"罕见事件"场景中最大。
-
样本量是首要调节变量:RM 的优势随 n 增大而缩小。在 \(n=500\) 时,RM 的 RMSE 比 EM 低约 20-40%(具体数值取决于场景);在 \(n=5000\) 时,两者差距缩小到 10% 以内,部分场景 EM 反超。这与偏差-方差权衡的理论预期一致:RM 的降维减少了方差,但 EM 的灵活性在大样本下能更好地捕捉真实交互结构。
-
EM 的优势仅在"纯效应修饰因子"存在且样本量大时出现:在 BOTH+PF+M 场景(含 1 个纯效应修饰因子 m)且 \(n=5000\) 时,EM 的 RMSE 低于 RM。这是 RM 假设被最严重违背的场景——m 不影响基线风险,因此第一阶段赋予其零系数,第二阶段无法利用它。
-
两种方法偏差都很小,差异主要在方差:图 6 显示两种方法的平均偏差都接近零,但 RM 的偏差分布更集中(方差更小)。EM 在 \(n=500\) 时的偏差分布明显更宽,反映了交互项估计的不稳定性。
-
子场景的影响:
- 基线风险分布:罕见事件场景(c)中 RM 优势最大,因为 EM 的交互项在事件率低时更难估计。
- 效应修饰异质性:差异大时(f)EM 的相对表现略有提升,但 RM 仍多数占优。
- 排除重要预后因子(g):RM 的优势缩小,但未反转——即使第一阶段模型不完美,RM 的降维仍然有效。
作者的解释:RM 的优势来自"借力"——通过第一阶段将 p 维预后信息压缩为 1 维基线风险,第二阶段只需估计 4 个参数,大幅减少了方差。EM 的 LASSO 虽然能进行变量选择,但在小样本下交互项的估计仍然不稳定。作者强调,RM 的隐含假设(基线风险是唯一效应修饰因子)在临床中经常近似成立,因为大多数处理效应机制确实通过基线风险传导。
证明路线¶
本文是模拟研究,其"证明"逻辑是:
- 理论论证(第 3 节):先用一个说明性例子(第 3.1 节)展示 RM 的合理性——当处理效应为常数 RR 或 OR 时,基线风险天然是效应修饰因子,RM 的模型结构正确。然后用代数推导(附录 7.1)证明:任何 RM 得到的个体化处理效应公式都可以被 EM 表达,但反之不然——EM 的假设更一般,RM 是 EM 的一个约束版本(所有交互系数与主效应系数成比例)。
- 模拟验证:通过系统变化的场景矩阵,检验理论预期(RM 方差小、EM 偏差小)在有限样本下是否成立,并刻画两种方法相对表现的边界条件(样本量、假设违背程度、事件率)。
- 临床实例:论文没有真实数据应用,但模拟参数(基线风险分布、效应修饰系数)基于临床文献设定(如心血管风险预测模型),使结果具有实践参考价值。
技术技巧¶
- LASSO 惩罚:EM 使用 LASSO 进行变量选择,模拟现实中研究者不知道哪些协变量是真正的效应修饰因子的情况。惩罚参数通过 10 折交叉验证选择,最小化结局预测误差(而非处理效应误差)——这是一个重要的现实选择,因为实践中处理效应误差不可观测。
- 两阶段估计:RM 第一阶段用全部数据(忽略处理分配)拟合基线风险模型,第二阶段用估计的 \(\hat{h}_i\) 作为协变量。作者引用 Van Klaveren et al. (2019) 指出,用全部数据(而非仅对照组)估计基线风险更高效。
- 模拟场景设计:通过"主要场景 × 子场景"的因子设计,系统分离了不同因素(协变量类型、基线风险分布、效应修饰异质性、样本量)对两种方法相对表现的贡献。这是模拟研究的规范做法。
- 评估指标:使用测试集 RMSE 和偏差,而非训练集拟合优度——直接针对预测性能,避免过拟合的虚假优势。
真实例子与应用¶
本文为纯模拟研究,无真实数据应用。但模拟场景的设计有明确的临床动机:
- "现实基线风险分布"(右偏,中位数 35%)基于对 32 个大型临床试验的再分析(Kent et al., 2016, 引用 [4]),该分析显示大多数试验中患者基线风险呈右偏分布。
- 处理效应与基线风险的关系(递增、递减、非线性)模拟了不同作用机制的药物(如抗凝药对高出血风险患者获益更大,某些靶向药对特定生物标志物亚群有效)。
- 样本量 500/2000/5000 对应小型 RCT、大型 RCT 和注册登记研究的典型规模。
作者在讨论中明确指出,模拟结果不能替代真实数据验证,但为实际应用中的方法选择提供了初步证据。
🔎 结论是否比证明窄¶
是,结论比证明窄。具体表现:
-
模拟场景的局限性:所有场景都假设协变量-结局关系为线性逻辑模型(对数几率尺度上的线性),且交互结构相对简单。真实数据中可能存在非线性、高阶交互、测量误差等,这些可能改变两种方法的相对表现。作者在讨论中承认了这一点("We did not consider modern prediction modelling approaches, such as machine learning methods"),但未系统讨论非线性设定下的表现。
-
"RM 优于 EM"的结论被过度泛化:论文的核心结论是"RM 在中小样本下更优",但这一结论基于的模拟场景中,RM 的假设(基线风险是唯一效应修饰因子)至少近似成立。在 BOTH+PF+M 场景(含纯效应修饰因子)且 \(n=5000\) 时,EM 已经反超。作者在摘要和结论中对此有保留("in most scenarios"),但正文中"RM performs particularly well in settings with smaller sample sizes"的表述容易被读者理解为无条件结论。
-
未考虑推断不确定性:论文只评估了点预测的 RMSE 和偏差,未评估置信区间覆盖率、预测区间校准等不确定性量化指标。在实际临床决策中,处理效应估计的不确定性同样重要。RM 的降维可能带来更窄的预测区间,但也可能因模型误设导致区间校准不良——论文未涉及。
-
LASSO 的特定选择:EM 使用 LASSO 作为估计方法,但 LASSO 的变量选择一致性需要条件(如 irrepresentable condition),且交叉验证选择惩罚参数可能不是最优的。使用其他正则化方法(如 adaptive LASSO、SCAD)或贝叶斯收缩可能改变 EM 的表现。作者未做敏感性分析。
-
"公平性"的局限:作者声称这是"公平比较",但 RM 的第二阶段只包含一个协变量(\(\hat{h}_i\)),而 EM 包含所有协变量及其交互。这种不对称性本身就是 RM 的核心假设——如果这个假设成立,RM 自然更高效;如果不成立,RM 的偏差可能很大。模拟结果只是量化了这个权衡,并未证明 RM 在一般意义上"更好"。
四、开放问题¶
-
非线性与高维设定下的比较:本文只考虑了线性逻辑模型。当真实模型包含非线性(如样条、树结构)或高维协变量(p > n)时,RM 的降维优势是否更显著?EM 的 LASSO 在高维下是否比 RM 更有效?——扎根于论文讨论部分 "We did not consider modern prediction modelling approaches, such as machine learning methods"(第 5 节)。
-
连续结局与时间-事件结局:本文只研究了二分类结局。对于连续结局(如血压变化)和时间-事件结局(如生存时间),基线风险作为效应修饰因子的数学关系是否仍然成立?RM 的降维逻辑是否可迁移?——扎根于论文第 5 节 "We considered only logistic regression-based RM and EM for dichotomous outcomes. Further simulation studies are needed to assess whether our findings extend to continuous and time-to-event outcomes."
-
不确定性量化:RM 和 EM 在预测区间校准、置信区间覆盖率上的比较是空白的。特别是 RM 第二阶段使用估计的 \(\hat{h}_i\) 作为协变量,这种"生成式"两步估计对推断的影响(是否低估方差)未被讨论。——扎根于论文只报告 RMSE 和偏差、未报告区间估计的事实。
-
与 meta-learners 的比较:论文明确排除了 T-learner、X-learner(Künzel et al. 2018)、R-learner(Nie & Wager 2021)等现代方法。这些方法在 RCT 数据上的表现是否优于 RM/EM?RM 是否可以视为一种特殊的 meta-learner?——扎根于论文第 5 节 "we did not compare RM and EM with alternative approaches, such as meta-learners"。
-
外部验证与真实数据:模拟结论需要真实 RCT 数据的验证。论文引用的 32 个临床试验再分析(Kent et al., 2016)提供了基线风险分布的经验证据,但没有用真实数据比较 RM 和 EM 的预测性能。一个自然的后续工作是:在多个大型 RCT 中,用交叉验证比较 RM 和 EM 的个体化处理效应预测精度。——扎根于论文第 1 节对 Kent et al. (2016) 的引用及其"缺乏实证比较"的 framing。
-
理论保证:本文没有给出 RM 估计量的渐近性质。在什么条件下,RM 的个体化处理效应预测是相合的?RM 的降维是否可以被理解为一种"半参数约束"(即假设处理效应完全由基线风险决定),其效率损失如何刻画?——扎根于论文第 3 节的理论论证停留在代数层面,未涉及渐近统计性质。
提醒:要确认上述某条是否是真 gap,建议去读 RM/EM 比较这一子领域近 5 年的文献(如 Van Klaveren 2015/2019、Rekkas 2023 的后续引用)——如果多篇近期论文的 intro 都指向同一缺口,说明是共识性 gap;如果各论文对"哪种方法更好"的结论互相矛盾,则说明问题本身可能依赖具体设定,值得深入刻画其边界条件。
Maintained by 陈星宇 · Homepage · Source on GitHub