Response Propensity Estimation and Cross-Fitting¶
作者: Alessandro La Rocca
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.28324
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是调查估计中的非响应调整,具体而言,是当使用灵活的非参数机器学习方法(如随机森林、梯度提升机)来估计每个样本单元的响应倾向性(response propensity)时,如何通过交叉拟合(cross-fitting) 来改善最终总体均值估计量的有限样本性质(偏差、方差、均方误差)。该方向的核心统计问题是:在响应机制的条件独立性假设下,如何利用辅助变量构建稳定的逆概率权重,以校正因单元无应答(unit nonresponse)导致的估计偏差,同时控制因权重极端变异引发的方差膨胀。当前该领域的成熟度属于应用导向的模拟与实证研究阶段,理论上的渐近性质分析(特别是非参数倾向性得分估计下的交叉拟合理论)尚不完整。
发展脉络(history)¶
从论文引言与参考文献中,可以梳理出以下发展脉络:
-
奠基工作:逻辑回归作为标准基准。 逻辑回归因其可解释性、计算简单和在调查加权中的既定角色,长期以来是响应倾向性估计的默认参数方法。论文将其作为“conventional parametric benchmark”(第2页)。Brick (2013) 的综述性文章“Unit nonresponse and weighting adjustments: A critical review”系统讨论了响应倾向性模型和加权调整所依赖的假设,是该领域的经典参考。
-
主要进展:树集成方法(RF, GBM)的引入。 Breiman (2001) 的随机森林(RF)和 Friedman (2001) 的梯度提升机(GBM)被引入调查领域,以应对逻辑回归无法捕捉的非线性关系和交互效应。Buskirk & Kolenikov (2015) 是关键的早期工作,他们“found that RF can provide advantages over logistic regression under complex response mechanisms, particularly when the response process contains interactions”(第7页)。Ferri-García & Rueda (2020) 进一步提供了“more recent evidence similarly suggests that machine-learning methods can outperform conventional logistic regression when response mechanisms are complex”(第7页)。这些工作留下了一个口子:灵活方法虽然能更好地拟合响应机制,但也更容易过拟合,导致权重极端变异。
-
当前 Frontier:交叉拟合的引入与过拟合控制。 本文的核心贡献是将交叉拟合从双/去偏机器学习(DML)文献(Chernozhukov et al., 2018)引入到调查非响应调整的语境中。论文明确指出:“This sample-splitting principle is closely related to the cross-fitting framework developed in the double, debiased machine learning literature, although the present simulation does not constitute a conventional double machine learning estimator”(第3页)。这个引入的动机是:当灵活模型在训练数据上过度拟合响应指示变量时,会产生人为很小的估计倾向性,进而导致巨大的逆概率权重和高度不稳定的估计量。交叉拟合通过提供“out-of-sample”的倾向性预测来缓解这一问题。Ferri-García et al. (2024) 和 Larbi et al. (2024) 是近期在调查领域探讨机器学习与加权的工作,但本文是首次系统性地通过大规模模拟来分离和量化交叉拟合本身的效果。
-
本文的位置: 本文位于上述脉络的交汇点。它承认灵活方法(RF, GBM)在复杂响应机制下的优势(继承自Buskirk & Kolenikov, 2015; Ferri-García & Rueda, 2020),但指出其过拟合风险,并系统检验了交叉拟合(源自Chernozhukov et al., 2018)作为缓解手段的有效性。本文的独特之处在于,它不提出新的理论或方法,而是通过一个精心设计的有限总体蒙特卡洛模拟,在90种配置下,将交叉拟合的效果从学习算法(RF vs GBM)和最终估计量(HT vs Hájek)的效果中分离出来,提供了关于“何时交叉拟合有用”的实证证据。
子线索聚类¶
这些被引文献大致落在以下三条子线索上:
- 线索一:参数 vs. 非参数响应倾向性模型。 这一簇比较逻辑回归与树集成方法(RF, GBM)在非响应调整中的表现。核心问题是:当响应机制偏离线性可加假设时,灵活方法能否带来偏差的降低,以及这种降低是否以方差膨胀为代价。代表工作:Buskirk & Kolenikov (2015), Ferri-García & Rueda (2020), Lohr et al. (2015)。
- 线索二:交叉拟合与样本分裂在因果推断与调查估计中的应用。 这一簇关注通过样本分裂来打破模型拟合与参数估计之间的依赖,从而获得更可靠的推断或更稳定的估计量。核心问题是:交叉拟合能否在有限样本下改善基于机器学习方法的估计量性能。代表工作:Chernozhukov et al. (2018)(理论框架),本文(应用模拟)。
- 线索三:权重稳定性与估计量选择。 这一簇关注在非响应调整中,如何诊断和控制权重的极端变异,以及不同的最终估计量(如HT vs Hájek)对此的敏感性。核心问题是:在权重高度变异时,哪种估计量更稳健,以及是否应该采用修剪(trimming)或截断(winsorization)等策略。代表工作:Brick (2013), Küfner et al. (2022)。
这个方向在追问的核心问题¶
- 灵活方法是否真的优于参数方法? 在何种响应机制(线性、非线性、交互)和样本量下,RF或GBM能比逻辑回归带来更小的偏差和MSE?
- 交叉拟合能否改善灵活方法的有限样本性能? 这种改善是否普遍存在,还是依赖于学习算法、响应机制、样本量和响应率?
- 最终估计量的选择(HT vs Hájek)如何影响交叉拟合的效果? Hájek估计量的归一化能否抵消交叉拟合带来的某些负面效应?
- 如何诊断和控制由灵活方法导致的权重极端变异? 除了交叉拟合,修剪、截断等策略的效果如何,它们与交叉拟合是互补还是替代关系?
当前主流方法与已知瓶颈: 主流方法是使用逻辑回归或RF/GBM估计倾向性,然后构造HT或Hájek估计量。已知瓶颈是:灵活方法在有限样本下容易过拟合,导致权重极端变异,使得HT估计量方差极大,而Hájek估计量虽然更稳定,但其偏差和方差对倾向性估计的准确性仍然敏感。交叉拟合被提出作为缓解过拟合的手段,但其效果的系统性实证证据和理论分析都尚不充分。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么: 作者将缺口 frame 为“当使用灵活机器学习方法估计响应倾向性时,交叉拟合是否能改善非响应调整的有限样本性能?”(第1页摘要)。作者认为,尽管交叉拟合在DML文献中已有理论地位,但其在调查非响应调整这一特定应用中的效果,特别是与不同学习算法(RF vs GBM)和不同最终估计量(HT vs Hájek)的交互作用,尚未被系统研究。因此,本文的模拟设计旨在“isolates the effect of cross-fitting”(第3页),使其成为“显然的下一步”实证工作。
- 哪些竞争路线被他淡化或回避了:
- 理论分析被完全回避。 作者明确表示“the present simulation does not constitute a conventional double machine learning estimator”(第3页),从而回避了对交叉拟合在非参数倾向性得分估计下的渐近性质(如收敛速率、半参数效率)进行理论分析。这是一个重大的回避,因为DML理论(Chernozhukov et al., 2018)主要关注的是参数估计的根号n一致性和渐近正态性,而非本文关注的有限样本MSE。
- 其他交叉拟合变体被淡化。 作者只考虑了5折交叉拟合,没有讨论其他折数(如2折、10折)或重复交叉拟合的效果。这被简化为一个固定的选择。
- 与其他权重稳定化策略的比较被回避。 作者明确排除了倾向性得分修剪或截断(“The simulation deliberately does not apply propensity-score trimming or winsorization”,第8页),以“isolating the effect of cross-fitting itself”。这使得读者无法知道交叉拟合与这些更传统的策略相比是更好、更差还是互补。
- 什么明显该被引/该存在、却没出现在 intro 里?
- 关于交叉拟合在非参数/半参数估计中理论性质的工作。 除了Chernozhukov et al. (2018),还有大量关于样本分裂(sample splitting)和交叉拟合在非参数回归、半参数效率推断中的理论工作(如Newey & Robins, 2018; Kennedy, 2022等)。这些工作能为交叉拟合为何能改善有限样本性能提供更直接的理论支撑,但本文并未引用。这可能是由于本文的定位是纯应用模拟,但作为一个声称要研究交叉拟合效果的论文,缺乏对这些理论基础的引用是一个明显的缺口。
- 关于倾向性得分权重稳定性的更系统的理论。 例如,关于逆概率权重截断(truncation)的渐近性质的理论工作(如Ma & Wang, 2020; Crump et al., 2009)。这些工作与本文的核心关切(权重极端变异)直接相关,但未被提及。
张力¶
未见明显对立引用。所有被引工作基本都认同:灵活方法在复杂机制下优于逻辑回归,但存在过拟合风险;交叉拟合是缓解过拟合的一种有前景的策略。本文的模拟结果也基本支持这一共识,只是进一步揭示了其效果的异质性。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( N \):有限总体大小(本文设为100,000)。
- \( n \):样本量(本文考虑1,000和5,000)。
- \( i \):总体或样本中的单元索引。
- \( X_i \):单元 \( i \) 的辅助变量向量(可观测的协变量)。
- \( Y_i \):单元 \( i \) 的研究变量(连续型,本文的目标是估计其总体均值)。
- \( R_i \):单元 \( i \) 的响应指示变量(\( R_i = 1 \) 表示响应,\( R_i = 0 \) 表示无响应)。这是可观测的。
- \( p_i = P(R_i = 1 | X_i) \):单元 \( i \) 的真实响应倾向性(不可观测的潜在量)。
- \( \hat{p}_i \):单元 \( i \) 的估计响应倾向性(由模型预测得到)。
- \( \pi_i \):单元 \( i \) 的一阶包含概率(由抽样设计决定,本文是分层简单随机抽样)。
- \( d_i = 1/\pi_i \):单元 \( i \) 的设计权重。
- \( w_i = 1/\hat{p}_i \):单元 \( i \) 的非响应调整因子。
- \( \mu = N^{-1} \sum_{i=1}^N Y_i \):目标参数,有限总体均值。
- \( s \):样本集合。
- \( \hat{\mu}_{HT} \):Horvitz-Thompson估计量。
- \( \hat{\mu}_{Hajek} \):Hájek估计量。
- \( \text{ESS} \):有效样本量,衡量权重变异程度。
-
模型:
- 数据生成机制: 有限总体由 \( N \) 个单元组成。每个单元 \( i \) 的 \( (X_i, Y_i) \) 由一个固定的生成模型产生。\( Y_i \) 是辅助变量 \( X_i \) 的线性函数加上独立同分布的高斯噪声(见第4页公式)。响应机制由 \( R_i \) 的生成模型定义:\( R_i \sim \text{Bernoulli}(p_i) \),其中 \( p_i = \exp(\alpha + g(X_i)) / (1 + \exp(\alpha + g(X_i))) \)。函数 \( g(\cdot) \) 的结构(线性、非线性、交互)是变化的,代表了不同的响应机制。
- 关键假设(条件独立性): 给定辅助变量 \( X_i \),响应指示变量 \( R_i \) 与研究变量 \( Y_i \) 是条件独立的。即 \( R_i \perp Y_i | X_i \)。这是非响应调整得以进行的基础假设(可忽略性假设,ignorability)。本文的模拟设计保证了这一假设成立,因为 \( Y_i \) 和 \( R_i \) 都只依赖于 \( X_i \)。
- 要估的对象: 总体均值 \( \mu \)。
-
可观测数据:
- 研究者实际能观测到的是: 对于样本 \( s \) 中的每个单元 \( i \),可以观测到其辅助变量 \( X_i \)、设计权重 \( d_i \)、以及响应指示变量 \( R_i \)。只有当 \( R_i = 1 \) 时,才能观测到研究变量 \( Y_i \)。对于 \( R_i = 0 \) 的单元,\( Y_i \) 是缺失的。
- 想要但观测不到的是: 每个单元的真实响应倾向性 \( p_i \),以及无响应单元的研究变量 \( Y_i \)。整个分析依赖于通过模型 \( \hat{p}_i = \hat{P}(R_i=1|X_i) \) 来估计 \( p_i \),并利用 \( R_i \perp Y_i | X_i \) 的假设来校正缺失。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设我们只有一个二元辅助变量 \( X \in \{0, 1\} \),样本量 \( n=100 \),目标是用逆概率加权估计总体均值 \( \mu \)。
-
设定:
- 总体中,\( X=0 \) 和 \( X=1 \) 各占一半。
- 真实响应机制:\( P(R=1|X=0) = 0.8 \),\( P(R=1|X=1) = 0.2 \)。即 \( X=1 \) 的群体响应率很低。
- 研究变量 \( Y \) 的均值:\( E[Y|X=0] = 10 \),\( E[Y|X=1] = 20 \)。
- 目标:估计总体均值 \( \mu = 0.5*10 + 0.5*20 = 15 \)。
-
问题: 我们用一个非常灵活的模型(比如一棵很深的决策树)来估计 \( \hat{p}_i = \hat{P}(R_i=1|X_i) \)。由于样本量小且模型灵活,这个模型可能会过拟合。
-
无交叉拟合(In-sample)的情况:
- 模型在全部100个样本上训练,然后对同样的100个样本进行预测。
- 由于模型非常灵活,它可能会完美记住每个样本的响应状态。例如,对于 \( X=1 \) 的样本,如果其中某个样本恰好响应了(\( R=1 \)),模型可能会给这个样本一个非常高的 \( \hat{p}_i \)(接近1),而给其他 \( X=1 \) 但未响应的样本一个非常低的 \( \hat{p}_i \)(接近0)。
- 后果: 对于那些被预测为 \( \hat{p}_i \approx 0 \) 的样本,其权重 \( w_i = 1/\hat{p}_i \) 会变得极大。如果这些样本恰好有 \( Y \) 值,那么HT估计量 \( \hat{\mu}_{HT} \) 就会被这些极端的权重严重扭曲,导致巨大的方差和偏差。这就是过拟合导致权重极端变异的典型例子。
-
有交叉拟合(5-fold Cross-fitting)的情况:
- 我们将100个样本随机分成5份,每份20个样本。
- Fold 1: 用Fold 2-5(80个样本)训练模型,然后用这个模型预测Fold 1中20个样本的 \( \hat{p}_i \)。由于模型在训练时没有见过Fold 1中的任何样本,它无法记住这些样本的响应状态。因此,对于Fold 1中 \( X=1 \) 的样本,模型给出的 \( \hat{p}_i \) 会更接近真实的0.2,而不是极端值0或1。
- 重复这个过程5次,每个样本都得到一个“out-of-sample”的 \( \hat{p}_i \)。
- 后果: 这些“out-of-sample”的 \( \hat{p}_i \) 更稳健,不会出现接近0的极端值。因此,权重 \( w_i \) 的变异程度大大降低,HT估计量 \( \hat{\mu}_{HT} \) 的方差和偏差也随之减小。
这个最小内核揭示了本文的核心数学直觉: 交叉拟合通过切断模型拟合与预测之间的直接依赖,防止了灵活模型在训练数据上“记住”响应指示变量,从而避免了产生人为极小的倾向性估计和随之而来的巨大权重。它本质上是一种正则化手段,通过牺牲一点点偏差(因为模型是在略小的数据集上训练的)来换取方差的大幅降低,最终在MSE上获得收益。论文的一般情形(多个连续协变量、RF/GBM等复杂模型)只是这个简单直觉在高维、非线性情况下的推广。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题: 在调查估计的框架下,当使用随机森林(RF)和梯度提升机(GBM)等灵活机器学习方法估计响应倾向性时,5折交叉拟合(cross-fitting)是否能改善Horvitz-Thompson(HT)和Hájek两种非响应调整估计量的有限样本性能(偏差、方差、RMSE)。
- 核心工具/方法: 有限总体蒙特卡洛模拟,包含90种实验配置(2种样本量 × 3种响应机制 × 3种响应率 × 5种倾向性估计方法),每种配置重复2000次。核心比较是:对于RF和GBM,比较“in-sample”预测与“5-fold cross-fitted”预测对最终估计量的影响。
- 主要结论: 交叉拟合在94.4%的配置下改善了HT估计量的RMSE,尤其在低响应率和复杂响应机制下增益更大;但对Hájek估计量的改善仅发生在47.2%的配置中,且效果高度依赖于学习算法和响应机制。Hájek估计量整体上比HT估计量稳定得多。GBM配合交叉拟合在多数小样本配置下表现最佳,而逻辑回归在大样本下表现最好。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 总体与抽样: 有限总体 \( N=100,000 \)。采用分层简单随机抽样,分层变量是连续协变量 \( \eta \) 的四分位数。这引入了设计权重 \( d_i \),使得模拟更贴近实际调查。设计权重被用于最终估计量,但不作为倾向性模型中的拟合权重。
- 响应机制: 三种机制(线性、非线性、交互)代表了从简单到复杂的模型误设定程度。线性机制下,逻辑回归是正确指定的;非线性机制下,逻辑回归是误指定的;交互机制下,逻辑回归也是误指定的。这允许研究者观察灵活方法在模型误设定下的优势。
- 倾向性估计方法: 五种方法:逻辑回归(基准)、RF(in-sample)、RF(5-fold CF)、GBM(in-sample)、GBM(5-fold CF)。逻辑回归只使用in-sample预测,因为其过拟合风险较低。
- 交叉拟合实现: 5折划分,且划分是分层的,以保证每折中响应者和非响应者的比例与总体一致。这是标准做法,避免了因划分不平衡导致的额外变异。
- 无修剪/截断: 这是一个关键设定。作者明确排除了倾向性得分修剪,以隔离交叉拟合的效果。唯一的数值边界是 \( 10^{-6} \) 和 \( 1-10^{-6} \),用于避免算法返回精确0或1时权重未定义,这不属于统计修剪。
- 假设: 核心假设是响应机制的条件独立性(\( R_i \perp Y_i | X_i \)),这在模拟设计中被保证成立。此外,还隐含了重叠假设(overlap),即 \( 0 < P(R_i=1|X_i) < 1 \) 对所有 \( i \) 成立。模拟中的响应率(0.4, 0.6, 0.7)保证了这一点,但低响应率(0.4)下,某些子群的倾向性可能接近0,这正是交叉拟合要缓解的问题。
主要结果¶
本文是应用/方法型,核心量化结论如下:
- 权重变异(ESS): RF产生的权重变异远大于GBM和逻辑回归。RF的mean ESS/n仅为0.167(有CF)和0.319(无CF),而GBM和逻辑回归均在0.46以上(表1)。反直觉的是,对于RF,交叉拟合降低了ESS(从0.319降至0.167),意味着权重变异增大。作者的解释是,交叉拟合可能使得某些单元的倾向性估计变得更小,从而放大了权重。这提示交叉拟合对RF的效果并非简单的“正则化”。
- 估计量性能(RMSE): Hájek估计量的RMSE远低于HT估计量,尤其是在RF下(表2)。例如,RF无CF时,HT的mean RMSE为4098.09,而Hájek仅为5.136。这证实了Hájek归一化对控制权重极端变异的关键作用。
- 交叉拟合的改善频率: 交叉拟合改善了94.4%的配置下HT的RMSE,但仅改善了47.2%的配置下Hájek的RMSE(表3)。这表明交叉拟合对HT的改善是普遍且一致的,但对Hájek则效果不一。
- 交叉拟合增益的异质性:
- 按响应率(表4): 对于HT,交叉拟合的增益随响应率降低而增大(例如GBM下,mean RMSE gain从0.331(70%响应率)增至0.513(40%响应率))。对于Hájek,GBM的增益随响应率降低而减小,RF的增益甚至为负。
- 按响应机制(表5): 对于HT,交叉拟合在所有机制下都有正增益。对于Hájek,GBM的增益在交互机制下最大(0.25),而RF的增益在所有机制下均为负。
- 最佳方法选择(表6): 在小样本(n=1000)下,GBM with CF是多数配置下的最佳方法。在大样本(n=5000)下,逻辑回归 without CF成为所有配置下的最佳方法。RF从未被选为最佳方法。
证明路线与技术技巧¶
本文是模拟研究,没有形式化的定理证明。其“证明路线”是模拟设计本身,可以概括为以下逻辑主干:
- 数据生成: 生成一个已知总体均值的有限总体,并定义多种响应机制。
- 抽样与响应: 从总体中抽取样本,并根据设定的响应机制生成响应指示变量。
- 倾向性估计: 对每个样本,用五种方法(逻辑回归、RF in-sample、RF CF、GBM in-sample、GBM CF)估计其响应倾向性。
- 估计量构造: 用估计的倾向性构造HT和Hájek估计量。
- 性能评估: 在2000次重复中,计算每个估计量的Monte Carlo偏差、方差和RMSE,以及权重的ESS。
- 比较与归因: 通过比较不同方法(特别是RF/GBM的in-sample vs CF)的性能,来归因交叉拟合的效果。通过比较不同响应机制和样本量下的结果,来揭示效果的异质性。
技术技巧:
- 有限总体蒙特卡洛: 不同于无限总体设定,这里的目标参数是固定的有限总体均值,模拟重复的是抽样和响应过程。这更贴近调查实践。
- 分层抽样: 引入设计权重,使得模拟更真实。
- 响应机制设计: 精心设计的线性、非线性、交互三种机制,系统地考察了模型误设定的影响。
- 交叉拟合实现: 分层划分保证了每折的代表性。
- 性能度量: 使用偏差、绝对偏差、方差、RMSE和ESS,从多个维度评估性能,特别是ESS直接诊断了权重变异问题。
真实例子与应用¶
本文没有使用真实数据例子。它是一个纯模拟研究。模拟本身构成了论文的全部实证内容。模拟的目的是在已知真相(总体均值)的条件下,系统地比较不同方法,从而为实践提供指导。作者在结论中明确将结果定位为“simulation results indicate...”,并指出其局限性。
🔎 结论是否比证明窄¶
是的,结论的表述比模拟设计所能证明的范围要窄,但这是合理的。主要体现为:
- “Cross-fitting improves RMSE in 94.4% of the configurations for the Horvitz-Thompson estimator”(第1页摘要)。这个结论是准确的,因为它严格限定于“the configurations”和“the Horvitz-Thompson estimator”。它没有声称交叉拟合对所有HT估计量都有效。
- “Overall, the findings suggest that cross-fitting can improve the finite-sample performance and stability of estimators adjusted for nonresponse weights based on flexible response propensity models”(第1页摘要)。这里的“can improve”是谨慎的,因为模拟结果明确显示了对Hájek估计量的改善是不一致的。结论的“suggest”而非“prove”是恰当的。
- 潜在过度泛化: 作者在结论中说“Cross-fitting is selected in 8 of 18 configurations as part of the method with the lowest Hájek RMSE”(第1页摘要)。这个数字(8/18)虽然正确,但可能被读者解读为交叉拟合是“好”的。然而,表6显示,这8次全部发生在n=1000的小样本下,且全部是GBM with CF。在大样本下,逻辑回归 without CF是唯一的最佳方法。因此,更精确的结论应该是“在小样本下,GBM配合交叉拟合是Hájek估计量的最佳选择之一”。
- 未证明的claim: 作者在引言中提到交叉拟合“reducing the risk that highly adaptive machine learning method exploit idiosyncratic features of the observations on which they were trained”(第3页)。这个机制解释是合理的,但模拟并没有直接验证这个机制(例如,没有比较in-sample和out-of-sample的预测误差)。它只是一个合理的后验解释。
四、开放问题(点到为止,扎根具体语句)¶
- 理论分析:交叉拟合在非参数倾向性得分估计下的渐近性质是什么? 本文的模拟结果(特别是RF下交叉拟合反而增大了权重变异)挑战了“交叉拟合总是正则化”的简单直觉。一个开放问题是:对于像RF这样的非参数方法,交叉拟合对最终估计量的偏差、方差和MSE的渐近影响是什么?这与DML理论(Chernozhukov et al., 2018)中关于交叉拟合保证根号n一致性的结论有何联系和区别?扎根点: 论文第3页承认“the present simulation does not constitute a conventional double machine learning estimator”,回避了理论分析。
- 交叉拟合与其他权重稳定化策略的比较。 本文刻意排除了倾向性得分修剪(trimming)或截断(winsorization)。一个直接的开放问题是:交叉拟合与这些传统策略相比,在控制权重变异和改善MSE方面,是互补、替代还是更优?扎根点: 论文第8页明确说明“The simulation deliberately does not apply propensity-score trimming or winsorization... to isolate the effect of cross-fitting itself”。
- 交叉拟合的折数选择。 本文只使用了5折交叉拟合。折数(如2折、10折、重复交叉拟合)如何影响偏差-方差权衡?更少的折数意味着更大的训练集(偏差更小)但更少的预测集(方差更大),反之亦然。是否存在一个最优的折数,或者它是否依赖于样本量和模型复杂度?扎根点: 论文第3页只描述了“five-fold cross fitting”,没有讨论其他选择。
- 扩展到其他因果参数和更复杂的设定。 本文只研究了总体均值的估计。交叉拟合在估计处理效应(ATE, ATT)、分位数处理效应或更一般的因果参数时,其效果是否类似?当辅助变量维度很高时,交叉拟合的效果是否会发生变化?扎根点: 论文第1页将目标参数限定为“population mean”,且模拟中的辅助变量维度很低(5个)。
Maintained by 陈星宇 · Homepage · Source on GitHub