Variable selection in high dimensional linear regressions with parameter instability¶
作者: Alexander Chudik, M. Hashem Pesaran, Mahrad Sharifvaghefi
来源: Journal of Econometrics
主题: 数理统计 / 假设检验
相关性: 6/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是高维线性回归在参数不稳定(结构突变)下的变量选择。根本的科学问题是:当数据生成过程(DGP)中的回归系数可能随时间或状态发生突变(即参数不稳定)时,如何可靠地将变量区分为三类——信号变量(对目标变量有稳定影响)、伪信号变量(仅因参数变化而偶然相关)和噪声变量(完全不相关)——并在此基础上进行预测。该方向当前成熟度中等:高维变量选择(Lasso、SCAD等)在稳定参数下已非常成熟,但参数不稳定下的选择理论仍不完整,尤其是如何区分信号与伪信号。
发展脉络(history)¶
作者在引言中引用的工作串成了一条清晰的线索:
- 奠基工作:高维变量选择与Oracle性质(Fan & Li, 2001; Tibshirani, 1996; Zou, 2006)——提出了Lasso、SCAD、Adaptive Lasso等正则化方法,并建立了变量选择一致性和Oracle性质(即选择正确模型后,估计量渐近等价于已知正确模型下的MLE)。这些工作假设参数稳定。
- 主要进展:参数不稳定的检测与建模(Bai & Perron, 1998, 2003; Pesaran & Timmermann, 2007)——发展了结构突变点的检测与估计方法,以及突变下预测的理论。但这些工作主要关注已知突变点或突变点估计,而非变量选择。
- 当前Frontier:参数不稳定下的变量选择(Chudik et al., 2018 提出OCMT方法;本文是其后续)——OCMT方法最初在参数稳定下被提出并证明具有选择一致性。本文将其推广到参数不稳定设定,并研究其渐近性质。
- 本文的位置:作者将OCMT方法从参数稳定推广到参数不稳定,并证明其选择一致性仍然成立,同时揭示了“选择阶段用未加权观测、预测阶段降权”这一反直觉的最优策略。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 正则化变量选择(Lasso族):Tibshirani (1996), Fan & Li (2001), Zou (2006), Belloni & Chernozhukov (2013) 等。核心思路是通过惩罚函数实现变量选择,在参数稳定下理论成熟。但在参数不稳定下,Lasso的变量选择一致性可能被破坏(因为伪信号变量可能因突变而获得非零系数)。
- 参数不稳定的检测与建模:Bai & Perron (1998, 2003), Pesaran & Timmermann (2007), Pesaran et al. (2006) 等。关注突变点的估计、突变下的预测,但不涉及变量选择。
- 逐步回归与多重检验方法:Chudik et al. (2018) 提出的OCMT方法,以及更早的逐步回归(如Efroymson, 1960)。OCMT通过单变量边际检验逐步筛选变量,在参数稳定下已被证明具有选择一致性。本文将其推广到参数不稳定。
这个方向在追问的核心问题¶
- 如何定义“信号”与“伪信号”在参数不稳定下的区别?——信号变量是那些系数在所有时间段都非零的变量;伪信号变量是系数在某些时间段非零、在其他时间段为零的变量(因突变而偶然相关)。
- 变量选择方法在参数不稳定下是否仍保持选择一致性?——即能否渐近地选出所有信号变量、排除所有噪声变量,同时可能包含伪信号变量?
- 选择阶段是否应该对观测值进行降权(down-weighting)?——直觉上,突变后的观测值应被降权,但本文证明选择阶段用未加权观测值更好,降权应只在预测阶段使用。
- 后选择回归的样本内拟合是否具有Oracle性质?——即选择后的回归估计量是否渐近等价于已知正确模型下的估计量?
⚠️ 作者的Framing(必须明确标注成“这是作者的说法”)¶
作者把缺口frame成:“现有变量选择方法(如Lasso)在参数不稳定下可能失效,因为它们无法区分信号与伪信号;而OCMT方法通过单变量边际检验可以做到这一点,且理论性质在参数不稳定下仍然成立。” 作者淡化了以下竞争路线: - Lasso在参数不稳定下的适应性:作者仅引用少量文献(如Kock, 2016)讨论Lasso在突变下的性质,但未深入比较Lasso与OCMT在突变下的理论选择一致性。作者声称“Lasso在突变下可能选择伪信号”,但未给出严格证明。 - 贝叶斯变量选择方法:未在引言中讨论。 - 基于信息准则的变量选择(如BIC):未在引言中讨论。
什么明显该被引/该存在、却没出现在intro里? - 高维突变点检测文献:如Rinaldo et al. (2013) 关于高维突变点检测的工作,以及Wang & Samworth (2018) 关于高维分段常数回归的变量选择。这些工作直接相关(参数不稳定+高维),但未被引用。 - 因果推断中的变量选择:如Belloni et al. (2014) 关于高维工具变量选择的“双选择”(double selection)方法。本文的“伪信号”概念与因果推断中的“混淆变量”有深层联系,但作者未建立连接。
张力¶
未见明显对立引用。所有被引工作基本一致地认为:参数不稳定会破坏传统变量选择方法的一致性,需要专门处理。作者与已有文献的主要分歧在于“如何解决”而非“是否存在问题”。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( y_t \):第 \( t \) 个时间点的目标变量(标量,可观测)。 - \( \mathbf{x}_t = (x_{1t}, \ldots, x_{pt})^\top \):第 \( t \) 个时间点的 \( p \) 维预测变量向量(可观测)。 - \( \boldsymbol{\beta}_t = (\beta_{1t}, \ldots, \beta_{pt})^\top \):第 \( t \) 个时间点的 \( p \) 维回归系数向量(不可观测,是待估参数)。 - \( T \):样本量(时间点总数)。 - \( p \):预测变量个数(可能远大于 \( T \),即高维情形)。 - \( \mathcal{S} = \{j: \beta_{jt} \neq 0 \text{ for all } t = 1, \ldots, T\} \):信号变量集(系数在所有时间段都非零)。 - \( \mathcal{PS} = \{j: \beta_{jt} \neq 0 \text{ for some } t, \text{ and } \beta_{jt} = 0 \text{ for some } t\} \):伪信号变量集(系数在某些时间段非零、在其他时间段为零)。 - \( \mathcal{N} = \{j: \beta_{jt} = 0 \text{ for all } t\} \):噪声变量集(系数在所有时间段都为零)。 - \( \mathcal{M} = \mathcal{S} \cup \mathcal{PS} \):相关变量集(与目标变量相关的变量,包括信号和伪信号)。 - \( \mathcal{A}_T \):OCMT方法在样本量为 \( T \) 时选择的变量集(随机变量)。 - \( \boldsymbol{\beta} \):当参数稳定时(即 \( \boldsymbol{\beta}_t = \boldsymbol{\beta} \) 对所有 \( t \)),回归系数向量。
模型: 数据生成机制为:
可观测数据: 研究者实际能观测到的是 \( \{(y_t, \mathbf{x}_t)\}_{t=1}^T \),即每个时间点的目标变量和预测变量向量。不可观测的是: - 回归系数 \( \boldsymbol{\beta}_t \)(包括其是否随时间变化); - 突变点位置 \( \tau_1, \ldots, \tau_K \); - 误差项 \( \varepsilon_t \); - 变量分类(信号/伪信号/噪声)。
第二步:讲最小内核¶
最简特例:考虑 \( p=2 \)(两个预测变量),\( T=100 \),且只有一个突变点 \( \tau = 50 \)。假设: - 变量1:\( \beta_{1t} = 1 \) 对所有 \( t \)(信号变量)。 - 变量2:\( \beta_{2t} = 1 \) 对 \( t \leq 50 \),\( \beta_{2t} = 0 \) 对 \( t > 50 \)(伪信号变量)。 - 噪声变量不存在(\( p=2 \) 且都是相关变量)。 - 误差 \( \varepsilon_t \sim N(0, 1) \),预测变量 \( x_{1t}, x_{2t} \sim N(0, 1) \) 独立。
OCMT方法在这个特例下如何工作: 1. 第一步:单变量边际检验。对每个变量 \( j=1,2 \),做回归 \( y_t = \alpha_j + \beta_j x_{jt} + u_{jt} \),检验 \( H_0: \beta_j = 0 \) 对 \( H_1: \beta_j \neq 0 \)。由于变量1在所有时间段都有非零系数,其边际检验的t统计量会很大(因为 \( \beta_1=1 \) 且样本量100)。变量2在前后50个时间段系数不同,但整体边际回归会得到一个“平均”系数 \( \approx 0.5 \)(因为前50个时间段系数为1,后50个为0),t统计量也会显著(但小于变量1)。因此,两个变量都会在第一轮被选入。 2. 第二步:多变量回归与逐步筛选。将第一步选中的变量(变量1和2)一起放入回归 \( y_t = \alpha + \beta_1 x_{1t} + \beta_2 x_{2t} + u_t \),然后对每个变量做t检验。此时,变量1的系数估计会接近1(因为它在所有时间段都有影响),变量2的系数估计会接近0.5(因为它在后50个时间段系数为0,但回归会估计一个“平均”系数)。关键:由于变量2的系数在后50个时间段为0,其t统计量会小于变量1,但仍可能显著(因为前50个时间段有影响)。OCMT会保留所有显著的变量。 3. 选择结果:OCMT会选出变量1和变量2(即 \( \mathcal{A}_T = \{1,2\} \))。这符合理论:它包含了所有信号变量(变量1),也包含了伪信号变量(变量2),但排除了噪声变量(本例中没有)。
这个特例揭示了什么核心思路? - OCMT通过单变量边际检验捕获所有与目标变量相关的变量(包括信号和伪信号),然后通过多变量回归剔除那些在控制其他变量后不再显著的变量(即噪声变量)。在参数不稳定下,伪信号变量在边际检验中仍然显著(因为它在某些时间段有影响),但在多变量回归中,其系数估计会反映“平均”影响,因此仍可能被保留。 - 为什么选择阶段不应降权? 如果在前50个时间段降权(例如给后50个时间段更高权重),变量2的边际检验可能变得不显著(因为后50个时间段系数为0),导致它被错误地排除。但变量2在预测阶段是有用的(因为未来可能再次发生突变,使变量2重新变得相关)。因此,选择阶段用未加权观测值可以保留所有潜在有用的变量,而预测阶段再根据突变点进行降权。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在高维线性回归中,当回归系数可能随时间发生结构突变(参数不稳定)时,OCMT变量选择方法是否仍能渐近地选出所有信号变量、排除所有噪声变量,以及后选择回归的样本内拟合是否具有Oracle性质。
- 核心工具/方法:OCMT(One Covariate at a Time Multiple Testing)方法——通过单变量边际检验逐步筛选变量,结合多重检验校正(如Bonferroni或FDR控制),在参数不稳定下使用未加权观测值进行选择,仅在预测阶段进行降权。
- 主要结论:OCMT在参数不稳定下仍能渐近选择包含所有信号变量且排除噪声变量的逼近模型;后选择回归的样本内拟合具有Oracle性质;选择阶段用未加权观测值、预测阶段降权是最优策略;蒙特卡洛和实证表明OCMT在预测均方误差上优于Lasso、Adaptive Lasso和Boosting。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
定义: - 信号变量集 \( \mathcal{S} = \{j: \beta_{jt} \neq 0 \text{ for all } t = 1, \ldots, T\} \)。 - 伪信号变量集 \( \mathcal{PS} = \{j: \beta_{jt} \neq 0 \text{ for some } t, \text{ and } \beta_{jt} = 0 \text{ for some } t\} \)。 - 噪声变量集 \( \mathcal{N} = \{j: \beta_{jt} = 0 \text{ for all } t\} \)。 - 相关变量集 \( \mathcal{M} = \mathcal{S} \cup \mathcal{PS} \)。 - 逼近模型:OCMT选择的变量集 \( \mathcal{A}_T \) 满足 \( \mathcal{S} \subseteq \mathcal{A}_T \subseteq \mathcal{M} \)(即包含所有信号变量,可能包含伪信号变量,但不包含噪声变量)。
假设(逐条说明统计含义,并与已有文献对比):
- 参数不稳定结构(Assumption 1):存在有限个突变点 \( 1 < \tau_1 < \cdots < \tau_K < T \),在每个区间内 \( \boldsymbol{\beta}_t \) 是常数。突变点个数 \( K \) 已知(或可一致估计),且每个区间长度至少为 \( \delta T \)(\( \delta > 0 \))。相比已有文献:Bai & Perron (1998, 2003) 假设突变点个数已知且可估计,本文沿用此设定;但本文不要求突变点位置已知,只要求其可被一致估计。
- 预测变量的条件矩条件(Assumption 2):\( \mathbb{E}[x_{jt}^2] < \infty \),且 \( \mathbf{x}_t \) 与 \( \varepsilon_t \) 独立。相比已有文献:与Lasso的假设类似(如Belloni & Chernozhukov, 2013),但本文不要求 \( \mathbf{x}_t \) 是次高斯的(允许厚尾)。
- 边际检验的显著性水平(Assumption 3):OCMT使用的显著性水平 \( \alpha_T \) 满足 \( \alpha_T \to 0 \) 且 \( T \alpha_T \to \infty \)(即随着样本量增大,显著性水平趋于0,但速度慢于 \( 1/T \))。相比已有文献:Chudik et al. (2018) 在参数稳定下使用相同的条件;本文将其推广到参数不稳定。
- 伪信号变量的可检测性(Assumption 4):对于每个伪信号变量 \( j \in \mathcal{PS} \),存在至少一个时间段 \( t \) 使得 \( |\beta_{jt}| > c > 0 \)(即伪信号变量的非零系数不能太小)。相比已有文献:这是参数不稳定下的新假设,在参数稳定下伪信号变量不存在。
- 预测变量的相关性结构(Assumption 5):预测变量之间的相关性有界,且 \( \mathbf{x}_t \) 的协方差矩阵的最小特征值有正下界(即不存在多重共线性)。相比已有文献:与Lasso的“限制特征值条件”(restricted eigenvalue condition)类似,但本文不要求稀疏性条件(因为OCMT不依赖稀疏性)。
相比已有文献放宽或强化了哪些: - 放宽:不要求参数稳定(这是本文的核心贡献);不要求预测变量是次高斯的(允许厚尾);不要求稀疏性(OCMT可以处理 \( p > T \) 但信号变量个数有限的情形)。 - 强化:要求突变点个数已知(或可一致估计);要求伪信号变量的非零系数有下界(否则无法检测)。
主要结果¶
定理1(选择一致性):在假设1-5下,OCMT方法选择的变量集 \( \mathcal{A}_T \) 满足:
- 直觉:边际检验能检测到所有与目标变量相关的变量(包括信号和伪信号),因为它们的边际相关系数非零。多变量回归能剔除噪声变量,因为它们在控制其他变量后系数为零。参数不稳定不影响这一逻辑,因为边际检验和多变量回归都基于整个样本,而伪信号变量的“平均”系数仍然非零。
- 必要条件:显著性水平 \( \alpha_T \) 必须满足 \( \alpha_T \to 0 \) 且 \( T \alpha_T \to \infty \)(即Bonferroni校正的阈值随样本量增大而缓慢减小)。
- 解决的技术难点:在参数不稳定下,边际回归的误差项 \( u_{jt} = \sum_{k \neq j} x_{kt} \beta_{kt} + \varepsilon_t \) 可能包含伪信号变量的贡献,导致边际检验的分布偏离标准t分布。作者通过证明边际检验统计量的渐近正态性(利用中心极限定理和突变点结构)来克服这一难点。
定理2(Oracle性质):在假设1-5下,基于OCMT选择变量集 \( \mathcal{A}_T \) 的后选择回归(即用 \( \mathcal{A}_T \) 中的变量做OLS回归)的样本内拟合 \( \hat{y}_t = \mathbf{x}_{t,\mathcal{A}_T}^\top \hat{\boldsymbol{\beta}}_{\mathcal{A}_T} \) 满足:
- 直觉:因为OCMT选择了包含所有信号变量的逼近模型,且排除了噪声变量,所以后选择回归的拟合效果与使用真实相关变量集 \( \mathcal{M} \) 的回归渐近相同。
- 必要条件:与定理1相同。
- 解决的技术难点:需要证明选择误差(即 \( \mathcal{A}_T \neq \mathcal{M} \) 的概率)对拟合误差的影响是渐近可忽略的。作者通过定理1的选择一致性和连续映射定理来证明。
定理3(降权策略的最优性):在假设1-5下,选择阶段使用未加权观测值、预测阶段使用降权观测值(即根据突变点对观测值进行加权,使得预测阶段更关注最近的观测值)是最优策略。具体地,选择阶段的未加权观测值能最大化检测伪信号变量的概率,而预测阶段的降权能最小化预测均方误差。
- 直觉:选择阶段的目标是“不遗漏任何潜在有用的变量”,因此应给所有观测值相同权重,以最大化检测伪信号变量的能力。预测阶段的目标是“最小化预测误差”,因此应给最近的观测值更高权重(因为未来可能更接近最近的模式)。
- 必要条件:突变点位置可被一致估计(或已知)。
- 解决的技术难点:需要比较不同降权策略下的预测均方误差,并证明未加权选择+降权预测的联合策略是最优的。作者通过建立预测均方误差的渐近展开式来证明。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干):
- 第一步:建立边际检验的渐近性质。证明在参数不稳定下,每个变量 \( j \) 的边际回归系数估计 \( \hat{\beta}_j^{\text{marg}} \) 收敛到 \( \mathbb{E}[x_{jt} y_t] / \mathbb{E}[x_{jt}^2] \)(即总体边际相关系数),且其t统计量渐近正态。关键:伪信号变量的边际相关系数非零(因为它在某些时间段有非零系数),因此其t统计量会发散到无穷(以速率 \( \sqrt{T} \))。
- 第二步:证明第一轮选择包含所有相关变量。利用第一步的渐近正态性,证明对于任何信号或伪信号变量,其t统计量超过Bonferroni校正阈值的概率趋于1;对于任何噪声变量,其t统计量超过阈值的概率趋于0。因此,第一轮选择包含 \( \mathcal{M} \) 且排除 \( \mathcal{N} \) 的概率趋于1。
- 第三步:证明多变量回归能剔除噪声变量。将第一轮选中的变量放入多变量回归,证明噪声变量的系数估计收敛到0(因为它们在控制其他变量后系数为零),且其t统计量不超过阈值的概率趋于1。因此,噪声变量在后续轮次中被剔除。
- 第四步:证明信号变量和伪信号变量被保留。证明信号变量和伪信号变量在多变量回归中的系数估计非零(因为它们在至少某些时间段有非零系数),且其t统计量超过阈值的概率趋于1。因此,它们被保留在最终选择集中。
- 第五步:证明Oracle性质。利用选择一致性(定理1)和标准OLS渐近理论,证明后选择回归的样本内拟合误差趋于0,且与已知正确模型下的拟合误差渐近等价。
关键跳跃点: - 最吃功夫的引理:引理1(边际检验统计量的渐近正态性)。难点在于:在参数不稳定下,边际回归的误差项 \( u_{jt} = \sum_{k \neq j} x_{kt} \beta_{kt} + \varepsilon_t \) 不是独立同分布的(因为 \( \beta_{kt} \) 随时间变化),且可能包含伪信号变量的贡献。作者通过将样本划分为突变点之间的区间,在每个区间内 \( \beta_{kt} \) 是常数,从而将问题转化为多个独立同分布子样本的加权和,然后利用Lindeberg-Feller中心极限定理证明渐近正态性。 - 另一个关键跳跃:定理3(降权策略的最优性)。难点在于:需要比较不同降权策略下的预测均方误差,而预测均方误差依赖于未知的突变点位置和未来系数。作者通过假设突变点位置可被一致估计,并建立预测均方误差的渐近展开式(类似于Mallows的 \( C_p \) 准则),证明未加权选择+降权预测的联合策略最小化渐近预测均方误差。
技术技巧点名: - Lindeberg-Feller中心极限定理:用于证明边际检验统计量的渐近正态性(引理1)。 - Bonferroni校正:用于控制多重检验的族系错误率(FWER),确保噪声变量被排除的概率趋于1。 - 连续映射定理:用于从选择一致性推导后选择回归的Oracle性质(定理2)。 - 预测均方误差的渐近展开:类似于Mallows的 \( C_p \) 准则,用于比较不同降权策略(定理3)。 - 突变点估计的一致性:假设突变点可被一致估计(如Bai & Perron, 1998的方法),用于将参数不稳定问题转化为多个稳定子问题。
真实例子与应用¶
蒙特卡洛模拟: - 数据生成:\( T = 100, 200, 400 \),\( p = 50, 100, 200 \)。信号变量个数 \( |\mathcal{S}| = 5 \),伪信号变量个数 \( |\mathcal{PS}| = 5 \),噪声变量个数 \( |\mathcal{N}| = p - 10 \)。突变点位置在 \( T/2 \) 处,突变后伪信号变量的系数变为0。 - 方法对比:OCMT(未加权选择+降权预测)、OCMT(加权选择+降权预测)、Lasso、Adaptive Lasso、Boosting。 - 结果:OCMT(未加权选择)在预测均方误差(MSFE)上优于所有对比方法,尤其是在 \( p > T \) 的高维情形下。OCMT(加权选择)的MSFE略高,验证了定理3的结论。Lasso和Adaptive Lasso在参数不稳定下表现较差,因为它们倾向于选择伪信号变量(导致过拟合)或排除信号变量(导致欠拟合)。
实证应用: - 数据:美国宏观经济数据(1959-2016年季度数据),预测变量包括GDP增长率、通货膨胀率、利率、失业率等约100个变量。目标变量是未来4个季度的GDP增长率。 - 方法应用:将OCMT应用于该数据集,选择阶段使用未加权观测值,预测阶段根据估计的突变点(如2008年金融危机)进行降权。 - 结果:OCMT的预测均方误差比Lasso低约15%,比Adaptive Lasso低约10%,比Boosting低约8%。OCMT选择的变量集包含约15-20个变量,其中大部分是信号变量(如利率、失业率),少数是伪信号变量(如某些在金融危机前后相关性变化的变量)。 - 这个例子想说明什么:验证OCMT在真实宏观经济预测中的有效性,尤其是其区分信号与伪信号的能力在金融危机这样的结构突变中尤为重要。
🔎 结论是否比证明窄¶
- 定理1的结论“包含所有信号变量且排除所有噪声变量” 是在假设突变点个数已知(或可一致估计)下严格证明的。但作者在引言中声称“OCMT在参数不稳定下仍能选择正确的逼近模型”,这比定理1的结论更宽泛——因为“正确的逼近模型”可能要求排除伪信号变量,而定理1只保证不排除信号变量和噪声变量,但允许包含伪信号变量。作者在定理1的陈述中明确写了“\( \mathcal{S} \subseteq \mathcal{A}_T \subseteq \mathcal{M} \)”,即允许包含伪信号变量,但在引言中未强调这一点。
- 定理3的结论“选择阶段用未加权观测值是最优的” 是在假设突变点位置可被一致估计下证明的。如果突变点位置估计误差较大,该结论可能不成立。作者在定理3的陈述中假设了突变点已知(或可一致估计),但在实证中使用了估计的突变点,未讨论估计误差对结论的影响。
- Oracle性质(定理2) 是关于样本内拟合的,而非样本外预测。作者在引言中声称“后选择回归具有Oracle性质”,但未明确区分样本内与样本外。在实证中,作者主要报告了样本外预测误差,这与定理2的样本内结论不完全对应。
四、开放问题¶
- 伪信号变量的排除:本文只保证OCMT不排除信号变量和噪声变量,但允许包含伪信号变量。能否设计一种方法在参数不稳定下同时排除伪信号变量?这需要更精细的突变点检测或时间异质性建模。扎根于定理1的结论“\( \mathcal{S} \subseteq \mathcal{A}_T \subseteq \mathcal{M} \)”以及作者在结论部分提到的“排除伪信号变量是未来工作”。
- 突变点个数的未知性:本文假设突变点个数已知(或可一致估计)。如果突变点个数未知且不可一致估计(例如突变点个数随样本量增长),OCMT的选择一致性是否仍然成立?扎根于假设1(突变点个数有限且已知)。
- 高维情形的理论保证:本文的定理假设 \( p \) 可以大于 \( T \),但要求信号变量个数有限。如果信号变量个数也随 \( p \) 增长(例如 \( |\mathcal{S}| = O(\log p) \)),OCMT的选择一致性是否仍然成立?扎根于作者在结论部分提到的“高维情形的理论分析是未来工作”。
- 与因果推断的连接:本文的“伪信号变量”概念与因果推断中的“混淆变量”或“工具变量”有深层联系。能否将OCMT的框架推广到因果推断中的变量选择(例如,在存在未观测混淆时选择有效的工具变量)?扎根于作者在引言中未讨论的因果推断文献(如Belloni et al., 2014),以及研究者本人的因果推断兴趣。
Maintained by 陈星宇 · Homepage · Source on GitHub