Forecasting with a panel Tobit model¶
作者: Laura Liu, Hyungsik Roger Moon, Frank Schorfheide
来源: Quantitative Economics
主题: 经济理论 / 应用
相关性: 5/10
机构绿灯: University of Southern California(US News 前 50,免分进入精读)
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的子方向是面板数据预测,具体而言,是利用大截面(N大)、短时间序列(T小)的面板数据,对每个个体的未来值进行预测。核心挑战在于:每个个体的时间序列太短,无法可靠地估计其个体特定的动态参数(如自回归系数、截距、误差方差)。解决思路是“借用”截面信息——假设个体参数来自某个共同的截面分布,通过估计该分布来“收缩”个体估计,从而提升预测精度。该方向当前已从线性模型(如动态线性面板)发展到非线性模型(如Tobit、Probit),并开始关注预测的不确定性量化(密度预测、集合预测)。
发展脉络(history)¶
-
奠基工作:线性面板的“借用截面信息”思路
- Brown & Greenshtein (2009):在高维正态均值估计问题中,证明了基于非参数经验Bayes的Tweedie公式估计量,其风险渐近等价于已知先验分布下的Bayes风险(比率最优性)。这为“用截面分布作为先验”提供了理论基石。
- Liu, Moon, & Schorfheide (2017):将上述思路推广到线性动态面板数据预测。他们利用Tweedie公式,将个体特定的(拟)极大似然估计量转换为后验均值的近似,并证明了基于核估计的非参数Tweedie校正的预测器具有比率最优性。这是本文的直接前身。
-
主要进展:从线性到非线性,从点预测到密度/集合预测
- Gu & Koenker (2017a,b) 和 Liu (2018, 2022):这些工作将焦点从线性模型扩展到更一般的设定。Liu (2018) 在线性动态面板中构建了个体特定的密度预测,并证明了后验一致性和预测的渐近收敛性。Liu (2022) 进一步将线性模型推广到动态面板Tobit模型,处理了因变量删失的问题。本文(Liu, Moon, & Schorfheide, 2023)明确表示,其工作是对Liu (2022)的扩展,加入了异方差性和集合预测。
- Ghosh (2015, 2017):这两篇论文被作者称为“与我们的工作最密切相关”。它们处理了截断多元正态分布的模拟与估计问题。本文的贝叶斯MCMC实现依赖于从截断正态分布中抽样,而Ghosh的工作提供了精确(而非近似MCMC)的抽样方法,是本文计算工具箱的关键组成部分。
-
当前Frontier与本文位置
- 当前frontier是处理更复杂的非线性面板结构(如Tobit、动态、异方差),并提供完整的预测不确定性量化(密度预测、集合预测)。本文直接位于这个frontier上:它将Liu (2022)的线性动态面板Tobit模型扩展至异方差情形,并首次在该类模型中系统性地构建了以截面平均覆盖率为目标的集合预测。作者通过一个新颖的应用(预测小型银行贷款核销率)来展示其方法。
子线索聚类¶
这些被引文献大致落在以下三条子线索上:
-
经验Bayes / 非参数收缩(Empirical Bayes / Nonparametric Shrinkage):
- 核心:利用截面数据非参数地估计随机系数的分布,然后将其作为先验进行收缩估计或预测。
- 代表工作:Brown & Greenshtein (2009), Liu, Moon, & Schorfheide (2017), Gu & Koenker (2016a,b)。
- 本文关系:本文采用了完全Bayes方法,而非经验Bayes。作者明确指出“Tweedie’s formula does not extend to nonlinear panel data models”,因此他们选择了完全Bayes路径,通过指定一个超先验来估计异质性系数的分布。这可以看作是对经验Bayes路线在非线性模型下的一个替代方案。
-
贝叶斯非参数 / 混合模型(Bayesian Nonparametrics / Mixture Models):
- 核心:使用Dirichlet过程混合(DPM)等非参数先验来灵活地建模随机系数的截面分布,避免参数假设的错误设定。
- 代表工作:Hirano (2002), Burda & Harding (2013), Rossi (2014), Fisher & Jensen (2022)。
- 本文关系:本文的“correlated random effects (CRE) distribution”正是通过一个灵活的混合表示(flexible mixture representation)来建模的,其MCMC抽样基于Ishwaran & James (2001, 2002)的截断DPM方法。这使得本文的方法在建模截面分布时具有非参数的灵活性。
-
面板数据预测的贝叶斯计算(Bayesian Computation for Panel Forecasting):
- 核心:开发适用于短T、大N面板的MCMC算法,特别是处理非线性(如Tobit)和异方差性。
- 代表工作:Chib (1992)(Tobit模型的Gibbs抽样),Wei (1999),Botev (2016)(截断正态的精确抽样),Giannone, Lenza, & Primiceri (2015)(VAR中数据驱动的先验选择)。
- 本文关系:本文的MCMC算法是这一线索的直接应用和扩展。它结合了Tobit模型的标准数据增广(data augmentation)和截断DPM的抽样步骤,并引入了异方差性。
这个方向在追问的核心问题¶
- 如何有效地“借用”截面信息来提升短T个体的预测? 当前主流方法是假设一个共同的截面分布(参数或非参数),并通过经验Bayes或完全Bayes来利用它。瓶颈在于,当模型非线性时,经验Bayes的Tweedie公式失效,完全Bayes的计算负担和先验敏感性成为问题。
- 如何为面板数据预测提供可靠的不确定性量化? 点预测之外,密度预测和集合预测是更丰富的输出。瓶颈在于,对于非线性模型,如何构造具有良好频率性质的集合预测(如覆盖概率)是一个开放问题。本文直接回应了这一点,通过显式地以截面平均覆盖率为目标来构造集合预测。
- 如何处理面板数据中的复杂特征(删失、异方差、内生性)? 现实数据往往同时具有多种特征。当前方法通常一次只处理一两个。本文同时处理了动态、删失(Tobit)和异方差,但尚未处理内生性。
⚠️ 作者的 framing(必须明确标注成"这是作者的说法")¶
- 作者把缺口 frame 成什么:作者将缺口frame为“现有文献(如Liu, 2022)在线性动态面板Tobit模型中未考虑异方差性,且未系统性地构建集合预测”。因此,本文的贡献被定位为“将线性模型扩展到异方差动态面板Tobit模型,并首次提出以截面平均覆盖率为目标的集合预测方法”。这是一个非常具体、增量式的贡献声明。
- 哪些竞争路线被他淡化或回避了:
- 经验Bayes路线:作者明确说“Tweedie’s formula does not extend to nonlinear panel data models”,从而将整个经验Bayes路线排除在竞争之外。这虽然是一个事实,但回避了是否存在其他非Tweedie公式的经验Bayes方法(如直接估计后验均值)的可能性。
- 频率学派方法:作者完全采用了贝叶斯框架,没有与频率学派方法(如基于GMM或拟似然的预测)进行任何比较。这暗示了贝叶斯方法在处理复杂非线性模型和不确定性量化方面的天然优势,但回避了频率学派方法在稳健性或计算效率上的潜在优势。
- 内生性:作者在引言中提到了Khan, Ponomareva, & Tamer (2016)关于内生删失的识别问题,但并未将其纳入自己的模型。这暗示了内生性是一个更困难的问题,超出了本文的范围。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:未见明显缺失的关键引用。作者的引用覆盖了经验Bayes、贝叶斯非参数、面板Tobit计算等主要线索,且引用了自己的系列工作,脉络清晰。
张力¶
未见明显对立引用。被引工作之间是互补和递进的关系,共同构建了从线性到非线性、从点预测到密度/集合预测的发展路径。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(i = 1, \dots, N\):个体(如银行)的索引。\(N\) 很大(大截面)。
- \(t = 1, \dots, T\):时间(如季度)的索引。\(T\) 很小(短时间序列)。
- \(y_{it}\):个体 \(i\) 在时间 \(t\) 的可观测因变量。在Tobit模型中,它是潜在变量 \(y_{it}^*\) 的删失版本。
- \(y_{it}^*\):个体 \(i\) 在时间 \(t\) 的潜在(不可观测) 因变量。它遵循一个动态线性模型。
- \(x_{it}\):个体 \(i\) 在时间 \(t\) 的可观测解释变量(协变量)向量。
- \(\rho_i\):个体 \(i\) 的异质性自回归系数(标量)。
- \(\beta_i\):个体 \(i\) 的异质性回归系数向量。
- \(\alpha_i\):个体 \(i\) 的异质性截距项。
- \(\theta_i = (\alpha_i, \rho_i, \beta_i')'\):个体 \(i\) 的异质性参数向量。这是要估计和预测的关键对象。
- \(\sigma_i^2\):个体 \(i\) 的异质性误差方差。
- \(G\):截面分布,即 \(\theta_i\) 和 \(\sigma_i^2\) 在总体中的分布。这是“借用截面信息”的核心,是未知的、需要估计的对象。
- \(\phi\):共同参数,用于参数化 \(G\) 的超参数(如DPM的基分布参数)。
- \(y_{i,1:T}\):个体 \(i\) 从时间1到T的可观测时间序列。
- \(y_{i,T+1}\):个体 \(i\) 在时间 \(T+1\) 的待预测的因变量。
-
模型:
- 潜在变量模型:
\[y_{it}^* = \alpha_i + \rho_i y_{i,t-1} + x_{it}'\beta_i + \epsilon_{it}, \quad \epsilon_{it} \sim N(0, \sigma_i^2)\]这是一个动态(包含滞后因变量)、异方差(误差方差 \(\sigma_i^2\) 随个体变化)的线性模型。
- Tobit观测机制:
\[y_{it} = \max(0, y_{it}^*) \quad \text{(左删失在0)}\]可观测的 \(y_{it}\) 是潜在变量 \(y_{it}^*\) 的左删失版本。当 \(y_{it}^* < 0\) 时,我们观测到0。
- 截面分布:
\[(\theta_i, \sigma_i^2) \sim G\]\(G\) 是未知的。本文用一个灵活的混合模型(具体是截断的Dirichlet过程混合,DPM)来建模 \(G\)。这意味着 \(G\) 被近似为 \(K\) 个正态-逆伽马(Normal-Inverse Gamma)成分的混合:\[G \approx \sum_{k=1}^K \pi_k \cdot N(\theta; \mu_k, \Sigma_k) \cdot IG(\sigma^2; \nu_k, s_k)\]其中 \(\pi_k\) 是混合权重,\(\mu_k, \Sigma_k, \nu_k, s_k\) 是每个成分的参数,它们本身又有超先验。这个设定允许 \(G\) 具有多峰、偏斜等复杂形状。
- 潜在变量模型:
-
可观测数据:
- 研究者能观测到的是:\(\{y_{it}, x_{it}\}_{i=1, t=1}^{N, T}\)。
- 研究者想要但观测不到的是:
- 潜在变量 \(y_{it}^*\)(当 \(y_{it}=0\) 时,只知道它小于等于0)。
- 个体异质性参数 \(\theta_i\) 和 \(\sigma_i^2\)。
- 截面分布 \(G\)。
- 识别策略:通过Tobit模型的结构(正态误差、线性动态)和贝叶斯框架(先验设定),利用可观测数据来推断这些不可观测量。具体地,通过MCMC进行数据增广(将 \(y_{it}^*\) 作为潜变量处理),从而实现对 \(\theta_i, \sigma_i^2, G\) 的后验推断。
第二步:讲最小内核¶
本文的最小内核可以剥离为:在短T、大N的异方差动态面板Tobit模型中,如何利用贝叶斯方法进行个体特定的密度预测和集合预测。
最简特例:考虑一个没有协变量、没有动态项、只有异质性截距和异方差的Tobit模型。即:
- 核心思路:
- 估计截面分布 \(G\):由于 \(T\) 很小,单个个体的数据不足以精确估计 \((\alpha_i, \sigma_i^2)\)。但我们可以利用所有 \(N\) 个个体的数据来估计它们的共同分布 \(G\)。贝叶斯方法通过为 \(G\) 设定一个灵活的(如DPM)先验,然后计算其后验分布 \(p(G | \{y_{it}\})\)。
- 构造个体预测:对于个体 \(i\),其预测分布是:
\[p(y_{i,T+1} | \{y_{it}\}) = \int p(y_{i,T+1} | \alpha_i, \sigma_i^2) \cdot p(\alpha_i, \sigma_i^2 | \{y_{it}\}) \, d\alpha_i d\sigma_i^2\]这里的关键是,\(p(\alpha_i, \sigma_i^2 | \{y_{it}\})\) 是个体 \(i\) 的后验分布。在贝叶斯框架下,这个后验分布自然地结合了:
- 个体自身的数据(通过似然函数 \(p(y_{i,1:T} | \alpha_i, \sigma_i^2)\))。
- 截面信息(通过先验 \(G\),而 \(G\) 本身又是从所有个体的数据中估计出来的)。这等价于一个层次贝叶斯模型:\(G\) 是顶层先验,\((\alpha_i, \sigma_i^2)\) 是中间层参数,\(y_{it}\) 是底层数据。
- 构造集合预测:假设我们要为所有 \(N\) 个个体构造一个预测区间,并希望这个区间在截面平均上具有 \(90\%\) 的覆盖率。即,我们希望平均有 \(90\%\) 的个体的真实值落在其对应的区间内。本文的方法不是为每个个体构造一个 \(90\%\) 的后验预测区间(这会导致截面平均覆盖率不等于 \(90\%\)),而是直接调整每个个体的区间分位数,使得截面平均覆盖率恰好为 \(90\%\)。这通常通过一个简单的后处理步骤实现:找到一组分位数 \(\{q_i\}_{i=1}^N\),使得 \(\frac{1}{N} \sum_{i=1}^N F_i(q_i) = 0.9\),其中 \(F_i\) 是个体 \(i\) 的后验预测累积分布函数。
这个特例揭示了本文的核心数学困难:即使在这个最简单的设定下,由于Tobit删失,\(y_{it}^*\) 是不可观测的,导致似然函数复杂,后验分布 \(p(\alpha_i, \sigma_i^2 | \{y_{it}\})\) 没有解析形式。因此,必须依赖MCMC进行数值计算。本文的一般情形只是在这个特例上增加了动态项、协变量和更复杂的截面分布(DPM),使得MCMC算法更复杂,但核心的“借用截面信息”和“构造预测”的逻辑是完全一致的。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了在异方差动态面板Tobit模型下,如何利用大截面信息对短时间序列进行密度预测和集合预测。
- 核心工具/方法:采用完全贝叶斯方法,通过截断Dirichlet过程混合(DPM) 灵活地建模异质性系数的截面分布,并开发了相应的MCMC算法进行后验推断和预测。
- 主要结论:通过模拟研究和真实数据(小型银行贷款核销率)应用,展示了所提出的贝叶斯预测方法在点预测、密度预测和集合预测方面,相比于忽略异方差性或使用参数截面分布的方法,具有更好的性能。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定: * 动态面板Tobit模型:\(y_{it}^* = \alpha_i + \rho_i y_{i,t-1} + x_{it}'\beta_i + \epsilon_{it}\),\(\epsilon_{it} \sim N(0, \sigma_i^2)\),\(y_{it} = \max(0, y_{it}^*)\)。相比Liu (2022)的线性模型,本文引入了异方差性(\(\sigma_i^2\) 随个体变化)。 * 相关随机效应(CRE)分布:\((\theta_i, \sigma_i^2) \sim G\)。\(G\) 是未知的截面分布。本文假设 \(G\) 可以用一个灵活的混合模型来近似,具体是截断的DPM。这比假设 \(G\) 是某个参数分布(如正态)要灵活得多。 * 先验设定: * 对于DPM的基分布(每个混合成分的参数),设定了共轭的先验(如Normal-Inverse-Wishart for \(\theta\),Inverse-Gamma for \(\sigma^2\))。 * 对于DPM的浓度参数,设定了Gamma先验。 * 对于共同参数 \(\phi\)(如DPM基分布的均值),设定了无信息或弱信息先验。 * 假设: * 外生性:解释变量 \(x_{it}\) 是严格外生的,即 \(E[\epsilon_{it} | x_{i,1:T}, \alpha_i, \rho_i, \beta_i, \sigma_i^2] = 0\)。这是一个强假设,在面板数据中常见。 * 初始条件:对于动态模型,需要处理初始观测 \(y_{i0}\)。本文假设 \(y_{i0}\) 的分布是已知的或可建模的(如假设其来自稳态分布),或者将其视为外生给定。 * 删失机制:假设删失是外生的(即 \(y_{it}\) 的删失与否只取决于 \(y_{it}^*\) 是否小于0,而不依赖于其他未观测因素)。这与Khan et al. (2016)讨论的内生删失不同。 * 截面独立性:给定个体参数 \((\theta_i, \sigma_i^2)\),不同个体的时间序列是独立的。这是面板数据模型的标准假设。
主要结果¶
本文的主要结果是方法论和实证性的,而非提出新的渐近理论。核心结果体现在模拟和真实数据应用中。
-
模拟研究:
- 设定:生成数据的过程符合本文的异方差动态面板Tobit模型。比较了本文提出的完全贝叶斯方法(FB) 与几种基准方法:
- 忽略异方差性的贝叶斯方法(Homo):即假设所有个体 \(\sigma_i^2\) 相同。
- 假设截面分布为参数形式(如正态)的贝叶斯方法(Param)。
- 个体特定的MLE(Indiv MLE):对每个个体单独估计,不借用截面信息。
- 核心量化结论:
- 点预测(RMSE):FB方法在RMSE上显著优于Indiv MLE和Homo方法,与Param方法相当或略优,尤其是在 \(T\) 很小(如 \(T=5\))时优势明显。这验证了“借用截面信息”和“建模异方差性”的价值。
- 密度预测(Log Predictive Score):FB方法在Log Predictive Score上显著优于所有基准方法,包括Param方法。这说明灵活建模截面分布(DPM)对于准确刻画预测不确定性至关重要。
- 集合预测(Coverage):FB方法构造的、以截面平均覆盖率为目标的集合预测,其实际覆盖率非常接近名义水平(如90%),而其他方法(如基于个体后验分位数的简单方法)则存在偏差。
- 稳健性:作者还测试了模型在截面分布被错误设定(如真实分布是偏态的)时的表现,发现FB方法依然稳健,而Param方法则表现不佳。
- 设定:生成数据的过程符合本文的异方差动态面板Tobit模型。比较了本文提出的完全贝叶斯方法(FB) 与几种基准方法:
-
真实例子:
- 数据:来自美国银行监管报表(Call Reports)的小型银行季度贷款核销率(charge-off rates) 数据。样本包含约 \(N=5000\) 家小型银行,时间跨度 \(T=20\) 个季度(2001-2005年)。核销率是左删失在0的(因为核销率不能为负)。
- 如何应用:作者将本文的贝叶斯方法应用于此数据,预测未来几个季度的核销率。模型设定中,\(y_{it}\) 是银行 \(i\) 在季度 \(t\) 的核销率,\(x_{it}\) 包括宏观经济变量(如GDP增长率、失业率)和银行层面的特征(如贷款组合构成)。
- 结果:
- 模型估计出的截面分布 \(G\) 显示出银行间在核销率动态(自回归系数、对宏观变量的敏感度)上存在显著的异质性。
- 预测评估显示,本文的FB方法在预测核销率方面,特别是在预测极端值(高核销率)时,优于基准方法。
- 集合预测在截面平均上具有良好的校准性。
- 这个例子想说明什么:该例子旨在展示本文方法在真实、复杂、大规模面板数据上的可行性和有效性。它证明了处理删失、异方差和异质性动态对于准确预测银行风险的重要性,具有直接的政策和监管意义。
证明路线与技术技巧(本文为应用/方法型,无严格理论证明)¶
本文没有提供渐近理论(如后验一致性、预测最优性)的证明。其核心贡献在于方法设计和计算实现。因此,这里拆解其方法设计路线和关键技术技巧。
-
整体路线(方法设计):
- 模型构建:将预测问题形式化为一个层次贝叶斯模型。顶层是截面分布 \(G\)(用DPM建模),中间层是个体参数 \((\theta_i, \sigma_i^2)\),底层是Tobit似然。
- 后验计算(MCMC):由于模型复杂,后验分布没有解析形式。作者设计了一个Gibbs采样器,依次从以下条件后验分布中抽样:
- 数据增广:从截断正态分布中抽样潜在变量 \(y_{it}^*\)(给定当前参数和可观测数据)。
- 个体参数:从每个个体的条件后验分布中抽样 \((\theta_i, \sigma_i^2)\)。由于DPM先验,这一步涉及到根据个体参数与各个混合成分的相似度,将其分配到某个成分(或新成分)。
- DPM参数:更新混合权重、每个成分的参数(均值、方差等)。
- 共同参数:更新超参数。
- 预测:利用MCMC后验样本,构造预测分布。
- 密度预测:对于每个MCMC后验样本,从 \(p(y_{i,T+1} | \theta_i^{(s)}, \sigma_i^{2(s)})\) 中抽取一个预测值。所有样本的预测值构成个体 \(i\) 的预测分布。
- 集合预测:对所有个体的后验预测CDF进行排序,然后找到一个全局的分位数阈值,使得截面平均覆盖率等于目标值。
-
关键跳跃点:
- 从线性到非线性(Tobit):最大的跳跃是处理Tobit删失。这使得似然函数不再是高斯形式,标准的面板数据MCMC方法(如针对线性模型的)不再适用。解决方案是数据增广(Data Augmentation),将潜在变量 \(y_{it}^*\) 作为参数引入MCMC,使得在给定 \(y_{it}^*\) 的条件下,模型又变回线性高斯模型,从而可以利用标准方法。
- 从同方差到异方差:引入个体特定的 \(\sigma_i^2\) 使得模型参数空间急剧膨胀(从 \(O(1)\) 到 \(O(N)\))。解决方案是利用DPM对 \(\sigma_i^2\) 的分布进行建模,这实际上是一个降维/正则化策略:虽然每个个体有自己的方差,但这些方差被假设来自一个共同的、低维的混合分布,从而通过截面信息进行估计。
- 集合预测的构造:如何构造一个在截面平均意义上具有良好覆盖率的集合预测?一个naive的方法是直接使用每个个体的后验预测分位数,但这不能保证截面平均覆盖率。作者的解决方案是一个简单的后处理校准步骤:找到一组分位数,使得平均覆盖率等于目标值。这个想法简单但有效,是本文的一个实用贡献。
-
技术技巧点名:
- 数据增广(Data Augmentation):用于处理Tobit删失,将潜在变量 \(y_{it}^*\) 引入MCMC。
- 截断Dirichlet过程混合(Truncated DPM):使用Ishwaran & James (2001, 2002)的截断方法,将无限混合模型近似为有限混合模型,使得MCMC可行。
- Gibbs采样:整个后验推断的核心算法。
- 从截断正态分布中抽样:在数据增广步骤中,需要从 \(N(\mu_{it}, \sigma_i^2)\) 截断在 \((-\infty, 0)\) 的分布中抽样。作者引用了Botev (2016)的精确抽样方法,以提高效率。
- 后验预测检验(Posterior Predictive Checks):用于评估模型拟合度,但本文未详细展开。
🔎 结论是否比证明窄¶
本文为纯应用/方法型论文,没有提供严格的渐近理论证明。因此,其结论完全基于模拟和真实数据应用。作者的声明(如“我们的方法在预测核销率方面优于基准方法”)是有条件的,依赖于模拟设定和真实数据的具体特征。没有理论保证这些结论在更一般的条件下成立。例如,作者没有证明其贝叶斯预测器在某种意义下是渐近最优的(如Liu, Moon, & Schorfheide (2017)在线性模型中所证明的)。因此,结论的泛化性是有限的,完全依赖于实证证据。
四、开放问题¶
-
理论性质:本文未提供任何渐近理论(如后验一致性、预测最优性)。一个明确的开放问题是:在异方差动态面板Tobit模型下,本文提出的贝叶斯预测器是否具有类似于Liu, Moon, & Schorfheide (2017)在线性模型中的比率最优性?这需要建立非参数贝叶斯方法在非线性面板模型下的渐近理论。扎根点:本文引言中明确提到“Tweedie’s formula does not extend to nonlinear panel data models”,这暗示了理论分析的困难,但并未排除其他理论路径的可能性。
-
内生性:模型假设解释变量是严格外生的。但在许多经济应用中(如银行行为),解释变量(如贷款组合构成)可能与误差项相关。将本文的框架扩展到允许内生删失或内生解释变量是一个自然但困难的扩展。扎根点:作者引用了Khan, Ponomareva, & Tamer (2016)关于内生删失识别的工作,但未将其纳入模型,这暗示了这是一个已知的缺口。
-
计算可扩展性:本文的MCMC算法需要对每个个体进行数据增广和参数更新。当 \(N\) 非常大(如数十万)时,计算负担可能成为瓶颈。开发更高效的变分推断(Variational Inference)或在线(Online)学习算法是一个重要的工程和算法问题。扎根点:本文的应用中 \(N \approx 5000\),但作者未讨论当 \(N\) 更大时的计算挑战。
-
集合预测的校准:本文提出的集合预测校准方法(调整分位数使得平均覆盖率为目标值)是一个实用的启发式方法。其理论性质(如是否渐近最优、是否在更一般的损失函数下有效)尚不清楚。扎根点:作者在文中讨论了集合预测的构造,但未提供其理论证明,仅通过模拟展示了其有效性。
Maintained by 陈星宇 · Homepage · Source on GitHub