Repairing Locally Misspecified GMM: An Empirical Bayes Approach¶
作者: Patrick Kline
主题: 经济理论 / 应用
相关性: 6/10
链接: https://arxiv.org/abs/2608.23925
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向研究的是广义矩方法(GMM)在模型设定存在局部误差时的修复与推断问题。GMM 的核心在于利用过识别约束(overidentifying restrictions)来估计参数,但当这些矩条件被轻微违反(即存在 n^{-1/2} 阶的设定误差)时,标准的 GMM 估计量会产生一阶偏差,且其方差估计会低估不确定性。该方向的目标是:在承认模型是近似而非精确的前提下,利用过识别约束中的信息来校正偏差、改进精度,并实现“设定误差感知”(misspecification-aware)的频率推断。当前成熟度属于活跃发展期,已有多个竞争框架,但尚未形成统一范式。
发展脉络¶
- 奠基工作:Sargan (1958) 和 Hansen (1982) 建立了 GMM 的过识别检验框架(J 统计量),其核心思想是比较样本矩条件与零的偏离。然而,正如作者引用 Andrews, Chen, and Tecchio (2025) 所指出的,J 统计量在现代实证工作中很少被报告,因为模型拒绝难以解释。
- 局部设定误差框架:Andrews, Gentzkow, and Shapiro (2017) 提出了一个关键框架,将设定误差视为
n^{-1/2}阶的固定向量b。他们证明,在此框架下,GMM 估计量的一阶偏差为Λb/√n,但渐近方差不变。这为后续研究提供了基础,但将b视为固定常数,限制了信息的利用。 - 贝叶斯与准贝叶斯方法:Andrews, Barnhard, and Carlson (2024) 提出了一个旋转不变先验下的贝叶斯推断方法,但要求先验均值为零。Chernozhukov, Hansen, Kong, and Wang (2025) 提出了一个准贝叶斯方法,在
m随n增长的环境下,对结构参数和设定误差都指定先验。作者指出,这些方法的覆盖陈述依赖于对设定误差分布(如高斯性)的假设。 - 线性 IV 的排除限制违反:Kolesár et al. (2015) 研究了线性 IV 模型中排除限制违反的问题,提出了一个基于
k类估计量的偏差校正方法,其关键假设是违反项与一阶段系数正交。作者指出,该方法依赖于同方差假设,而本文在更一般的 GMM 框架下工作,允许异方差和非线性矩条件。 - 本文的位置:本文在上述工作的基础上,将设定误差
b视为可交换随机变量,而非固定常数。这允许作者估计设定误差的均值和方差(超参数),并利用这些估计来构造偏差校正和经验贝叶斯收缩估计量。本文的渐近框架要求m^2/n → 0,排除了“许多工具变量”偏差成为一阶问题的情况,但覆盖了大多数 GMM 应用场景。
子线索聚类¶
- 局部设定误差的固定效应方法:以 Andrews, Gentzkow, and Shapiro (2017) 为代表,将
b视为固定但未知的向量。这类方法侧重于敏感性分析或推断,但无法利用b的结构信息来改进估计。 - 贝叶斯与准贝叶斯方法:以 Andrews, Barnhard, and Carlson (2024) 和 Chernozhukov, Hansen, Kong, and Wang (2025) 为代表,对
b施加先验分布。这类方法能提供完整的后验推断,但推断的有效性依赖于先验的正确性。 - 线性 IV 的特定方法:以 Kolesár et al. (2015) 为代表,专门针对线性 IV 模型中的排除限制违反。这类方法通常依赖于特定的结构假设(如正交性、同方差),但计算简单,有明确的实证应用导向。
核心问题与瓶颈¶
- 如何识别设定误差的分布特征? 在过识别模型中,只有
m-p个线性组合的矩条件是“可见的”(即被M矩阵投影后的残差)。如何从这些可见的组合中推断出所有m个设定误差的均值和方差?本文的答案是:利用可交换性假设,通过矩方程(1)来识别。 - 如何构造偏差校正估计量? 已知一阶偏差为
µΛ1_m/√n,但µ未知。如何估计µ并构造可行的偏差校正估计量?本文提出了基于M矩阵的回归估计量µ̂。 - 如何实现设定误差感知的推断? 标准 GMM 方差估计忽略了设定误差的方差
σ²。如何构造一个包含σ²的方差估计量,并保证置信区间在无条件意义下(即对b的分布取平均)具有正确的渐近覆盖?本文通过组合中心极限定理和方差估计量V̂_BC和V̂_EB来解决。 - 经验贝叶斯收缩能否进一步改进精度? 偏差校正后,估计误差中仍包含可预测的结构(即
b中未被µ捕捉的部分)。能否利用σ²的估计来构造一个最优线性预测器,从而进一步降低风险?本文的答案是肯定的,并证明了 EB 估计量在领先项风险上弱优于 BC 估计量。
⚠️ 作者的 framing¶
作者将缺口 frame 成:现有局部设定误差方法要么将 b 视为固定常数(浪费了结构信息),要么依赖于特定的先验分布(推断对先验敏感)。本文通过引入可交换性假设,在两者之间架起桥梁:既利用了 b 的随机结构来估计超参数,又保持了频率推断的客观性。 作者淡化了以下竞争路线:
- 固定 b 的敏感性分析:作者在引言中承认 Andrews, Gentzkow, and Shapiro (2017) 的框架,但指出其“没有量化近似误差的性质”。
- 全局设定误差:作者明确将分析限制在局部设定误差(n^{-1/2} 阶),并指出全局设定误差会导致 GMM 不一致。这回避了更困难的全局设定误差问题。
- 其他贝叶斯方法:作者指出 Andrews, Barnhard, and Carlson (2024) 要求先验均值为零,而本文放松了这一限制。但作者没有深入讨论当可交换性假设本身被违反时,这些方法的相对稳健性。
什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用关于随机效应模型或混合模型的计量经济学文献,这些文献也处理了类似的可交换性结构(例如,在面板数据或分层模型中)。此外,关于经验贝叶斯方法在计量经济学中的一般性应用(如 Chen 2026)虽然被引用,但作者没有将其与更广泛的 EB 文献(如 Efron 2010)联系起来。
张力¶
未见明显对立引用。各工作主要在假设强度、推断目标和应用范围上有所不同,而非得出相互矛盾的结论。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型与可观测数据¶
- 符号:
θ ∈ ℝ^p:目标参数向量,是研究者想要估计的对象。g(θ) ∈ ℝ^m:m个总体矩条件组成的向量。在正确设定下,g(θ₀) = 0。ĝ(θ) ∈ ℝ^m:g(θ)的样本对应物。G ∈ ℝ^{m×p}:g(θ)在θ₀处的雅可比矩阵,G = ∇_θ g(θ₀)。W ∈ ℝ^{m×m}:GMM 的权重矩阵,正定。Λ ∈ ℝ^{p×m}:灵敏度矩阵,Λ = -(G'W G)^{-1} G'W。它衡量了样本矩条件对参数估计的局部影响。M ∈ ℝ^{m×m}:残差生成矩阵,M = I_m - H,其中H = -GΛ是斜投影矩阵。M将矩条件投影到G的列空间的正交补上。b ∈ ℝ^m:设定误差向量。在局部设定误差框架下,g(θ₀) = b/√n。ε_n ∈ ℝ^m:抽样噪声,ε_n = √n(ĝ(θ₀) - g(θ₀))。r_n ∈ ℝ^m:缩放后的样本矩条件,r_n = √n ĝ(θ₀) = b + ε_n。µ ∈ ℝ:设定误差的实现均值,µ = (1/m) Σ_{j=1}^m b_j。σ² ∈ ℝ:设定误差的实现方差,σ² = (1/(m-1)) Σ_{j=1}^m (b_j - µ)²。Q ∈ ℝ^{m×m}:中心化矩阵,Q = I_m - (1/m) 1_m 1_m'。V ∈ ℝ^{m×m}:ε_n的渐近协方差矩阵。-
Σ ∈ ℝ^{m×m}:r_n的协方差矩阵,Σ = V + σ² Q。 -
模型:
- 局部设定误差模型:假设存在一个唯一的真实参数
θ₀,但矩条件被n^{-1/2}阶的设定误差污染:g(θ₀) = b/√n。这里b是一个随机向量,而非固定常数。 - 可交换性假设:
b的各个分量b_j是可交换的(exchangeable),即它们的联合分布是置换不变的。这意味着所有b_j具有相同的边际分布,且所有(b_j, b_k)对具有相同的联合分布。 -
独立性假设:
b与ε_n独立。 -
可观测数据:
- 研究者可以观测到样本矩条件
ĝ(θ)及其在θ̂处的值ĝ(θ̂)。 - 研究者可以估计
G(通过Ĝ)、V(通过V̂)和W(通过Ŵ)。 - 不可观测:设定误差向量
b本身是不可观测的。研究者只能通过M矩阵投影后的残差M r_n来间接推断b的性质。M矩阵“隐藏”了p个线性组合的b_j,这些组合与G的列空间相关。
第二步:最小内核——线性 IV 模型,p=1,m 个工具¶
考虑最简单的线性 IV 模型:Y_i = θ₀ T_i + e_i,其中 T_i 是内生的,我们有 m 个工具变量 Z_i ∈ ℝ^m。假设排除限制被轻微违反:E[Y_i - θ₀ T_i | Z_i] = b_j / √n,其中 b_j 是第 j 个工具的直接效应。
- 矩条件:
g(θ) = E[(Y_i - θ T_i) Z_i]。在θ₀处,g(θ₀) = b/√n。 - 雅可比矩阵:
G = -E[T_i Z_i] ∈ ℝ^{m×1},是一个列向量。 - 灵敏度矩阵:
Λ = -(G'W G)^{-1} G'W,是一个1×m的行向量。Λ1_m是一个标量。 - GMM 估计量:
θ̂是 TSLS 估计量。 - 核心问题:由于
b的存在,θ̂有偏差µ Λ1_m / √n,且方差被低估。
最小内核的推导:
1. 偏差校正:如果我们知道 µ,我们可以构造偏差校正估计量 θ̂_BC = θ̂ - (µ/√n) Λ1_m。这相当于从 θ̂ 中减去其领先项偏差。
2. µ 的识别:由于 M1_m 非零(即 1_m 不在 G 的列空间中),我们可以通过回归 M r_n 对 M1_m 来识别 µ。具体地,µ = (M1_m)' M r_n / ||M1_m||²。这个公式的直觉是:M r_n 是 r_n 中与 G 正交的部分,而 M1_m 是 1_m 中与 G 正交的部分。它们的比值给出了 b 的均值 µ。
3. σ² 的识别:σ² 可以通过 M r_n 的残差平方和减去抽样噪声的期望来识别。具体地,σ² = (||M r_n - µ M1_m||² - tr(M V M')) / tr(M' M Q)。这个公式的直觉是:M r_n 的总方差由抽样方差 tr(M V M') 和设定误差方差 σ² tr(M' M Q) 组成。
4. 经验贝叶斯收缩:偏差校正后,估计误差为 Λ (r_n - µ 1_m)。这个误差中有一部分是“可预测的”,即与 M r_n 相关的部分。EB 估计量通过减去 Λ Π (r_n - µ 1_m) 来移除这部分可预测的误差,其中 Π 是 r_n - µ 1_m 对 M r_n 的最优线性预测系数。这相当于对 r_n - µ 1_m 进行收缩,使其更接近其条件均值(零)。
这个最小内核的核心思路:在可交换性假设下,b 的均值和方差可以通过过识别约束的“平均”行为来估计。利用这些估计,我们可以先校正偏差(BC),再通过经验贝叶斯收缩进一步降低方差(EB)。整个方法的关键在于,m 足够大(但 m²/n → 0),使得对 µ 和 σ² 的估计足够精确。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当 GMM 的矩条件存在可交换的
n^{-1/2}阶设定误差时,如何利用过识别约束来修复参数估计和推断。 - 核心工具/方法:提出了一个经验贝叶斯框架,通过估计设定误差的均值
µ和方差σ²,构造了偏差校正(BC)和经验贝叶斯收缩(EB)两个估计量。 - 主要结论:在
m²/n → 0的渐近框架下,建立了µ̂和σ̂²的一致性;证明了 BC 和 EB 估计量均以√n速率收敛;证明了 EB 估计量在领先项风险上弱优于 BC 估计量;利用组合中心极限定理建立了两个估计量的渐近正态性,并提供了设定误差感知的方差估计量,实现了有效的频率推断。
关键设定与假设¶
- Assumption 1 (可交换性与独立性):
b ⊥ ε_n:设定误差与抽样噪声独立。这是一个关键的经济学假设,排除了数据依赖的矩选择规则。b可交换,且具有有界四阶矩。这是本文的核心假设,允许利用b的结构信息。ε_n渐近正态,均值为零,协方差为V。- Assumption 2 (渐近正则性条件):
m = m(n) → ∞,且m²/n → 0。这排除了“许多工具变量”偏差,但允许m随n增长。||W||₂ = 1,||V||₂ = 1(归一化)。行和一致有界。- 一阶段估计量(
Ĝ,V̂,Λ̂,M̂)在算子范数下以O_p(√(m/n))或O_p(1/√n)速率一致收敛。 M V M'的最小非零特征值λ⁺_min(M V M')满足λ⁺_min(M V M') · n/m → ∞。这确保了残差化后的矩条件协方差非退化。G的条目一致有界,||M||₂ = O(1)。m^{-1} ||M1_m||² → κ ∈ (0, ∞)。这确保了µ是强识别的。Var(ε_n) = V_n存在,且||V_n - V||₂ = O(√(m/n))。- Assumption 3 (率条件):
||Λ1_m|| = O(1):偏差校正项的幅度有界。||Λ||₂ = O(1):灵敏度矩阵的算子范数有界。- Assumption 4 (EB 正则性):
tr(((M Σ_µ M')⁺)²) = O(m):中心化后的矩条件协方差矩阵的逆特征值平方和以m为阶,限制了弱识别方向。E[||(Π̂_σ - Π) M_µ r_n||²] = O(m²/n):一阶段估计误差对 EB 预测器的影响可控。||(I_m - Π) M_µ||₂ = O(1):收缩残差算子有界。- Assumption 5 (CLT 条件):
Λ_⋆ 1_m = 0,||Λ_⋆||₂ = O(1),V_⋆正定。(Λ_⋆ V Λ_⋆')^{-1/2} Λ_⋆ ε_n → N(0, I_p):抽样噪声的 CLT。max_j Λ'_{⋆,j} V_⋆^{-1} Λ_{⋆,j} → 0:没有单个矩条件占主导。λ_min(V_⋆) · n/m → ∞:领先项方差足够大,使得一阶段噪声可忽略。σ² = O_p(1),λ_min(V_⋆)远离零。
与已有文献的对比:
- 相比 Andrews, Gentzkow, and Shapiro (2017):本文放松了 b 为固定常数的假设,引入了可交换性,从而可以估计 µ 和 σ²。
- 相比 Andrews, Barnhard, and Carlson (2024):本文放松了先验均值为零的限制,但要求 m 随 n 增长,而他们的方法适用于固定 m 的贝叶斯推断。
- 相比 Chernozhukov, Hansen, Kong, and Wang (2025):本文不依赖于对设定误差分布(如高斯性)的特定先验,而是依赖于可交换性和矩条件。
- 相比 Kolesár et al. (2015):本文在更一般的 GMM 框架下工作,允许非线性矩条件和异方差,且不要求违反项与一阶段系数正交。
主要结果¶
- Lemma 2 (µ̂ 的一致性):
µ̂ - µ = O_p(1/√m) + O_p(√(m/n))。第一项是“oracle”误差(使用真实M和r_n),以1/√m速率收敛;第二项是可行性成本(用M̂和r̂代替),以√(m/n)速率收敛。在m²/n → 0下,第一项占主导。 - Lemma 3 (σ̂² 的一致性):
σ̂² - σ² = O_p(1/√m) + O_p(√(m/n))。速率与µ̂相同。证明的关键在于利用 Lemma A.2(置换二次型)来控制(b-µ1_m)' M' M (b-µ1_m)的波动。 - Proposition 1 (BC 估计量的收敛率):
θ̂_BC - θ₀ = O_p(1/√n)。证明的关键在于将√n(θ̂_BC - θ₀)分解为Λ(r_n - µ1_m) - (µ̂-µ)Λ1_m + o_p(1),并证明后两项是o_p(1)。 - Proposition 2 (EB 估计量的收敛率):
θ̂_EB - θ₀ = O_p(1/√n)。证明的关键在于控制可行预测器Π̂(r̂ - µ̂1_m)与不可行预测器Π M_µ r_n之间的误差,该误差以O_p(1) + O_p(m/√n)的速率收敛。 - Proposition 3 (方差排序):
- (i)
V_BC - V_EB = Λ Σ_µ M' (M Σ_µ M')⁺ M Σ_µ Λ'是半正定的。因此,EB 估计量的领先项风险弱优于 BC 估计量。当M Σ_µ Λ' ≠ 0时,改进是严格的。当p=1且m ≥ 2p+1时,改进是正定的。 - (ii) 当
λ_min(V) > 0时,EB 估计量的领先项等于对中心化矩条件M_µ g(θ)进行有效 GMM 估计的影响函数,且其方差V_EB = (G' Σ_µ⁺ G)^{-1}不依赖于权重矩阵W。这揭示了 EB 估计量的效率性质。 - Theorem 1 (通用 CLT):对于任何满足 Assumption 5 且余项可忽略的估计量
θ̂_⋆,有√n V_⋆^{-1/2} (θ̂_⋆ - θ₀) → N(0, I_p)。证明的核心是使用组合中心极限定理(Hájek 1961)来处理Λ_⋆ (b - µ1_m)这一项,并利用事件分解来处理σ²可能很小的情况。 - Corollary 1 (BC 和 EB 的 CLT):在 Assumptions 1-5 下,
√n V_BC^{-1/2} (θ̂_BC - θ₀) → N(0, I_p)和√n V_EB^{-1/2} (θ̂_EB - θ₀) → N(0, I_p)。 - Corollary 2 (可行推断):在额外条件下,使用可行方差估计量
V̂_BC和V̂_EB的 Wald 检验具有正确的渐近大小。
证明路线与技术技巧¶
- 整体路线:
- 超参数估计:首先,利用矩方程 (1) 构造
µ̂和σ̂²。证明其一致性依赖于 Lemma A.1(控制 oracle 误差和可行性成本)和 Lemma A.2(控制置换二次型的波动)。 - 偏差校正:将
µ̂代入偏差校正公式,得到θ̂_BC。证明其√n收敛率依赖于 Lemma 2 和 Assumption 3。 - 经验贝叶斯收缩:利用
µ̂和σ̂²构造Π̂,进而得到θ̂_EB。证明其√n收敛率需要更精细地控制Π̂的估计误差,这依赖于 Assumption 4。 - 分布理论:证明 BC 和 EB 估计量的渐近正态性。核心是 Theorem 1,它提供了一个通用框架。证明的关键在于处理
Λ_⋆ (b - µ1_m)这一项,这需要组合中心极限定理。 -
方差估计:构造
V̂_BC和V̂_EB,并证明它们是一致的。这依赖于µ̂、σ̂²和Λ̂的一致性。 -
关键跳跃点:
- Lemma A.2 的证明:这是整个一致性论证的基础。它需要计算一个置换二次型的方差,这涉及到复杂的四阶矩计算。作者巧妙地利用了均匀抽样的矩公式,并证明了方差以
tr(A²)为阶,从而得到了O_p(√(tr(A²)))的波动率。 - Theorem 1 的证明:这是分布理论的核心。证明的关键在于将
Λ_⋆ (b - µ1_m)视为一个置换统计量,并应用 Hájek (1961) 的组合中心极限定理。这需要验证两个条件:权重a_j的最大平方和趋于零(Assumption 5.iii),以及b_j的标准化值的最大平方和趋于零(由有界四阶矩保证)。此外,证明还通过事件分解来处理σ²可能很小的情况,确保 CLT 在所有情况下都成立。 -
Proposition 3 的证明:证明 EB 估计量的效率性质。关键步骤是证明
Λ_EB = -(G' Σ_µ⁺ G)^{-1} G' Σ_µ⁺ M_µ,这需要利用 Moore-Penrose 逆的性质和M_µ G = G这一事实。然后,通过 Gauss-Markov 论证,证明Λ_EB在所有满足B G = -I_p和B 1_m = 0的B中具有最小方差。 -
技术技巧点名:
- 组合中心极限定理 (Combinatorial CLT):用于处理
Λ_⋆ (b - µ1_m)的渐近分布。这是本文分布理论的核心工具。 - Moore-Penrose 逆的微分:用于分析
Π̂对σ̂²的依赖性,从而控制 EB 估计量的可行性成本。 - 置换二次型 (Permutation Quadratic Form):用于控制
(b-µ1_m)' A (b-µ1_m)的波动,这是证明σ̂²一致性的关键。 - 事件分解 (Event Decomposition):在 Theorem 1 的证明中,将样本空间分解为
{σ²_n > h}和{σ²_n ≤ h}两个事件,分别处理,最后让h → 0。这巧妙地处理了σ²可能为零或很小的情况。 - 最优线性预测 (BLP):用于构造 EB 收缩估计量。作者将
r_n - µ1_m对M r_n的 BLP 视为一个收缩算子,并证明了其风险改进性质。
真实例子与应用¶
- 模拟实验 (Section 9):
- 数据/场景:基于线性 IV 模型,其中
m个工具是互斥的二元变量(类似于细胞 IV 设计)。设定误差b服从自由度为 5 的多元 t 分布,具有可交换性但非独立性。 - 方法应用:将 GMM、BC、EB 以及它们的 oracle 版本应用于模拟数据,并比较偏差、标准差和 RMSE。
- 结果:
- 当
µ较大时(µ̄=8),BC 和 EB 的 RMSE 显著低于 GMM(0.254 和 0.242 vs 0.287)。 - EB 的 RMSE 始终低于 BC,验证了 Proposition 3 的风险改进性质。
- 当
σ²较大时(σ̄=16),EB 相对于 BC 的优势更加明显(RMSE 0.345 vs 0.395)。 - 随着
n和m的增长(m = n^{0.4}),BC 和 EB 的 Wald 检验的拒绝率趋近于名义水平 5%,而 GMM 的拒绝率保持在 38-41%。
- 当
-
说明的问题:验证了理论预测,展示了 BC 和 EB 在有限样本下的有效性,特别是在存在显著设定误差时。
-
实证应用:Angrist and Krueger (1991) 的教育回报研究 (Section 10):
- 数据/场景:1980 年人口普查 5% PUMS 数据,样本量为 486,926 名男性。工具变量是 51 个“非第一季度出生 × 州出生”的交互项。目标参数是教育回报率。
- 方法应用:将 GMM(等价于 TSLS)、BC 和 EB 应用于四种不同的控制变量设定。
- 结果:
- TSLS 估计值对控制变量设定非常敏感(从 3.6% 到 14.1%)。
- BC 和 EB 估计值在不同设定下更加稳定(集中在 7-11% 之间),且都向 OLS 估计值(约 5%)方向移动。
µ̂的符号在是否包含年龄控制变量时发生反转,这与 Rosenzweig and Wolpin (2000) 和 Buckles and Hungerman (2013) 的理论一致。- EB 的标准误小于 BC,但略大于 TSLS,反映了设定误差感知推断的保守性。
- 可交换性诊断测试(基于细胞频率和地区指标)未能拒绝原假设,支持了可交换性假设的合理性。
- 说明的问题:展示了 BC 和 EB 方法在实际应用中的价值,特别是在工具变量排除限制可能被违反时。它们能够提供更稳健的点估计和更诚实的标准误。
🔎 结论是否比证明窄¶
- Proposition 3 (i) 声称 EB 弱改进 BC,但证明是在“领先项风险”(leading-term risk)的意义下,即只考虑
√n缩放后的估计误差的线性部分。在有限样本中,高阶项可能导致 EB 的表现不如 BC。作者在 Remark 5 中承认了这一点,并指出需要一致可积性才能将排序推广到极限 MSE。 - Theorem 1 声称
√n V_⋆^{-1/2} (θ̂_⋆ - θ₀) → N(0, I_p),但证明依赖于 Assumption 5 中的多个条件,特别是λ_min(V_⋆) · n/m → ∞。在模拟中,作者通过数值验证了这些条件,但在实际应用中,这些条件可能难以验证。 - Corollary 2 声称可行方差估计量
V̂_BC和V̂_EB是一致的,但证明依赖于λ_min(V_BC) √(n/m) → ∞和λ_min(V_EB) √(n/m) → ∞。这些条件在V_BC或V_EB的特征值很小时可能不成立,导致推断不可靠。
四、开放问题¶
- 弱识别下的超参数估计:作者在 Remark 2 中承认,当
mκ = O(1)时(即µ弱识别),µ̂的行为需要进一步研究。扎根于:Section 6.1, Remark 2。一个开放问题是:在弱识别下,如何构造µ和σ²的估计量,以及这对 BC 和 EB 估计量的性质有何影响? - 全局设定误差下的行为:作者在 Remark 6 中讨论了线性模型和全局设定误差,但指出一致性仍然要求设定误差随
n增长而消失。扎根于:Section 7.5, Remark 6。一个开放问题是:当设定误差不随n收缩时(即全局设定误差),本文的方法是否仍然有用?例如,能否将θ̂_BC或θ̂_EB解释为对某个伪真值(pseudo-true value)的估计? - 非线性模型的扩展:虽然作者在 Example 3 中给出了一个二元选择模型的例子,但本文的分布理论(特别是 Theorem 1 和 Corollary 1)的证明依赖于线性化展开。扎根于:Section 3, Example 3。一个开放问题是:对于更一般的非线性 GMM 模型,本文的渐近理论是否仍然成立?特别是,当矩条件非线性时,线性化余项的控制可能更加困难。
- 更一般的可交换性结构:本文假设
b的所有分量都是可交换的。一个自然的推广是允许分组可交换性(groupwise exchangeability),即b在某些组内是可交换的,但组间可以有不同的分布。扎根于:Section 2, Assumption 1.ii。一个开放问题是:如何将本文的框架扩展到分组可交换性,并估计每个组的µ和σ²?
Maintained by 陈星宇 · Homepage · Source on GitHub