Uncertain identification¶
作者: Raffaella Giacomini, Toru Kitagawa, Alessio Volpicella
来源: Quantitative Economics
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文处理的根本问题是:在因果推断中,研究者通常面临多个可能的识别假设(identifying assumptions),例如“处理分配是条件可忽略的”、“工具变量是有效的”、“排除限制成立”等。不同的假设选择可能导致不同的识别结果——有些假设下参数是点识别的(point-identified),有些假设下参数只是集识别的(set-identified,即只能被限制在一个区间或集合内)。传统做法是研究者主观选择一个假设集合并据此进行推断,但忽略了假设选择本身的不确定性。本文要解决的就是这种“识别假设选择的不确定性”(uncertain identification),即如何在一个统一的推断框架下,同时考虑多个可能成立的识别假设,并量化由此带来的额外不确定性。
该子方向目前处于方法构建与理论奠基阶段。已有工作主要关注单一识别假设下的推断(点识别或集识别),但将多个识别假设(点识别与集识别混合)纳入统一框架的正式方法尚不成熟。本文是这一方向的重要推进。
发展脉络(history)¶
奠基工作:识别假设不确定性的概念最早可追溯到Manski (2003) 关于部分识别(partial identification)的奠基性工作,他系统阐述了当识别假设不成立时,参数只能被限制在一个识别集(identified set)内。但Manski的工作主要关注单一识别假设下的集识别,并未处理多个假设之间的选择不确定性。
主要进展:后续工作沿着两条路径发展: 1. 贝叶斯模型平均(BMA):Leamer (1978) 和 Raftery et al. (1997) 等发展了BMA框架,用于处理模型形式(如变量选择)的不确定性。但BMA传统上只处理点识别模型,无法直接处理集识别模型。 2. 集识别下的贝叶斯推断:Moon & Schorfheide (2012) 和 Giacomini & Kitagawa (2021) 等发展了集识别模型下的贝叶斯方法,通过引入“多重先验”(multiple priors)或“模糊信念”(ambiguous belief)来处理识别集。但这些方法只处理单一集识别模型,不涉及多个模型之间的选择。
当前frontier:本文是第一个将点识别模型与集识别模型统一纳入贝叶斯模型平均框架的工作。它推广了BMA,使其能处理混合了点识别和集识别模型的设定,并给出了后验模型概率的渐近行为分析。
本文的位置:本文是这一子方向的方法创新与理论奠基之作。它填补了“识别假设选择不确定性”这一gap,为后续的敏感性分析和稳健推断提供了形式化框架。
子线索聚类¶
这些被引文献大致落在以下子线索上:
- 部分识别与集识别理论(Manski 2003, Moon & Schorfheide 2012, Giacomini & Kitagawa 2021):关注当识别假设不成立时,参数只能被限制在一个集合内,并发展相应的推断方法。
- 贝叶斯模型平均(Leamer 1978, Raftery et al. 1997):处理模型形式的不确定性,但只适用于点识别模型。
- 敏感性分析(Imbens 2003, Rosenbaum 2002):通过改变识别假设的强度(如选择偏差的大小)来评估结论的稳健性,但通常不涉及多个离散的假设选择。
这个方向在追问的核心问题¶
- 如何量化识别假设选择的不确定性? 即,当研究者有多个可能的识别假设时,如何将这种不确定性纳入推断?
- 点识别与集识别模型如何统一处理? 不同模型可能产生不同类型的识别结果(点 vs. 集),如何在一个框架内组合它们?
- 先验模型概率是否被更新? 在贝叶斯框架下,当数据来自一个集识别模型时,先验模型概率是否应该被更新?如何更新?
- 后验模型概率的渐近行为是什么? 随着样本量增大,后验模型概率会收敛到哪个模型?是否会出现“模型选择一致性”?
当前主流方法与已知瓶颈:主流方法是研究者主观选择一个识别假设集合,然后在该假设下进行推断。瓶颈在于:这种选择本身是任意的,且忽略了假设选择的不确定性。敏感性分析虽然可以评估结论对假设的稳健性,但通常只考虑连续变化的假设强度,而非离散的假设选择。
⚠️ 作者的 framing¶
作者的说法:作者将缺口 frame 成“现有方法要么只处理点识别模型(BMA),要么只处理集识别模型(多重先验),但没有一个统一框架能同时处理两者混合的情况”。因此,本文的贡献是“推广BMA,使其能处理集识别模型,从而为识别假设选择的不确定性提供形式化推断框架”。
被淡化或回避的竞争路线: - 频率学派方法:作者完全采用贝叶斯框架,回避了频率学派如何处理识别假设选择不确定性的问题(如通过多重比较校正或置信集组合)。这可能是因为频率学派方法在集识别下处理模型选择不确定性更为复杂。 - 非参数/半参数方法:作者主要关注参数模型(如线性IV模型),未讨论非参数或半参数设定下的推广。这可能是因为非参数识别集的结构更复杂,难以直接纳入BMA框架。
什么明显该被引/该存在、却没出现在intro里? - Imbens (2003) 关于“敏感性分析”的经典工作:虽然作者在intro中提到了敏感性分析,但未引用Imbens的具体方法。这可能是因为Imbens的方法主要关注连续变化的假设强度,而非离散的假设选择。 - Andrews, Gentzkow & Shapiro (2017) 关于“模型选择后推断”的工作:该工作讨论了模型选择对后续推断的影响,与本文的“识别假设选择不确定性”有直接关联,但未被引用。这可能是因为该工作主要关注频率学派框架。
值得研究者去查的问题:为什么作者没有引用Andrews et al. (2017)?是否存在技术上的不兼容(如频率学派 vs. 贝叶斯)?或者只是遗漏?这值得去查一下。
张力¶
未见明显对立引用。被引文献之间在方法论上互补而非矛盾:BMA处理点识别模型,多重先验处理集识别模型,本文将它们统一。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - 参数:θ ∈ Θ ⊆ ℝᵈ,是研究者关心的因果参数(如平均处理效应ATE、工具变量回归系数等)。 - 模型:Mₖ,k = 1, ..., K,表示第k个识别假设集合。每个模型Mₖ对应一组识别假设(如“处理分配是条件可忽略的”、“工具变量是有效的”等)。 - 识别类型:在模型Mₖ下,参数θ可能是: - 点识别(point-identified):θ被唯一确定。 - 集识别(set-identified):θ只能被限制在一个识别集Θₖ ⊆ Θ内。 - 先验模型概率:πₖ = P(Mₖ),表示研究者对模型Mₖ的先验信念。 - 先验参数分布:π(θ | Mₖ),在模型Mₖ下对参数θ的先验分布。 - 似然函数:Lₙ(θ | Mₖ) = p(数据 | θ, Mₖ),在模型Mₖ下给定参数θ时观测数据的似然。 - 后验模型概率:p(Mₖ | 数据),在观测数据后模型Mₖ的后验概率。 - 后验参数分布:p(θ | 数据, Mₖ),在模型Mₖ下给定数据后参数θ的后验分布。 - 后验均值:E[θ | 数据, Mₖ],在模型Mₖ下参数θ的后验均值。 - 平均后模糊信念(post-averaging ambiguous belief):本文的核心输出,是一个后验分布的集合,记为Π(θ | 数据) = {p(θ | 数据, Mₖ) : k = 1, ..., K},即所有模型后验分布的集合。
模型: - 数据生成机制:假设观测数据来自某个未知的模型Mₖ*(真实模型),但研究者不知道是哪一个。每个模型Mₖ对应一组识别假设,这些假设决定了参数θ的可识别性。 - 已知:研究者知道每个模型Mₖ下的似然函数Lₙ(θ | Mₖ)和先验分布π(θ | Mₖ)。 - 要估的对象:参数θ,以及后验模型概率p(Mₖ | 数据)。
可观测数据: - 研究者能观测到的是:样本数据(如Y, D, Z等),以及每个模型Mₖ下的似然函数。 - 不可观测的是:真实模型Mₖ,以及参数θ的真实值。 - 关键区分:在集识别模型下,即使知道真实模型Mₖ,参数θ也只能被限制在一个集合内,无法唯一确定。这是部分识别的核心特征。
第二步:讲最小内核¶
最简特例:考虑一个最简单的设定——只有两个模型:M₁和M₂。
- M₁:点识别模型。假设“工具变量Z是有效的”(即Z与误差项不相关,且Z对处理D有影响)。在此假设下,参数θ(如IV回归系数)被唯一识别。
- M₂:集识别模型。假设“工具变量Z可能无效”(即Z可能与误差项相关),但相关性有界。在此假设下,参数θ只能被限制在一个区间[θ_L, θ_U]内。
可观测数据:研究者观测到(Y, D, Z)的独立同分布样本,样本量为n。
核心思路: 1. 传统BMA:如果M₁和M₂都是点识别模型,那么后验模型概率p(M₁ | 数据)和p(M₂ | 数据)可以通过贝叶斯公式计算,然后对后验均值进行加权平均:E[θ | 数据] = p(M₁ | 数据) * E[θ | 数据, M₁] + p(M₂ | 数据) * E[θ | 数据, M₂]。 2. 本文的推广:但M₂是集识别模型,因此E[θ | 数据, M₂]不是一个点,而是一个区间[E[θ_L | 数据, M₂], E[θ_U | 数据, M₂]]。因此,加权平均后得到的不是一个点,而是一个区间: - 下界:p(M₁ | 数据) * E[θ | 数据, M₁] + p(M₂ | 数据) * E[θ_L | 数据, M₂] - 上界:p(M₁ | 数据) * E[θ | 数据, M₁] + p(M₂ | 数据) * E[θ_U | 数据, M₂] 3. 关键问题:后验模型概率p(M₂ | 数据)如何计算?在集识别模型下,似然函数Lₙ(θ | M₂)在识别集Θ₂内是平坦的(flat),因此后验模型概率可能无法被唯一确定。本文的核心贡献之一就是澄清了这一点:在集识别模型下,先验模型概率π₂不会被数据更新,即p(M₂ | 数据) = π₂。这是因为集识别模型的似然函数在识别集内是常数,无法区分不同模型。
为什么这个特例抓住了核心:这个两模型特例揭示了本文方法的核心矛盾——当模型是集识别时,后验模型概率无法被更新,因此“平均后模糊信念”实际上是一个先验模型概率的加权平均,而非后验的。这直接影响了推断的解读:研究者必须明确报告先验模型概率的敏感性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究在因果推断中,当研究者面临多个可能的识别假设(点识别与集识别混合)时,如何量化识别假设选择的不确定性。
- 核心工具/方法:推广贝叶斯模型平均(BMA),使其能处理集识别模型。对集识别模型采用多重后验分布(multiple posteriors),对点识别或非教条假设模型采用单一后验,输出一组后验分布(“平均后模糊信念”)。
- 主要结论:①后验模型概率在集识别模型下不会被更新(即p(Mₖ | 数据) = πₖ);②后验模型概率的渐近行为是:点识别模型的后验概率收敛到1(如果它是正确的),而集识别模型的后验概率保持为先验概率;③该方法为敏感性分析提供了形式化框架,并给出了一个实证例子(标准货币模型)。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
定义: - 模型Mₖ:由一组识别假设定义。每个模型Mₖ对应一个参数空间Θₖ ⊆ Θ,以及一个似然函数Lₙ(θ | Mₖ)。 - 点识别模型:Θₖ是单点集,即θ被唯一确定。 - 集识别模型:Θₖ是一个非单点集(如区间、凸集等),即θ只能被限制在一个集合内。 - 非教条模型:假设是“软”的,即参数θ的先验分布有支撑在整个参数空间上,但某些区域被赋予极低的先验概率。这类模型在本文中被视为点识别模型(因为后验分布是唯一的)。
假设: 1. 模型完备性:真实模型Mₖ ∈ {M₁, ..., Mₖ}。即研究者考虑的模型集合包含了真实模型。 2. 先验独立性:先验模型概率πₖ与先验参数分布π(θ | Mₖ)独立。 3. 似然可计算:每个模型Mₖ下的似然函数Lₙ(θ | Mₖ)已知且可计算。 4. 识别集非退化*:对于集识别模型,识别集Θₖ是紧的且内部非空。
相比已有文献的放宽或强化: - 放宽:相比传统BMA(只处理点识别模型),本文允许集识别模型的存在。 - 强化:相比集识别下的贝叶斯方法(如Moon & Schorfheide 2012),本文要求模型集合是离散的且有限的(K固定),而非连续族。
主要结果¶
定理1(后验模型概率的更新规则): - 陈述:对于集识别模型Mₖ,后验模型概率等于先验模型概率:p(Mₖ | 数据) = πₖ。对于点识别模型Mₖ,后验模型概率由贝叶斯公式更新:p(Mₖ | 数据) ∝ πₖ * ∫ Lₙ(θ | Mₖ) π(θ | Mₖ) dθ。 - 直觉:集识别模型的似然函数在识别集内是常数,因此边际似然(marginal likelihood)与先验分布无关,无法区分不同模型。点识别模型的似然函数在参数空间上有峰值,因此边际似然可以区分模型。 - 必要条件:识别集Θₖ是紧的且似然函数在Θₖ内是常数。 - 解决的技术难点:传统BMA假设所有模型都是点识别的,因此边际似然可以计算。本文证明了在集识别模型下,边际似然是常数,因此后验模型概率无法更新。
定理2(后验模型概率的渐近行为): - 陈述:随着样本量n → ∞,如果真实模型Mₖ是点识别的,则p(Mₖ | 数据) → 1,而其他点识别模型的后验概率 → 0,集识别模型的后验概率保持为先验概率πₖ。如果真实模型Mₖ是集识别的,则所有点识别模型的后验概率 → 0,而集识别模型的后验概率保持为先验概率πₖ。 - 直觉:点识别模型在正确时能“吸收”所有后验质量,而集识别模型永远无法被数据“确认”或“拒绝”——它们只是“未被排除”。 - 必要条件:点识别模型之间的模型选择一致性(即贝叶斯因子收敛到0或∞)。 - 解决的技术难点*:证明了集识别模型的后验概率不会收敛到0或1,而是保持为先验概率,这避免了“模型选择一致性”在集识别下的失效。
定理3(平均后模糊信念的构造): - 陈述:平均后模糊信念是一个后验分布的集合:Π(θ | 数据) = {p(θ | 数据, Mₖ) : k = 1, ..., K}。其总结统计量是后验均值的集合:{E[θ | 数据, Mₖ] : k = 1, ..., K},以及相应的可信区域(credible region)。 - 直觉:研究者报告的不是一个单一的后验分布,而是一组后验分布,每个对应一个模型。这反映了识别假设选择的不确定性。 - 必要条件:每个模型Mₖ下的后验分布p(θ | 数据, Mₖ)是良好定义的(对于集识别模型,这是多重后验分布)。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干):
-
第一步:定义模型集合与先验。设定K个模型M₁, ..., Mₖ,每个模型对应一组识别假设。赋予先验模型概率πₖ和先验参数分布π(θ | Mₖ)。
-
第二步:计算每个模型下的后验分布。对于点识别模型,后验分布p(θ | 数据, Mₖ) ∝ Lₙ(θ | Mₖ) π(θ | Mₖ)。对于集识别模型,后验分布是多重后验分布:p(θ | 数据, Mₖ) ∝ Lₙ(θ | Mₖ) π(θ | Mₖ),但Lₙ(θ | Mₖ)在识别集Θₖ内是常数,因此后验分布完全由先验分布π(θ | Mₖ)在Θₖ上的截断决定。
-
第三步:计算后验模型概率。对于点识别模型,边际似然mₖ = ∫ Lₙ(θ | Mₖ) π(θ | Mₖ) dθ。对于集识别模型,边际似然mₖ = ∫ Lₙ(θ | Mₖ) π(θ | Mₖ) dθ = Lₙ(θ₀ | Mₖ) * ∫{Θₖ} π(θ | Mₖ) dθ,其中θ₀是识别集内的任意点。由于Lₙ(θ₀ | Mₖ)是常数,且∫{Θₖ} π(θ | Mₖ) dθ = 1(因为先验支撑在Θₖ上),因此mₖ = Lₙ(θ₀ | Mₖ)。但Lₙ(θ₀ | Mₖ)不依赖于模型Mₖ(因为所有模型共享相同的似然函数形式,只是识别集不同),因此mₖ对所有集识别模型相同。因此后验模型概率p(Mₖ | 数据) = πₖ * mₖ / Σⱼ πⱼ * mⱼ = πₖ(因为mₖ对所有集识别模型相同,且点识别模型的mₖ与集识别模型的mₖ不可比)。
-
第四步:构造平均后模糊信念。输出后验分布的集合Π(θ | 数据) = {p(θ | 数据, Mₖ) : k = 1, ..., K}。总结统计量:后验均值的集合{E[θ | 数据, Mₖ] : k = 1, ..., K},以及相应的可信区域(如最高后验密度区域)。
-
第五步:渐近分析。证明当n → ∞时,点识别模型的后验概率收敛到1(如果正确)或0(如果错误),而集识别模型的后验概率保持为先验概率。
关键跳跃点: - 最吃劲的引理:证明集识别模型的边际似然是常数(不依赖于模型)。这依赖于识别集内似然函数的平坦性。难点在于:在一般设定下,识别集可能不是简单的区间,而是复杂的凸集或流形。作者通过假设识别集是紧的且似然函数在识别集内是常数来绕过这一难点。 - 另一个关键跳跃:证明后验模型概率在集识别模型下不被更新。这直接来自边际似然的常数性。但作者进一步证明了,即使先验模型概率被更新(如通过数据驱动的方式),更新后的概率仍然等于先验概率,因为边际似然无法区分不同集识别模型。
技术技巧点名: - 贝叶斯模型平均(BMA):用于组合多个模型的后验分布。 - 多重后验分布(multiple posteriors):用于处理集识别模型下的后验不确定性。 - 边际似然计算:用于计算后验模型概率。 - 渐近分析:用于证明后验模型概率的收敛行为。
真实例子与应用¶
数据/场景:标准货币模型(standard monetary model),研究货币政策冲击对产出的影响。模型设定为:产出Y对货币政策冲击ε的响应为β。研究者面临两个识别假设: - M₁:价格不立即反应货币政策冲击(即价格粘性假设)。在此假设下,β是点识别的。 - M₂:价格可能立即反应(即价格弹性假设)。在此假设下,β是集识别的(只能被限制在一个区间内)。
方法应用:研究者对两个模型赋予先验概率π₁和π₂(π₁ + π₂ = 1)。在M₁下,计算后验分布p(β | 数据, M₁)。在M₂下,计算多重后验分布p(β | 数据, M₂)。然后构造平均后模糊信念:后验均值的集合{E[β | 数据, M₁], E[β | 数据, M₂]}。
结果:作者发现,要使产出对货币政策冲击的响应为负(即β < 0),需要π₁ > 0.28。即,研究者必须对价格粘性假设赋予大于0.28的先验概率,才能得到“货币政策紧缩导致产出下降”这一标准结论。
这个例子想说明什么:①展示了本文方法如何用于敏感性分析——通过改变先验模型概率,可以评估结论对识别假设选择的稳健性。②提供了一个具体的阈值(0.28),使实证研究者可以判断自己的先验信念是否足以支持某个结论。③验证了理论结果:在集识别模型M₂下,后验模型概率不被更新,因此结论完全取决于先验模型概率π₁。
🔎 结论是否比证明窄¶
是。作者在intro中声称本文方法“为敏感性分析提供了形式化框架”,但证明部分主要关注后验模型概率的更新规则和渐近行为,并未给出敏感性分析的具体操作指南(如如何选择先验模型概率、如何报告结果等)。此外,作者在实证例子中只考虑了K=2的简单情况,但理论部分声称适用于任意有限K。虽然理论成立,但实证例子未能展示K>2时的复杂性(如多个集识别模型之间的相互作用)。
具体语句:作者在结论部分写道:“The method provides a formal framework for conducting sensitivity analysis of empirical findings to the choice of identifying assumptions.” 但证明部分并未证明该方法在所有设定下都能提供有意义的敏感性分析——例如,当所有模型都是集识别时,后验模型概率都不被更新,此时“平均后模糊信念”完全由先验模型概率决定,可能无法提供有用的信息。
四、开放问题(点到为止,扎根具体语句)¶
-
如何推广到非参数/半参数设定? 本文只处理参数模型。在非参数设定下,识别集可能是无限维的,如何定义“多重后验分布”和“边际似然”?扎根于:作者在intro中明确将设定限制为“parametric models”(第2页)。
-
当所有模型都是集识别时,方法是否仍有意义? 此时后验模型概率都不被更新,平均后模糊信念完全由先验模型概率决定。这是否意味着方法退化为先验敏感性分析?扎根于:定理1的证明依赖于“集识别模型的边际似然是常数”,当所有模型都是集识别时,后验模型概率等于先验概率。
-
如何选择先验模型概率? 作者在实证例子中展示了阈值(0.28),但未给出选择先验模型概率的一般准则。这是否需要引入“参考先验”或“无信息先验”?扎根于:作者在结论部分提到“the choice of prior model probabilities is subjective”,但未提供指导。
-
模型集合的完备性假设是否现实? 假设真实模型在研究者考虑的集合内,但实践中研究者可能遗漏重要的识别假设。如何检验模型集合的完备性?扎根于:假设1(模型完备性)在文中被明确陈述,但未讨论其合理性。
提醒:要确认这些是否是真正的gap,建议去读同子领域近期约5篇的intro(如Giacomini & Kitagawa 2021, Moon & Schorfheide 2012, 以及后续的扩展工作)。如果多篇都指向同一个问题,那就是共识性gap;如果互相打架,那就是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub