跳转至

Public Signals, Concealed Choices: Dynamic Measurement without Behavioral Identification

作者: Rok Spruk
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2608.21077


一、领域脉络与小综述

这个方向是什么

本文研究的根本问题是:在集体决策场景下,当个体的行为选择(如投票)完全隐藏,仅留下公开信号(如官方声明、新闻稿)时,如何从这些信号中测量个体的公开立场,以及如何理解该立场与隐藏行为之间的关系。 这是一个介于“完全可观测行为”(如公开的议会投票记录)与“完全无信息”之间的中间地带。当前该子方向的成熟度较低,缺乏一个统一的框架来区分“测量公开立场”与“识别行为链接”这两个截然不同的任务,常常导致研究者将前者(对公开立场的精确估计)错误地等同于后者(对隐藏行为的推断)。

发展脉络

  1. 奠基工作:从可观测行为中恢复潜在立场

    • Poole & Rosenthal (1985) 和 Clinton, Jackman & Rivers (2004) 建立了从可观测的议会投票(roll-call votes)中恢复立法者理想点(ideal points)的经典框架。这是整个领域的起点,其核心假设是行为(投票)是可观测的。
    • Martin & Quinn (2002) 将动态结构引入理想点模型,用于追踪美国最高法院大法官随时间变化的意识形态。West & Harrison (1997) 提供了动态贝叶斯模型的一般性框架。这些工作奠定了本文测量模型(动态状态空间模型)的数学基础。
  2. 主要进展:处理文本数据与动态测量

    • Elff (2013) 将动态状态空间模型应用于编码后的政治文本,直接从文本中恢复潜在立场。这是本文的直接前身,但Elff的模型假设文本是行为的直接反映,并未区分“公开立场”与“隐藏行为”。
    • Kim, Londregan & Ratkovic (2018) 提出了一个联合模型,同时利用投票和文本数据来估计共同的空间偏好。他们的方法依赖于可观测的投票行为来锚定文本的潜在尺度。本文的设定恰好相反:投票行为是隐藏的,因此无法使用这种联合锚定。
    • Reuning, Kenwick & Fariss (2019) 指出了动态模型的一个关键缺陷:当数据稀疏时,时间平滑会掩盖突变或产生误导性的精度。这直接影响了本文的设计——作者明确表示其贡献“不是一个新的状态空间核”,而是围绕它构建的推断架构。
  3. 当前Frontier与本文位置:处理部分隐藏行为与不可识别性

    • 当前的前沿是处理行为部分或完全不可观测的情况。Carrubba et al. (2006) 和 Hug (2010) 已经指出,未记录的投票(unrecorded votes)会导致选择偏差,影响基于投票的分析。Rubin (1976) 关于缺失数据的经典工作为理解这种“可观测性”问题提供了理论基础。
    • 本文的位置:它填补了“可观测投票”与“完全无行为数据”之间的空白。作者明确指出,其贡献不在于提出新的状态空间模型,而在于构建了一个推断架构,该架构:
      1. 明确定义了一个狭窄的、条件于语料库的“公开立场”估计量。
      2. 证明了似然排除(likelihood-exclusion) 结果:在给定条件下,公开信号无法更新行为链接参数的后验。
      3. 因此,任何声称的从立场到行为的映射只能以敏感性包络(sensitivity envelope) 的形式报告,而非点估计或识别界。

子线索聚类

  1. 理想点与投票模型:以Poole & Rosenthal (1985), Clinton et al. (2004), Martin & Quinn (2002) 为代表。核心是利用可观测的离散行为(投票)来推断连续潜在偏好。这是最成熟的线索。
  2. 文本作为数据:以Elff (2013), Kim et al. (2018), Grimmer & Stewart (2013) 为代表。核心是从非结构化的文本中提取结构化的立场信息。Kim et al. (2018) 试图将文本与投票联合建模,但依赖于投票的可观测性。
  3. 缺失数据与选择偏差:以Rubin (1976), Carrubba et al. (2006), Hug (2010) 为代表。核心是处理行为或信号的可观测性并非随机的问题。本文的“可观测性”问题(谁说话、谁沉默)直接属于此线索。
  4. 贝叶斯非识别模型:以Poirier (1998) 为代表。核心是处理模型中参数无法被数据识别的贝叶斯推断。本文的Proposition 1直接应用了Poirier的逻辑,是这一线索在“隐藏集体选择”场景下的具体化。

核心问题与瓶颈

  1. 如何从公开信号中测量一个“干净”的立场? 瓶颈在于信号是有选择地产生的(谁说话、说什么、何时说),且信号本身(如“支持国际法”)与具体行为(如“投票支持某决议”)不是同一概念。
  2. 如何将测量的公开立场与隐藏行为链接起来? 这是本文的核心问题。瓶颈在于,如果行为完全不可观测,那么任何声称的链接函数(如“立场越强,投票支持的概率越高”)都无法被数据识别。
  3. 如何处理信号稀疏性和不均匀性? 瓶颈在于,少数活跃的个体可能产生大部分信号,而沉默的大多数则几乎没有信息。动态模型虽然能利用时间结构,但在极端稀疏下可能不如简单方法。
  4. 如何评估和报告不确定性? 瓶颈在于,不确定性不仅来自测量误差,更来自不可识别性。传统的置信区间或后验区间无法反映后者。本文提出的“敏感性包络”是一种尝试,但它本身也依赖于一个声明的、无法被数据验证的映射类。

⚠️ 作者的Framing

  • 作者如何frame缺口:作者将缺口定义为“在观察到公开信号但行为完全隐藏的中间设定下,缺乏一个将‘测量公开立场’与‘识别行为链接’明确分离的推断架构”。作者声称,现有方法要么假设行为可观测(如投票模型),要么假设信号是行为的直接反映(如文本模型),而本文填补了这两者之间的空白。
  • 被淡化或回避的竞争路线:
    • 结构选择模型:作者明确承认,如果能够对“信号产生过程”建模(例如,一个结构性模型来解释为什么某些部长说话更多),理论上可以解决部分问题。但作者认为“本语料库无法识别这样的模型”,因此将其回避。这暗示了,如果数据更丰富(如多个决策、更长的面板),结构选择模型可能是一条更强的竞争路线。
    • Proximal Causal Inference (PCI):本文的似然排除结果(Proposition 1)与PCI中的负对照(negative control) 逻辑有深刻的相似性。在PCI中,一个负对照暴露(或结果)被用来检测或校正未观测的混杂。在这里,行为链接参数λ可以被视为一个“目标”,而公开信号Y则无法提供关于λ的信息,因为λ被排除在观测数据的似然之外。这本质上是一种“负对照”结构。作者完全没有提及PCI,这可能是一个值得研究者去探索的连接点。
  • 什么明显该被引/该存在、却没出现在intro里?
    • Proximal Causal Inference (Tchetgen Tchetgen et al., 2020; Miao et al., 2018等):如上所述,本文的核心识别问题与PCI的框架高度相关。PCI提供了一套处理“部分可观测性”和“代理变量”的成熟理论(包括识别条件、效率理论)。引入PCI可以极大地形式化本文的识别问题,并可能提供更一般的敏感性分析框架。这是一个高价值信号,值得研究者去核实。
    • 部分识别(Partial Identification, Manski, 2003):本文的“敏感性包络”本质上是一种部分识别的方法。Manski的经典工作为在弱假设下获得识别界提供了系统框架。作者没有引用Manski,而是引用了Poirier (1998) 的贝叶斯非识别模型。这暗示作者选择了贝叶斯路径而非频率学派的部分识别路径。比较这两种路径的优劣是一个有趣的问题。

张力

未见明显对立引用。被引工作之间是互补的,共同构成了从“完全可观测行为”到“完全隐藏行为”的谱系。主要的张力在于,当数据稀疏时,复杂的动态模型是否真的优于简单的信号汇总规则。本文的模拟实验明确展示了这种张力,并诚实地报告了动态模型在某些条件下的劣势。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型与可观测数据

  • 符号:

    • i = 1, ..., N: 个体(如部长)的索引。
    • t = 1, ..., T: 时间周期(如季度)的索引。
    • r = 1, ..., R: 可恢复的公开通信(如新闻稿)的索引。
    • θ_{it}: 核心估计量。个体i在时间t的语料库条件公开立场(corpus-conditional public-position state)。这是一个标量,值越大表示公开表达的支持越强。这是潜在变量,是我们想要估计但无法直接观测的。
    • y_r: 第r条通信的有序编码,取值范围为{-2, -1, 0, 1, 2}。这是可观测数据。
    • B: 完全未观测到的制度性行为(如秘密投票结果)。这是潜在变量,且完全不可观测。
    • λ: 行为链接参数,用于将θ映射到B。这是目标参数,但我们无法从数据中学习它。
    • ψ: 测量参数,包括状态空间模型中的方差和有序Logistic模型中的区分度。这些是辅助参数,用于从y估计θ。
    • σ_0^2: 初始状态θ_{i1}的方差。
    • τ^2: 状态转移方程中创新项u_{it}的方差。
    • β: 有序Logistic模型中的区分度参数(discrimination parameter)。
    • κ: 有序Logistic模型中的固定截断点(cut-points)。
  • 模型:

    1. 状态转移模型:θ_{it}遵循一个独立的随机游走。
      • θ_{i1} ~ N(0, σ_0^2)
      • θ_{it} = θ_{i,t-1} + u_{it}, 其中 u_{it} ~ N(0, τ^2)
    2. 观测模型:可观测的有序编码y_r通过一个有序Logistic模型与潜在立场θ相连。
      • Pr(y_r ≤ j | θ_{i(r), t(r)}) = logit^{-1}(κ_j - β * θ_{i(r), t(r)})
      • 其中κ_j是固定的截断点,β是固定的区分度。
  • 可观测数据:

    • 研究者实际能观测到的是:一系列有序编码y_r,以及这些编码对应的个体i(r) 和时间t(r)。
    • 研究者无法观测到的是:
      1. 潜在立场θ_{it}。
      2. 制度性行为B(如秘密投票)。
      3. 行为链接参数λ。
      4. 为什么某些个体说话而另一些保持沉默(信号产生机制)。

第二步:最小内核

本文的核心数学困难可以用一个最简特例来理解:假设只有一个个体(N=1),两个时间点(T=2),且该个体在时间点2做了一个秘密的二元选择(B ∈ {0, 1},例如,投票支持或反对)。我们观测到该个体在时间点1和2的公开信号(y_1, y_2)。

  • 问题:我们想估计行为链接参数λ,它定义了Pr(B=1 | θ_2),例如,一个简单的Logistic模型:Pr(B=1 | θ_2) = logit^{-1}(λ_0 + λ_1 θ_2)。
  • 可观测数据:y_1, y_2。
  • 潜在变量:θ_1, θ_2, B。
  • 模型:
    • θ_1 ~ N(0, σ_0^2)
    • θ_2 = θ_1 + u, u ~ N(0, τ^2)
    • y_t ~ OrderedLogit(β θ_t, κ) (t=1, 2)
    • B ~ Bernoulli(logit^{-1}(λ_0 + λ_1 θ_2))

本文的核心命题(Proposition 1)在这个特例下退化成什么?

命题说:如果λ(这里是λ_0, λ_1)只进入B的分布,并且不进入y的分布,且先验独立,那么观测到y_1, y_2不会更新我们对λ的信念。

证明思路(在这个特例下):

  1. 我们想求p(λ | y_1, y_2)。
  2. 根据贝叶斯定理,p(λ | y_1, y_2) ∝ p(λ) * p(y_1, y_2 | λ)。
  3. 关键在于计算似然p(y_1, y_2 | λ)。由于B是完全未观测的,我们需要将其边缘化: p(y_1, y_2 | λ) = ∫∫ p(y_1, y_2 | θ_1, θ_2) * [Σ_{b=0}^1 p(B=b | θ_2, λ)] * p(θ_1, θ_2) dθ_1 dθ_2
  4. 注意,p(y_1, y_2 | θ_1, θ_2) 中不包含λ(因为λ只影响B)。而Σ_{b=0}^1 p(B=b | θ_2, λ) = 1(因为概率之和为1)。
  5. 因此,p(y_1, y_2 | λ) = ∫∫ p(y_1, y_2 | θ_1, θ_2) * 1 * p(θ_1, θ_2) dθ_1 dθ_2。这个积分与λ无关!
  6. 所以,p(λ | y_1, y_2) ∝ p(λ) * (与λ无关的常数),即p(λ | y_1, y_2) = p(λ)。

这个例子揭示了什么?

它揭示了识别失败的本质。即使我们能够完美地测量θ_2(例如,通过无限多的精确信号),我们仍然无法从y中学习λ。因为λ和y之间的唯一桥梁是θ_2,而θ_2通过B与λ相连。但是,由于B从未被观测到,这个桥梁在似然中被“边缘化”掉了(因为B的概率之和为1)。观测y可以更新我们对θ_2的信念,但无法更新λ,因为λ对y的似然没有贡献。

本文的关键想法:承认这种不可识别性,并放弃点估计或识别界,转而报告一个敏感性包络。这个包络通过在一个声明的、合理的映射类C上变化λ,来展示不同的λ假设会导致什么样的行为概率范围。这避免了将“对θ的精确估计”错误地等同于“对B的精确预测”。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在集体决策场景下,当个体行为(如投票)完全隐藏,仅留下公开信号时,如何将“测量公开立场”与“识别行为链接”这两个任务分离开来,并诚实地报告不确定性。
  2. 核心工具/方法:一个动态有序状态空间模型用于测量公开立场,加上一个似然排除(likelihood-exclusion)命题来证明行为链接参数的不可识别性,最后通过敏感性包络(sensitivity envelope) 来展示行为含义的范围。
  3. 主要结论:公开信号无法更新行为链接参数的后验(在给定先验独立条件下)。因此,任何从公开立场到隐藏行为的映射都只能以敏感性包络的形式报告,而非点估计或识别界。对斯洛文尼亚内阁的案例分析表明,公开信号只能定位少数高度可见的个体,而大多数成员的后验被先验主导。

关键设定与假设

  • 核心估计量:θ_{it}被明确定义为“语料库条件公开立场”,它不是私人偏好、完整信息集或对未观测场景下言论的估计。这是一个关键假设,它将估计量限制在可观测的、经过编码的公开记录上。
  • 状态转移模型:假设θ_{it}遵循独立的随机游走。相比已有文献,作者强化了独立性假设(不借用政党或部门均值),目的是让信息缺失变得可见,而不是通过群体归属来填补。这是一个有意识的设计选择,而非技术限制。
  • 观测模型:使用有序Logistic模型,但固定了截断点κ和区分度β。相比已有文献,这是一个强化的假设。作者认为,在数据极度稀疏(36条记录集中在6个人身上)的情况下,联合估计所有参数会“用弱识别的灵活性取代透明的假设”。这是一个务实的、但也是可争议的假设。
  • 似然排除命题的假设:
    1. 似然排除:行为链接参数λ不进入观测数据Y的似然p(Y|Θ, ψ)。
    2. 行为完全未观测:B是完全未观测的。
    3. 先验独立性:p(λ, Θ, ψ) = p(λ) p(Θ, ψ)。
    4. 相比已有文献,这个命题是强化了识别问题的边界。它明确指出,即使Θ被完美测量,只要上述三个条件成立,λ就无法被学习。这比简单地说“投票很难预测”要强得多。
  • 敏感性包络:声明了一个映射类C = {(a, k, π): a∈[-0.5, 0.5], k∈[0.5, 2], π∈[0.5, 0.9]}。这个类假设了单调性(k>0,即立场越强,支持概率越高)和参与概率的范围。这是一个弱假设,但也是不可验证的。

主要结果

  • 理论结果(Proposition 1):这是本文的核心理论贡献。它严格证明了在给定条件下,行为链接参数λ的后验等于其先验。这意味着,无论我们收集多少公开信号,都无法从数据中学习λ。这个结果将“测量”和“行为识别”彻底分开。
  • 模拟结果:
    • 动态模型优势:在基线设定下,动态有序模型相比静态有序模型,RMSE更低(1.141 vs 1.212)且区间覆盖率更好(0.945 vs 0.767)。在信息密集时,其排名恢复能力更强(Spearman相关系数0.755 vs 0.706)。
    • 动态模型劣势:在严重稀疏时,简单方法(如均值信号)的排名恢复能力与动态模型相当甚至略好。在弱区分度和遗漏维度时,动态模型的覆盖率下降到0.89左右,表明模型设定错误时校准会失效。
    • 关键含义:动态模型的价值在于不确定性校准和利用时间信息,而非在所有情况下都提供最佳的点估计。模拟结果诚实地展示了方法的适用边界。
  • 实证结果(斯洛文尼亚内阁案例):
    • 信号极度集中:36条可归因信号中,29条来自两位部长(Tanja Fajon和Robert Golob)。21位部长中只有6位有任何可归因信号。
    • 后验结果:模型只定位了一个小的、高度可见的群体(Asta Vrečko, Tanja Fajon, Robert Golob),其公开立场明显偏向支持外部法律和外交压力。其余15位部长的后验被先验主导,区间宽度约为6个潜在单位。
    • 事件依赖性调整:当对同一事件的多条信号进行去重或降权后,即使是可见群体的后验精度也显著下降(例如,Vrečko的95%区间轻微跨越零)。
    • 与披露结果的对比:披露的投票记录显示,7张反对票全部来自没有可归因信号的部长。但同时,该群体中也有2票赞成,6票未投票。这表明“无信号”不等于“反对”。该对比没有被用来验证模型,而是作为一个诊断性对比,强调了公开立场、参与和具体选择是三个不同的概念。

证明路线与技术技巧

  • 整体路线:

    1. 定义问题:将问题形式化为一个贝叶斯分层模型,其中包含可观测的公开信号Y、潜在立场Θ、测量参数ψ、未观测行为B和行为链接参数λ。
    2. 识别核心困难:指出λ是目标,但它只通过B与数据相连,而B是完全未观测的。
    3. 证明不可识别性(Proposition 1):通过边缘化未观测的B,并利用λ不进入Y的似然以及先验独立性,证明p(λ|Y) = p(λ)。证明的关键在于Σ_b p(B=b|Θ, λ) = 1,这使得λ在边缘化过程中被消去。
    4. 构建替代方案:由于无法识别λ,放弃点估计,转而构建一个敏感性包络。这个包络通过在一个声明的、合理的映射类C上变化λ,来展示λ的不同取值会导致什么样的行为概率范围。
    5. 评估测量部分:通过模拟和实证,评估动态有序模型在恢复潜在立场Θ方面的表现,并诚实地报告其在不同条件下的优势和劣势。
  • 关键跳跃点:

    • 从“估计”到“敏感性分析”的跳跃:这是本文最关键的思维转变。作者没有试图寻找一个“最佳”的λ估计,而是承认其不可识别性,并转向报告一个依赖于外部假设的包络。这个跳跃是概念性的,而非技术性的,但它定义了整个论文的贡献。
    • 证明中“概率之和为1”的运用:这是证明中最巧妙的一步。Σ_b p(B=b|Θ, λ) = 1这个看似平凡的恒等式,在边缘化未观测行为时,直接消除了λ对似然的影响。这是一个非常简洁且有力的论证。
  • 技术技巧点名:

    • 贝叶斯非识别模型(Bayesian nonidentified model):整个理论框架建立在Poirier (1998) 的基础上,处理参数无法被数据识别时的贝叶斯推断。
    • 动态有序状态空间模型(Dynamic ordinal state-space model):用于测量潜在立场,结合了卡尔曼滤波/平滑和有序Logistic回归的思想。
    • 非中心化参数化(Non-centered parameterization):在MCMC采样中用于提高效率,将状态转移模型重写为θ_{it} = θ_{i,t-1} + τ z_{it},其中z_{it} ~ N(0,1)。
    • 广义贝叶斯/分数似然(Generalized Bayes / Fractional likelihood):在事件依赖性敏感性分析中,使用分数幂似然(p(y_r|θ)^{w_r})来降低重复信号的影响。
    • NUTS采样器(No-U-Turn Sampler):用于高效地从后验分布中采样。

真实例子与应用

  • 数据/场景:斯洛文尼亚内阁在2026年3月12日关于是否介入“南非诉以色列案”的秘密决策。数据是决策前(截止到3月11日)所有可公开获取的官方声明和新闻稿。
  • 方法应用:
    1. 根据一个声明的协议,从GOV.SI和Levica网站搜索并编码了41条记录(36条个人信号,5条组织信号)。
    2. 使用动态有序状态空间模型,从这36条信号中估计出21位部长在决策时刻的“语料库条件公开立场”θ_{iT}。
    3. 基于θ_{iT}的后验分布,在一个声明的映射类C上计算“投票支持”的敏感性包络。
  • 结果:
    • 模型只“看到”了6位部长,其中2位贡献了大部分信号。
    • 只有3位部长的后验均值明显为正(Vrečko, Fajon, Golob),其余15位部长的后验被先验主导。
    • 敏感性包络非常宽,即使对于可见的部长,也几乎覆盖了整个概率范围。
  • 这个例子想说明什么:
    • 验证理论:实证结果完美地说明了Proposition 1的实践含义。当信号稀疏且集中在少数人身上时,我们无法对大多数人的隐藏行为做出任何有信息的推断。
    • 展示方法:展示了如何将理论框架应用于一个真实的政治科学问题,并诚实地报告了不确定性。
    • 提供警示:与事后披露的投票记录对比,生动地展示了将“公开立场”等同于“隐藏行为”的危险性。所有反对票都来自“无信号”群体,但该群体中也有赞成票和未投票者。

🔎 结论是否比证明窄

  • 是。Proposition 1的证明是严格的,但其结论依赖于先验独立性假设。作者在文中承认:“如果p(λ, Θ, ψ)是相关的,观测到Y可以通过更新Θ或ψ来改变λ的边缘分布。” 然而,在实证部分,作者没有探索或报告这种先验相关性可能带来的影响。作者只是简单地假设了先验独立性,并在此基础上得出结论。这是一个窄化:理论结果允许更一般的情况(先验相关),但实证结论只适用于一个特例(先验独立)。
  • 另一个窄化:作者声称“本文的贡献不在于声称动态模型普遍更优,而在于提供一个推断架构”。然而,在模拟和实证中,作者主要展示了动态模型相对于静态模型的优势。对于“推断架构”的核心——敏感性包络——作者只提供了一个简单的、线性的、单调的映射类C。作者没有探索更复杂的映射类(如非线性、非单调),也没有讨论如何选择或证明C的合理性。因此,“推断架构”的通用性被一个非常具体的、可能过于简单的映射类所限制。

四、开放问题

  1. 放松先验独立性假设:Proposition 1依赖于p(λ, Θ, ψ) = p(λ)p(Θ, ψ)。如果这个假设不成立,后验p(λ|Y)会发生什么变化?能否量化先验相关性对后验的影响?这直接扎根于Proposition 1的证明和作者在文中的讨论(“如果p(λ, Θ, ψ)是相关的,观测到Y可以改变λ的边缘分布”)。

  2. 更一般的敏感性分析框架:本文的敏感性包络依赖于一个声明的、线性的、单调的映射类C。能否发展出一个更一般的、非参数或半参数的敏感性分析框架?例如,能否将λ视为一个无限维参数,并推导出行为概率的部分识别界(partial identification bounds),而不是依赖于一个特定的参数类?这扎根于作者将结果限制在“敏感性包络”而非“识别界”的声明。

  3. 与Proximal Causal Inference (PCI) 的桥梁:本文的似然排除结果与PCI中的负对照结构有深刻的相似性。能否将本文的设定形式化为一个PCI问题?如果可以,PCI中关于识别、效率理论和敏感性分析的工具能否直接应用于此,从而得到一个更一般、更强大的框架?这扎根于本文与PCI文献之间明显的、但未被作者探索的概念联系。

  4. 信号产生过程的建模:作者回避了对“为什么某些部长说话而另一些保持沉默”的建模。如果能够获得更丰富的数据(如多个决策、更长的面板),能否估计一个结构性的选择模型?这个模型能否与行为链接模型联合估计,从而在理论上绕过Proposition 1的不可识别性?这扎根于作者在文中承认的局限性:“结构性选择模型需要额外的假设或数据”。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论