When Predictions Become Regressors: A Split-Sample Correction for Biases in Downstream Inference¶
作者: Nathan Canen, Ted Enamorado
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.02909
一、领域脉络与小综述¶
这个方向是什么¶
当研究者使用机器学习(包括LLM)生成的预测变量作为线性回归的解释变量时,由于预测误差导致测量误差,从而产生内生性偏差(attenuation bias 或更一般形式的偏差)。本文研究的是:在不额外收集验证数据(即无法观测到真实值 \(X_i\) 的任何子集)的前提下,如何一致地估计回归系数 \(\beta_1\)。该子方向当前处于快速发展期,大量工作集中在2022–2026年,但多数方法依赖“至少有一小部分真实标签”或“参数化误差结构”的假设。
发展脉络(history)¶
从经典测量误差问题出发,作者将近期工作串成一条线:
- 奠基工作:经典教科书(Wooldridge, 2016)已指出测量误差导致衰减偏差。Gillen et al. (2019) 在实验设计中提出用多次实验的测量互为工具变量(“To create such instrumental variables, we combine the commonly used sample splitting approach in machine learning with the intuition from experimental social science where a researcher uses additional experimental measures as instruments for each other (e.g., Gillen et al., 2019)”)。这是本文的直接灵感来源。
- 主要进展(需验证数据):Yang et al. (2022) 和 Burtch et al. (2026) 分别利用随机森林和集成学习,通过观察一小部分数据的预测误差来构造IV(“Yang et al. (2022) shows that the prediction errors across trees will become uncorrelated (as sample size grows), so they can be used as instruments…”;“Burtch et al. (2026) do not require independence across measurement errors (conditional on the input data)”)。Angelopoulos et al. (2023) 提出 prediction-powered inference,需要无误差的验证子集。Egami et al. (2023) 的 DSL 方法也需要少量专家标注。Duan & Pelger (2026) 提出结合校准数据的偏差校正估计量。
- 参数化路线:Battaglia et al. (2025) 推导了特定模型(如多项logit)下偏差的解析表达式,并提出更有效的偏差校正估计量(“Battaglia et al. (2025) derives the expression of the bias of the estimand, proposes a more efficient estimator that can remove this bias”)。
- 本文的位置:作者声称他们的方法“does not require a ‘validation set’ of observations, where the underlying measure of interest is observed perfectly”,且“does not require assuming a specific parametric form of the type of measurement error”。它通过样本分割构造多个独立测量,然后使用IV,本质上是一种无验证数据、无参数假设的测量误差校正。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 需要验证数据的方法:Angelopoulos et al. (2023), Duan & Pelger (2026), Yang et al. (2022), Burtch et al. (2026), Egami et al. (2023), Rister Portinari Maranca et al. (2025)。这些方法假设研究者能观测到(至少一小部分)无误差的真实值,然后利用该信息校正偏差。
- 参数化偏差校正:Battaglia et al. (2025)。假设预测模型来自特定类(如多项logit),推导偏差表达式并构造更有效的估计量。
- 实验/多重测量IV:Gillen et al. (2019)。在实验环境中,用多次实验的测量互为IV。本文将其思想移植到观测数据,用样本分割“模拟”多次实验。
这个方向在追问的核心问题¶
- 核心问题1:当预测变量存在测量误差时,如何一致估计下游回归系数?
- 核心问题2:能否在不依赖验证数据或参数假设的情况下实现一致估计?
- 核心问题3:样本分割构造的IV在什么条件下有效?有限样本表现如何?
- 主流方法与已知瓶颈:主流方法要么需要验证数据(成本高,且在某些场景下不可行,如“exact media slants”无法人工标注),要么需要参数假设(可能错误指定)。本文试图填补“无验证数据、无参数假设”的空白。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
作者把缺口 frame 成:“our approach is computationally simple, theoretically desirable, and does not require any more data or variables than what the researcher used in the first place”。他们强调自己的方法“does not require a validation set”、“does not require assuming a specific parametric form”。他们淡化/回避了: - 独立性假设的强度:Assumption 1 要求测量误差 \(\eta_i\) 跨个体独立(条件于 \(Z_i\))。作者在3.5.1节承认“the assumption may fail in empirically relevant scenarios”,但未深入讨论如何检验或放松。 - 匹配质量对有限样本的影响:Proposition 2 显示不完美匹配只影响第一阶段强度,不影响一致性,但模拟中在最小样本(n=5000)且低噪声时IV的RMSE反而高于OLS(Table 1),说明有限样本方差可能很大。 - 与cross-fitting的亲缘性:本文的样本分割与DML中的cross-fitting(Chernozhukov et al. 2018)有技术亲缘性,但作者未引用或讨论cross-fitting文献。值得研究者去查:cross-fitting的方差分析是否可以直接用于本文IV估计量的方差推导?是否存在更高效的样本利用方式(如交换角色后平均)?
什么明显该被引/该存在、却没出现在intro里? 除了cross-fitting文献,经典的两样本IV文献(Angrist & Krueger 1992; Inoue & Solon 2010)被引了,但关于测量误差的经典专著(如Carroll et al. 2006, Measurement Error in Nonlinear Models)未被引用。这可能是因为本文聚焦于线性模型,但非线性扩展是未来方向。
张力¶
未见明显对立引用。所有被引工作都承认测量误差导致偏差,只是解决方案不同。Yang et al. (2022) 和 Burtch et al. (2026) 与本文最接近,但前者需要验证数据,后者不需要误差独立性(但需要验证数据)。本文与Battaglia et al. (2025) 的张力在于:参数化 vs 非参数化,效率 vs 稳健性。作者明确说“if such parametric forms are deemed reasonable, Battaglia et al. (2025) … may have significant statistical gains”,承认了效率损失。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(Y_i \in \mathbb{R}\):结果变量(可观测)。 - \(Z_i \in \mathbb{R}^K\):原始特征向量(如词频向量),可观测。 - \(X_i = f(Z_i) \in \mathbb{R}\):真实潜在变量(如情感得分),不可观测。\(f(\cdot)\) 是某个已知或预训练的函数(如LLM的population输出)。 - \(\hat{X}_i\):预测值,由 \(Z_i\) 通过某个估计方法得到,可观测。满足 \(\hat{X}_i = X_i + \eta_i\),其中 \(\eta_i\) 是测量误差。 - \(\eta_i\):测量误差,满足 \(E[\eta_i | Z_i] = 0\),且跨个体独立(Assumption 1)。 - \(\varepsilon_i\):回归误差,满足 \(E[\varepsilon_i | X_i] = 0\)。 - \(\beta_0, \beta_1\):待估参数。 - \(n\):样本量。 - 下标 \(i\) 表示个体,\(nn(i)\) 表示在另一个样本中与 \(i\) 匹配的个体索引。
模型: 目标线性回归模型:
可观测数据: 研究者实际能观测到的是 \(\{(Y_i, Z_i)\}_{i=1}^n\),以及通过某种预测方法(如LLM)从 \(Z_i\) 计算出的 \(\hat{X}_i\)。不可观测的是 \(X_i\) 和 \(\eta_i\)。研究者没有任何无误差的验证数据(即没有观测到任何 \(X_i\) 的真实值)。
第二步:最小内核¶
最简特例:假设 \(Z_i\) 是离散的,且样本量足够大,使得在随机分割后的两个子样本(训练集和工具集)中,对每个训练集个体 \(i\),都能在工具集中找到一个个体 \(j\) 满足 \(Z_j = Z_i\)(完美匹配)。此时,两个预测值分别为:
因此,\(\hat{X}_j^{\text{instr}}\) 是 \(\hat{X}_i^{\text{train}}\) 的有效工具变量。IV估计量:
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当预测生成变量(如LLM输出)被用作线性回归的解释变量时,由于测量误差导致的内生性偏差,以及如何在不依赖验证数据或参数假设的情况下一致估计回归系数。
- 核心工具/方法:通过随机样本分割,在独立子样本上分别生成预测值,然后使用最近邻匹配构造工具变量(一个子样本的预测值作为另一个子样本预测值的IV),最后用标准IV估计量。
- 主要结论:在测量误差跨个体独立(条件于输入)且样本分割随机的假设下,该IV估计量一致;模拟显示OLS偏差不随样本量消失,而IV偏差随样本量减小;两个实证应用(德国议会性别化语言、中国政治风险)中IV估计的效应量比原始OLS大50–100%。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - 数据 \(\{(Y_i, Z_i)\}_{i=1}^n\) i.i.d.。 - 真实模型:\(Y_i = \beta_0 + \beta_1 X_i + \varepsilon_i\),\(E[\varepsilon_i | X_i] = 0\)。 - 可观测预测:\(\hat{X}_i = X_i + \eta_i\)。 - Assumption 1 (Measurement Error Structure): (i) \(\{(Z_i, \eta_i, \varepsilon_i)\}\) 跨个体独立。 (ii) \(E[\eta_i | Z_i] = 0\)。 注意:不要求 \(\eta_i\) 与 \(\varepsilon_i\) 独立(允许同个体内相关),也不要求 \(\eta_i\) 同方差。 - Assumption 2 (Randomization in Sample Splitting):数据分割的随机化 \(U\) 独立于 \(\{Z_i, \eta_i, \varepsilon_i\}\),且匹配规则只依赖于 \(\{Z_i\}\) 和 \(U\)。 - 额外假设(用于不完美匹配的Proposition 2):\(E[\varepsilon_i | Z_i] = 0\)(比 \(E[\varepsilon_i | X_i]=0\) 更强)。 - 技术条件:\(\text{Var}(X_i) > 0\),二阶矩有界。
与已有文献的对比: - 相比Yang et al. (2022) 和 Burtch et al. (2026):本文不需要验证数据,但需要 \(\eta_i\) 跨个体独立(后者不需要,因为他们能观测误差)。 - 相比Battaglia et al. (2025):本文不假设预测模型的具体形式,但效率可能更低。 - 相比Angelopoulos et al. (2023):本文不需要任何无误差标签。
主要结果¶
Proposition 1 (完美匹配下的IV有效性):若 \(Z_{nn(i)} = Z_i\),则在Assumptions 1-2下,\(\hat{X}_i^{\text{instr}}\) 是 \(\hat{X}_i\) 的有效IV:\(\text{Cov}(\hat{X}_i, \hat{X}_i^{\text{instr}}) \neq 0\) 且 \(\text{Cov}(u_i, \hat{X}_i^{\text{instr}}) = 0\)。 - 直觉:相关性来自共同测量 \(X_i\);外生性来自误差独立(\(\eta_i\) 与 \(\eta_{nn(i)}\) 独立,且均与 \(\varepsilon_i\) 独立)。 - 必要条件:完美匹配(\(Z_{nn(i)} = Z_i\)),这在离散 \(Z_i\) 且大样本下成立。
Proposition 2 (不完美匹配下的IV有效性):若 \(Z_i \neq Z_{nn(i)}\),但在Assumptions 1-2及 \(E[\varepsilon_i | Z_i] = 0\) 下,仍有 \(\text{Cov}(u_i, \hat{X}_i^{\text{instr}}) = 0\);相关性为 \(\text{Cov}(X_i, X_{nn(i)})\),只要该协方差非零则IV相关。 - 直觉:外生性不依赖匹配质量,因为 \(\eta_{nn(i)}\) 仍与 \(u_i\) 独立;但相关性依赖于 \(X_i\) 与 \(X_{nn(i)}\) 的接近程度。 - 技术难点:需要处理匹配索引的随机性,证明中通过条件期望和随机化 \(U\) 来分解。
Corollary 3.1 (IV估计量一致性):在唯一匹配(每个工具集个体只匹配一个训练集个体)条件下,标准IV估计量 \(\hat{\beta}_1^{\text{IV}}\) 一致。
模拟结果(Table 1, Figure 1): - OLS偏差不随样本量增加而消失(RMSE在n=5K/20K/50K下几乎不变),符合固定渐近偏差。 - IV的RMSE随n增加而下降,在中等噪声(\(\sigma_\eta=1\))下,n=20K时IV的RMSE(0.173)远低于OLS(0.675)。 - 例外:n=5K且低噪声时IV的RMSE(0.248)略高于OLS(0.177),说明有限样本方差在匹配池较小时可能占主导。 - 稳健性检验(Table 2):当误差跨个体相关(如共同冲击\(\delta\))时,IV的RMSE接近OLS,验证了独立性假设的关键性。
证明路线与技术技巧¶
整体路线(以Proposition 1为例): 1. 写内生性来源:\(u_i = \varepsilon_i - \beta_1 \eta_i\),\(\hat{X}_i = X_i + \eta_i\)。 2. 写工具变量:\(\hat{X}_i^{\text{instr}} = X_i + \eta_{nn(i)}\)(完美匹配下)。 3. 计算协方差:
关键跳跃点: - 处理匹配索引 \(nn(i)\) 的随机性:在证明中,作者将 \(\eta_{nn(i)}\) 写为 \(\sum_{j \in \text{instr}} \mathbf{1}_{nn(i)=j} \eta_j\),然后利用随机化 \(U\) 独立于所有变量,取条件期望后得到 \(E[\eta_{nn(i)} | Z_1,\dots,Z_n, U] = 0\)。这是证明外生性的核心步骤。 - 不完美匹配(Proposition 2)需要更强的 \(E[\varepsilon_i | Z_i]=0\) 来保证 \(\text{Cov}(X_{nn(i)}, \varepsilon_i)=0\),因为此时 \(X_{nn(i)} = f(Z_{nn(i)})\) 不一定等于 \(X_i\),但条件期望仍为零。
技术技巧点名: - 条件期望与随机化:利用 \(U\) 的独立性分解匹配索引的随机性。 - 最近邻匹配:在嵌入空间(SVD降维后)使用欧氏距离,作为不完美匹配的近似。 - 两样本IV:标准IV估计量,闭式解,可用现有统计包实现。
真实例子与应用¶
例子1:德国议会性别化语言(Ash et al., 2025) - 数据:544,000+ 演讲,来自16个德国州议会(1991–2020)。包含演讲文本、演讲者性别、反应类型(鼓掌、插话等)。 - 方法应用:作者用LDA主题模型估计每个演讲的“性别化程度”(Predicted Gender),即该演讲更可能由女性还是男性发表的概率。原始论文将该估计值作为回归变量,研究其对反应计数的影响。本文复现时,将数据随机分成三份:一份训练LDA,另两份分别作为分析样本和工具样本。在分析样本和工具样本之间,用SVD降维(200维)后的欧氏距离进行最近邻匹配,然后用工具样本的Predicted Gender作为分析样本的IV。 - 结果:IV估计的系数绝对值比原始OLS大50–100%。例如,Predicted Gender对鼓掌的效应从-0.100变为-0.138(增大38%),对插话的效应从-0.162变为-0.216(增大33%)。交互项(Female×Predicted Gender)也显著增大。这表明原始估计因测量误差而严重衰减。 - 说明什么:验证了理论预测(衰减偏差),并展示了方法在真实大规模文本数据上的可行性。
例子2:中国政治风险与扶贫支出(Lin, 2025) - 数据:418,480 条投资者-公司Q&A,来自中国上市公司(2012–2019)。构建公司-年层面的政治风险指数(PRI),即政治相关Q&A的比例。使用BERT分类。 - 方法应用:将数据随机分成两组,用主题特定的PRI(topic-specific PRIs)进行最近邻匹配,然后用匹配的PRI作为IV。 - 结果:PRI×Post2015的IV估计系数比原始OLS大30%(0.021 vs 0.016),且仍显著。说明测量误差导致低估了政治风险对扶贫支出的影响。 - 说明什么:在差异中的差异设定下,IV校正仍有效,且效应量增大。
本文为纯理论+实证例子,没有纯模拟之外的额外实验。
🔎 结论是否比证明窄¶
- Proposition 2 需要更强的假设:\(E[\varepsilon_i | Z_i] = 0\),而Proposition 1只需要 \(E[\varepsilon_i | X_i]=0\)。在实证中,如果 \(Z_i\) 包含 \(X_i\) 以外的变量,这个假设可能不成立。作者在Proposition 2的陈述中明确写了“under the strengthened assumption”,但在正文讨论中未强调这一差异。读者需注意:不完美匹配下的外生性依赖于 \(Z_i\) 对 \(\varepsilon_i\) 的均值独立性,而不仅仅是 \(X_i\)。
- 模拟中的“完美匹配”从未实现:在连续 \(Z_i\) 下,最近邻匹配只能近似,因此实际一致性依赖于Proposition 2的假设。作者在模拟中使用了嵌入空间匹配,但未检验 \(E[\varepsilon_i | Z_i]=0\) 是否合理。
- Corollary 3.1 要求唯一匹配:每个工具集个体只匹配一个训练集个体。如果使用一对多匹配,则工具变量之间会引入相关性,标准IV渐近理论需要调整。作者在算法中未强制唯一匹配,但在理论中假设了。
四、开放问题(点到为止,扎根具体语句)¶
-
放松测量误差独立性假设:当 \(\eta_i\) 跨个体相关时(如共同模型误差、网络溢出),IV失效(模拟Row 2显示IV的RMSE接近OLS)。如何检验或放松Assumption 1(ii)?作者在3.5.1节承认“the assumption may fail in empirically relevant scenarios”,但未给出诊断或稳健方法。扎根:Section 3.5.1, 模拟Table 2 Row 2。
-
匹配质量的有限样本影响:在n=5000且低噪声时IV的RMSE高于OLS(Table 1),说明有限样本方差可能抵消偏差校正收益。如何选择匹配变量(原始特征 vs 嵌入)和距离度量以最小化有限样本MSE?作者在算法中使用了SVD降维,但未讨论最优降维维度。扎根:Table 1 (n=5K, Low noise), 算法Step 2。
-
扩展到非线性结果模型:本文仅考虑线性回归。对于logit、Poisson或分位数回归,测量误差偏差的形式不同,IV方法是否仍有效?作者在Discussion中提到“extensions to nonlinear outcome models”。扎根:Section 6最后一段。
-
多个样本分割与多模型组合:当有多个独立分割或多个预测模型时,如何最优构造IV(如平均、加权、GMM)?作者提到“one could follow Gillen et al. (2019) and simply swap the labels, obtain two IV estimators, and average them”,但未分析效率增益。扎根:Section 3.5.2, 以及“Future work could examine … the use of more than two sample splits or multiple prediction models”。
Maintained by 陈星宇 · Homepage · Source on GitHub