跳转至

Econometrics with Pre-Trained Embeddings for Unstructured Data

作者: Yuya Shimizu
主题: 经济理论 / 应用
相关性: 7/10
链接: https://arxiv.org/abs/2607.17378


一、领域脉络与小综述

这个方向是什么

这个子方向研究的是:在实证经济学中,当研究者使用由计算机科学家在不同任务和数据集上预训练的深度学习模型(如CNN、BERT)提取的嵌入(embeddings) 作为协变量时,如何保证下游统计推断(如因果效应估计、需求弹性估计)的有效性。其核心统计问题是两步估计(Murphy and Topel, 1985; Pagan, 1984)在迁移学习场景下的理论性质:第一步(源任务)的估计误差如何传播到第二步(目标任务),以及嵌入函数的非识别性(partial identification)如何影响下游推断。当前该领域的成熟度较低,缺乏统一的理论框架。

发展脉络(history)

  • 奠基工作:传统两步估计理论(Murphy and Topel, 1985; Pagan, 1984)为生成回归元(generated regressors)的推断提供了基础,但未考虑源任务与目标任务不一致的情况。
  • 主要进展(DML框架):Chernozhukov et al. (2018) 提出的双重机器学习(DML)框架为使用机器学习估计的 nuisance 参数进行推断提供了通用工具,其核心条件是 nuisance 参数的收敛速度需快于 \(n^{-1/4}\)。这为后续研究设定了技术目标。
  • 当前 Frontier(预训练嵌入的应用):大量实证工作(Avivi, 2025; Dube et al., 2020; Bajari et al., 2025; Bach et al., 2024; Compiani et al., 2025)直接使用预训练嵌入作为协变量,并隐含假设嵌入能充分概括非结构化数据中的相关信息。这些工作缺乏对源任务估计误差和嵌入函数非识别性的理论处理。
  • 本文的位置:本文(Shimizu, 2026)是首个在DML框架下,显式建模源任务估计误差嵌入函数非识别性,并给出目标模型收敛速度的理论工作。它填补了实证实践与理论之间的空白。

子线索聚类

  1. 缺失数据框架:Fong and Tyler (2021), Angelopoulos et al. (2023), Egami et al. (2023) 等将非结构化数据生成变量视为缺失数据问题,通常假设MCAR或已知倾向得分。这些方法未研究基于非结构化数据的倾向得分估计的收敛速度。
  2. 预训练嵌入的理论证明:Bach et al. (2024), Vafa et al. (2025) 在高层假设下建立了参数估计的 \(\sqrt{n}\)-相合性。Schulte, Rügamer, and Nagler (2025) 指出了嵌入函数的识别问题,但忽略了源任务估计误差隐含假设可迁移性。Christensen and Compiani (2026) 开发了需求反事实的偏差校正,但其理论将 nuisance 参数的收敛视为给定。
  3. 迁移学习理论:Tripuraneni, Jordan, and Jin (2020) 引入“任务多样性”作为学习可迁移表示的关键条件。Watkins et al. (2023) 在可实现性(realizability)假设下推导了乐观的过剩风险界。这些工作主要关注预测风险,其收敛速度通常慢于 \(n^{-1/4}\),不足以直接应用于DML推断。

这个方向在追问的核心问题

  1. 嵌入函数的识别问题:在什么条件下,从源任务学到的嵌入函数 \(h\) 能被(部分)识别?其识别集的结构是什么?
  2. 迁移条件:源任务和目标任务需要满足什么关系,才能保证源任务学到的嵌入对目标任务有效?如何量化这种“可迁移性”?
  3. 收敛速度:在考虑源任务估计误差和嵌入非识别性后,目标模型的收敛速度是多少?何时能达到DML所需的 \(n^{-1/4}\) 速度?
  4. 实际指导:给定这些理论限制,实证研究者应如何选择嵌入层(如最后一层 vs. 中间层)和目标模型(如LASSO vs. Ridge)?

⚠️ 作者的 framing

  • 作者把缺口 frame 成什么:作者将问题定位为“迁移学习+识别问题”,并强调源任务估计误差是现有理论(如 Schulte et al., 2025)忽略的关键因素。作者通过引入“近似真嵌入函数”和“任务多样性”两个概念,将问题转化为一个可处理的统计收敛问题,使其成为DML理论的“显然的下一步”。
  • 哪些竞争路线被他淡化或回避了
    • 与 Escanciano and Pérez-Izquierdo (2026) 的关系:作者在附录A.2中专门讨论了这一点。Escanciano and Pérez-Izquierdo (2026) 研究了一般生成回归元下的局部稳健估计,并指出生成回归元通常会影响推断。作者通过假设嵌入是目标任务的充分统计量(即 \(E[Y|Z] = E[Y|h_m(Z)]\)),使得Neyman正交性对嵌入的扰动不敏感,从而回避了更一般的“直接一阶效应”问题。这实际上是一个强假设,作者将其定位为“DML类比于半参模型中的指标限制”。
    • 密度比假设:作者在Assumption 3中假设源任务和目标任务协变量 \(Z\) 的密度比有下界。这是一个很强的假设,尤其是在非结构化数据场景下。作者承认“放松这个假设超出了本文范围”。
  • 什么明显该被引/该存在、却没出现在 intro 里?:作者没有引用关于统计-计算权衡低度多项式障碍的文献。考虑到论文的核心是“迁移条件”和“收敛速度”,这些文献中关于“表示学习”的计算复杂度或“任务多样性”的算法障碍可能提供有价值的补充视角。这是一个值得研究者去查的问题。

张力

未见明显对立引用。各条线索之间是互补关系,而非矛盾关系。例如,缺失数据框架和预训练嵌入理论可以结合,而迁移学习理论为预训练嵌入提供了更底层的保障。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(\theta^*\): 目标参数(estimand),如ATE或部分线性模型中的系数。
    • \(W_i = (Y_i, X_i, Z_i)\): 目标任务的可观测数据,其中 \(Y_i\) 是结果,\(X_i\) 是处理变量/关键变量,\(Z_i\) 是非结构化协变量(如图像、文本)。
    • \(S_j\): 源任务的可观测结果(如图像标签)。
    • \(Z_j\): 源任务的可观测协变量(与目标任务共享相同的非结构化数据空间)。
    • \(h: \mathcal{Z} \to \mathbb{R}^K\): 嵌入函数,将非结构化数据映射到低维向量空间。\(h_m\) 是“近似真”嵌入函数,\(\hat{h}\) 是源任务估计的嵌入函数。
    • \(g: \mathbb{R}^K \to \mathbb{R}^T\): 源任务模型(如分类器的头部),\(g_m\) 是“近似真”源模型,\(\hat{g}\) 是估计的源模型。
    • \(f: \mathbb{R}^K \to \mathbb{R}\): 目标任务模型(如回归函数),\(f_n\) 是“近似真”目标模型,\(\hat{f}\) 是估计的目标模型。
    • \(m\): 源任务样本量。\(n\): 目标任务样本量。
    • \(\delta_{so,m}\): 源模型 \(\hat{g} \circ \hat{h}\)\(g_m \circ h_m\) 的收敛速度。
    • \(r_{ta,n}\): 给定 \(\hat{h}\),目标模型 \(\hat{f} \circ \hat{h}\) 到其最优近似 \(f^\bullet_n \circ \hat{h}\) 的收敛速度。
    • \(\nu_n\): 可迁移性强度(transferability strength),量化源任务识别集对目标任务识别集的约束力。
    • \(\epsilon_{so,m}, \epsilon_{ta,n}\): 源任务和任务目标的近似误差(approximation error),衡量 \(g_m \circ h_m\)\(f_n \circ h_m\) 与真实模型 \(a^*_{so}, a^*_{ta}\) 的距离。
  • 模型

    • 数据生成机制:源样本 \((S_j, Z_j) \sim_{i.i.d.} P_{so}\),目标样本 \((Y_i, Z_i) \sim_{i.i.d.} P_{ta}\),且两者独立。源任务和目标任务共享一个“近似真”的嵌入函数 \(h_m\),但它们的边际分布 \(P_{so}(Z)\)\(P_{ta}(Z)\) 可以不同。
    • 统计模型:这是一个半参数模型。参数 \(\theta^*\) 是有限维的,而 nuisance 参数 \((\gamma^*, \alpha^*)\) 是无限维的,它们被建模为 \(f \circ h_m\) 的形式,其中 \(f\) 属于某个函数类 \(\mathcal{F}_n\)
    • 已知/未知:研究者知道预训练模型 \((\hat{g}, \hat{h})\),但不知道源样本 \(\{(S_j, Z_j)\}\)。源任务和任务目标的真实模型 \(a^*_{so}, a^*_{ta}\) 未知。函数类 \(\mathcal{G}_m, \mathcal{H}_m, \mathcal{F}_n\) 是已知的。
  • 可观测数据

    • 可观测:目标样本 \(\{Y_i, Z_i\}_{i=1}^n\),源任务估计的嵌入函数 \(\hat{h}\) 和源模型 \(\hat{g}\)
    • 潜在/不可观测:源样本 \(\{(S_j, Z_j)\}_{j=1}^m\) 对经济学家不可观测。嵌入函数 \(h_m\) 本身是潜在变量,只能通过源任务输出 \(g_m \circ h_m\) 部分识别。目标任务的真实 nuisance 函数 \(\gamma^*, \alpha^*\) 也是不可观测的。

第二步:讲最小内核

论文的核心数学困难在于:当嵌入函数 \(h\) 只能被部分识别(即存在多个 \(h\) 产生相同的源任务输出)时,如何保证目标任务的估计误差可控?

最简特例:线性模型(Example 9)

假设源任务和目标任务都是线性的: - 源任务\(g_m \circ h_m(Z) = \alpha_{so,m} + B_{so,m} h_m(Z)\),其中 \(B_{so,m} \in \mathbb{R}^{T \times K}\)。 - 目标任务\(f_n \circ h_m(Z) = \alpha_{ta,n} + \beta'_{ta,n} h_m(Z)\),其中 \(\beta_{ta,n} \in \mathbb{R}^K\)

在这个特例下,论文的核心命题退化为:

如果源任务系数矩阵 \(B_{so,m}\)行空间(row space)不包含目标系数向量 \(\beta_{ta,n}\),那么即使源任务估计完美,目标任务估计也会产生不可忽略的偏差。

为什么? 1. 识别问题:源任务只能识别 \(h_m\)\(B_{so,m}\) 行空间中的部分。任何与行空间正交的方向 \(v\)(即 \(B_{so,m} v = 0\))都无法被源任务识别。因此,存在一个与 \(h_m\) 不同的嵌入函数 \(h' = h_m + v\),它产生完全相同的源任务输出。 2. 迁移失败:如果 \(\beta_{ta,n}\) 不在 \(B_{so,m}\) 的行空间中,那么它有一个非零分量在正交方向 \(v\) 上。当我们使用 \(h'\) 代替 \(h_m\) 时,目标任务的预测会改变(因为 \(\beta'_{ta,n} h' \neq \beta'_{ta,n} h_m\)),但源任务输出不变。因此,源任务无法区分 \(h_m\)\(h'\),但目标任务却需要这个区分。 3. 结果:源任务的估计误差(即使很小)会通过这个“未覆盖”的方向被放大到目标任务中,导致估计偏差。这就是论文中模拟实验(Figure 1)展示的“out-of-span”设计。

核心思路:论文的“任务多样性”条件(Definition 2)正是为了排除这种情况。它要求源任务的识别集(即所有与 \(h_m\) 产生相似源输出的 \(h\))是目标任务识别集的子集。在线性模型中,这等价于要求 \(\beta_{ta,n}\)\(B_{so,m}\) 的行空间中。这样,任何源任务无法区分的 \(h\),在目标任务中也是“近似”无法区分的,从而保证了迁移的有效性。

三、这篇论文做了什么

  • 三句话
    1. 研究了什么问题:在DML框架下,使用预训练嵌入进行因果推断和结构估计的理论基础,特别是当源任务与目标任务不同且嵌入函数存在识别问题时。
    2. 核心工具/方法:提出了“近似真嵌入函数”和“任务多样性”两个概念,并基于此建立了迁移学习理论,将目标模型的收敛速度分解为源任务收敛速度、可迁移性强度和近似误差之和。
    3. 主要结论:在满足任务多样性和密度比等条件下,目标模型的收敛速度可以快于 \(n^{-1/4}\),从而满足DML框架的要求。论文还提供了实际指导,如推荐使用最后一层嵌入和岭回归,并警告LASSO的脆弱性。

关键设定与假设

  • 近似真嵌入函数 (Definition 1):假设存在一个嵌入函数 \(h_m\),使得源任务和目标任务都能被它很好地近似(近似误差 \(\epsilon_{so,m}, \epsilon_{ta,n}\) 小)。这形式化了“嵌入能概括相关信息”的隐含假设。
  • 任务多样性 (Definition 2):源任务的近似识别集是目标任务近似识别集的子集。这是保证迁移有效性的核心条件。在线性模型中,它等价于目标系数在源系数矩阵的行空间中。
  • \(\nu_n\)-可迁移性 (Definition 3):量化了任务多样性的强度。\(\nu_n\) 越大,源任务对目标任务的约束越强。
  • 密度比假设 (Assumption 3)\(p_{so}(z)/p_{ta}(z) \ge w_n^2\)。这是一个很强的假设,用于将源任务的 \(L_2\) 范数误差转换为目标任务的 \(L_2\) 范数误差。它要求目标任务的支撑集是源任务支撑集的子集。
  • 损失函数条件 (Assumption 4, 5):要求过剩风险(excess risk)被 \(L_2\) 范数的平方上下界控制,且损失函数是Lipschitz连续的。这是统计学习理论中的标准假设。

相比已有文献的强化/放宽: - 强化:相比 Schulte et al. (2025) 隐含假设可迁移性,本文显式建模了任务多样性条件。相比 Tripuraneni et al. (2020) 的可实现性假设,本文允许近似误差 \(\epsilon > 0\)。 - 放宽:相比 Watkins et al. (2023) 要求风险为零的可实现性假设,本文不需要这个强假设,因此更适用于经济应用。

主要结果

  • 定理1 (收敛速度分解):这是核心定理。它指出目标模型 \(\hat{f} \circ \hat{h}\) 到真实模型 \(a^*_{ta}\)\(L_2\) 收敛速度由三部分组成:

    \[\|\hat{f} \circ \hat{h} - a^*_{ta}\|_{P_{ta},2} = O_P(r_{ta,n} + \delta_{so,m}/\nu_n + \epsilon_{ta,n})\]

    • \(r_{ta,n}\): 给定嵌入后的目标模型估计误差。
    • \(\delta_{so,m}/\nu_n\): 源任务估计误差经可迁移性调整后的影响。
    • \(\epsilon_{ta,n}\): 目标任务的近似误差。 直觉:如果可迁移性很强(\(\nu_n\) 大),源任务估计误差的影响会被削弱。最终速度由最慢的一项决定。
  • 定理6 (低维目标模型收敛速度):在低维情况下(VC维小),给出了 \(r_{ta,n}\) 的具体形式为 \(\sqrt{V(\mathcal{F}_n) \log(n)/n}\)。结合定理1,只要 \(\delta_{so,m}/\nu_n + \epsilon_{ta,n} = o(n^{-1/4})\),就能满足DML要求。

  • 定理7 (源模型收敛速度):给出了源模型 \(\hat{g} \circ \hat{h}\) 的收敛速度 \(\delta_{so,m}\),它依赖于源任务函数类 \(\mathcal{H}_m, \mathcal{G}_m\) 的VC维和样本量 \(m\)

  • 定理8 (高维岭回归目标模型):在高维情况下,当目标模型是岭回归时,给出了具体的收敛速度。该速度依赖于嵌入协方差矩阵的有效自由度 \(N_{h_m,n}(\lambda)\)。在特征值多项式衰减的条件下,岭回归可以达到 \(o(n^{-1/4})\) 的速度。

证明路线与技术技巧

  • 整体路线

    1. 分解:通过三角不等式,将目标模型的总误差分解为三部分(如定理1所示)。
    2. 源任务收敛:使用经验过程理论(Lemma 8, 11)和VC维/均匀熵界,证明源模型 \(\hat{g} \circ \hat{h}\) 以速度 \(\delta_{so,m}\) 收敛到 \(g_m \circ h_m\)(定理7)。
    3. 迁移条件应用:利用任务多样性条件(Assumption 2),将源任务的收敛速度 \(\delta_{so,m}\) 转化为目标任务的“识别误差” \(\delta_{so,m}/\nu_n\)。这一步是证明的核心,它连接了源任务和目标任务。
    4. 目标模型收敛:再次使用经验过程理论,证明给定 \(\hat{h}\) 后,目标模型 \(\hat{f} \circ \hat{h}\) 以速度 \(r_{ta,n}\) 收敛到其最优近似 \(f^\bullet_n \circ \hat{h}\)(定理6)。
    5. 合并:将步骤2-4的结果代入步骤1的分解,得到最终收敛速度。
  • 关键跳跃点

    • 从源任务 \(L_2\) 误差到目标任务 \(L_2\) 误差:这是任务多样性条件(Definition 2)和密度比假设(Assumption 3)共同作用的地方。定理3提供了一个充分条件,通过一个Lipschitz函数 \(\Gamma\) 将源模型和目标任务模型联系起来。
    • 处理嵌入函数的非识别性:论文通过定义“近似识别集” \(\mathcal{H}_{so,m}(\rho)\)\(\mathcal{H}_{ta,m}(\rho)\),将非识别性问题转化为集合包含关系。任务多样性条件正是要求这两个集合之间存在包含关系。这是处理非识别性的一个巧妙方法。
  • 技术技巧点名

    • 经验过程理论 (Empirical Process Theory):用于控制随机误差,特别是通过局部化最大不等式(Lemma 8)和速率定理(Lemma 11, 12)来推导收敛速度。
    • VC维/均匀熵 (VC Dimension / Uniform Entropy):用于度量函数类的复杂度,是推导收敛速度的基础。
    • 覆盖数 (Covering Number):用于计算函数类的熵,是经验过程理论的核心工具。
    • 核范数/谱范数不等式 (Nuclear/Spectral Norm Inequalities):在岭回归的证明(定理8)中,用于处理嵌入协方差矩阵的扰动。
    • 有效自由度 (Effective Degrees of Freedom):用于刻画岭回归的复杂度,并推导其在特征值衰减下的收敛速度。

真实例子与应用

论文包含一个模拟实验(Section I),用于验证理论预测。 - 数据/场景:部分线性模型(Example 1),其中 \(Z\) 是50维的,通过一个固定的随机ReLU网络生成10维的“真”嵌入 \(h^*\)。源任务是预测一个100维的向量 \(S\),该向量只依赖于 \(h^*\) 的5维子空间。 - 方法应用:源任务训练一个5层ReLU网络来估计嵌入 \(\hat{h}\)。目标任务使用线性DML估计 \(\theta\)。 - 结果: - In-span设计:目标系数 \(\beta, \delta\) 在源任务可识别的5维子空间内。估计量 \(\hat{\theta}\) 的均值接近真值1(1.005),分布对称。 - Out-of-span设计:目标系数 \(\beta, \delta\) 在源任务不可识别的正交方向上。估计量 \(\hat{\theta}\) 的均值显著偏离真值(1.197),且nuisance参数的预测误差急剧增大。 - 说明的问题:这个例子直观地展示了任务多样性条件的重要性。当目标任务的“方向”未被源任务“覆盖”时,即使源任务估计得很好,迁移也会失败,导致DML估计产生偏差。这完美地验证了定理4(必要条件)和模拟的动机。

🔎 结论是否比证明窄

  • 。论文的主要结论(定理1)是在一系列假设下严格证明的,但作者在讨论和实际指导中,有时会做出更泛化的声明。
  • 具体语句
    • 作者在Remark 3中说:“Applied work using source task embeddings often ignores the estimation error of the pre-trained model... This theorem provides a theoretical justification for this common practice...”。然而,这个“理论证明”依赖于任务多样性密度比等强假设。在实践中,这些假设是否成立是未知的。因此,这个“justification”是有条件的,而不是无条件的。
    • 作者在Section 4.2.2中强烈建议不要使用LASSO,理由是“approximate sparsity is not preserved under the unidentified invertible linear transformations”。这个结论是基于定理2(必要条件)和Kolesár et al. (2026)的讨论。然而,这个结论的严格性依赖于“嵌入函数只能被识别到可逆线性变换”这个前提。如果源任务能提供更强的识别(例如,通过正则化或特定的网络结构),LASSO可能仍然可行。作者没有严格证明在所有情况下LASSO都失败,而是给出了一个基于“一般情况”的警告。

四、开放问题

  1. 放松密度比假设 (Assumption 3):论文的收敛速度严重依赖于 \(p_{so}(z)/p_{ta}(z) \ge w_n^2\) 这个假设。在非结构化数据(如图像、文本)中,源任务和任务目标的分布可能差异巨大,这个假设很难满足。扎根点:Section 3.3.1, “Relaxing this assumption is beyond the scope of this paper and is an important direction for future research.” 一个可能的路径是利用最优传输(optimal transport)或分布鲁棒优化(distributionally robust optimization)来替代密度比。

  2. 更一般的迁移条件:论文的“任务多样性”条件(Definition 2)是一个集合包含关系,其充分条件(Theorem 3)依赖于存在一个Lipschitz函数 \(\Gamma\)。对于非线性源任务(如深度神经网络),这个条件非常强。扎根点:Theorem 5的讨论指出,对于非线性源任务,任务多样性条件要求目标函数是源任务输出的一个函数。能否找到更弱、更易验证的迁移条件?例如,能否利用因果图结构方程模型来刻画源任务和目标任务之间的关系?

  3. 高维非线性目标模型的理论:论文为高维线性目标模型(岭回归)提供了理论(Theorem 8),但指出对于正则化神经网络,其收敛速度“is not well understood in the literature”。扎根点:Section 4.2.3, “Establishing the convergence rate of regularized neural network estimators for the target model in our setting is an important direction for future research.” 这是一个开放且具有挑战性的问题,需要结合深度学习的逼近理论和统计学习理论。

  4. 多模态迁移学习:论文在附录H中扩展到了多模态场景,但假设模态间的迁移条件是“联合”成立的。扎根点:Appendix H, Definition 6. 如何验证或保证这种“联合”条件?不同模态的嵌入之间可能存在复杂的交互作用,如何建模这种交互并推导出更紧的收敛速度?这直接连接了研究者对多模态因果推断的兴趣。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论