Towards a Unified Theory for Semiparametric Data Fusion with Individual-Level Data¶
作者: Ellen Graham, Marco Carone, Andrea Rotnitzky
主题: 效率理论 / Debiased ML
相关性: 8/10
链接: https://arxiv.org/abs/2409.09973
一、领域脉络与小综述¶
这个方向是什么¶
数据融合(data fusion)旨在利用多个独立数据源来估计目标总体中的某个有限维参数。每个数据源只提供目标随机向量 \(W\) 的一个子向量 \(W^{(j)}\),且假设某些条件分布或边际分布与目标分布 \(Q_0\) 的对应分量“对齐”(align)。核心统计问题是:在给定对齐假设下,如何刻画所有正则渐近线性(RAL)估计的影响函数,特别是有效影响函数(EIF),从而为基于机器学习的去偏半参数有效估计铺平道路。该方向当前处于从特例方法向统一理论过渡的阶段。
发展脉络¶
-
奠基工作:Angrist & Krueger (1992) 提出两样本工具变量(TSIV)方法,利用两个独立样本分别估计 \(X|L\) 和 \(Y|L\) 的条件分布。Robins, Rotnitzky & Zhao (1994) 和 van der Laan & Robins (2003) 建立了缺失数据(coarsened at random, CAR)下的半参数效率理论,其核心是通过得分算子(score operator)刻画影响函数。这些工作为数据融合提供了早期工具,但均针对特定设定。
-
主要进展:Pearl & Bareinboim (2011) 提出因果效应的可运输性(transportability)框架,用图模型处理多环境数据。Rudolph & van der Laan (2017) 和 Dahabreh et al. (2020) 发展了将随机试验结果运输到目标总体的半参数估计方法。Li & Luedtke (2023) 首次提出一个统一的半参数数据融合框架,要求各数据源的对齐条件分布对应于目标联合分布的一个单一分解(sequential conditional factorization)。Qiu, Tchetgen Tchetgen & Dobriban (2024) 在该框架下发展了多重稳健估计。
-
当前前沿:本文(Graham, Carone, Rotnitzky, 2024)将 Li & Luedtke (2023) 的框架推广到允许不同数据源的对齐条件分布来自目标联合分布的不同分解,从而覆盖两样本IV、测量误差校正、不同流行病学设计整合等常见但未被 Li & Luedtke 覆盖的场景。本文的核心工具是得分算子及其伴随算子,与 CAR 理论一脉相承,但融合数据的目标总体与缺失数据不同——融合数据中,合并样本并非目标总体的随机样本,目标总体是抽象的,仅通过对齐与各源关联。
子线索聚类¶
-
两样本工具变量(TSIV):Angrist & Krueger (1992), Klevmarken (1982), Zhao et al. (2019), Pierce & Burgess (2013), Shu & Tan (2020), Sun & Miao (2022)。这些工作聚焦于用两个独立样本分别估计工具变量对处理和处理对结果的条件分布,从而识别因果效应。本文的 Example 2 属于此类。
-
因果效应运输(transportability):Pearl & Bareinboim (2011), Rudolph & van der Laan (2017), Dahabreh et al. (2020), Li & Luedtke (2023)。这些工作假设目标总体的条件结果分布与源总体相同,但协变量分布不同,从而将源总体的因果效应运输到目标总体。本文的 Example 3 scenario (i) 属于此类。
-
测量误差校正与验证研究:Chen, Hong & Tarozzi (2008), Cole et al. (2023), Li, Miao & Tchetgen Tchetgen (2023)。这些工作利用外部验证研究来校正主研究中的测量误差。本文的 Example 1 属于此类。
-
不同流行病学设计整合:Jia, Geng & Wang (2006), Chatterjee et al. (2016)。这些工作整合前瞻队列与回顾性病例对照数据。本文的 Example 3 scenarios (ii)-(iv) 属于此类。
核心问题与已知瓶颈¶
-
核心问题:给定多个独立数据源,每个源提供 \(W\) 的一个子向量,且假设某些条件/边际分布与目标分布对齐,如何刻画所有 RAL 估计的影响函数?如何计算有效影响函数?如何构造去偏机器学习估计?
-
已知瓶颈:Li & Luedtke (2023) 的框架要求所有对齐条件分布来自目标联合分布的单一分解,这排除了两样本IV(因为 \(Y|L\) 和 \(X|L\) 来自不同分解)、测量误差校正(因为 \(V|X\) 和 \(V|Y,X\) 来自不同分解)以及病例对照与队列整合(因为 \(Y|L,A\) 和 \(L,A|Y\) 来自不同分解)。此外,当对齐本身对观测数据分布施加等式约束时(如 Example 3 scenario (iii)),有效影响函数的计算变得复杂,信息算子可能不可逆或不是压缩映射。
⚠️ 作者的 framing¶
作者将缺口 frame 为:现有理论(Li & Luedtke, 2023)只适用于“单一分解”场景,而许多重要应用(两样本IV、测量误差、不同设计整合)不满足该条件。因此,本文的“显然下一步”是推广到允许不同分解的对齐。作者淡化了以下竞争路线: - 针对特定问题的专用方法(如 TSIV 的 Zhao et al. 2019)虽然已有影响函数刻画,但缺乏统一性。 - 图模型方法(Bareinboim & Pearl, 2016; Lee et al., 2020)处理更一般的识别问题,但未提供半参数效率理论。 - 作者明确提到“leave an extension of the present results to this setting [latent variables] for future work”,暗示当前框架不直接适用于存在未观测混杂的图模型场景。
值得研究者去查的问题:作者在引言中引用了大量工作,但未提及 Bareinboim & Tian (2015) 关于选择偏差恢复的工作,也未提及 Hünermund & Bareinboim (2023) 的综述。这些工作是否与本文的框架有重叠或互补?此外,Evans & Didelez (2024) 关于 copula 对齐的工作被作者在讨论中提及,但未在引言中作为竞争路线出现——这可能是作者有意回避,因为 copula 对齐不满足本文的条件分布对齐假设。
张力¶
未见明显对立引用。各被引工作基本在各自设定下自洽,没有在相同条件下得出相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(W\):理想数据随机向量,取值于 \(\mathcal{W} \subseteq \mathbb{R}^K\),目标分布为 \(Q_0\)。
- \(S \in \{1,\dots,J\}\):数据源指示变量。
- \(W^{(j)} = c(W,j)\):源 \(j\) 中观测到的子向量。
- \(O = (c(W,S), S)\):观测数据向量。
- \(P_0\):观测数据 \(O\) 的真实分布。
- \(Q\):理想数据模型,\(Q_0 \in \mathcal{Q}\)。
- \(\mathcal{P}\):观测数据模型,\(P_0 \in \mathcal{P}\)。
- \(\psi: \mathcal{Q} \to \mathbb{R}\):理想数据参数(如平均处理效应)。
- \(\varphi: \mathcal{P} \to \mathbb{R}\):观测数据参数,满足 \(\varphi(P) = \psi(Q)\) 当 \(P\) 与 \(Q\) 对齐。
- \(\mathcal{C}\):对齐假设的集合,由每个源中哪些条件/边际分布与 \(Q_0\) 对齐来定义。
- \(Z^{(j)}_k\):源 \(j\) 中第 \(k\) 个对齐分量的随机向量(按某个分解排序)。
- \(\mathcal{Z}^{(j)}_{k-1}\):条件分布 \(Z^{(j)}_k | Z^{(j)}_{k-1}\) 对齐的支撑子集。
- \(\psi^1_Q\):\(\psi\) 在 \(Q\) 处的影响函数(梯度)。
- \(\varphi^1_P\):\(\varphi\) 在 \(P\) 处的影响函数。
- \(\mathcal{D}^{(j)}_k(Q)\):由形如 \(I(z^{(j)}_{k-1} \in \mathcal{Z}^{(j)}_{k-1}) \{ d(z^{(j)}_k) - E_Q[d(Z^{(j)}_k) | z^{(j)}_{k-1}] \}\) 的函数构成的空间。
- \(\mathcal{R}^{(j)}_k(P_{Q,U,\lambda})\):类似地,用于未对齐部分的函数空间。
- \(A_{Q,U,\lambda}\):得分算子,将理想数据得分映射到观测数据得分。
-
\(A^*_{Q,U,\lambda}\):其伴随算子。
-
模型:
- 目标分布 \(Q_0\) 属于某个模型 \(\mathcal{Q}\)(可以是非参数、半参数或参数)。
- 每个源 \(j\) 的观测数据分布 \(P(\cdot|S=j)\) 与 \(Q_0\) 在指定的条件/边际分布上对齐(Definition 1)。
- 观测数据模型 \(\mathcal{P}\) 由所有满足对齐假设的 \(P\) 构成,即存在 \(Q \in \mathcal{Q}\) 使得 \(P \overset{\mathcal{C}}{\approx} Q\)。
-
参数 \(\psi(Q)\) 仅通过对齐的分量依赖于 \(Q\)(Assumption 1),因此 \(\varphi(P)\) 被唯一确定(Theorem 1)。
-
可观测数据:
- 研究者观测到来自 \(J\) 个独立源的 i.i.d. 样本:每个样本包含源指示 \(S\) 和该源下的子向量 \(W^{(S)}\)。
- 例如,在两样本IV中,源1观测 \((L,Y)\),源2观测 \((L,X)\);在测量误差例子中,源1观测 \((X,V)\),源2观测 \((X,V,Y)\)。
- 不可观测的是目标总体 \(Q_0\) 的完整向量 \(W\) 以及未对齐的条件分布(如 \(Q_0(A|L)\) 在 Example 3 scenario (i) 中未对齐)。
第二步:最小内核——两样本线性IV(Example 2 的最简版本)¶
考虑最简单的两样本IV设定:\(W = (L, X, Y)\),其中 \(L\) 是二元工具变量(取值 0 或 1),\(X\) 是连续处理,\(Y\) 是连续结果。假设线性结构方程模型:
对齐假设:
核心数学问题:给定理想数据影响函数 \(\psi^1_Q\)(例如,对于参数 \(\psi\),其影响函数为 \(\psi^1_Q = B_Q(g)^{-1} g(L) \{ Y - \alpha - \psi X \}\),其中 \(g(L)\) 是任意函数使得 \(B_Q(g) = E_Q[g(L)(1, X)]\) 非奇异),如何找到观测数据影响函数 \(\varphi^1_P\)?
关键想法:将 \(\psi^1_Q\) 分解为两个部分,分别属于 \(\mathcal{D}^{(1)}_2(Q)\)(关于 \(Y|L\) 的空间)和 \(\mathcal{D}^{(2)}_2(Q)\)(关于 \(X|L\) 的空间)。通过解一个积分方程(Proposition 1 中的方程 (23)),可以找到这样的分解。具体地,令 \(m^{(2)}(L,X) \in \mathcal{D}^{(2)}_2(Q)\) 满足:
这个最小内核说明了什么:即使对齐条件分布来自不同分解,只要我们能将理想数据影响函数分解为各源对应的正交空间中的函数之和,就能直接写出观测数据影响函数。分解的关键是解一个线性算子方程(在 \(J=2\) 时是积分方程)。论文的一般理论正是将这个思路推广到任意 \(J\) 和任意对齐结构。
三、这篇论文做了什么¶
三句话¶
- 研究问题:在多个独立个体级数据源融合的设定下,当各源的对齐条件分布不要求来自目标联合分布的单一分解时,如何刻画所有正则渐近线性估计的影响函数以及有效影响函数。
- 核心工具:通过定义融合数据模型的得分算子 \(A_{Q,U,\lambda}\) 及其伴随算子 \(A^*_{Q,U,\lambda}\),将观测数据影响函数的刻画转化为求解算子方程 \(A^*_{Q,U,\lambda} \varphi^1_P = (\psi^1_{Q,\text{eff}}, 0_J, 0)\),并利用正交分解给出显式表达式。
- 主要结论:Theorem 2 给出了所有观测数据影响函数的通用形式(公式 (22)),Theorem 3 给出了有效影响函数的特征(通过极限序列或闭值域条件)。Proposition 1 提供了 \(J=2\) 时通过解积分方程计算影响函数的实用方法。
关键设定与假设¶
- 融合数据模型 (Definition 2):三元组 \((\mathcal{Q}, \mathcal{P}, \mathcal{C})\),其中 \(\mathcal{C}\) 由每个源中哪些条件/边际分布对齐来定义(Definition 1)。对齐允许只发生在条件变量的某个子集上(\(\mathcal{Z}^{(j)}_{k-1}\) 可以是真子集)。
- 强对齐 (Definition 5):要求密度比 \(dP(\cdot|S=j)/dQ\) 和 \(dP(\cdot|S=j)/dU^{(j)}\) 在相关支撑上有界且远离零。这是保证得分算子有界的关键正则性条件。
- Assumption 1:\(\psi(Q)\) 仅通过对齐的分量依赖于 \(Q\),即若 \(Q \overset{\mathcal{C}}{\sim} \tilde{Q}\) 则 \(\psi(Q) = \psi(\tilde{Q})\)。这保证了 \(\varphi(P)\) 被唯一确定(Theorem 1)。
- 模型 \(\mathcal{Q}\) 和 \(\mathcal{P}\):\(\mathcal{Q}\) 可以是任意半参数模型(包括非参数),\(\mathcal{P}\) 由 \(\mathcal{Q}\) 和对齐 \(\mathcal{C}\) 共同决定。特别地,即使 \(\mathcal{Q}\) 是非参数的,\(\mathcal{P}\) 也可能是半参数的(如 Example 3 scenario (iii)),因为对齐的存在本身可能对 \(P\) 施加等式约束。
相比 Li & Luedtke (2023),本文的假设更弱:不要求所有对齐来自单一分解,允许每个源有自己的分解顺序,且允许对齐只发生在条件变量的部分支撑上。
主要结果¶
- Theorem 1:在 Assumption 1 下,\(\varphi(P) = \psi(Q)\) 对所有满足对齐的 \((Q,P)\) 成立,即参数被识别。
- Lemma 2:给出得分算子 \(A_{Q,U,\lambda}\) 及其伴随 \(A^*_{Q,U,\lambda}\) 的显式表达式。这是整个理论的技术核心。\(A_{Q,U,\lambda}\) 将理想数据得分 \(h^{(Q)}\) 映射为观测数据得分,通过正交投影到空间 \(\mathcal{D}^{(j)}_k(Q)\) 和 \(\mathcal{R}^{(j)}_k(P_{Q,U,\lambda})\) 实现。
- Lemma 4:\(\varphi\) 在 \(P\) 处路径可微当且仅当存在理想数据影响函数 \(\psi^1_Q\) 可分解为 \(\sum_{j,k} m^{(j)}_k\),其中 \(m^{(j)}_k \in \mathcal{D}^{(j)}_k(Q)\)。这等价于 \(\psi^1_{Q,\text{eff}}\) 在 \(A^*_Q\) 的值域中。
- Theorem 2:所有观测数据影响函数 \(\varphi^1_P\) 由公式 (22) 给出,其中 \(m^{(j)}_k\) 来自某个理想数据影响函数的分解。当扩展模型 \(\mathcal{P}^{\text{ext}}\) 是非参数时,每个 \(\psi^1_Q\) 至多对应一个 \(\varphi^1_P\);否则可能对应无穷多个(因为存在非平凡的零空间)。
- Theorem 3:有效影响函数 \(\varphi^1_{P,\text{eff}}\) 由极限序列刻画(公式 (25)),或者当 \(A^*_Q\) 有闭值域时,可通过解一个线性算子方程得到。
- Proposition 1(\(J=2\) 情形):给出一个可操作的积分方程(公式 (23)),解出 \(m^{(2)}\) 后即可构造 \(\varphi^1_P\)。该方程在 Examples 1-3 中都有闭式解。
证明路线与技术技巧¶
整体路线: 1. 参数化观测数据模型:Lemma 1 表明 \(\mathcal{P}\) 中的每个分布 \(P\) 可由三元组 \((Q, U, \lambda)\) 参数化,其中 \(Q \in \mathcal{Q}\),\(U^{(j)}\) 是源 \(j\) 中未对齐部分的自由分布,\(\lambda\) 是源概率。 2. 构造得分算子:对 \((Q, U, \lambda)\) 的任意正则子模型,其得分 \(h = (h^{(Q)}, h^{(U)}, h^{(\lambda)})\) 通过 \(A_{Q,U,\lambda}\) 映射为观测数据得分 \(g\)。Lemma 2 给出 \(A\) 和 \(A^*\) 的显式,证明有界性。 3. 路径可微性条件:由半参数理论,\(\varphi\) 在 \(P\) 处路径可微当且仅当存在 \(\varphi^1_P\) 满足 \(A^*_{Q,U,\lambda} \varphi^1_P = (\psi^1_{Q,\text{eff}}, 0, 0)\)。这等价于 \(\psi^1_{Q,\text{eff}}\) 在 \(A^*_Q\) 的值域中(Lemma 4)。 4. 分解理想数据影响函数:Lemma 4 将上述条件转化为存在分解 \(\psi^1_Q = \sum_{j,k} m^{(j)}_k\),其中 \(m^{(j)}_k \in \mathcal{D}^{(j)}_k(Q)\)。Theorem 2 进一步证明所有 \(\varphi^1_P\) 都对应这样的分解。 5. 有效影响函数:Theorem 3 利用 \(A^*_Q\) 的闭值域或极限序列来刻画 \(\varphi^1_{P,\text{eff}}\)。当 \(A^*_Q\) 有闭值域时,可通过广义逆计算。
关键跳跃点: - 从得分算子到影响函数刻画:利用伴随算子方程 \(A^* \varphi^1_P = (\psi^1_{Q,\text{eff}}, 0, 0)\) 将问题转化为线性代数问题。这是 van der Vaart (2000) Chapter 25.5 的标准技术,但本文需要处理多个源和复杂的对齐结构。 - 正交分解的存在性与唯一性:公式 (20) 将 \(L^2_0(P)\) 分解为相互正交的子空间之和,这依赖于强对齐条件保证密度比有界。该分解是计算 \(A^*\) 的基础。 - 积分方程 (23) 的推导:对于 \(J=2\),通过将 \(A^*_Q\) 的表达式代入并利用正交投影的性质,得到关于 \(m^{(2)}\) 的线性算子方程。该方程的解存在性等价于 \(\varphi\) 的路径可微性。
技术技巧点名: - 正交投影与空间分解:反复使用 \(L^2\) 空间的正交分解,将函数投影到 \(\mathcal{D}^{(j)}_k(Q)\) 和 \(\mathcal{R}^{(j)}_k(P)\) 上。 - 得分算子与伴随算子:核心工具,用于连接理想数据与观测数据的得分。 - 强对齐条件:保证密度比有界,从而得分算子有界,伴随算子定义良好。 - 积分方程求解:在 \(J=2\) 时,通过条件期望算子将问题转化为 Fredholm 型积分方程,并在具体例子中给出闭式解。 - 信息算子与广义逆:在讨论有效影响函数时,涉及信息算子 \(A^*A\) 的广义逆,并指出在融合数据模型中该算子不一定可逆或不是压缩映射(Section S9 给出反例)。
真实例子与应用¶
本文包含三个主要例子,均贯穿全文:
-
Example 1(测量误差):\(W=(X,V,Y)\),源1观测 \((X,V)\),源2观测 \((X,V,Y)\)。对齐:\(Q(V|X) = P(V|X,S=1)\),\(Q(V|Y,X) = P(V|Y,X,S=2)\)。目标参数 \(\psi(Q) = E_Q[Y]\)(疾病患病率)。通过解积分方程得到唯一观测数据影响函数(公式 (27) 附近)。该例子展示了即使 \(Q\) 非参数且 \(P\) 非参数,影响函数仍可显式计算。
-
Example 2(两样本IV):如上所述,得到所有影响函数的参数化形式(公式 (S45)),并给出有效影响函数(通过最小化方差得到 \(t_{P,\text{eff}}(L) = \sigma^{-2}(L) E_P[U|L]\))。与 Zhao et al. (2019) 的估计方程结果一致。
-
Example 3(运输ATE):三个子场景:
- (i) 前瞻队列 + 目标总体随机样本(仅协变量):唯一影响函数(公式 (28) 附近),与 Rudolph & van der Laan (2017) 一致。
- (ii) 前瞻队列 + 目标总体病例登记(仅 \(Y=1\) 的样本):唯一影响函数(公式 (S46)),通过解积分方程得到。
- (iii) 前瞻队列 + 目标总体病例对照:无穷多个影响函数(公式 (S47)),有效影响函数通过解一个矩阵方程得到(Proposition S2)。该场景展示了当对齐本身施加等式约束时,效率损失与多重影响函数的存在。
- 此外,Section S5.2.1 引入 scenario (iv)(仅对齐 \(Y=1|L=l_0,A=0\)),作为更弱对齐的例子,并比较了各场景下的渐近相对效率(Figure 2),说明放松对齐会降低效率。
🔎 结论是否比证明窄¶
- 论文的主要结论(Theorem 2 和 Theorem 3)是严格的,在给定假设下成立。但作者在讨论中指出,对于某些融合数据模型(如 Example 1 中 \(Y\) 和 \(V\) 非二值时),识别条件更复杂,且理想数据模型 \(\mathcal{Q}_\tau\) 的切空间刻画是开放问题(Section S5.1.4)。因此,Theorem 2 的应用范围受限于能否验证 Assumption 1 和路径可微性。
- 在 Theorem 3 中,作者未能给出一个简单的充分条件保证 \((\psi^1_{Q,\text{eff}}, 0, 0)\) 在信息算子的值域中,仅指出在 CAR 模型中信息算子可逆,但在融合数据模型中可能不是压缩映射(Section S9 给出反例)。因此,有效影响函数的显式计算在一般情形下仍是困难的,只能通过极限序列或广义逆来刻画。
- 作者在讨论中声称“paves the way for machine-learning debiased, semiparametric efficient estimation”,但并未给出任何具体的去偏机器学习估计量或模拟实验。这只是一个理论承诺,实际构造需要额外的正则性条件(如交叉拟合、Donsker 类等)。
四、开放问题¶
-
信息算子的可逆性与有效影响函数的显式计算:Theorem 3 仅给出有效影响函数的极限序列刻画,但未提供一般条件下可操作的闭式解。作者指出在 CAR 模型中信息算子可逆,但在融合数据模型中可能不是压缩映射(Section S9 的反例)。扎根于 Section 4.3 末尾:“We have been unable to derive a simple sufficient condition under which \((\psi^1_{Q,\text{eff}}, 0_J, 0)\) is in the range of the information operator for an arbitrary fused-data framework.” 一个开放问题是:对于哪些类型的对齐结构,信息算子有闭值域或可逆?能否找到类似于 CAR 模型中“强阳性”的条件?
-
多重稳健结构的推广:Qiu et al. (2024) 在 Li & Luedtke (2023) 的框架下发现线性目标泛函的影响函数具有多重稳健结构。作者在讨论中提到“Our preliminary results indicate that this multiply robust structure is preserved in our more general framework”,但未给出证明。扎根于 Section 5:“Qiu, Tchetgen Tchetgen, and Dobriban, 2024 noted that within the framework of S. Li and A. Luedtke, 2023, the influence functions for linear target functionals have a particular multiply robust structure. Our preliminary results indicate that this multiply robust structure is preserved in our more general framework. A full investigation of this topic is beyond the scope of this paper.” 开放问题:在本文的框架下,线性目标泛函的影响函数是否仍具有多重稳健形式?如何构造对应的多重稳健估计量?
-
与图模型方法的整合:本文的对齐假设基于条件分布,但许多因果识别问题涉及未观测混杂,需要图模型(如 DAG)来刻画识别性。作者提到“When all latent variables are observed, the present work applies directly to identified counterfactual parameters. When some latent variables are not observed, there is no guarantee that the implied alignments on the observed variables follow the structure considered in this work.” 扎根于 Section 3.1 末尾:“We leave an extension of the present results to this setting for future work.” 开放问题:如何将本文的得分算子方法推广到存在未观测变量的图模型设定?例如,当对齐是在潜在变量层面定义时,观测数据的影响函数如何刻画?
-
部分数据源仅提供汇总统计量:本文假设所有数据源都提供个体级数据。但在实际中,某些源可能只提供汇总统计量(如已发表文献中的估计值)。作者在讨论中提及此方向。扎根于 Section 5:“Developing a unified theory that accommodates the possibility of using individual-level data from some sources and summary statistics from others would be of great practical importance and deserves further study.” 开放问题:当部分源仅提供汇总统计量(如均值、回归系数)时,如何刻画影响函数?是否可以通过将汇总统计量视为某种“对齐”来纳入本文的框架?
Maintained by 陈星宇 · Homepage · Source on GitHub