跳转至

Partial Identification Learning with Categorical Treatments for Individualized Treatment Rules

作者: Johannes Hruza, Paweł Morzywołek, Jakob Zeitler, Samir Bhatt, Michael C Sachs
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2608.19853


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:在存在未测量混杂(unmeasured confounding)的观测研究中,如何利用工具变量(IV)提供的部分识别信息,学习一个稳健的个体化治疗规则(ITR),使得即使无法点识别因果效应,也能保证决策的保守最优性。 当前成熟度:二元治疗设定下已有较完整的理论和方法(Pu & Zhang, 2021; Cui, 2021),但多元治疗(k≥3)的扩展几乎空白——本文正是填补这一缺口。

发展脉络(history)

奠基工作:IV与部分识别的经典框架 - Balke & Pearl (1997):对二元治疗、二元结局、二元IV的经典设定,推导了因果效应的sharp symbolic bounds,奠定了部分识别的基础。本文引用其作为“seminal sharp symbolic bounds”。 - Manski (1990, 2000):提出非参数界和单调IV假设(Monotone Instrumental Variable),为部分识别提供了更一般的框架。

ITR学习的主流方法(假设无未测量混杂) - Murphy (2003)、Robins (2004):奠基性的动态治疗规则(DTR)工作,基于Q-learning和A-learning,但依赖no unmeasured confounding。 - Athey & Wager (2021):提出基于doubly robust估计的政策学习,可处理二元或连续治疗,但同样依赖无混杂假设。 - Zhang et al. (2020):提出MOML(Multicategory Outcome-weighted Margin-based Learning),将OWL扩展到多元治疗,但假设所有混杂被测量。

部分识别与ITR的结合(二元治疗) - Pu & Zhang (2021):本文最直接的先行工作。首次将部分识别与ITR学习结合,提出“IV-optimality”概念,将问题转化为加权二元SVM分类。但严格限于二元治疗(k=2),且依赖Balke-Pearl经典IV界。 - Cui (2021):总结了部分识别下三种决策准则(Optimist/Pessimist/Opportunist),建立了与经典决策理论的联系。同样限于二元治疗。 - Cui & Tchetgen Tchetgen (2021):提出半参数IV方法学习最优治疗规则,但聚焦于complier最优规则,且治疗为二元。

多元分类与ITR的几何方法 - Zhang & Liu (2014):提出angle-based large-margin分类框架,用regular simplex embedding避免one-vs-rest的几何不一致性。本文直接借用其嵌入策略。 - Zhang et al. (2020):将上述框架用于多元ITR(MOML),但假设无混杂。

本文的位置:将Pu & Zhang (2021)的二元部分识别ITR框架扩展到多元治疗,同时借用Zhang & Liu (2014)的simplex embedding解决多元决策的几何问题。这是首次在部分识别框架下处理k≥3的治疗选择。

子线索聚类

  1. IV界的推导与自动化(Balke & Pearl 1997; Sachs et al. 2022; Duarte et al. 2023; Zhang & Bareinboim 2021):提供sharp bounds的计算工具。本文使用Sachs et al.的causaloptim包作为bounding engine。
  2. 部分识别下的决策准则(Cui 2021; Pu & Zhang 2021):定义“最优性”概念(minimax regret等)。本文采用Opportunist(minimax)准则。
  3. 多元ITR的几何方法(Zhang & Liu 2014; Zhang et al. 2020):用simplex embedding处理多元决策。本文将其与部分识别结合。
  4. 核方法与oracle不等式(Steinwart & Christmann 2008):提供RKHS框架下的理论保证。本文借用其熵条件与正则化分析。

这个方向在追问的核心问题

  1. 如何定义“最优”当因果效应只能被部分识别? 不同准则(maximin, maximax, minimax regret)导致不同规则,且可能产生paradox(Cui 2021)。
  2. 如何将部分识别框架从二元治疗扩展到多元治疗? 多元情况下worst-case loss的定义、几何嵌入、优化方法都需要重新设计。
  3. 部分识别界的宽度如何影响ITR的性能? 弱IV导致宽界,保守性增加;强IV使界变窄,性能接近oracle。
  4. 当治疗数超过IV水平数时,部分识别是否还有用? 本文实验表明此时性能急剧下降,这是一个结构性瓶颈。

⚠️ 作者的framing

作者把缺口frame成:“现有部分识别ITR方法严格限于二元治疗,而许多实际决策问题(如多种药物选择)是多元的。因此,将二元理论扩展到多元是‘显然的下一步’。”

被淡化/回避的竞争路线: - 连续治疗或有序治疗:作者在讨论中承认“本文聚焦于分类治疗、结局和IV,尚未处理连续决策空间”,但未深入讨论为何simplex embedding不适用于有序治疗(如剂量递增)。 - 随机化决策规则:作者提到“基于随机化决策规则的扩展需要额外的方法论发展”,但未说明为什么确定性规则(minimax)是首选。 - proxy variable方法:作者在讨论中提及“可与proxy-variable方法结合”,但未在正文中展开。

什么明显该被引/该存在、却没出现在intro里? - Levis et al. (2023)(已在参考文献中,但intro未重点讨论):该文提出了协变量辅助的IV界,并给出了influence function-based估计器,可达到参数收敛率。本文的bounding方法(causaloptim)是符号性的,未讨论如何高效估计界。 - Jonzon et al. (2025)(已在参考文献中):讨论了协变量加入界时的sharpness问题,直接关系到本文“bounds are pointwise valid”的假设是否足够。 - Arlot & Celisse (2010)(已在参考文献中):交叉验证的综述,但本文未讨论如何数据自适应地选择λ和核带宽。

张力

未见明显对立引用。所有被引工作基本一致地认为:部分识别是处理未测量混杂的稳健方法,但二元到多元的扩展是开放问题。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(X \in \mathcal{X} \subseteq \mathbb{R}^d\):预处理协变量(可观测,d维连续)。 - \(A \in \mathcal{A} = \{1, \dots, k\}\):治疗(离散,k个水平,可观测)。 - \(Y\):结局(分类,本文假设为二值或有限分类,可观测)。 - \(Z\):工具变量(分类,可观测)。 - \(U\):未测量混杂(不可观测,可能为多元或连续)。 - \(Y(a)\):潜在结局(counterfactual,不可观测),即若将A设为a时的Y值。 - \(\mu_a(x) := \mathbb{E}[Y(a) \mid X = x]\):条件期望潜在结局(目标estimand,不可直接识别)。 - \(L_a(x), U_a(x)\):部分识别下\(\mu_a(x)\)的下界和上界(由因果图+IV推导,可计算)。 - \(g: \mathcal{X} \to \mathcal{A}\):ITR(政策),可测函数。 - \(R(g) := \mathbb{E}_X[L(X, g(X))]\):worst-case risk,其中\(L(x, a) = \max_{b \neq a} U_b(x) - L_a(x)\)。 - \(g^*(x) := \arg\min_a L(x, a)\):minimax政策(理论最优)。 - \(w_a := \phi(a) \in \mathbb{R}^{k-1}\):治疗a的simplex嵌入向量(固定,已知)。 - \(f: \mathcal{X} \to \mathbb{R}^{k-1}\):嵌入函数(待学习),诱导政策\(g_f(x) = \arg\max_a \langle w_a, f(x) \rangle\)。 - \(p_a(x, f) := \frac{\exp(\langle w_a, f(x) \rangle)}{\sum_b \exp(\langle w_b, f(x) \rangle)}\):softmax权重。 - \(L_s(x, f) := \sum_a p_a(x, f) L(x, a)\):surrogate loss。 - \(R_s(f) := \mathbb{E}[L_s(X, f)]\):surrogate risk。

模型: - 数据生成机制由非参数结构方程模型(NPSEM)描述:每个变量由其父变量和独立外生噪声决定(式1)。 - 因果图Γ至少包含:\(X \to A\), \(X \to Y\), \(A \to Y\),以及未测量混杂\(U\)同时影响\(A\)和\(Y\)。 - IV \(Z\)满足:\(Z \perp\!\!\!\perp U\)(给定X),\(Z\)影响\(A\),且\(Z\)对\(Y\)无直接效应(排除限制)。 - 部分识别界\([L_a(x), U_a(x)]\)由因果图+IV推导,满足\(L_a(x) \leq \mu_a(x) \leq U_a(x)\)(点wise valid)。

可观测数据: - 研究者实际能观测到:\((X_i, A_i, Y_i, Z_i)\),i.i.d.样本,\(i=1,\dots,N\)。 - 不可观测:潜在结局\(Y_i(a)\)(所有\(a \neq A_i\)),以及混杂\(U_i\)。 - 部分识别界\(L_a(x), U_a(x)\)不是直接观测到的,而是从可观测分布\(P(O)\)和因果假设推导出来的(通过causaloptim等工具)。

第二步:最小内核

最简特例:\(k=3\)(三种治疗),\(Z\)有3个水平,\(Y\)为二值(0/1),\(X\)为一维连续(\(d=1\))。去掉所有为一般性服务的技术假设(如RKHS、正则化),核心问题退化为:

给定每个\(x\)处的界\([L_1(x), U_1(x)], [L_2(x), U_2(x)], [L_3(x), U_3(x)]\),如何找到一个函数\(g(x) \in \{1,2,3\}\),使得期望的worst-case loss最小?

核心思路: 1. 定义worst-case loss:若选治疗\(a\),最坏情况下的损失是“最佳替代治疗的上界”减去“所选治疗的下界”:

\[L(x, a) = \max_{b \neq a} U_b(x) - L_a(x).\]
例如,若\(U_2(x)=0.8, U_3(x)=0.6, L_1(x)=0.7\),则\(L(x,1)=\max(0.8,0.6)-0.7=0.1\)。

  1. minimax政策:对每个\(x\),选择使\(L(x,a)\)最小的治疗:

    \[g^*(x) = \arg\min_{a \in \{1,2,3\}} L(x, a).\]
    这是点wise最优,且是全局最优(Proposition 3.1)。

  2. 为什么需要学习而非直接应用\(g^*\)? 因为界\(L_a(x), U_a(x)\)本身需要从数据估计(有估计误差),且\(g^*\)是离散的、不可微的,无法直接优化。因此需要平滑的surrogate。

  3. Simplex embedding:将三个治疗映射到\(\mathbb{R}^2\)中正三角形的三个顶点:

    \[w_1 = (1, 0), \quad w_2 = (-\frac{1}{2}, \frac{\sqrt{3}}{2}), \quad w_3 = (-\frac{1}{2}, -\frac{\sqrt{3}}{2}).\]
    学习一个函数\(f: \mathbb{R} \to \mathbb{R}^2\),使得\(f(x)\)指向最优治疗对应的顶点方向。政策为:
    \[g_f(x) = \arg\max_{a} \langle w_a, f(x) \rangle.\]

  4. Surrogate loss:用softmax权重平滑化:

    \[L_s(x, f) = \sum_{a=1}^3 p_a(x, f) L(x, a), \quad p_a(x, f) = \frac{\exp(\langle w_a, f(x) \rangle)}{\sum_b \exp(\langle w_b, f(x) \rangle)}.\]
    当\(f(x)\)与\(w_{a^*}\)对齐时,\(p_{a^*} \approx 1\),\(L_s \approx L(x, a^*)\)。

这个特例下要证的命题:最小化\(R_s(f) = \mathbb{E}[L_s(X, f)]\)等价于最小化\(R(g) = \mathbb{E}[L(X, g(X))]\),且收敛率由界估计误差和函数类复杂度控制。

为什么难:\(L(x,a)\)本身是max of linear functions(在界上),不光滑;softmax引入非凸性;界估计引入plug-in误差。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在存在未测量混杂的观测研究中,如何利用工具变量(IV)的部分识别信息,学习一个多元治疗(k≥3)的个体化治疗规则(ITR),使得worst-case regret最小化。
  2. 核心工具/方法:提出一个广义minimax损失准则,结合simplex embedding(将离散治疗映射到正则单纯形顶点)和softmax-weighted surrogate loss,将离散优化问题转化为可微的连续优化问题;采用RKHS或神经网络参数化。
  3. 主要结论:证明了最小化surrogate risk等价于最小化原始worst-case risk(Theorem 5.1);给出了有限样本收敛率的oracle不等式(Theorem 5.2),并验证了高斯RBF核满足所需条件;模拟实验表明,在存在未测量混杂时,该方法显著优于忽略混杂的基线方法。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • NPSEM框架(Section 2.1):每个变量由结构方程\(v = h_V(PA_V, u_V)\)决定,外生噪声\(u_V\)联合独立。这是因果推断的标准非参数框架。
  • 部分识别界(Section 2.2):对每个\(a, x\),存在\(L_a(x) \leq \mu_a(x) \leq U_a(x)\)。关键:界是点wise valid(式4),但不要求sharp(虽然sharp更好)。本文使用causaloptim(Sachs et al. 2022)自动推导sharp bounds。
  • IV假设:存在工具变量\(Z\),满足排除限制和独立性(给定\(X\))。具体假设取决于bounding方法(如Balke-Pearl或Manski-Pepper)。
  • Assumption 1 (Boundedness):界\(L_a, U_a\)及其估计\(\hat{L}_a, \hat{U}_a\)一致有界于\(M\)。
  • Assumption 2 (Entropy):函数类\(\mathcal{F}\)的单位球的covering number满足\(\sup_Q \log N(\epsilon, \mathcal{B}_0, L_2(Q)) = O(\epsilon^{-v})\),\(v \in (0,2)\)。这是RKHS(如高斯核)的标准条件。
  • Assumption 3 & 4 (Existence of minimizers):理论最小化和经验最小化都存在。
  • Assumption 5 (Convergence rate of bounds):界估计的\(L_1\)误差以\(O(n^{-\alpha})\)和\(O(n^{-\beta})\)收敛。对于离散问题(causaloptim),这由概率估计的收敛率保证。
  • Assumption 6 (Supremum norm bound):\(\|f\|_\infty \leq \kappa \|f\|_\mathcal{F}\),RKHS满足此条件。

相比已有文献的放宽/强化: - 放宽:从二元治疗(Pu & Zhang 2021)扩展到任意有限分类治疗。 - 强化:需要界估计的收敛率(Assumption 5),这在二元情况下隐含但未明确。 - 不变:仍依赖IV的有效性假设(排除限制、独立性)。

主要结果

Theorem 5.1(Surrogate risk的合理性): - 陈述:\(\inf_{f \in \mathcal{G}} R_s(f) = R(g^*)\),且对任意\(f\),\(0 \leq R(g_f) - R(g^*) \leq k \cdot (R_s(f) - \inf_{f'} R_s(f'))\)。 - 直觉:surrogate risk的最小值等于原始worst-case risk的最小值;且excess surrogate risk以因子\(k\)控制excess原始risk。 - 必要条件:\(g^*(x)\)唯一(Assumption 1 of Theorem 5.1),且最大损失可积。 - 解决的技术难点:证明softmax权重序列可以任意接近指示函数(通过缩放\(f\)),从而逼近点wise minimizer。

Theorem 5.2(Oracle inequality): - 陈述:\(R_s(\hat{f}_s) - \inf_{f \in \mathcal{F}} R_s(f) \leq a_\mathcal{F}(\lambda) + O((n\lambda)^{-1/2} + n^{-\alpha} + n^{-\beta})\)。 - 直觉:excess surrogate risk由三部分控制:正则化近似误差\(a_\mathcal{F}(\lambda)\)、经验过程误差\(O((n\lambda)^{-1/2})\)、界估计误差\(O(n^{-\alpha} + n^{-\beta})\)。 - 必要条件:Assumptions 1-6,且\(\lambda \leq 1\)。 - 解决的技术难点:需要处理plug-in界估计带来的额外误差项(Lemma A.2),以及非凸surrogate loss下的经验过程控制(Lemma A.4)。

Corollary 1(最终收敛率): - 结合Theorem 5.1和5.2,得到原始risk的收敛率:\(R(g_{\hat{f}_s}) \leq R(g^*) + k \cdot [\mathcal{A}(\mathcal{F}) + a_\mathcal{F}(\lambda) + O((n\lambda)^{-1/2} + n^{-\alpha} + n^{-\beta})]\)。 - 其中\(\mathcal{A}(\mathcal{F}) = \inf_{f \in \mathcal{F}} R_s(f) - \inf_{f \in \mathcal{G}} R_s(f)\)是函数类近似误差。

证明路线与技术技巧

整体路线(Theorem 5.2的证明): 1. 样本分割:将数据分为\(I_1\)(估计界)和\(I_2\)(学习政策),使界估计误差与优化误差独立。 2. 分解excess risk:将\(R_s(\hat{f}_s) - \inf_{f \in \mathcal{F}} R_s(f)\)分解为6项(式21-26),包括正则化近似误差、经验过程误差、界估计误差等。 3. 控制每项: - 正则化近似误差\(a_\mathcal{F}(\lambda)\):由定义直接处理。 - 经验过程误差(Lemma A.4):利用熵条件(Assumption 2)和Lipschitz性质(Lemma A.3),通过van der Vaart & Wellner的Theorem 2.14.1得到\(O(1/\sqrt{n\lambda})\)。 - 界估计误差(Lemma A.2):利用Assumption 5和三角不等式,得到\(O(n^{-\alpha} + n^{-\beta})\)。 - 其余项(如(22)和(24))通过条件期望和最小化性质消去。 4. 合并:得到最终bound。

关键跳跃点: - Lemma A.3(Covering number transfer):需要将surrogate loss函数类\(\mathcal{F}_L = \{L_s(\cdot, f): f \in \mathcal{B}^*\}\)的covering number与原始函数类\(\mathcal{B}^*\)的covering number联系起来。关键技巧是证明\(f \mapsto L_s(\cdot, f)\)是Lipschitz的(Lipschitz常数\(4M\)),从而covering number的转移成立。 - Lemma A.4(经验过程bound):需要处理\(\hat{f}_s\)是数据依赖的(非固定),因此必须用supremum over \(\mathcal{B}^*\)来控制。这要求函数类\(\mathcal{F}_L\)有良好的熵性质,且envelope function存在(\(F(X)=2M\))。

技术技巧点名: - Empirical process theory:用于控制经验过程误差(Lemma A.4),使用van der Vaart & Wellner的Theorem 2.14.1。 - Covering number transfer via Lipschitz property:Lemma A.3,将surrogate loss的复杂度与原始函数类关联。 - Sample splitting:解耦界估计与政策学习,使证明中可条件于\(I_1\)。 - Softmax smoothing:将离散的argmin问题转化为连续可微优化。 - Simplex embedding:避免one-vs-rest的几何不一致性,提供对称的决策空间。 - Representer theorem:将RKHS中的无限维优化转化为有限维系数矩阵优化(式18)。

真实例子与应用

本文为纯方法论文,无真实数据例子。所有实验均为模拟(Section 6)。模拟设计如下:

  • 数据生成(ExactDGP):5维连续协变量\(X \sim \text{Uniform}(-1,1)^5\),3分类治疗\(A\),3水平IV \(Z\),二值结局\(Y\)。离散潜混杂\(U \in \{-2,-1,0,1,2\}\)影响\(A\)和\(Y\)。治疗分配为multinomial logistic,结局为logistic。通过边际化\(U\)可解析计算真实\(\mu_a(X)\)和oracle政策。
  • 关键设计:使用真实条件联合概率\(P(A=a, Y=y | Z=z, X)\)输入causaloptim计算界,而非从数据估计。这移除了界估计误差,专门评估政策学习算法的性能。
  • 比较方法:KerRiskMin(本文核方法)、NeuralRiskMin(本文神经网络)、MOML(假设无混杂)、Tree OutcomeReg、NeuralOutReg、Minimax rule(理论最优)。
  • 四个实验:
  • 有限样本收敛(无混杂\(\lambda_{\text{conf}}=0\)):所有方法随\(n\)增大收敛。无混杂时,outcome regression最优;本文方法收敛到minimax rule(略保守)。
  • 对未测量混杂的稳健性(\(\lambda_{\text{conf}}\)从0到10):混杂增强时,outcome regression和MOML性能急剧下降(从~90% agreement降至~57-70%),而本文方法保持稳定(~75-80% agreement),接近minimax rule。
  • IV强度的影响(\(\lambda_{\text{iv}}\)从0到7):IV越强,界越窄,本文方法性能越好(agreement从~60%升至~90%)。outcome regression对IV强度不敏感(因为不使用Z)。
  • 治疗数可扩展性(\(k\)从2到6,固定\(|Z|=3\)):当\(k \leq 3\)时性能良好;当\(k > |Z| = 3\)时性能急剧下降,反映结构性瓶颈(IV水平数不足以约束所有治疗的界)。
  • 这个例子想说明:本文方法在存在未测量混杂时显著优于忽略混杂的方法,且性能与IV强度正相关;但当治疗数超过IV水平数时,部分识别本身变得无力。

🔎 结论是否比证明窄

  • Theorem 5.2的收敛率依赖于Assumption 5(界估计的收敛率),但作者在模拟中使用了真实界(而非估计的界),因此模拟结果并未验证Assumption 5的实际影响。作者在Section 5.1中声称“对于causaloptim处理的离散问题,概率估计的收敛率直接转移到plug-in界”,但未给出具体速率\(\alpha, \beta\)的表达式或验证。
  • Theorem 5.1要求\(g^*(x)\)唯一,但作者在Proposition 3.1中通过固定tie-breaking规则保证了唯一性。然而,当多个治疗的\(L(x,a)\)相等时,tie-breaking是任意的,可能影响有限样本性能。
  • Corollary 1中的函数类近似误差\(\mathcal{A}(\mathcal{F})\) 未被量化。作者仅验证了高斯RBF核满足熵条件,但未给出\(\mathcal{A}(\mathcal{F})\)随\(\mathcal{F}\)容量(如带宽)的变化。
  • 模拟中未使用样本分割(因为使用了真实界),因此Theorem 5.2的样本分割策略在模拟中未被验证。

四、开放问题

  1. 更紧的收敛率:Theorem 5.2的收敛率\(O((n\lambda)^{-1/2} + n^{-\alpha} + n^{-\beta})\)是否sharp?能否在更弱的熵条件下(如\(v=0\),对应有限VC维类)得到\(O(1/\sqrt{n})\)?扎根于:Theorem 5.2的证明依赖于Assumption 2(\(v \in (0,2)\)),且经验过程bound使用了\(O(\lambda^{-1/2})\)(Lemma A.4的证明中积分得到\(O(\lambda^{-v/4}) \leq O(\lambda^{-1/2})\),但\(v\)可能远小于2)。

  2. 数据自适应的界估计与政策学习的联合收敛:本文使用样本分割解耦界估计与政策学习,但若界估计本身是高效的(如Levis et al. 2023的influence function-based估计器),能否得到更快的联合收敛率?扎根于:Section 5的样本分割策略和Assumption 5(界估计速率独立给定)。

  3. 当治疗数超过IV水平数时的替代策略:模拟表明\(k > |Z|\)时性能急剧下降。能否通过引入额外的结构假设(如单调性、顺序约束)来收紧界?或者改用随机化决策规则?扎根于:Section 6.4的实验结果和Section 7的讨论(“the instrument should have sufficient number of levels relative to the number of treatments”)。

  4. 连续治疗或有序治疗的扩展:本文的simplex embedding假设治疗无内在顺序。对于有序治疗(如剂量递增),能否设计更合适的几何嵌入(如将治疗映射到一维直线上的有序点)?扎根于:Section 7的讨论(“treatments correspond to different doses of the same drug rather than to completely different drugs”)。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论