跳转至

Sharp Causal Bounds for Dynamic Treatment Regimes

作者: Alexander Alvarez, Sebastian E. Ferrando
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.06397


一、领域脉络与小综述

这个方向是什么

本子方向研究动态治疗策略(DTR)在未测量混杂下的因果推断。核心问题是:当每个治疗阶段存在未测量的因子同时影响当前治疗和下一观测状态时,如何为任意给定的治疗策略计算期望结局的(部分)识别区间,以及如何选择最优策略。当前成熟度:经典方法(g-formula, Q-learning)在sequential exchangeability假设下已成熟;但放松该假设后,识别与推断仍处于活跃发展阶段,本文是其中一个重要进展。

发展脉络(history)

奠基工作: - Robins [1986]:提出g-formula,在sequential exchangeability和positivity下,将期望结局表示为观测分布的递推乘积。这是所有后续工作的基准。 - Murphy [2003]:提出Q-learning,通过逆向递归计算最优策略的Q函数,同样依赖sequential exchangeability。作者指出“Murphy [2003] does not use the term Q-learning, but develops the equivalent finite-horizon backward recursion in terms of Q-functions and optimal benefit-to-go functions”(p.2)。 - Manski [1990, 1995]:提出partial identification框架,对单步处理效应给出非参数界(Manski bounds),不依赖未测量混杂的排除。这是本文局部可行集构造的直接来源。

主要进展: - Confounding-robust offline RL:Kallus and Zhou [2020] 在无限时域下通过occupancy-ratio formulation得到sharp policy-value bounds;Bruns-Smith [2021] 和 Bruns-Smith and Zhou [2023] 在stagewise-independent confounding下,证明observed-state Markov结构允许robust dynamic programming,且其矩形构造在二值动作下是exactly sharp的(多于二值时可能conservative)。Kausik et al. [2024] 进一步扩展。作者评价:“This literature commonly models unmeasured confounding through sensitivity restrictions that limit its magnitude”(p.3)。 - Graph-based bounds:Zhang and Bareinboim [2020] 将Manski-type natural bounds扩展到任意因果图,用于加速在线DTR学习,但“do not show that the bounds obtained separately at each cell combine into the sharp identified set for the expected outcome under a fixed regime”(p.4)。Duarte et al. [2024] 提出更一般的graph-based partial identification方法,但本文利用额外的时间结构将全局优化分解为局部计算。 - Sensitivity analysis:Tan [2025] 在纵向设定下扩展marginal sensitivity model,允许一般纵向依赖,但引入每期的敏感性参数。Robins et al. [2000] 和 Rose et al. [2023] 通过指定confounding bias的参数或分布进行敏感性分析。 - Instrumental variable approaches:Chen and Zhang [2023] 使用时变工具变量和修改的Bellman递归;Han [2024] 用二值工具变量导出sharp partial ordering。作者明确“We take a different route: without instruments or sensitivity parameters”(p.4)。 - Response-function construction:Balke and Pearl [1997] 在工具变量设定下,从观测分布和因果模型导出sharp因果界,是本文“constructive sharpness strategy”的直接前身(p.4)。

当前frontier:如何在不引入敏感性参数或工具变量的前提下,对动态治疗策略在同期混杂下获得sharp界?本文填补了这一缺口。

本文的位置:本文在同期混杂假设下,利用观测分布、因果图和结构后继集,构造局部Manski-type polytope,通过逆向归纳组合得到全局sharp界,并给出maximin最优策略。当所有局部转移概率可识别时,退化为g-formula和Q-learning。

子线索聚类

  1. 经典DTR方法(Robins, Murphy, Hernán and Robins):依赖sequential exchangeability,点识别。
  2. Partial identification / sharp bounds(Manski, Balke and Pearl, Duarte et al.):处理静态或一般因果图中的未测量混杂,但未专门处理动态策略的sharp性。
  3. Confounding-robust RL(Kallus and Zhou, Bruns-Smith, Bruns-Smith and Zhou, Kausik et al.):通过敏感性参数或stagewise-independent假设处理动态混杂,但sharp性仅在特定条件下成立。
  4. Graph-based bounds for DTR(Zhang and Bareinboim, Saghafian):处理动态混杂,但未证明全局sharp性,或依赖敏感性参数/模型类选择。

这个方向在追问的核心问题

  1. 识别:在未测量混杂下,给定观测分布和因果图,DTR的期望结局的sharp identified set是什么?
  2. 计算:如何高效计算该identified set?能否分解为局部优化?
  3. 决策:在部分识别下,如何选择最优策略?maximin/minimax regret等准则的合理性。
  4. 与经典方法的关系:当混杂消失时,新方法是否退化为g-formula/Q-learning?

当前主流方法:敏感性分析(引入参数)、工具变量、或假设stagewise-independent confounding。已知瓶颈:敏感性参数的选择主观;工具变量可能不存在;stagewise-independent假设在持久混杂下不成立;全局sharp性难以证明。

⚠️ 作者的framing

作者把缺口frame成:“在同期混杂下,无需敏感性参数或工具变量,即可从观测分布、因果图和结构限制直接构造sharp界”。具体而言: - 作者强调“No sensitivity parameter, instrumental variable, or externally specified ambiguity radius is introduced”(p.2)。 - 作者将竞争路线(敏感性分析、IV、持久混杂)淡化或回避:对持久混杂,作者明确“Persistent confounding generally does not”(p.3)并留作未来工作;对敏感性分析,作者仅在Remark 3.3中提及可作为可行集的“widening”操作。 - 什么明显该被引/该存在、却没出现在intro里? 值得研究者去查: - Proximal causal inference(Tchetgen Tchetgen et al.):处理未测量混杂的另一种框架,使用proxies,与本文的“同期混杂”假设有重叠但不同。本文未引用。 - 更一般的graphical criteria for sharp bounds:如Richardson and Robins [2013]的SWIGs框架,本文仅在Remark 2.5中提及,但未深入讨论其与sharp界的关系。 - 连续状态空间的扩展:本文明确假设有限状态空间(Assumption 2.10),但未引用任何处理连续状态的partial identification文献。

张力

未见明显对立引用。各工作主要在假设强度、sharp性、计算复杂度上存在trade-off,而非根本性矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(T\):时域长度(阶段数)。 - \(S_t \in \mathcal{S}_t\):t时刻的观测状态(有限空间)。 - \(A_t \in \mathcal{A}\):t时刻的治疗(有限空间)。 - \(U_t\):t时刻的同期混杂因子(潜在变量),只影响\(A_t\)和\(S_{t+1}\),不影响后续阶段。 - \(Y = y(S_T)\):结局,是\(S_T\)的已知函数。 - \(d = (d_0, \ldots, d_{T-1})\):动态治疗策略,\(d_t: \mathcal{S}_t \to \mathcal{A}\)。 - \(V^d = \mathbb{E}[Y^d]\):策略d下的期望结局(因果量)。 - \(\kappa_t(\cdot | s, a)\):结构转移核,即在SCM中固定\(S_t=s, A_t=a\)后\(S_{t+1}\)的分布(定义2.6)。 - \(P\):观测分布(已知)。 - \(P^d\):策略d下的干预分布。 - \(G\):因果图(ADMG),包含有向边\(S_t \to A_t, S_t \to S_{t+1}, A_t \to S_{t+1}\),以及可能的双向边\(A_t \leftrightarrow S_{t+1}\)(表示同期混杂)。 - \(\mathcal{S}_{t+1}(s, a) \subseteq \mathcal{S}_{t+1}\):局部结构后继集,即从\((s,a)\)可能转移到的状态集合(定义2.7)。 - \(Q_t(s, a) \subseteq \Delta(\mathcal{S}_{t+1}(s, a))\):局部可行集,包含所有与观测分布、因果图、结构限制兼容的候选转移分布(定义3.1)。 - \(\mathcal{P}^d(Q)\):干预模糊集,由所有从各局部可行集独立选择转移核构成的干预分布集合(定义3.4)。 - \(\mathcal{I}^d(P, G, \mathcal{S})\):因果识别集,即所有与观测分布、因果图、结构限制兼容的SCM在策略d下产生的干预分布集合(定义3.6)。

模型: 数据由结构因果模型(SCM)生成(方程1):

\[S_0 = f^{S}_0(\varepsilon^{S}_0), \quad U_t = f^{U}_t(\varepsilon^{U}_t), \quad A_t = f^{A}_t(S_t, U_t, \varepsilon^{A}_t), \quad S_{t+1} = f^{S}_{t+1}(S_t, A_t, U_t, \varepsilon^{S}_{t+1}).\]
关键假设: - 同期混杂:\(U_t\)只出现在\(A_t\)和\(S_{t+1}\)的方程中,不直接影响后续阶段(方程1的结构)。 - 独立噪声(Assumption 2.4):所有外生噪声\(\varepsilon^{S}_0, \{\varepsilon^{U}_t, \varepsilon^{A}_t, \varepsilon^{S}_{t+1}\}_{t=0}^{T-1}\)相互独立。这蕴含\(U_t \perp\!\!\!\perp S_t\),且各\(U_t\)相互独立。 - 模块性(Assumption 2.2):干预只替换治疗方程,其他方程不变。

可观测数据: 研究者实际能观测到的是完整轨迹\((S_0, A_0, S_1, A_1, \ldots, S_{T-1}, A_{T-1}, S_T, Y)\),其联合分布为\(P\)。不可观测的是所有\(U_t\)(潜在变量)以及结构转移核\(\kappa_t(\cdot | s, a)\)(当存在同期混杂时)。研究者只能通过\(P\)、因果图\(G\)和结构后继集\(\mathcal{S}\)来约束\(\kappa_t\)。

第二步:最小内核

最简特例:\(T=1\)(单步决策),状态空间\(\mathcal{S}_0 = \{s_0\}\)(单点,无基线信息),治疗空间\(\mathcal{A} = \{0,1\}\),结局\(Y = S_1 \in \{0,1\}\)(二值)。存在同期混杂\(U_0\)同时影响\(A_0\)和\(S_1\)。观测分布\(P\)已知:\(P(A_0=1) = \pi\),\(P(S_1=1 | A_0=1) = p_1\),\(P(S_1=1 | A_0=0) = p_0\)。结构后继集\(\mathcal{S}_1(s_0, a) = \{0,1\}\)(无额外限制)。

核心问题:对于固定策略\(d\)(例如\(d(s_0)=1\),即总是治疗),求\(V^d = \mathbb{E}[Y^d]\)的sharp界。

在已交代记号下的完整推导: - 结构转移核\(\kappa_0(\cdot | s_0, 1)\)是未知的,但受限于观测分布和因果图。 - 由于存在同期混杂(\(A_0 \leftrightarrow S_1\)),\(\kappa_0(1 | s_0, 1)\)不一定等于\(P(S_1=1 | A_0=1) = p_1\)。 - 默认构造(Section 3.1 Step 4)给出Manski可行集:

\[Q_0(s_0, 1) = \{ q \in \Delta(\{0,1\}) : \pi \cdot p_1 \le q(1) \le \pi \cdot p_1 + (1-\pi) \}.\]
其中\(\pi \cdot p_1 = P(A_0=1, S_1=1)\)是观测到的联合质量,\((1-\pi) = P(A_0=0)\)是未观测动作的总质量。 - 因此,\(q(1)\)的下界是\(\pi p_1\),上界是\(\pi p_1 + (1-\pi)\)。 - 期望结局\(V^d = \mathbb{E}[Y^d] = \kappa_0(1 | s_0, 1) \cdot 1 + \kappa_0(0 | s_0, 1) \cdot 0 = q(1)\)。 - 所以sharp界为:
\[\theta^d = \pi p_1, \quad \bar{\theta}^d = \pi p_1 + (1-\pi).\]
- 当\(\pi=1\)(所有患者都接受治疗)时,界退化为点\(p_1\)(识别);当\(\pi=0\)(无患者接受治疗)时,界为\([0,1]\)(完全模糊)。

这个特例揭示了论文的核心思路:在每个局部细胞,利用观测分布和因果图构造一个Manski-type polytope作为可行集;然后通过逆向归纳(此处仅一步)组合这些局部集,得到全局sharp界。一般情形(多步、多状态)只是这个特例的“加壳”——每个细胞独立地贡献一个Manski polytope,矩形结构保证全局优化可分解为局部线性规划。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在同期混杂(每阶段存在未测量因子同时影响治疗和下一观测状态,但对后续阶段无直接效应)下,为动态治疗策略(DTR)计算期望结局的sharp因果界,并给出maximin最优策略。
  2. 核心工具/方法:利用观测分布、因果图和结构后继集,在每个状态-治疗对构造Manski-type polytope作为局部可行集;通过逆向归纳(robust MDP的Bellman recursion)组合这些局部集,得到全局上下界;对策略选择,采用maximin准则(最大化最坏情况期望结局)。
  3. 主要结论:Theorem 3.8证明默认构造的局部可行集组合成的干预模糊集恰好等于因果识别集(sharpness);Theorem 4.4给出逆向归纳算法精确计算上下界;Theorem 4.9给出maximin最优策略的逆向归纳算法。当所有局部转移概率可识别时,退化为g-formula和Q-learning。

关键设定与假设

  • Assumption 2.2 (Modularity):干预只替换治疗方程,其他方程不变。这是因果推断的标准假设。
  • Assumption 2.4 (Independent noise):所有外生噪声相互独立。这蕴含\(U_t \perp\!\!\!\perp S_t\)且各\(U_t\)相互独立。相比Bruns-Smith and Zhou [2023]的“memorylessness”条件(允许\(U_t\)分布依赖于\(S_t\)),本文更强(Remark 2.15)。
  • Assumption 2.10 (Finite compatible structural successor specification):状态、治疗、结局空间有限,且模型类非空。这是技术性假设,保证可行集为紧凸多面体,逆向归纳可解。
  • 结构后继集\(\mathcal{S}_{t+1}(s, a)\):固定且已知,记录从\((s,a)\)可能转移到的状态。这是模型类的一部分,而非从数据推断。
  • 因果图\(G\):固定且已知,由分析者指定。双向边\(A_t \leftrightarrow S_{t+1}\)表示允许同期混杂。
  • 相比已有文献:本文放宽了sequential exchangeability(允许同期混杂),但强化了混杂的时间结构(只持续一期,不持久)。相比敏感性分析文献(Tan, Robins et al.),本文不引入敏感性参数。相比IV文献(Chen and Zhang, Han),本文不依赖工具变量。

主要结果

Theorem 3.8 (Exact Sharpness):对于默认构造的可行集族\(\mathcal{Q}^{\text{default}}\),干预模糊集\(\mathcal{P}^d(\mathcal{Q}^{\text{default}})\)等于因果识别集\(\mathcal{I}^d(P, G, \mathcal{S})\)。 - 直觉:每个局部Manski polytope是局部sharp的(Manski [1990]的经典结果);矩形结构保证局部sharp性可“拼接”为全局sharp性。证明的关键是Lemma A.1(局部可实现性):对任何局部可行集中的分布,存在一个局部SCM实现它,同时保持观测分布和因果图。 - 必要条件:同期混杂假设(\(U_t\)只影响\(A_t\)和\(S_{t+1}\))、独立噪声假设、有限状态空间。 - 解决的技术难点:证明全局sharp性需要构造一个全局SCM,其每个局部转移核恰好等于干预模糊集中选定的分布。Lemma A.1通过一个精巧的“共享潜在变量”构造(当\(\alpha(a^*) > 0\)且存在双向边时),实现了这一点。

Theorem 4.4 (Backward Induction):上下界可通过逆向递归精确计算:

\[\overline{V}^d_t(s) = \max_{q \in Q_t(s, d_t(s))} \sum_{s'} q(s') \overline{V}^d_{t+1}(s'), \quad \underline{V}^d_t(s) = \min_{q \in Q_t(s, d_t(s))} \sum_{s'} q(s') \underline{V}^d_{t+1}(s').\]
- 直觉:矩形结构(Proposition 3.5)允许在每个细胞独立选择最坏/最好的转移核,而不影响其他细胞的选择。因此全局优化分解为局部线性规划。 - 必要条件:有限状态空间、可行集紧凸。 - 解决的技术难点:证明递归的精确性(而非仅给出界)需要构造达到上/下界的“延续族”(continuation family),证明通过归纳法完成。

Theorem 4.9 (Maximin Backward Induction):maximin最优策略可通过robust Bellman recursion计算:

\[W_t(s) = \max_{a \in \mathcal{A}} \min_{q \in Q_t(s, a)} \sum_{s'} q(s') W_{t+1}(s').\]
- 直觉:与Theorem 4.4类似,矩形结构允许在每个细胞独立选择最坏转移核,然后选择最大化最坏情况期望的动作。 - 必要条件:同上。 - 解决的技术难点:证明贪婪策略(在每个状态选择最大化最坏情况期望的动作)是全局maximin最优的,这依赖于矩形结构(标准robust MDP结果)。

证明路线与技术技巧

Theorem 3.8的证明路线: 1. 正向包含(\(\mathcal{I}^d \subseteq \mathcal{P}^d(\mathcal{Q}^{\text{default}})\)):对任意\(M \in \mathcal{M}(P, G, \mathcal{S})\),证明其每个结构转移核属于对应的默认可行集。在正概率、有混杂的细胞,利用Manski界;在正概率、无混杂的细胞,利用识别性;在零概率细胞,利用全单纯形。然后由Theorem 2.13得\(P^d_M \in \mathcal{P}^d(\mathcal{Q}^{\text{default}})\)。 2. 反向包含(\(\mathcal{P}^d(\mathcal{Q}^{\text{default}}) \subseteq \mathcal{I}^d\)):对任意\(Q \in \mathcal{P}^d(\mathcal{Q}^{\text{default}})\),需要构造一个SCM \(M \in \mathcal{M}(P, G, \mathcal{S})\)使得\(P^d_M = Q\)。 - 关键跳跃点:Lemma A.1(局部可实现性)。对每个细胞\((t, s, a^*)\)和选定的分布\(q_s \in Q_t(s, a^*)\),构造一个局部治疗机制和转移机制,使得:(i) 当\(P(S_t=s)>0\)时,重现观测分布\(P(A_t, S_{t+1} | S_t=s)\);(ii) 结构转移核\(\kappa_{M,t}(\cdot | s, a^*) = q_s\);(iii) 当无双向边时,治疗和转移机制不共享潜在变量;(iv) 转移机制取值在结构后继集内。 - 构造技巧:当\(\alpha(a^*) > 0\)且存在双向边时,引入一个共享潜在变量\(U = (B, (Z_a)_{a \in \mathcal{A}})\),其中\(B\)服从治疗倾向分布,\(Z_a\)是每个动作下的潜在结局。通过条件概率的巧妙选择(利用Manski界中的剩余质量\(r(z) = (q_s(z) - \pi(z))/(1-\alpha^*)\)),使得在干预\(A_t \leftarrow a^*\)下,\(S_{t+1} = Z_{a^*}\)的分布恰好为\(q_s\)。 3. 拼接:将各阶段的局部构造“粘贴”成一个全局SCM,验证其满足所有假设且\(P_M = P\)。

技术技巧点名: - Manski polytope:用于构造局部可行集(Section 3.1 Step 4)。 - 共享潜在变量构造:Lemma A.1中,当\(\alpha(a^*) > 0\)且存在双向边时,通过一个共享潜在变量\(U\)实现任意可行分布,同时保持观测分布。这是证明sharp性的核心技巧。 - 矩形结构(Proposition 3.5):保证局部优化可独立进行,是逆向归纳的基础。 - 逆向归纳/动态规划:Theorem 4.4和4.9的标准robust MDP技术。 - 线性规划:在每个细胞,优化问题退化为在Manski polytope上的线性规划(在二值后继时解析可解,在多值后继时需数值求解)。

真实例子与应用

例子1:HIV抗逆转录病毒治疗(Section 5.1) - 数据:基于Naimi et al. [2017]的基准例子,\(N=1,000,000\)名HIV患者,两期治疗(\(T=2\))。状态:\(S_0\)(基线病毒载量,固定为1),\(S_1 = (A_0, Z_1)\)(第一期治疗和病毒载量),\(S_2 = (A_0, Z_1, A_1, C)\)(完整历史,\(C\)为CD4计数)。结局:\(Y = C\)。 - 如何应用:假设第一期存在同期混杂(\(A_0 \leftrightarrow S_1\)),第二期无混杂。对四个静态策略(always-treat, never-treat, treat-early, treat-late)计算sharp界。 - 结果:always-treat的界为\([140.120, 156.445]\),完全高于其他策略的界,因此即使考虑混杂,always-treat仍为最优(与plug-in排名一致)。 - 说明:验证了方法在经典例子上的应用,展示了sharp界如何提供比点估计更稳健的决策依据。

例子2:合成生物标志物研究(Section 5.2) - 数据:合成数据,三状态(低/中/高生物标志物表达),二值治疗(标准/强化),\(T=2\)。第一期存在同期混杂,第二期无混杂。结局\(Y = 1 - S_2/2\)(最大化Y等价于最小化终端生物标志物严重程度)。 - 如何应用:比较Q-learning(假设无混杂)和maximin准则(考虑混杂)得到的最优策略。 - 结果:在基线状态\(S_0=1\)处,Q-learning偏好标准治疗(点估计更高),但maximin偏好强化治疗(最坏情况期望更高)。两个策略的全局最坏情况期望分别为0.493和0.526,maximin策略更优。 - 说明:展示了plug-in和maximin排名可能反转,强调了在部分识别下考虑最坏情况的重要性。反转的根源在于:标准治疗在\(S_0=1\)处是“稀有”动作(\(P(A_0=0|S_0=1)=0.3\)),其Manski polytope的坐标宽度更大,因此最坏情况更低。

🔎 结论是否比证明窄

  • Theorem 3.8的sharp性依赖于默认构造:作者明确“The equality is specific to the unmodified default family”(p.17)。对于缩小或放大的可行集(Remark 3.3),动态规划仍精确计算\(\mathcal{P}^d(Q)\)的界,但该集合不一定等于因果识别集。这是一个重要的窄化:sharp性不是方法本身的属性,而是默认构造的属性。
  • Theorem 4.4和4.9对任何矩形可行集成立:但只有默认构造下,这些界才是因果sharp的。作者在Remark 4.5(a)中明确这一点。
  • 持久混杂被排除:作者在Conclusion中承认“Allowing such persistent confounding would require a different factorization and would likely lead to ambiguity sets that are not rectangular. We expect that some validity results may survive in that more general setting, but sharpness should not be expected in general”(p.36)。这是一个明确的限制。
  • 有限样本推断未处理:作者明确“Statistical estimation of \(P\), and inference for the corresponding partially identified regime values when \(P\) is estimated from finite data, are outside the scope of this paper”(p.5)。因此,本文的界是人口界,而非样本界。

四、开放问题

  1. 持久混杂下的sharp界:当\(U_t\)的影响持续多期(如慢性虚弱或固定社会经济状况),本文的矩形结构不再成立。作者推测“some validity results may survive... but sharpness should not be expected in general”(p.36)。扎根于:Conclusion段落“The analysis is restricted to confounding that acts within a single stage... Allowing such persistent confounding would require a different factorization”。

  2. 有限样本推断:本文假设观测分布\(P\)已知。当\(P\)从有限数据估计时,如何对部分识别的界进行统计推断(如构造置信区间)?作者指出“Developing inference for the resulting partially identified bounds is a separate problem”(p.36)。扎根于:Conclusion段落“Throughout the paper we treat the observational law as known. With finite data, sampling uncertainty would enter in addition to causal identification uncertainty”。

  3. maximin策略与点识别策略的一致性条件:何时maximin选择的策略与在点识别假设下选择的策略相同?作者仅提及“Another question is when the regime selected by the maximin criterion is the same as the regime that would be selected under point identification”(p.36)。扎根于:Conclusion段落。

  4. 连续状态空间的扩展:本文假设有限状态空间(Assumption 2.10)。扩展到连续状态空间需要额外的正则性条件,且Manski polytope的构造和线性规划的求解将更复杂。作者仅提及“many of the results in this paper have natural extensions to continuous state spaces under suitable regularity conditions; we do not pursue this extension here”(p.10)。扎根于:Assumption 2.10后的Remark。

提醒:要确认这些是否为真gap,建议阅读同子领域近期约5篇论文的intro(如Bruns-Smith and Zhou [2023], Kausik et al. [2024], Tan [2025], Saghafian [2024], Duarte et al. [2024])。如果多篇都指向同一问题,则为共识性真gap;如果互相打架(如对持久混杂的处理方式不同),则为机会。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论