跳转至

Evaluating Surrogates in Individualized Treatment Rules

讲者: Yue Liu
会场: Data Integration and Surrogate Endpoint for Causal Inference
报告题目: Evaluating Surrogates in Individual Treatment Regimes
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:当主要结局(primary outcome)昂贵、延迟或难以观测时,能否用更容易获取的替代指标(surrogate endpoint)来学习一个“好”的个性化治疗规则(ITR),以及如何量化这种替代决策的质量损失。 它位于两个成熟领域的交叉点——替代指标验证(surrogate validation)与个性化治疗规则学习(ITR learning)——但关注的是一个被两者都部分忽略的问题:替代指标对“决策”的价值,而非对“效应估计”的价值。当前该交叉点尚处于早期形成阶段,缺乏统一的评估框架。

发展脉络

奠基工作(1989-2007):替代指标研究的起点是Prentice (1989) 提出的统计替代性(statistical surrogacy) 标准,要求主要结局在给定替代指标后条件独立于处理。Frangakis & Rubin (2002) 用潜在结果框架提出了主替代性(principal surrogacy),强调替代指标对处理效应的捕捉应基于个体层面的潜在结果。Chen et al. (2007) 提出了一致替代性(consistent surrogacy) 标准。这些工作奠定了替代指标验证的理论基础,但它们的共同特点是:关注的是替代指标能否“替代”主要结局来估计平均处理效应(ATE),而非能否用于个体化决策。

ITR学习的发展(2011-2021):几乎平行地,ITR学习领域从Qian & Murphy (2011) 的l1惩罚最小二乘和Zhao et al. (2012) 的outcome weighted learning开始,发展到Athey & Wager (2021) 的doubly robust policy learning。这些方法都假设主要结局是可观测的。同时,针对未观测混杂的扩展开始出现:Cui & Tchetgen Tchetgen (2021) 用工具变量,Qi et al. (2024) 用代理变量(proxy variables)。但这些工作都默认ITR学习的目标是主要结局本身,没有考虑替代指标作为决策依据时的特殊问题。

替代指标与ITR的交叉(2020-2024):最近几年,两个领域开始交汇。Yang et al. (2023) 提出用协变量和替代指标来插补缺失的长期结局,然后在插补值上学习最优ITR。Wu et al. (2024) 开发了平衡长期和短期奖励的ITR学习框架。Kallus & Mao (2024) 研究了在结局缺失时,利用替代指标提高ATE估计效率。这些工作开始触及“替代指标用于决策”的问题,但它们要么把替代指标当作插补工具(Yang et al.),要么关注的是平均效应而非个体化决策(Kallus & Mao),要么没有提供评估替代指标本身决策价值的度量。

本文的位置:本文是第一个系统性地提出直接评估替代指标在ITR中决策价值的框架。它不关心替代指标能否“替代”主要结局来估计ATE,而是问:用替代指标学出的ITR,在主要结局上表现如何? 它引入了三个度量——替代遗憾(surrogate regret)、替代增益(surrogate gain)、替代效率(surrogate efficiency)——并建立了相应的估计和推断理论。

子线索聚类

  1. 替代指标验证(传统路线):Prentice (1989), Frangakis & Rubin (2002), Chen et al. (2007), VanderWeele (2013), Wang et al. (2020, 2023)。这一簇关注的是替代指标能否“解释”或“捕捉”处理对主要结局的效应,通常以ATE为对象。本文的定位:不沿此路线,因为ATE层面的替代性不保证ITR层面的决策质量。

  2. ITR学习(标准路线):Qian & Murphy (2011), Zhao et al. (2012), Athey & Wager (2021), Kitagawa & Tetenov (2018)。这一簇关注如何在主要结局可观测时学习最优ITR。本文的定位:不沿此路线,因为本文假设主要结局难以观测,必须依赖替代指标。

  3. 替代指标辅助的ITR学习(交叉路线):Yang et al. (2023), Wu et al. (2024), Kallus & Mao (2024)。这一簇开始将替代指标用于ITR学习,但方式不同:Yang et al. 用替代指标插补结局再学ITR;Wu et al. 平衡长短奖励;Kallus & Mao 用替代指标提高ATE效率。本文的定位:不同于这些工作,本文不提出新的ITR学习方法,而是提出评估替代指标本身决策价值的度量。

  4. 预算约束下的ITR:Bhattacharya & Dupas (2012), Matrajt et al. (2021), Xu et al. (2024)。这一簇考虑当只能处理部分人口时的最优ITR。本文的定位:将预算约束纳入替代指标评估,这是本文的一个关键扩展。

核心问题与已知瓶颈

这个方向在追问的核心问题有2-3个: 1. 替代指标在什么条件下能保证ITR层面的决策质量? 已知瓶颈:传统替代性标准(如Prentice标准)不保证ITR质量,本文用三个反例证明了这一点。 2. 如何量化替代指标导致的ITR性能损失? 已知瓶颈:缺乏直接针对ITR的替代指标评估度量。本文提出的替代遗憾、增益、效率是首次尝试。 3. 在预算约束下,替代指标的排序能力比符号一致性更重要? 已知瓶颈:即使CATE符号一致,排序不同也会导致预算约束下的决策严重偏离。本文的Example 3展示了这一点。

⚠️ 作者的framing

作者把缺口frame成什么:作者在引言中明确说:“Existing surrogate criteria, however, are largely designed for causal effect evaluation rather than treatment allocation decision-making.” 因此,本文的framing是:现有替代指标验证框架关注的是“效应估计”而非“决策”,所以需要一套全新的、直接针对ITR的评估度量。 这使得本文成为“显然的下一步”:既然替代指标已被用于决策(如在线广告、教育),那么就需要工具来评估这种决策的质量。

哪些竞争路线被他淡化或回避了: - Yang et al. (2023) 的插补方法:作者在引言中只提了一句“More recently, Yang et al. (2023) propose to use both covariates and surrogates to impute missing long-term outcomes”,但没有深入讨论这种方法与本文框架的关系。实际上,Yang et al. 的方法也可以被视为一种“用替代指标做决策”的路线,但作者选择将其定位为“插补”而非“评估”。 - Kallus & Mao (2024) 的效率增益框架:作者在讨论部分提到“Kallus and Mao (2024) have developed methods for estimating ITRs with missing outcomes”,但没有在引言中将其作为竞争路线。Kallus & Mao 关注的是用替代指标提高ATE估计效率,而非ITR评估,所以可能被作者视为不同问题。

什么明显该被引/该存在、却没出现在intro里? - Ben-Michael et al. (2022) 的非对称反事实效用政策学习:这篇论文(已检索)讨论了当决策者关心“do no harm”时的政策学习,与本文的“替代指标可能导致有害决策”主题高度相关。但本文只在参考文献中列出,未在引言中讨论。 - Levis et al. (2023) 的协变量辅助IV界:这篇论文(已检索)讨论了非光滑泛函的推断问题,与本文处理非光滑ITR指示函数的技术挑战相关。但本文未引用。

张力

未见明显对立引用。被引工作之间没有彼此矛盾或在略不同条件下得相反结论的情况。这是一个相对和谐的领域,不同工作关注不同方面,没有根本性冲突。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - A ∈ {0,1}:处理变量,1=处理,0=对照。 - X ∈ ℝᵈ:基线协变量,在治疗前观测。 - Y ∈ ℝ:主要结局(primary outcome),昂贵/延迟/难以观测。 - S ∈ ℝ:替代指标(surrogate endpoint),容易/快速/大规模观测。 - Y(a), S(a):潜在结局(potential outcomes),即如果个体被分配到处理a时会观测到的YS值。不可观测,因为每个个体只能接受一种处理。 - τ_Y(x) = E[Y(1)-Y(0)|X=x]:主要结局的条件平均处理效应(CATE)。 - τ_S(x) = E[S(1)-S(0)|X=x]:替代指标的CATE。 - π: 𝒳 → {0,1}:个性化治疗规则(ITR),一个从协变量空间到处理分配的确定性映射。 - π_Y(x) = 1{τ_Y(x) > 0}:主要结局最优ITR(无预算约束时)。 - π_S(x) = 1{τ_S(x) > 0}:替代指标最优ITR(无预算约束时)。 - π_{Y,λ}(x), π_{S,λ}(x):预算约束为λ时的最优ITR(见下文)。 - e(x) = P(A=1|X=x):倾向得分(propensity score)。 - µ_a(x) = E[Y|X=x, A=a]:主要结局的回归函数。 - µ_{S,a}(x) = E[S|X=x, A=a]:替代指标的回归函数。 - n₁, n₂:两个数据集的样本量。 - ρ = lim n₁/n₂ ∈ (0,∞):样本量比。

模型: - 潜在结果框架:每个个体有四个潜在变量(Y(0), Y(1), S(0), S(1)),但只能观测到与分配处理对应的那一个。 - 假设1(无混淆性):A ⊥ Y(a) | XA ⊥ S(a) | X。即给定X,处理分配与潜在结局独立。 - 假设2(重叠性):e(X) ∈ [ε, 1-ε] 几乎必然,其中ε>0。即每个个体都有正概率接受任一处理。 - 数据生成:(A, X, S(0), S(1), Y(0), Y(1)) i.i.d. 来自某个总体分布P

可观测数据: - 研究者拥有两套独立的数据集: - 结局数据集 D₁ = {(Aᵢ, Xᵢ, Yᵢ) : i ∈ I₁},样本量n₁。包含处理、协变量和主要结局,但没有替代指标。 - 替代数据集 D₂ = {(Aⱼ, Xⱼ, Sⱼ) : j ∈ I₂},样本量n₂。包含处理、协变量和替代指标,但没有主要结局。 - 关键点:主要结局Y和替代指标S不在同一个体上同时观测。这是两样本设计(two-sample design),反映了实际中长期间结局和短期间替代指标可能来自不同研究。 - 不可观测的量:潜在结局Y(a), S(a),以及由此定义的CATE τ_Y(x), τ_S(x)。这些只能通过假设(无混淆性+重叠性)从可观测数据中识别。

第二步:最小内核

本文的核心数学问题可以浓缩为:当用替代指标S学出的ITR π_S替代主要结局最优ITR π_Y时,主要结局的期望损失是多少?

最简特例:假设CATE是常数,即τ_Y(x) ≡ c_Yτ_S(x) ≡ c_S,且c_Yc_S符号相反。例如: - τ_S(x) ≡ 1(替代指标显示处理对所有个体都有益) - τ_Y(x) ≡ -1(主要结局显示处理对所有个体都有害)

在这个特例下: - 主要结局最优ITR:π_Y(x) = 1{τ_Y(x) > 0} = 1{-1 > 0} = 0,即不处理任何人。 - 替代指标最优ITR:π_S(x) = 1{τ_S(x) > 0} = 1{1 > 0} = 1,即处理所有人

替代遗憾(Surrogate Regret) 定义为:

R = E[Y(π_Y(X))] - E[Y(π_S(X))]
在这个特例中: - E[Y(π_Y(X))] = E[Y(0)](因为π_Y=0,所有人接受对照) - E[Y(π_S(X))] = E[Y(1)](因为π_S=1,所有人接受处理) - 所以 R = E[Y(0)] - E[Y(1)] = -E[τ_Y(X)] = -(-1) = 1

这个例子说明了什么:即使替代指标S与主要结局Y高度相关(例如,SY的相关系数接近1),只要它们的CATE符号相反,替代指标最优ITR就会导致完全错误的决策,造成巨大的主要结局损失。本文的Example 1和Example 2就是这种情形的推广,其中CATE不是常数但符号相反。

更一般的情况:当CATE不是常数时,替代遗憾可以写成:

R = E[τ_Y(X) · (π_Y(X) - π_S(X))]
这等价于对决策不一致的区域(即π_Y(X) ≠ π_S(X)的区域)按τ_Y(X)的绝对值加权求和。如果τ_Y(X)τ_S(X)符号一致,则π_Y = π_SR=0。如果符号不一致,则R>0

预算约束下的扩展:当只能处理λ比例的人口时,最优ITR变为只处理CATE最大的前λ比例的人(且CATE为正)。此时,替代指标不仅需要符号一致,还需要排序一致——即τ_S(x)τ_Y(x)的排序要匹配。本文的Example 3展示了即使符号一致,排序不同也会导致预算约束下的巨大遗憾。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:当主要结局难以观测时,如何评估替代指标在个性化治疗规则(ITR)中的决策价值,即用替代指标学出的ITR在主要结局上表现如何。
  2. 核心工具/方法:提出了三个ITR导向的评估度量——替代遗憾(surrogate regret)、替代增益(surrogate gain)、替代效率(surrogate efficiency)——并构建了基于增广逆概率加权(AIPW)的估计量和相应的渐近推断理论。
  3. 主要结论:在margin条件下,所提估计量是√n-一致的且渐近正态的;模拟和Criteo数据集上的实证分析验证了方法的有限样本性能。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 两样本设计:这是本文的一个关键设定。研究者拥有两个独立数据集:D₁(有YS)和D₂(有SY)。这比单样本设计(同时有YS)更一般,也更符合实际(长期结局和短期替代指标可能来自不同研究)。论文也讨论了单样本设计的扩展(见补充材料S2.2)。
  • 假设1(无混淆性)A ⊥ Y(a) | XA ⊥ S(a) | X。这是标准假设,但本文没有考虑未观测混杂。相比已有文献(如Cui & Tchetgen Tchetgen 2021用IV处理未观测混杂),这是一个强化的假设。
  • 假设2(重叠性)e(X) ∈ [ε, 1-ε]。标准假设。
  • 假设3(margin条件):这是本文的关键技术假设,用于处理ITR指示函数的非光滑性。它要求CATE τ_Y(X)τ_S(X)在决策阈值(0和分位数y_{1-λ}, s_{1-λ})附近没有太多概率质量。具体地:
  • P(|τ_Y(X)| ≤ t) = O(t^{α₁})τ_Y在0附近不集中。
  • P(|τ_S(X)| ≤ t) = O(t^{α₂})τ_S在0附近不集中。
  • P(|τ_Y(X) - y_{1-λ}| ≤ t) = O(t^{β₁})τ_Y在分位数附近不集中。
  • P(|τ_S(X) - s_{1-λ}| ≤ t) = O(t^{β₂})τ_S在分位数附近不集中。 这些条件与分类文献中的Tsybakov margin条件(Audibert & Tsybakov 2007)和ITR文献中的类似条件(Luedtke & van der Laan 2016)一致。相比已有文献,本文同时需要τ_Yτ_S的margin条件,因为两个ITR(π_Yπ_S)都需要估计。
  • 预算约束λ ∈ (0,1]表示最多可处理的人口比例。当λ=1时退化为无约束情形。预算约束下的最优ITR是π_{Y,λ}(x) = 1{τ_Y(x) > 0} · 1{τ_Y(x) > y_{1-λ}},其中y_{1-λ}τ_Y(X)(1-λ)分位数。这相当于只处理CATE为正且最大的前λ比例的人。

主要结果

定理1(无约束替代遗憾的收敛率)

R̂ - R = O_P(n^{-1/2} + D_{1,n} + D_{2,n} + D_{3,n})
其中: - D_{1,n} = ‖ê - e‖₂ · (‖µ̂₁ - µ₁‖₂ + ‖µ̂₀ - µ₀‖₂):倾向得分和结局回归的乘积误差。如果两者都一致估计,则D_{1,n} = o_P(n^{-1/2})。 - D_{2,n} = ‖τ_Y - τ̂_Y‖_∞^{1+α₁}τ_Y的估计误差,受margin参数α₁控制。α₁越大,收敛越快。 - D_{3,n} = ‖τ_S - τ̂_S‖_∞^{α₂}τ_S的估计误差,受margin参数α₂控制。

直觉D_{1,n}是AIPW的典型二阶项,D_{2,n}D_{3,n}是估计ITR指示函数带来的额外偏差。如果margin条件足够强(α₁, α₂足够大),且所有nuisance函数以足够快速度一致估计,则√n-一致的。

命题1(无约束替代遗憾的渐近正态性):如果D_{1,n} + D_{2,n} + D_{3,n} = o_P(n^{-1/2}),则√n(R̂ - R) → N(0, σ²_R),其中σ²_R = Var[ϕ_R(Y, A, X; η)]

定理2(预算约束替代遗憾的收敛率)

R̂(λ) - R(λ) = O_P(n^{-1/2} + D_{1,n} + D_{2,n} + D_{3,n} + D_{4,n} + D_{5,n})
其中D_{4,n} = (‖τ_Y - τ̂_Y‖_∞ + |y_{1-λ} - ŷ_{1-λ}|)^{β₁}D_{5,n} = (‖τ_S - τ̂_S‖_∞ + |s_{1-λ} - ŝ_{1-λ}|)^{β₂}。预算约束引入了两个额外项,反映CATE估计误差和分位数估计误差的联合影响。

定理3和4(替代增益和效率的收敛率):类似结构,但只涉及D_{1,n}, D_{3,n}, D_{5,n}(因为增益和效率只依赖π_S,不依赖π_Y)。

证明路线与技术技巧

整体路线(以定理1为例,3-5步逻辑主干):

  1. 分解估计误差:将R̂ - R分解为三部分:
  2. 主导项:(E_{I_{1,1}} - E_P)[ϕ_R(Y, A, X; η)],即用真实nuisance参数时的经验过程项。
  3. 二阶项1:(E_{I_{1,1}} - E_P)[ϕ_R(Y, A, X; η̂) - ϕ_R(Y, A, X; η)],即nuisance估计误差带来的经验过程项。
  4. 二阶项2:E_P[ϕ_R(Y, A, X; η̂) - ϕ_R(Y, A, X; η)],即nuisance估计误差带来的偏差项。

  5. 处理二阶项1:利用样本分割(sample splitting),使得η̂E_{I_{1,1}}独立。然后应用Kennedy et al. (2020)的引理(Lemma S4):如果‖ϕ_R(·; η̂) - ϕ_R(·; η)‖₂ = o_P(1),则二阶项1是o_P(n^{-1/2})。证明的关键是验证这个L₂范数条件,通过三角不等式和Cauchy-Schwarz将其转化为nuisance估计误差的L₂范数。

  6. 处理二阶项2(偏差项):利用Lemma 2(或Lemma S1)将偏差分解为两部分:

  7. 乘积项:(ê - e)(µ̂_a - µ_a),由AIPW结构保证。
  8. 一阶项:τ_Y · [(π̂_Y - π_Y) - (π̂_S - π_S)],这是ITR估计误差带来的。

  9. 控制一阶项:这是最吃劲的部分。由于π̂_Yπ̂_S包含指示函数,直接控制E_P[τ_Y · (π̂_Y - π_Y)]需要margin条件。关键技巧是Lemma S5和Lemma S7:

  10. Lemma S5:|1(f̂ > 0) - 1(f > 0)| ≤ 1(|f| ≤ |f̂ - f|),将指示函数误差转化为f在0附近的事件。
  11. Lemma S7:利用margin条件,E_P[|τ_Y| · 1(|τ_Y| ≤ |τ̂_Y - τ_Y|)] ≤ ‖τ_Y - τ̂_Y‖_∞^{1+α₁}

  12. 汇总:主导项是O_P(n^{-1/2})且渐近正态;二阶项1是o_P(n^{-1/2});二阶项2的阶由D_{1,n}, D_{2,n}, D_{3,n}控制。如果这些项都是o_P(n^{-1/2}),则√n-一致且渐近正态的。

关键跳跃点: - Lemma 2的偏差分解:将AIPW估计量的偏差分解为乘积项和一阶项,这是后续分析的基础。乘积项是AIPW的典型优势(double robustness),一阶项是ITR特有的挑战。 - Lemma S5的指示函数误差控制:将非光滑的指示函数误差转化为光滑的|f| ≤ |f̂ - f|事件,这是处理ITR估计误差的标准技巧。 - Lemma S7的margin条件应用:将E_P[|τ_Y| · 1(|τ_Y| ≤ |τ̂_Y - τ_Y|)] bound为‖τ_Y - τ̂_Y‖_∞^{1+α₁},这是利用margin条件的关键步骤。α₁越大,这个bound越紧。

技术技巧点名: - AIPW(Augmented Inverse Probability Weighting):用于构造估计函数ϕ,使得偏差项具有乘积结构((ê - e)(µ̂_a - µ_a)),从而实现double robustness。 - 样本分割(Sample Splitting):将D₁分成两部分,一部分用于估计nuisance参数,另一部分用于计算最终估计量。这保证了η̂与评估样本独立,简化了渐近分析。 - Cross-fitting:在补充材料中讨论,通过K折交叉验证提高有限样本性能。 - Margin条件(Tsybakov条件):用于控制非光滑指示函数估计的偏差,是处理ITR问题的标准工具。 - 经验过程理论:Lemma S4(来自Kennedy et al. 2020)用于控制二阶经验过程项,其证明基于条件方差和Markov不等式。

真实例子与应用

数据:Criteo Uplift Prediction数据集(Diemert et al. 2018),包含25,309,483个用户级观测,来自多个增量实验。每个观测有:二元处理指示(是否看到广告)、12个协变量、两个替代指标(visit和exposure)、一个转化指示(conversion,即是否购买)。数据特点:visit率4.13%,转化率0.23%,处理比例84.6%,反映了数字广告中典型的稀疏性。

方法应用: - 主要结局Y:转化(conversion)。 - 替代指标S:visit(是否访问网站)和exposure(是否有效暴露于广告)。 - 处理A:是否分配到广告组。 - 协变量X:12个可用特征。 - 采用与模拟相同的样本分割策略,将数据集分为辅助样本和主样本。 - 用四种ML方法估计CATE:Random Forest (RF), LightGBM, XGBoost, Gradient Boosting。 - 用逻辑回归估计倾向得分。 - 在预算约束λ ∈ {5%, 10%, 15%, 20%}下估计R̂(λ), Ĝ(λ), V̂(λ)

结果: - 替代遗憾R̂(λ)(表2):所有方法下都非常小(0.000049到0.000195),说明visit和exposure作为替代指标学出的ITR与主要结局最优ITR性能非常接近。 - 替代增益Ĝ(λ)(表3):均为正,说明替代指标ITR优于不处理基线。 - 替代效率V̂(λ)(表4):均为正,说明替代指标ITR优于随机分配。 - 预算影响:随着λ增大,遗憾减小,增益和效率增大,说明更大预算使替代指标ITR更接近最优。

这个例子想说明什么:在Criteo数据中,visit和exposure是“好”的替代指标——它们学出的ITR在主要结局(转化)上表现良好,接近最优。这验证了本文框架在实际应用中的可行性,也展示了如何用所提度量比较不同替代指标(visit vs. exposure)和不同ML方法。

🔎 结论是否比证明窄

  • 定理1-4的收敛率:这些结果是在margin条件(假设3) 下严格证明的。如果margin条件不满足(例如,CATE在0附近有概率质量),则D_{2,n}, D_{3,n}, D_{4,n}, D_{5,n}可能不是o_P(n^{-1/2})√n-一致性可能不成立。论文在讨论部分没有明确说明这一点,但这是隐含的。
  • 命题1-4的渐近正态性:这些结果要求D_{1,n} + D_{2,n} + D_{3,n} + ... = o_P(n^{-1/2})。这是一个充分条件,但论文没有讨论是否必要。在实际应用中,如果nuisance估计误差不够小,置信区间可能不准确。
  • 两样本设计:论文的主要理论是针对两样本设计的。对于单样本设计(补充材料S2.2),论文给出了算法但没有给出理论保证。这是一个明显的窄结论:单样本设计的渐近性质没有被证明。
  • 未观测混杂:论文假设无混淆性(假设1),没有考虑未观测混杂。在引言中,作者提到了用IV或代理变量处理未观测混杂的扩展(Cui & Tchetgen Tchetgen 2021; Qi et al. 2024),但本文没有处理这种情况。这是一个窄结论:本文框架在未观测混杂下不直接适用。

四、开放问题

  1. 组合多个替代指标:论文在讨论部分提到“methods that combine multiple surrogates into an optimal composite surrogate would be valuable”,并引用了Athey et al. (2025)的surrogate index。扎根点:论文第7节“Several promising directions for future research remain. First, methods that combine multiple surrogates into an optimal composite surrogate would be valuable.” 这是一个明确的开放问题:如何将多个替代指标组合成一个“最优复合替代指标”,使得基于它的ITR在主要结局上表现最好?

  2. 缺失数据场景:论文提到“extending our framework to handle missing data scenarios, where either surrogate or outcome measurements are partially unavailable”。扎根点:论文第7节“Second, extending our framework to handle missing data scenarios... would broaden its applicability.” 这是一个实际中常见的问题:如果替代指标或主要结局有缺失,本文的框架如何调整?

  3. 放松margin条件:本文的渐近理论依赖于margin条件(假设3)。如果CATE在决策阈值附近有概率质量,√n-一致性可能不成立。扎根点:定理1-4的证明中,margin条件被用于控制D_{2,n}, D_{3,n}, D_{4,n}, D_{5,n}。如果这些条件不满足,能否得到更慢的收敛率?或者能否用其他方法(如平滑)来避免margin条件?这是一个理论上的开放问题。

  4. 单样本设计的理论保证:论文在补充材料中给出了单样本设计的算法(S2.2, S2.3),但没有提供相应的渐近理论。扎根点:论文第2.1节提到“When only a single dataset D = {(Aᵢ, Xᵢ, Sᵢ, Yᵢ)} is available, our proposed framework can be also extended”,但正文的理论部分只针对两样本设计。单样本设计下的渐近性质(如收敛率、渐近方差)需要被建立。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论