Retrospective Causal Attribution under Case-Control Sampling¶
作者: Zijian Sui, Hong Zhang, Jinfeng Xu, Min Zeng
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2609.07721
一、领域脉络与小综述¶
这个方向是什么¶
本文所处的子方向是因果归因(causal attribution),其核心问题是回答"某个体在暴露下发生了结局,这个结局在多大程度上是由暴露造成的"。与更常见的平均因果效应(ATE)不同,归因问题关注的是个体层面的反事实概率,其中最核心的度量是必要性概率(Probability of Necessity, PN):给定一个暴露且发生结局的个体,若其未暴露,结局不发生的概率。PN 在法医学、职业病赔偿、疫苗不良反应归因等场景中有直接应用。该方向的成熟度处于"识别理论已基本清晰、但特定抽样设计下的有效推断仍是开放问题"的阶段——随机抽样下的 PN 识别与估计已有较完整的结果,但病例对照(case-control)抽样这一在流行病学中极为常见的回顾性设计,其下的 PN 识别与有效估计直到本文才被系统处理。
发展脉络¶
- 奠基工作:反事实框架与 PN 的语义定义。Pearl (1999) 与 Tian and Pearl (2000) 建立了概率归因的结构性语义框架,给出了 PN 的形式定义,并证明了在单调性(monotonicity)假设下,PN 可由暴露与结局的联合分布识别。Tian and Pearl (2000) 还给出了无单调性时 PN 的界。这一阶段确立了"PN 是反事实量、需要额外假设才能识别"的基本认识。
- 主要进展:协变量辅助的识别与界。Kuroki and Cai (2011) 将协变量信息引入 PN 的识别,证明了在条件交换性(conditional exchangeability)下,利用协变量可以收紧甚至点识别 PN。这一工作将 PN 从"无协变量的简单情形"推进到"有观测混杂的实用情形",为后续基于回归或加权的方法奠定了基础。
- 当前 frontier:特定抽样设计下的推断。近年来,注意力转向结果依赖抽样(outcome-dependent sampling)下的因果推断。Gabriel et al. (2022) 在病例对照抽样下推导了因果风险差的非参数界,但未处理 PN 这一反事实量;Jun and Lee (2024) 研究了病例对照和病例-总体抽样下的因果相对风险与归因风险,但主要关注识别而非效率。与此同时,van der Laan (2008) 展示了在已知总体患病率时,病例对照数据可以用于估计总体风险。本文的位置:Sui et al. 将 PN 的识别与有效估计推进到病例对照抽样下,填补了"PN + 回顾性抽样 + 非参数效率"这一交叉空白。与 Shingaki et al. (2026)(用代理变量识别病例对照下的归因概率)不同,本文走的是已知总体患病率 + 单调性的路线。
子线索聚类¶
- PN 的识别与界(无抽样偏差):Pearl (1999)、Tian and Pearl (2000)、Kuroki and Cai (2011)。这一簇在随机抽样或已知总体分布下研究 PN 的可识别条件与界,核心工具是反事实逻辑与单调性假设。
- 病例对照抽样下的因果推断:Prentice and Pyke (1979)(逻辑回归下 OR 的可估计性)、van der Laan (2008)(已知患病率时病例对照数据的校准)、Gabriel et al. (2022)(风险差的界)、Jun and Lee (2024)(相对/归因风险的界)。这一簇关注抽样机制带来的选择性偏差,核心问题是"哪些量在回顾性抽样下仍可识别、如何校正"。
- 归因概率的近期推断方法:Tian and Wu (2025)(随机抽样下 PN/PS 的有效估计)、Zhang et al. (2026)(随机化实验下无单调性的界与推断)、Shingaki et al. (2026)(病例对照下用代理变量识别)。这一簇是本文的直接竞争/互补文献,核心是效率理论与非光滑泛函的推断。
这个方向在追问的核心问题¶
- PN 在给定数据生成机制和抽样设计下是否可识别? 需要什么额外信息(如总体患病率)或假设(如单调性)?
- 在可识别的前提下,如何构造渐近有效估计量? 即达到半参数效率界,且对 nuisance 的估计误差稳健(double robustness / cross-fitting)。
- 当识别条件不满足时(如无单调性、无患病率信息),能得到什么样的界? 界是否尖锐、如何做推断?
- 近似策略的代价:当精确识别需要难以获取的外部信息时,基于近似(如罕见结局假设)的估计量误差有多大、何时可用?
已知瓶颈:PN 是反事实量,其识别严重依赖单调性等不可检验假设;病例对照抽样下,暴露-结局联合分布被抽样机制扭曲,需要外部信息(患病率)或额外假设才能恢复;PN 作为非光滑泛函(涉及指示函数),其推断对 nuisance 估计误差敏感,标准 bootstrap 可能失效。
⚠️ 作者的 framing(这是作者的说法)¶
作者将缺口 frame 为:"病例对照研究是研究罕见疾病病因的标准设计,但现有 PN 的识别与估计理论几乎全部假设随机抽样。我们证明,在已知总体患病率时,PN 在病例对照数据下可被精确识别;在无患病率信息时,若结局罕见,存在一个无需外部信息的近似公式,且误差为 O(p₀)。" 作者淡化的竞争路线包括:(1) Shingaki et al. (2026) 的代理变量方法——作者未讨论其与自身方法的相对优劣,仅作为"另一条路线"提及;(2) 无单调性时的界——作者仅给出 θ_E 作为下界,未与 Gabriel et al. (2022) 或 Jun and Lee (2024) 的界做比较。值得去查的问题:为什么作者不讨论在无单调性时 θ_E 是否就是尖锐下界?与 Gabriel et al. (2022) 的界相比如何?另外,作者对"已知患病率"这一假设的合理性讨论较少——在真实流行病学研究中,患病率通常来自独立的监测系统,其估计误差如何传播到 PN 估计?
张力¶
未见明显对立引用。但存在一个微妙的张力:Prentice and Pyke (1979) 表明病例对照数据可以"当作前瞻性数据"来估计 OR,而本文表明 PN 的识别必须依赖外部患病率或罕见结局近似——这说明"病例对照数据能支持哪些推断"在不同参数(OR vs. PN)上有本质差异。这一张力值得注意,因为它暗示病例对照设计的"信息量"是参数依赖的。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据¶
设目标总体为 P,其中每个个体有:
- 暴露 X ∈ {0,1}(二元)
- 结局 Y ∈ {0,1}(二元)
- 协变量 Z(向量,可包含离散与连续分量)
- 潜在结局 Y⁰, Y¹:分别表示在暴露 X=0 和 X=1 下的结局
目标量(estimand):必要性概率
抽样机制:病例对照抽样。从总体中独立抽取 n₁ 个病例(Y=1)和 n₀ 个对照(Y=0),观测每个被抽中个体的 (X, Z)。记观测分布为 Q,满足
关键参数: - π(x|y,z) := Q(X=x | Y=y, Z=z) —— 病例/对照中暴露的条件概率(可由数据估计) - m(z) := Q(Y=1 | Z=z) —— 病例对照样本中结局的条件概率(不是总体风险,受抽样扭曲) - η := P(X=1 | Y=1) = Q(X=1 | Y=1) —— 病例中暴露比例
可观测数据:从 Q 中 i.i.d. 抽取的 n 个样本 { (Yᵢ, Xᵢ, Zᵢ) },其中 Y=1 的样本数为 n₁,Y=0 的样本数为 n₀。注意:总体患病率 p₀ 不在观测数据中,必须外部提供(精确识别情形)或通过近似规避(罕见结局情形)。
第二步:最小内核¶
核心困难:PN 是反事实量,涉及 Y⁰ 的分布。在病例对照抽样下,我们观测到的联合分布 Q(X,Z|Y) 与总体 P(X,Z|Y) 一致(因为抽样只依赖 Y),但总体中 Y 的边缘分布 p₀ 是未知的。没有 p₀,就无法从 Q 恢复总体联合分布 P(X,Y,Z),从而无法计算 P(Y⁰=0 | X=1, Y=1)。
最小内核(最简情形):假设 Z 为空(无协变量),X, Y 均为二元。此时观测数据简化为一个 2×2 列联表(病例组和对照组中暴露的计数),外加外部已知的 p₀。
识别逻辑(为什么 p₀ 够用): 1. 由贝叶斯公式,总体中 P(X=1, Y=1) = P(Y=1) · P(X=1|Y=1) = p₀ · η,其中 η = Q(X=1|Y=1) 可由病例组直接估计。 2. 在单调性(Y¹ ≥ Y⁰)下,PN 可化简为(Tian and Pearl, 2000):
罕见结局近似(为什么 p₀ 可以不要):当 p₀ → 0 时,总体中 P(Y=1|X=0) 也趋于 0,此时 θ_A 与 θ_E 的差为 O(p₀)。直观上,如果结局极罕见,那么"未暴露且发生结局"的个体在总体中几乎不存在,此时 PN 主要由暴露组中的结局发生率决定,而后者可由病例对照数据近似(因为病例组中暴露比例 η 是可估计的)。这就是本文的核心洞察:在罕见结局下,PN 的识别可以不依赖外部患病率,代价是引入 O(p₀) 的渐近偏差。
为什么这个内核是"最小"的:去掉 Z、去掉单调性、去掉一般抽样权重,剩下的就是"一个 2×2 表 + 一个外部常数 p₀"的识别问题。本文的全部技术工作(EIF、交叉拟合、效率界)都是在这个内核上"加壳":加入协变量 Z(需要估计 π(x|y,z) 和 m(z))、去掉单调性(θ_E 退化为下界)、处理 nuisance 估计误差(交叉拟合 + 乘积率条件)。
三、这篇论文做了什么¶
三句话¶
- 研究问题:在病例对照抽样下,如何从回顾性数据中识别并有效估计必要性概率 PN(以及无单调性时的有效下界),并构造渐近正态、达到半参数效率界的估计量。
- 核心方法:在已知总体患病率 p₀ 时,推导 PN 的精确识别公式 θ_E(定理 1);在无 p₀ 时,提出罕见结局近似 θ_A,证明 |θ_A − θ_E| = O(p₀)(定理 2);基于两者的有效影响函数(EIF)构造交叉拟合估计量,证明其渐近正态且达到半参数效率界(定理 4)。
- 主要结论:θ_E 在单调性下精确识别 PN,无单调性时是有效下界;θ_A 在罕见结局下是 θ_E 的 O(p₀) 近似且无需外部信息;模拟显示两种估计量在有限样本下偏差小、覆盖率高,GEMS 数据应用显示 Rotavirus 的 PN 显著高于 Cryptosporidium。
关键设定与假设¶
- 假设 1(一致性):Y = Y^X。标准假设,连接观测结局与潜在结局。
- 假设 2(条件交换性):(Y⁰, Y¹) ⊥ X | Z。即在给定协变量下,暴露分配与潜在结局独立。这是无未测量混杂的假设,比随机抽样下的无混杂更强(因为还要求 Z 捕捉所有混杂)。
- 假设 3(积极性):0 < P(X=x|Z) < 1 a.s.。保证每个协变量层内都有暴露和未暴露个体。
- 假设 4(单调性):Y¹ ≥ Y⁰ a.s.。排除"暴露反而预防结局"的个体(defier)。这是 PN 点识别的关键假设;去掉后 θ_E 退化为下界。
- 假设 5(病例对照抽样):抽样只依赖 Y,且 P(S=1|Y=y) > 0。这是病例对照设计的定义性假设,保证 Q(X,Z|Y=y) = P(X,Z|Y=y)。
- 条件 1(乘积率条件):∥d̂−d∥₂·∥q̂−q∥₂ = oₚ(n^{-1/2})(对 θ_E),以及类似的三项乘积率条件(对 θ_A)。这是交叉拟合估计量达到效率界的标准条件,允许 nuisance 以慢于 n^{-1/4} 的速率收敛,只要乘积足够快。
相比已有文献的定位:相比 Tian and Wu (2025)(随机抽样下的 PN 有效估计),本文处理了病例对照抽样的选择性偏差;相比 Gabriel et al. (2022) 和 Jun and Lee (2024)(病例对照下的界),本文给出了点识别和有效估计;相比 Shingaki et al. (2026)(用代理变量),本文走的是"已知患病率 + 单调性"的更简洁路线。
主要结果¶
定理 1(识别):在假设 1–3、5 下,对任意 x ∈ {0,1},
定理 2(近似率):在一致正则条件下,θ_A − θ_E = O(p₀) 当 p₀ → 0。这意味着罕见结局下,无需 p₀ 的 θ_A 与精确值 θ_E 的偏差随患病率线性消失。
定理 4(效率):在假设 1–3、5 和条件 1 下,交叉拟合估计量 θ̂_E 和 θ̂_A 满足
技术难点与解法: - 难点 1:病例对照抽样下 nuisance 的识别。m(z) = Q(Y=1|Z=z) 不是总体风险,直接回归会得到扭曲的估计。解法:用加权(IPSW)校正,权重 w(Y) 由 p₀ 和 h₀ 决定(公式 2.2),将 Q 下的期望转化为 P 下的期望。 - 难点 2:EIF 的推导。θ_E 和 θ_A 都是 nuisance(π, m)的复杂泛函,且 θ_E 涉及 p₀ 在分母。解法:采用 Gateaux 导数技术,在非参数模型中对泛函求导,得到显式 EIF(定理 3),并验证 E_Q{D_j|Y=y}=0 以保证交叉拟合的有效性。 - 难点 3:非光滑性。PN 的定义涉及指示函数 I(Y⁰=0),但 θ_E 和 θ_A 的表达式是光滑的(因为单调性下 PN 可写成风险的比值),这避免了非光滑泛函的推断困难。这是本文选择单调性假设的重要技术动机。
真实例子与应用¶
GEMS 数据(Kotloff et al., 2012, 2013):10,266 名非洲儿童(4,266 例中重度腹泻病例,6,000 名对照),关注 Cryptosporidium 和 Rotavirus 感染对腹泻的归因概率。设定 p₀ = 0.08(外部文献值)。结果: - θ̂_E (Cryptosporidium) = 0.409 (95% CI: 0.331, 0.488),θ̂_A = 0.462 (95% CI: 0.331, 0.488 附近) - θ̂_E (Rotavirus) = 0.739 (95% CI: 0.707, 0.771),θ̂_A = 0.821 (95% CI: 0.785, 0.857) - 结论:Rotavirus 感染对腹泻的归因概率显著高于 Cryptosporidium;θ_A 与 θ_E 的差异在 p₀ = 0.08 时约为 0.05–0.08,与 O(p₀) 的理论预测一致。
模拟设计:生成含非线性交互的总体(Z₁ 伯努利、Z₂ 正态、暴露概率由 logit 决定、结局由潜在结局类型决定),从总体中抽取 2,000 病例 + 2,000 对照,p₀ ∈ {0.001, 0.01, 0.04, 0.07, 0.10},300 次重复。结果显示:两种估计量偏差小(< 0.01),ESE 略大于 SSD(置信区间轻微保守),CP 在 0.943–0.970 之间,符合理论预期。
🔎 结论是否比证明窄¶
- 明确窄的地方:定理 1 的识别公式要求已知 p₀,但实际应用中 p₀ 通常来自独立监测系统,存在估计误差。作者在 Remark 2 中仅说"当 f 估计精确时影响可忽略",但未给出 p₀ 估计误差对 θ̂_E 的正式影响分析(如一阶展开)。这是一个证明窄于 claim 的地方。
- 定理 2 的近似率:O(p₀) 的证明依赖"一致正则条件"(在补充材料中),但正文未明确这些条件的直观含义。读者无法判断真实数据中这些条件是否合理。
- 无单调性时的下界:作者声称 θ_E 是有效下界,但未证明其尖锐性(sharpness),也未与 Gabriel et al. (2022) 的界做比较。这是一个"声称但未证明"的点。
- 交叉拟合的有限样本表现:模拟中 ESE 系统性大于 SSD,说明方差估计偏保守,但作者未讨论这是否源于交叉拟合的有限样本偏差。
四、开放问题¶
-
p₀ 不确定性的传播(扎根于 Remark 2):当 p₀ 需要从外部数据估计时,θ̂_E 的渐近方差如何修正?是否存在对 p₀ 估计误差稳健的估计量?——可考虑用 delta method 将 p₀ 的估计方差纳入,或构造对 p₀ 局部误设稳健的估计量。
-
无单调性时的尖锐界(扎根于定理 1(b) 和讨论部分):θ_E 作为下界是否尖锐?在病例对照抽样下,无单调性时 PN 的识别区间是否比随机抽样下更宽?——可考虑将 Zhang et al. (2026) 的随机实验界推广到病例对照设计。
-
罕见结局近似的实用判据(扎根于定理 2):O(p₀) 的误差界中的常数是否可显式表达?实际应用中 p₀ 多大时 θ_A 不再可靠?——可推导误差界的显式形式,或给出基于数据的诊断方法。
-
多暴露或竞争风险下的归因(扎根于 GEMS 应用中"不纳入其他病原体"的处理):当多个暴露可能共同导致结局时,PN 的定义和识别如何推广?病例对照抽样下竞争风险是否改变识别公式?——可考虑将本文框架扩展到多暴露设定,或引入竞争风险模型。
-
纵向病例对照设计(扎根于讨论部分未展开处):当暴露和结局都在纵向随访中观测时,病例对照抽样的选择机制更复杂,PN 的识别是否仍成立?——可考虑将本文的识别策略与纵向因果推断方法结合。
给研究者的提醒:若要确认上述某条是否为真 gap,建议去读 Shingaki et al. (2026)、Zhang et al. (2026) 以及 Gabriel et al. (2022) 的近期引用文献(约 5 篇)的引言部分——如果多篇都指向同一个未解决问题,那大概率是共识性 gap;如果各篇对同一问题的处理方式互相矛盾,那可能是更值得挖掘的机会。
Maintained by 陈星宇 · Homepage · Source on GitHub