跳转至

Expert-Guided g-computation with Large Language Models for Estimating Causal Effects on Timings: Applications to Hospital Quality Improvement

作者: Patrick Vossler, Jialin Ouyang, F. Richard Guo, Anran Huang, Ali Shojaie et al.
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.10339


一、领域脉络与小综述

这个方向是什么

本文所解决的子方向是:在干预从未被实施、无任何历史数据的情况下,如何估计一个候选操作型干预(operational intervention)对连续时间结局(如住院时长)的平均因果效应。核心挑战在于:① 干预是假设性的(hypothetical),不满足“正性假设”(positivity);② 因果机制复杂,涉及患者个体化的、非结构化的临床事件序列,无法用一个统一的、固定结构的因果图来刻画;③ 数据驱动模型(如回归、g-computation)在无历史数据时完全失效,而纯专家判断(如甘特图分析)易受认知偏差影响且难以规模化。该子方向当前处于“从纯定性/纯定量走向混合方法”的早期阶段,本文是第一个将甘特图赋予形式化因果语义、并系统性地将专家知识与数据驱动建模结合的框架。

发展脉络(history)

  1. 奠基工作:因果图与g-computation
  2. Robins (1986):提出g-computation公式,为纵向数据下的因果效应识别提供了核心工具。本文的识别策略直接继承自Robins的g-computation,但将其从离散时间网格推广到连续时间的甘特图事件过程。
  3. Pearl (1995):将DAG作为因果推理的通用语言。本文的因果模型(Assumptions 1-4)本质上是在Pearl的do-calculus框架下,针对甘特图这一特殊图结构做的具体化。

  4. 主要进展:专家知识与因果推断的结合

  5. VanderWeele (2019) 与 Guo & Zhao (2026):提出了混淆变量选择的“析取准则”(disjunctive criterion)和“迭代图扩展”方法。本文的LLM管线直接使用了Guo & Zhao的迭代图扩展思想来指导DAG构建。
  6. O'Hagan et al. (2006) 与 Cinelli & Hazlett (2020):展示了专家知识在因果推断中的传统角色——提供先验分布或敏感性分析中的边界。本文的贡献在于将专家输入从“全局参数”降维到“仅对干预直接影响的节点(Type III)”,其余部分由数据驱动模型接管。

  7. 当前Frontier:LLM辅助因果推理

  8. Kıcıman et al. (2024) 与 Liu et al. (2024):展示了LLM能从变量名或文本中推断成对因果关系,但仅限于小图(≤5节点)。本文的LLM管线将这一能力扩展到平均14节点、21边的患者特异性DAG。
  9. Cotta et al. (2024):用LLM从互联网文本中提取处理、结局和混淆变量,然后运行经典因果推断方法(如IPW)。本文与之不同:LLM不直接做因果估计,而是辅助专家完成“DAG构建”和“Type III节点时序模拟”这两个专家擅长的子任务。
  10. Vossler et al. (2026):本文作者的前期工作,用LLM从医院记录中识别瓶颈和延迟,生成候选QI干预列表。本文是那项工作的直接后续——从“发现问题”推进到“估计效果”。

  11. 本文的位置:本文是第一个将甘特图(Gantt chart)与形式化因果模型(DAG + g-computation)结合,并利用LLM规模化专家推理的框架。它填补了“纯定性甘特图分析”与“纯定量因果推断”之间的空白。

子线索聚类

  • 线索1:因果推断方法及其假设(Robins 1986, Pearl 1995, Didelez 2008, Mogensen & Hansen 2020, Røysland et al. 2025, Wald et al. 2024)
    这一簇关注纵向/连续时间下的因果效应识别,依赖条件可交换性、一致性和正性假设。本文的贡献在于:在正性假设不满足时,用专家输入替代数据缺失的部分。

  • 线索2:专家在因果推断中的角色(VanderWeele 2019, Guo & Zhao 2026, O'Hagan et al. 2006, Cinelli & Hazlett 2020)
    这一簇关注如何系统性地利用专家知识来指定因果结构或量化不确定性。本文的贡献在于:将专家输入限制在“干预直接影响的节点”这一最小集,其余由数据驱动。

  • 线索3:LLM用于因果发现与专家推理模拟(Kıcıman et al. 2024, Liu et al. 2024, Antonucci et al. 2024, Gendron et al. 2025, Cotta et al. 2024, Argyle et al. 2023, Aher et al. 2022)
    这一簇探索LLM能否替代或辅助人类进行因果推理。本文的贡献在于:设计了一个多步骤的LLM管线,将DAG构建分解为临床推理、节点确定、边确定、结构化编码等子任务,使LLM在复杂场景下也能生成可靠的、可审计的因果图。

  • 线索4:医疗流程建模的信息学/运筹学方法(Lean, DES, 排队论)
    这一簇(如Banks 2005, Shortle et al. 2018, Green 2006)用离散事件模拟或排队论建模医院流程,但缺乏因果识别保证。本文的贡献在于:将甘特图这一运筹学工具与形式化因果推理结合,使其具备识别和估计能力。

这个方向在追问的核心问题

  1. 如何在不满足正性假设时识别因果效应?
    当前主流方法(如g-computation、IPW、TMLE)都依赖正性假设。本文的答案是:将识别分解为“数据可识别部分”和“专家可识别部分”,后者通过专家对干预直接影响的模拟来填补。

  2. 如何将非结构化文本(临床笔记)中的因果信息系统性地纳入因果推断?
    当前主流方法仅使用结构化表格数据。本文的答案是:用LLM从文本中提取患者特异性DAG,然后用该DAG指导g-computation。

  3. 如何规模化专家推理,使其能应用于大量患者?
    传统专家标注成本极高。本文的答案是:用LLM管线替代人类专家完成DAG构建和Type III节点时序模拟,并通过与人类专家的对比验证其可靠性。

⚠️ 作者的framing

  • 作者把缺口frame成什么?
    作者将缺口frame为“纯定性方法(甘特图分析)易受认知偏差影响,纯定量方法(回归、g-computation)在无历史数据时完全失效”,因此“显然的下一步”是将两者结合,让专家只做他们擅长的事(判断干预直接影响的节点),让数据做它擅长的事(估计下游节点的条件分布)。这个framing在Introduction第2-3段和第4段末尾被明确陈述。

  • 哪些竞争路线被他淡化或回避了?

  • 离散事件模拟(DES):作者在Related Work中承认DES是医院流程建模的常用方法,但指出其“缺乏严格的因果识别保证”。然而,DES本身可以嵌入因果模型(如通过干预改变事件时间分布),作者没有深入讨论DES与egg-computation的兼容性或优劣对比。
  • 排队论:同样被提及但未深入。排队论可以建模资源约束下的等待时间,而本文的SUTVA假设(无干扰)恰恰忽略了资源约束。作者在Discussion中承认这一点,但未将其作为主要竞争路线。
  • 深度学习方法(如Wald et al. 2024的Deep-Q effect estimation):作者在Related Work中提及,但仅作为“现有方法依赖条件可交换性”的一个例子,未讨论其与egg-computation在连续时间因果推断上的直接竞争关系。

  • 什么明显该被引/该存在、却没出现在intro里?

  • 半参数效率理论(efficient influence function, one-step estimation, TMLE):本文的估计量(式3.6)是一个简单的平均差值,没有使用任何效率增强技术(如cross-fitting、one-step correction)。对于熟悉因果推断的读者,自然会问:能否用TMLE或DML来提升效率?作者在Discussion中提到了“需要正式的推断程序”,但未引用van der Laan & Rose (2011)或Chernozhukov et al. (2018)等标准文献。
  • 敏感性分析:作者在Assumption 7后提到“如果干预的真实直接效应未知,专家可以假设一组函数并加权”,但未引用任何敏感性分析文献(如Rosenbaum 2002, VanderWeele & Ding 2017)。
  • 连续时间因果推断的已有形式化:作者引用了Didelez (2008)和Røysland et al. (2025)的局部独立图(Local Independence Graphs),但未深入讨论这些框架与甘特图DAG的关系。局部独立图是连续时间事件过程的因果模型,而甘特图DAG是离散事件过程——两者在数学结构上不同,但作者未明确说明为何选择后者而非前者。

张力

未见明显对立引用。所有被引工作基本是互补的,没有在相同设定下得出相反结论的情况。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \(X\):基线协变量(baseline covariates),如年龄、诊断、合并症。是随机向量。 - \(\mathcal{D} = \{0, 1, \dots, K\}\):事件集(event set),其中\(k=0\)是入院(Admission),\(k=K\)是出院/死亡(Discharge)。\(\mathcal{D}\)是随患者变化的(患者特异性DAG)。 - \(T_k\):事件\(k\)发生的墙钟时间(wall time),以入院为0点。\(T_0 = 0\),\(Y := T_K\)是结局(LOS)。 - \(W_k\):事件\(k\)的等待时间(waiting time),即从所有父事件完成后到\(k\)发生的时间间隔。由式(2.1)定义:\(T_k = \max_{j \in Pa(k)} T_j + W_k\)(若\(Pa(k) \neq \emptyset\)),否则\(T_k = W_k\)。 - \(A\):二元干预变量(binary intervention),\(A=0\)表示当前政策(观测数据),\(A=1\)表示候选QI政策(反事实)。 - \(T_k(a), W_k(a)\):在干预\(a\)下的潜在墙钟时间和等待时间,\(a=0,1\)。 - \(Y(a) = T_K(a)\):潜在结局(LOS)。 - \(\tau = \mathbb{E}[Y(0) - Y(1)]\):平均处理效应(平均节省时间)。 - \(Pa(k), Ch(k), De(k), Nd(k)\):标准图论记号——父节点、子节点、后代、非后代。 - \(Ch(A)\):干预的直接目标节点(Type III节点),即等待时间直接被干预改变的节点。

模型: - 数据生成机制:给定\(X\)和\(\mathcal{D}\),每个患者的甘特图是一个DAG,其中节点是事件时间\(T_k\),边表示因果依赖。等待时间\(W_k\)满足局部马尔可夫性质(Assumption 4):\(W_k(a) \perp\!\!\!\perp T_{Nd(k)}(a) \mid T_{Pa(k)}(a), X, \mathcal{D}\)。这意味着,给定父事件的时间,\(W_k\)与所有非后代事件的时间条件独立。 - 干预模型:\(A\)是外生节点(\(Pa(A) = \emptyset\)),通过改变\(Ch(A)\)的等待时间来影响下游事件。关键假设包括: - 一致性(Assumption 1):\(T_k = T_k(0)\)。 - 外生干预(Assumption 2):\(W_k(a) \perp\!\!\!\perp A \mid X, \mathcal{D}\)。 - 排除限制(Assumption 3):① 非后代节点(\(k \in Nd(A)\))的等待时间不受干预影响(\(W_k(1) = W_k(0)\));② 后代但非直接子节点(\(k \in De(A) \setminus Ch(A)\))的条件等待时间分布在干预下不变:\(W_k(0) \mid T_{Pa(k)}(0) \sim W_k(1) \mid T_{Pa(k)}(1)\)。

可观测数据: - 可观测:每个患者的\(X\)、事件序列(事件类型+时间戳\(T_k\))、临床笔记(非结构化文本)。所有数据都是在\(A=0\)(当前政策)下观测的。 - 不可观测/想要但观测不到:① 在\(A=1\)下的任何事件时间\(T_k(1)\);② 干预直接目标节点(\(Ch(A)\))在\(A=1\)下的等待时间\(W_k(1)\)——这些只能靠专家输入;③ 患者特异性DAG \(\mathcal{D}\)——需要从文本中推断。

第二步:讲最小内核

最简特例:考虑一个只有三个事件的甘特图:入院(\(k=0\))、检查完成(\(k=1\))、出院(\(k=2\))。干预\(A\)的目标是加速检查完成(即\(Ch(A) = \{1\}\))。假设所有患者的DAG结构相同:\(Pa(1) = \{0\}\),\(Pa(2) = \{1\}\)。观测数据:\(n\)个患者,每个患者有\(T_0=0\),\(T_1\)(检查完成时间),\(T_2\)(出院时间)。我们想估计\(\tau = \mathbb{E}[T_2(0) - T_2(1)]\)。

在这个特例下,egg-computation退化成什么? 1. DAG构建:专家(或LLM)确认\(Pa(1)=\{0\}, Pa(2)=\{1\}, Ch(A)=\{1\}\)。 2. 节点分类: - Type I(非后代):\(k=0\)(入院)——不受干预影响,\(T_0(1) = T_0 = 0\)。 - Type III(直接子节点):\(k=1\)(检查完成)——专家需要提供\(W_1(1)\)的分布(即干预下检查需要多长时间)。 - Type II(后代非直接子节点):\(k=2\)(出院)——其条件等待时间分布\(W_2 \mid T_1\)可以从观测数据中估计。 3. 反事实模拟: - 对每个患者\(i\),从专家分布\(p_{\text{expert}}(W_1(1))\)中采样\(W_{i,1}(1)\),计算\(T_{i,1}(1) = T_{i,0} + W_{i,1}(1) = W_{i,1}(1)\)。 - 从拟合的\(p(W_2 \mid T_1)\)中采样\(W_{i,2}(1)\),计算\(T_{i,2}(1) = T_{i,1}(1) + W_{i,2}(1)\)。 - 反事实LOS:\(Y_i(1) = T_{i,2}(1)\)。 4. 估计:\(\hat{\tau} = \frac{1}{n} \sum_{i=1}^n (T_{i,2} - T_{i,2}(1))\)。

为什么这个特例抓住了核心? - 它清晰地展示了egg-computation的分工:专家只负责干预直接影响的节点(Type III),数据负责下游节点(Type II)。 - 它暴露了关键假设:Assumption 3(排除限制)要求\(W_2(1) \mid T_1(1)\)的分布与\(W_2(0) \mid T_1(0)\)相同——即干预只改变检查完成时间,不改变“从检查完成到出院”这一过程的机制。这在操作型干预中通常是合理的。 - 它说明了为什么传统方法失败:如果干预从未实施,没有患者经历过\(A=1\),那么任何数据驱动模型都无法直接学习\(W_1(1)\)的分布——必须依赖专家。

一般情形只是这个特例的“加壳”:更多事件、更复杂的DAG结构、患者特异性DAG。但核心思想不变:Type I节点直接复制,Type III节点靠专家,Type II节点靠数据。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在候选QI干预从未实施、无历史数据的情况下,如何估计其对平均住院时长(LOS)的因果效应(平均节省时间)。
  2. 核心工具/方法:将甘特图赋予形式化因果语义(DAG + 等待时间模型),提出“专家引导的g-computation”(egg-computation),其中专家仅提供干预直接目标节点(Type III)的反事实等待时间分布,其余部分由数据驱动模型完成;并用LLM管线规模化专家推理。
  3. 主要结论:在模拟中,当患者因果结构异质时,egg-computation优于传统因果推断方法(如单一共享DAG的g-computation);在真实医院研究中,LLM生成的DAG和节省时间估计与人类专家高度一致,且因果排序与临床直觉更吻合。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • Assumption 5(专家DAG规范):专家(或LLM)给出的患者特异性DAG \(\mathcal{D}\)和干预目标\(Ch(A)\)是正确的。这是整个框架的核心可检验性假设——作者承认它不可检验,但认为在操作型干预中合理,因为临床笔记通常包含足够丰富的信息来推断事件间的因果依赖。
  • Assumption 6(时序模型):对于Type II节点(\(k \in De(A) \setminus Ch(A)\)),我们有一个时序模型,它等于真实条件分布\(p(W_k \mid T_{Pa(k)}, X, \mathcal{D})\)。这是数据驱动部分的核心假设。
  • Assumption 7(专家反事实模拟):专家指定的分布\(p_{\text{expert}}\)等于反事实等待时间分布\(p(W_k(1) \mid T_{Pa(k)}(1), X, \mathcal{D})\),对所有\(k \in Ch(A)\)成立。这是专家输入部分的核心假设。

相比已有文献的放宽/强化: - 放宽:不要求正性假设(positivity),因为干预从未实施,\(P(A=1 \mid X) = 0\)。传统g-computation需要\(P(A=a \mid X) > 0\)对所有\(a\)成立。 - 强化:要求专家能准确指定DAG和Type III节点的反事实分布。这在传统因果推断中通常不需要——传统方法假设因果图已知且正确,但通常由领域专家一次性指定全局图,而非每个患者一个图。

主要结果

Theorem 3.1(egg-computation的正确性):在Assumptions 1-7下,由egg-computation生成的\(Y_i'\)与反事实时间\(Y_i(1)\)同分布。因此,\(\hat{\tau} = \frac{1}{n} \sum_i (Y_i - Y_i')\)是\(\tau\)的无偏估计。

  • 直觉:证明分三步:① Lemma A.1:Type I节点(非后代)的反事实时间等于观测时间;② Lemma A.2:Type II节点(后代非直接子节点)的反事实条件等待时间分布等于观测条件等待时间分布(由Assumption 3的排除限制保证);③ Lemma A.4(g-computation):按拓扑顺序递归生成反事实时间,每一步的条件分布要么来自观测数据(Type II),要么来自专家(Type III),最终联合分布等于真实反事实分布。
  • 必要条件:所有五个假设(1-7)必须同时成立。其中Assumption 5(专家DAG规范)和Assumption 7(专家反事实模拟)是不可检验的——这是该框架的根本局限。
  • 解决的技术难点:如何将甘特图这一运筹学工具转化为形式化因果模型。关键创新在于式(2.1)(墙钟时间与等待时间的关系)和式(2.2)(局部马尔可夫性质在等待时间上的表述)。传统DAG模型假设节点是随机变量,而这里节点是事件时间,其依赖关系通过“等待时间”而非“条件分布”来刻画。

证明路线与技术技巧

整体路线(3-5步逻辑主干): 1. 将甘特图转化为因果DAG:每个事件\(k\)对应一个节点,边表示“\(k\)必须在所有父事件完成后才能开始”。墙钟时间\(T_k\)由式(2.1)递归定义。 2. 定义潜在结果:对每个干预\(a\),定义潜在墙钟时间\(T_k(a)\)和潜在等待时间\(W_k(a)\),满足相同的递归关系。 3. 施加因果假设:一致性(Assumption 1)、外生干预(Assumption 2)、排除限制(Assumption 3)、局部马尔可夫(Assumption 4)。这些假设将反事实分布与观测分布联系起来。 4. 分解反事实联合分布:由局部马尔可夫性质,反事实时间\(T_0(1), \dots, T_K(1)\)的联合分布可分解为式(A.1)的乘积形式,每个因子对应一个节点的条件分布。 5. 用观测数据或专家输入替换每个因子: - Type I节点:\(T_k(1) = T_k\)(由排除限制)。 - Type II节点:\(p(T_k(1) \mid T_{[k-1]}(1)) = p(T_k \mid T_{Pa(k)})\)(由排除限制+外生干预+一致性)。 - Type III节点:由专家提供\(p(T_k(1) \mid T_{[k-1]}(1))\)。 6. 递归采样:按拓扑顺序,用上述替换后的条件分布依次采样\(T_k'(1)\),最终\(T_K'(1)\)与\(Y(1)\)同分布。

关键跳跃点: - Lemma A.2的证明:这是整个证明的核心。它需要将反事实条件分布\(p(W_k(1) \mid T_{[k-1]}(1))\)逐步转化为观测条件分布\(p(W_k \mid T_{Pa(k)})\)。每一步都依赖一个不同的假设: 1. 由Assumption 4(局部马尔可夫),\(W_k(1) \perp\!\!\!\perp T_{[k-1]}(1) \mid T_{Pa(k)}(1)\),因此条件分布可简化为\(p(W_k(1) \mid T_{Pa(k)}(1))\)。 2. 由Assumption 3(排除限制),\(p(W_k(1) \mid T_{Pa(k)}(1)) = p(W_k(0) \mid T_{Pa(k)}(0))\)。 3. 由Assumption 2(外生干预),\(p(W_k(0) \mid T_{Pa(k)}(0)) = p(W_k(0) \mid T_{Pa(k)}(0), A=0)\)。 4. 由Assumption 1(一致性),\(p(W_k(0) \mid T_{Pa(k)}(0), A=0) = p(W_k \mid T_{Pa(k)})\)。 这个链条清晰地展示了每个假设的作用,以及为什么它们缺一不可。

技术技巧点名: - 递归定义(式2.1):将墙钟时间与等待时间的关系形式化,使DAG上的因果推理成为可能。这不是一个标准技巧,而是针对甘特图这一特定图结构的原创建模。 - g-computation公式的变体:标准g-computation假设所有节点的条件分布都可以从观测数据中估计。本文的变体允许部分节点(Type III)的条件分布由外部(专家)提供。 - LLM管线中的多步骤分解:将DAG构建分解为5个LLM调用,每个调用专注于不同方面(临床推理、节点确定、边确定、结构化编码)。这不是一个数学技巧,而是一个工程技巧,用于提高LLM输出的可靠性。

真实例子与应用

模拟研究(Section 4.1): - 数据/场景:假设一个医院场景,患者经历CT和MRI检查,最终做出治疗决策。因果结构在患者间异质:一半患者CT报告依赖MRI报告,另一半相反;决策可能依赖一个或两个报告。生成\(n=4000\)个患者,每个患者的DAG均匀随机采样。 - 方法应用:比较egg-computation(使用患者特异性DAG + 精确时序传播)与使用单一共享DAG的传统方法。 - 结果:使用患者特异性DAG + 精确时序传播(即egg-computation的oracle版本)实现零偏差;使用单一共享DAG的方法偏差高达14小时;使用患者特异性DAG但用OLS/kNN估计时序的方法偏差较小(≤2.8小时)。 - 想说明什么:当患者因果结构异质时,强制使用单一共享DAG会导致严重且不可预测的偏差;egg-computation通过恢复患者特异性DAG可以消除结构误设。

真实医院研究(Section 4.2): - 数据/场景:从Zuckerberg San Francisco General Hospital提取2,193个住院患者的临床笔记、医嘱和检验结果,覆盖5种最常见诊断。分析11个候选QI干预。 - 方法应用:LLM管线为每个患者构建DAG,用ICL(GPT-5)预测Type II节点的等待时间,用专家提示(经迭代调优)模拟Type III节点的反事实时间。 - 结果: - DAG一致性:LLM生成的DAG与人类专家高度一致(干预目标特异性96.5%,召回率88.9-95.7%;边精确率91.8-94.2%,召回率80.2-86.0%)。重新运行egg-computation后,LLM与人类专家的平均节省时间估计差异为-2.6小时(早期出院计划)和8.1小时(关键影像优先)。 - 时序模型准确性:ICL(GPT-5)在Type II节点等待时间预测上达到最低MAE(24.1小时),优于零基线(28.3小时)和回归模型(33.8-36.6小时)。 - 因果排序:egg-computation的因果排序与临床直觉更吻合(4位临床医生中3位同意其排序),而仅基于合格率的排序与直觉不符。 - 想说明什么:LLM管线可以规模化专家推理,其输出与人类专家高度一致;egg-computation的因果估计比简单合格率排序更有信息量,能揭示干预设计的深层问题(如早期出院计划的效果被患者医疗需求所阻塞)。

🔎 结论是否比证明窄

  • Theorem 3.1的证明要求Assumptions 1-7全部成立,但作者在真实例子中承认Assumption 5(专家DAG规范)和Assumption 7(专家反事实模拟)不可检验(Section 3.1:“Although this assumption is untestable”)。因此,真实例子中的估计值严格来说不是无偏的——它们依赖于这些不可检验假设的近似成立。
  • 作者在Discussion中承认:“Our current estimand should therefore either be interpreted as the effect for patients in the same population strata defined by X keeping the same or effect of the intervention assuming unlimited resources for the proposed intervention and thus an upper-bound.” 这意味着,在存在资源约束(如共享设备)时,SUTVA假设(无干扰)不成立,估计量应被解释为“上限”而非真实效应。但Theorem 3.1的证明中明确假设了无干扰(Section 2.1:“Implicit in our notation is the simplifying assumption of no interference or SUTVA”)。
  • Type II节点的时序模型:Theorem 3.1要求时序模型等于真实条件分布(Assumption 6)。但在真实例子中,ICL模型虽然优于基线,其MAE仍有24.1小时,远非“等于真实分布”。作者在Remark A.3中承认了这一点,并指出“Theorem 3.1 requires the Type II timing models to equal the true conditional distributions, and in our implementation that condition holds to the extent this similarity assumption does”——这是一个弱化了的声称。

四、开放问题

  1. 资源约束与干扰:本文假设无干扰(SUTVA),但操作型干预常涉及共享资源(如CT设备、社工时间)。作者在Discussion中提出“将egg-computation应用于患者批次”作为解决方案,但未给出具体方法或理论保证。扎根于:Section 2.1的SUTVA假设和Discussion第一段。

  2. 正式的推断程序:本文的估计量\(\hat{\tau}\)是简单平均差值,没有提供置信区间或假设检验。作者在Discussion中提到“需要正式的推断程序”,但未给出任何具体方案。扎根于:Discussion第二段。

  3. Type II节点时序模型的误差传播:Theorem 3.1要求时序模型等于真实条件分布(Assumption 6),但实践中模型必然有误差。这些误差如何传播到\(\hat{\tau}\)?是否存在一个误差界?扎根于:Assumption 6和Remark A.3。

  4. DAG构建的自动化验证:Assumption 5(专家DAG规范)不可检验。能否用观测数据(如事件时间序列)部分验证DAG的结构?例如,如果DAG声称\(A \to B\),但数据中\(A\)和\(B\)的时间顺序经常颠倒,是否可以拒绝该DAG?扎根于:Assumption 5和Section 3.2.1中“LLM被提示只包含它能自信地从时间线中证明的节点和边”。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论